Machine Learning / AI
Cos'è la ricerca a fascio e perché viene usata raramente per la generazione aperta?
Cos'è la privacy differenziale e DP-SGD?
Come funziona un albero decisionale?
Cos'è NSP (previsione della frase successiva) e perché RoBERTa l'ha abbandonata?
Come funziona la distribuzione normale delle probabilità nella classificazione binaria?
Quale tasso di apprendimento si dovrebbe usare per batch grandi e quale per piccoli? Quali regole (regola di scaling lineare) conosci?
Qual dovrebbe essere la profondità degli alberi in Random Forest e in boosting?
Cos'è Monte Carlo Data?
Come è strutturata una lista in Python e qual è la complessità temporale delle operazioni principali?
Perché non si può semplicemente imparare dalle uscite del boosting del gradiente?
Quali metodi di regolarizzazione esistono per modelli non lineari?
Quali trucchi pratici accelerano l'inferenza dei trasformatori (decodifica speculativa, medusa)?
Qual è la differenza tra NaN e None in Python?
Cos'è l'architettura ViT (Vision Transformer)?
Cos'è la decodifica vincolata (regex, schema JSON)?
Come usare Airflow per orchestrare i processi ETL?
Chi avrà un effetto più negativo rimuovendo il primo albero: il modello di boosting o quello di bagging?
Cos'è un feature store e quali compiti risolve (Feast, Tecton)?
Quando il deep learning supera GBDT sui dati tabulari?
Perché non si può semplicemente calcolare la mediana su ogni worker e poi combinarli?