Machine Learning / AI
Cos'è l'interruzione anticipata in HPO (ASHA, Hyperband)?
Quanti pesi vengono addestrati in uno strato convoluzionale con un kernel 5x5 e 10 filtri?
Come filtrare solo i dati attuali in una query SQL?
Perché BERT offre una qualità migliore nei compiti di classificazione del testo rispetto a TF-IDF con regressione logistica?
Come scegliere la dimensione del vettore di embedding?
Cos'è RLHF? Descrivi le tre fasi dell'addestramento.
Cos'è ETL?
Da quanto tempo lavori in Albers?
Quali sono i parametri principali che di solito impostiamo per i compiti DAG e perché il grafico deve essere esattamente così (logica di alto livello del DAG)?
Cos'è la normalizzazione pivotata?
Cos'è una chiave surrogata?
Qual è il metodo di ensemble learning, oltre a bagging e boosting?
Quali metodi moderni sono efficaci per le serie temporali?
Perché si utilizza la convoluzione con kernel 1x1 nelle reti neurali?
Implementare un algoritmo di unione di sequenze, ad esempio hash join?
Cosa sono le meta-caratteristiche per warm-start AutoML?
Come si relazionavano la libertà creativa e i risultati aziendali nel lavoro?
Cos'è il negative sampling nell'addestramento di word2vec e a cosa serve?
Qual è la differenza tra i metodi fit, fit_transform e transform in scikit-learn?
Cos'è la segmentazione 3D nelle immagini mediche?