Cos'è l'operatore HAVING in SQL? Dove viene usato?
Machine Learning / AI
Compito di regressione: previsione del prezzo delle azioni nel quinto anno usando i dati dei 4 anni precedenti con boosting. Quale errore abbiamo commesso?
Cosa sono le metriche MAPE e SMAPE? Dove potrebbero essere inefficaci?
Parli del progetto di valutazione della qualità del lavoro dei dispatcher: quali modelli sono stati utilizzati, come sono stati confrontati con lo script di riferimento?
Perché scegliere CatBoost invece di XGBoost o LightGBM? Quali sono le differenze?
Compito MVP: classificazione binaria con squilibrio delle classi, i dati sono distribuiti su 10 macchine, c'è una caratteristica testuale. Quale approccio proponresti?
Parli del progetto di clustering delle richieste con etichettatura per importanza commerciale.
Quali metriche sono le più prioritarie in un grande squilibrio di classi (99 a 1)?
Conosci i protocolli HTTP, UDP, TLS?
Qual è la principale differenza tra Spark e Pandas? Cos'è Hadoop?
Sai cos'è il bagging? Fornisci un esempio di algoritmo.
Cos'è LoRA (Low-Rank Adaptation)?
Parlami più dettagliatamente del progetto di previsione del turnover dei dipendenti: cosa avete fatto, quali dati avete usato, perché avete scelto CatBoost?
Parla dell'algoritmo K-means e delle sue varianti avanzate (K-means++).
Parlami di te, della tua esperienza e dei tuoi progetti.
Quali metriche vengono utilizzate per valutare la qualità del clustering? Come scegliere il numero di cluster?