Mi az a HAVING operátor SQL-ben? Hol használják?
Machine Learning / AI
Regressziós feladat: a részvényárak előrejelzése az 5. évben a 4 év adatai alapján boosting segítségével. Milyen hibát követtünk el?
Mi a MAPE és SMAPE mérőszámok? Hol lehetnek hatástalanok?
Meséljen a diszpécserek munkaminőségének értékeléséről szóló projektről: milyen modelleket használtak, hogyan hasonlították össze az etalon forgatókönyvvel?
Miért CatBoost, és nem XGBoost vagy LightGBM? Miben különböznek?
MVP feladat: bináris osztályozás osztálykiegyensúlyozatlansággal, az adatok 10 gépen vannak elosztva, van egy szöveges jellemző. Milyen megközelítést javasolna?
Meséljen az üzleti fontosság szerint címkézett kérések klaszterezési projektjéről.
Mely metrikák a legfontosabbak nagy osztálykiegyensúlyozatlanság esetén (99:1)?
Ismeri az HTTP, UDP, TLS protokollokat?
Mi a fő különbség a Spark és a Pandas között? Mi az a Hadoop?
Tudod, mi az a bagging? Adj példát egy algoritmusra.
Mi az a LoRA (Low-Rank Adaptation)?
Meséljen a K-means algoritmusról és fejlettebb változatairól (K-means++).
Meséljen részletesebben az alkalmazottak elvándorlásának előrejelzési projektjéről: mit csináltak, milyen adatokat használtak, miért választották a CatBoost-ot?
Meséljen magáról, tapasztalatairól és projektjeiről.
Milyen metrikákat használnak a klaszterezés minőségének értékelésére? Hogyan válasszuk ki a klaszterek számát?