Mesélj a TF-IDF-ről: hogyan működik, hogyan néz ki a végső mátrix?
Machine Learning / AI
Milyen mérőszámot válasszunk ki az outlierekkel rendelkező regresszióhoz: MSE vagy MAE?
Hogyan növelhető a sebesség a teszten anélkül, hogy újra tanítanánk a modellt?
Milyen típusú adatbázist válasszak a hívásesemények tárolására és miért?
Hogyan lehet figyelembe venni az időintervallumot a vásárlások között a termékek relevanciája érdekében?
Mi az n-edik fa célváltozója a gradiens boostingban?
Milyen üzleti metrikákat és ellen-metrikákat kell mérni a termékpromóciós widget értékeléséhez?
Milyen körülbelüli sávra fókuszálsz a váltáshoz?
Milyen veszteségfüggvény (loss) van alapértelmezés szerint lineáris regresszióban?
Hogyan lehet beállítani a hiperparamétereket?
Hogyan fogjuk beállítani a paramétereket a gradient boostingban? Milyen paraméterek vannak, és mit fogsz elsőként beállítani?
Hogyan használhatók az együttműködő módszerek az embeddingeken alapuló ajánlásokhoz?
Miért nem használják a lineáris regresszió analitikus képletét a gyakorlatban?
Mondja el a regulárizációt a klasszikus ML algoritmusokban: L1 és L2. Milyen tulajdonságaik és különbségeik vannak?
Milyen felosztási kritériumokat használnak a döntési fákban (pl. entrópia kritérium)? Tud másokat is mondani?
Miért működik a bagging fákkal, mint a véletlenszerű erdőben?
Miért kell a LEAD függvényt használni a jövőbeli értékek kereséséhez id szerint SQL-ben?
Miben különbözik a sztochasztikus gradiens leszállás a klasszikustól?
Hogyan épülnek fel a coroutine-ok és az event loop Pythonban?
Milyen hibahatárt használjunk a tanulás leállításához?