Milyen fő paramétereket szoktunk beállítani a DAG feladatokhoz, és miért kell pontosan így legyen a grafikon (a DAG magas szintű logikája)?
Machine Learning / AI
Dolgozott már Spark-kal? Mi a általános véleménye arról, hogy ez mi?
Adott egy betűket és számokat tartalmazó sztring. Találd meg a sztringben a legnagyobb számot (tekintve az egymást követő számjegyeket egyetlen számnak).
Amikor osztálykiegyensúlyozatlanság esetén metrikákról beszélünk — melyek azok, amelyek megfelelőek, és melyek nem?
Mi történik Pythonban a sztringek összefűzésekor (pl. current += char)? Miért lehet ez a megközelítés problémás ebben a feladatban, és hogyan lehet optimalizálni a kódot, elkerülve a gyakori sztringösszefűzést?
Szorultál már véletlen erdővel (munkában vagy tanulás közben)? Milyen fő különbségek vannak a véletlen erdő és a boosting között?
Hogyan old meg ugyanazt a kattintás utáni keresési problémát JOIN nélkül?
Dolgozott már Airflow vagy Spark segítségével? Meséljen, mi az a DAG az Airflow-ban, tudna példát mondani a tapasztalatából? Maga írta a DAG-okat vagy csak használta/indította őket?
Miért mutat nem megfelelő minőségi értéket az osztályok kiegyensúlyozatlansága esetén az accuracy?
100 érme van, közülük egy hamis — mindkét oldalán sas van. Véletlenszerűen kiválasztunk egy érmét, feldobjuk, és sas jelenik meg. Mi a valószínűsége, hogy az érme hamis? Magyarázza el a megoldást (Bayes képletét használva).
Van tapasztalata idősorozatokkal? Milyen metrikákat használnak az idősorozat-előrejelző modellek minőségének értékelésére?
Adott a logs tábla felhasználói eseményekkel (user_id, item_id, action_type, timestamp). Írjon SQL lekérdezést, hogy minden felhasználó számára megtalálja az utolsó kattintott termék azonosítóját.
Ha a modellhez optimális fák száma 500, de véletlenül mind a random erdőt, mind a boostingot 1000 fával tanítottuk, melyik modell valószínűbb, hogy túlillesztett és miért?
Miért akadhat meg egy feladat a Sparkban, és tarthat nagyon sokáig?