Aké hlavné parametre zvyčajne nastavujeme pre úlohy DAG a prečo musí byť graf presne taký (vysoká úroveň logiky DAG)?
Machine Learning / AI
Pracoval ste s Sparkom? Aká je vaša všeobecná predstava o tom, čo to je?
Keď hovoríme o metrikách pri nerovnováhe tried — ktoré sú vhodné a ktoré nie?
Dan je niz, ki vsebuje črke in številke. Poiščite največje število, ki se pojavi v nizu (upoštevajte zaporedne številke kot eno število).
Kaj se dogaja v Pythonu pri združevanju nizov (npr., current += char)? Zakaj je ta pristop lahko problematičen pri tej nalogi in kako optimizirati kodo, da se izognemo pogostemu združevanju nizov?
Ako by ste vyriešili rovnaký problém vyhľadávania posledného kliknutia bez použitia JOIN?
Stretli ste se niekedy s náhodným lesom (v práci alebo v škole)? Aké sú hlavné rozdiely medzi náhodným lesom a boostingom?
Pracoval si s Airflow ali Spark? Povej, kaj je DAG v Airflow, lahko podaš primer iz svoje izkušnje? Sam pisal DAG-e ali si jih samo uporabljal/zagonil?
Prečo presnosť pri nerovnováhe tried ukazuje neprimeranú hodnotu kvality?
Máte skúsenosti s časovými radmi? Aké metriky sa používajú na hodnotenie kvality modelov prognózy časových radov?
Dá sa tabuľka logs s udalosťami používateľov (user_id, item_id, action_type, timestamp). Napíšte SQL dotaz, ktorý pre každého používateľa nájde ID posledného kliknutého produktu.
Obstaja 100 kovancev, od katerih je en lažen — z dvema orloma na obeh straneh. Naključno izberemo kovance, ga vržemo in pride orao. Kakšno je verjetnost, da je kovance lažen? Pojasnite rešitev (z uporabo Bayesove formule).
Če je optimalno število dreves za model 500, vendar smo po nesreči usposobili tako naključni gozd kot boosting na 1000 dreves, kateri model je bolj verjetno, da se bo preučil in zakaj?
Prečo môže byť úloha v Spark-u zaseknutá a trvať veľmi dlho?