Koje su osnovne parametre obično postavljamo za DAG zadatke i zašto graf mora biti baš takav (visokorazinska logika DAG)?
Machine Learning / AI
Да ли сте радили са Spark-ом? Какво је ваше опште мишљење о томе шта је то?
Koje su metrike prikladne, a koje nisu kada govorimo o neuravnoteženosti klasa?
Dat je niz koji sadrži slova i cifre. Pronađite najveći broj koji se pojavljuje u nizu (smatrajući uzastopne cifre kao jedan broj).
Šta se dešava u Pythona pri konkatenaciji stringova (npr., current += char)? Zašto ovaj pristup može biti problematičan u ovom zadatku i kako optimizovati kod izbegavajući čestu konkatenaciju stringova?
Да ли сте се икада сусрели са случајном шумом (на послу или у школи)? Које су главне разлике између случајне шуме и бустинга?
Kako biste rešili isti problem pretraživanja poslednjeg klika bez korišćenja JOIN?
Da li ste radili sa Airflow ili Spark? Ispričajte, šta je DAG u Airflow, možete li navesti primer iz svog iskustva? Da li ste sami pisali DAG-ove ili ste ih samo koristili/pokretali?
Zašto preciznost pri neuravnoteženosti klasa prikazuje neadekvatnu vrednost kvaliteta?
Да ли имате искуство са радом са временским низовима? Које метрике се користе за процену квалитета модела за прогнозу временских низова?
Data je tabela logs sa događajima korisnika (user_id, item_id, action_type, timestamp). Napišite SQL upit koji za svakog korisnika pronalazi ID poslednjeg proizvoda na koji je kliknuo.
Postoji 100 novčića, od kojih je jedan lažan — sa dva orla sa obe strane. Nasumično biramo novčić, bacamo ga i izlazi orao. Kolika je verovatnoća da je novčić lažan? Objasnite rešenje (korišćenjem Bayesove formule).
Ako je optimalan broj stabala za model 500, ali smo slučajno obučili i slučajnu šumu i boosting na 1000 stabala, koji od modela je verovatnije da će prekomerno naučiti i zašto?
Zašto zadatak u Spark-u može da se zaglavi i traje veoma dugo?