Kādus galvenos parametrus mēs parasti iestādam DAG uzdevumiem un kāpēc grafiks ir tieši tāds (DAG augstākās līnijas loģika)?
Machine Learning / AI
Vai esat strādājis ar Spark? Kāds ir jūsu vispārējais priekšstats par to, kas tas ir?
Dota ir rinda, kas satur burti un skaitļus. Atrodiet maksimālo skaitli, kas parādās rindā (uzskatot secīgas skaitļus kā vienu skaitli).
Runājot par klases nelīdzsvarotību, kuri ir piemērotas metrikas un kuras nav?
Kas notiek Python, kad savienotu virknes (piemēram, current += char)? Kāpēc šāda pieeja šajā uzdevumā var būt slikta un kā optimizēt kodu, izvairoties no biežas virkņu savienošanas?
Vai jūs kādreiz esat saskāries ar nejaušu mežu (darba vai mācību laikā)? Kādas ir galvenās atšķirības starp nejaušu mežu un boosting?
Kā jūs risinātu to paša problēmu, meklējot pēdējo klikšķi bez JOIN izmantošanas?
Vai esat strādājis ar Airflow vai Spark? Pastāstiet, kas ir DAG Airflow, vai varat sniegt piemēru no savas pieredzes? Vai pats rakstījāt DAGs vai tikai izmantojāt/palaidāt?
Kāpēc precizitāte klases nelīdzsvarotības gadījumā rāda neatbilstošu kvalitātes vērtību?
Vai jums ir pieredze ar laika rindām? Kādas metriku izmanto, lai novērtētu laika rindu prognozes modeļu kvalitāti?
Dota logs tabula ar lietotāju notikumiem (user_id, item_id, action_type, timestamp). Uzrakstiet SQL vaicājumu, lai katram lietotājam atrastu pēdējā klikšķa preces ID.
Ir 100 monētas, no kurām viena ir viltus — ar diviem ērglēm abās pusēs. Mēs nejauši izvēlamies monētu, to metam un iznāk ērglis. Kāda ir varbūtība, ka monēta ir viltus? Izskaidrojiet risinājumu (izmantojot Bayesa formulu).
Ja modeļa optimālais koku skaits ir 500, bet nejauši apmācījām gan nejaušo mežu, gan boosting ar 1000 kokiem, kurš modelis, visticamāk, pārtrauks mācīties un kāpēc?
Kāpēc uzdevums Spark var aizķerties un ilgi ilgi darboties?