Kokius pagrindinius parametrus paprastai nustatome DAG užduotims ir kodėl grafikas turi būti būtent toks (DAG aukšto lygio logika)?
Machine Learning / AI
Ar dirbote su Spark? Kokia yra bendroji nuomonė apie tai, kas tai yra?
Kalbant apie klasių disbalansą, kurie rodikliai yra tinkami, o kurie ne?
Eilutė, kurioje yra raidžių ir skaičių. Raskite didžiausią skaičių, kuris pasirodo eilutėje (laikant eilės skaitmenis kaip vieną skaičių).
Kas vyksta Python'e, kai sujungiamos eilutės (pvz., current += char)? Kodėl toks požiūris gali būti blogas šiai užduočiai ir kaip optimizuoti kodą, vengiant dažnų eilutės sujungimų?
Kaip išspręstumėte tą patį problemą ieškant paskutinio paspaudimo be JOIN naudojimo?
Ar kada nors susidūrėte su atsitiktiniu mišku (darbe ar mokykloje)? Kokie yra pagrindiniai skirtumai tarp atsitiktinio miško ir boosting?
Ar dirbote su Airflow ar Spark? Papasakokite, kas yra DAG Airflow'e, galite pateikti pavyzdį iš savo patirties? Ar pats rašėte DAG'us ar tik juos naudojote/paleidote?
Kodėl tikslumas esant klasių disbalansui rodo netinkamą kokybės reikšmę?
Ar turite patirties dirbant su laiko eilutėmis? Kokios metrikos naudojamos laiko eilių prognozės modelių kokybei įvertinti?
Duota lentelė logs su naudotojų įvykiais (user_id, item_id, action_type, timestamp). Parašykite SQL užklausą, kad kiekvienam naudotojui rastumėte paskutinio paspausto produkto ID.
Yra 100 monetų, iš kurių viena yra netikra — su dviem ereliais abiejose pusėse. Atsitiktinai pasirenkame monetą, ją metame ir iškrenta erelis. Kokia tikimybė, kad moneta yra netikra? Paaiškinkite sprendimą (naudodami Bayeso formulę).
Jei modelio optimalus medžių skaičius yra 500, bet atsitiktinai apmokėme tiek atsitiktinį mišką, tiek boosting su 1000 medžių, kuris modelis labiau tikėtina perprast ir kodėl?
Kodėl užduotis Spark gali užstrigti ir trukti labai ilgai?