Milliseid peamisi parameetreid me tavaliselt DAG ülesannetele määrame ja miks peab graafik olema just selline (DAG-i kõrgetasemeline loogika)?
Machine Learning / AI
Kas teiega on töötanud Sparkiga? Milline on teie üldine arusaam sellest, mis see on?
Kui räägime klasside ebavõrdsusest, millised mõõdikud on sobivad ja millised mitte?
Antud on string, mis sisaldab tähti ja numbreid. Leia suurim arv, mis stringis esineb (arvestades järjestikuseid numbreid kui ühte numbrit).
Mis juhtub Pythonis, kai sujungiamos eilutės (pvz., current += char)? Kodėl toks požiūris gali būti blogas šiai užduočiai ir kaip optimizuoti kodą, vengiant dažnų eilutės sujungimų?
Kuidas lahendaksite sama probleemi viimase kliki otsimisega ilma JOIN-ita?
Kas oled kunagi kokku puutunud juhusliku metsaga (tööl või koolis)? Millised on peamised erinevused juhusliku metsa ja boosting'u vahel?
Kas teinud tööd Airflow või Sparkiga? Rääkige, mis on DAG Airflow'is, kas on teie kogemustest näide? Kas ise kirjutasite DAG-e või kasutasite/käivitasite neid ainult?
Miks klasside ebavõrdsuse korral näitab täpsus ebatõenäolist kvaliteediväärtust?
Kas teil on kogemusi ajaridadega töötamisel? Milliseid mõõdikuid kasutatakse ajaridade prognoosimudelite kvaliteedi hindamiseks?
Andmed on tabel logs kasutajate sündmustega (user_id, item_id, action_type, timestamp). Kirjutage SQL-päring, et iga kasutaja jaoks leida viimase klõpsatud toote ID.
On 100 münti, millest üks on võlts — mõlemal pool on kaks kotka. Valime juhuslikult mündi, viskame selle ja tuleb kotkas. Kui suur on tõenäosus, et münt on võlts? Selgitage lahendust (kasutades Bayesi valemit).
Kui mudeli jaoks optimaalne puude arv on 500, kuid juhuslikult treenisime nii juhusliku metsa kui ka boostingut 1000 puuga, milline mudel on tõenäolisemalt üleõppinud ja miks?
Miks võib Spark ülesanne kinni jääda ja töötada väga kaua?