Jaké hlavní parametry obvykle nastavujeme pro úlohy DAG a proč musí být graf právě takový (vysoká úroveň logiky DAG)?
Machine Learning / AI
Které metriky jsou vhodné a které ne, když mluvíme o nerovnováze tříd?
Co se děje v Pythonu při spojování řetězců (například current += char)? Proč může být tento přístup v této úloze problémový a jak optimalizovat kód, aby se vyhnulo častému spojování řetězců?
Dan je řetězec obsahující písmena a číslice. Najděte největší číslo, které se v řetězci vyskytuje (považujte po sobě jdoucí číslice za jedno číslo).
Pracoval jste s Sparkem? Jaký máte obecný názor na to, co to je?
Setkal jste se někdy s náhodným lesem (v práci nebo ve škole)? Jaké jsou hlavní rozdíly mezi náhodným lesem a boostingem?
Jak byste vyřešili tentýž problém hledání posledního kliknutí bez použití JOIN?
Pracoval jste s Airflow nebo Spark? Povíte mi, co je DAG v Airflow, můžete uvést příklad ze své zkušenosti? Sám jste psal DAGy nebo je jen používal/spouštěl?
Máte zkušenosti s časovými řadami? Jaké metriky se používají k hodnocení kvality modelů předpovědi časových řad?
Proč přesnost při nerovnováze tříd ukazuje nevhodnou hodnotu kvality?
Dána tabulka logs s událostmi uživatelů (user_id, item_id, action_type, timestamp). Napište SQL dotaz, který pro každého uživatele najde ID posledního kliknutého produktu.
Existuje 100 mincí, z nichž jedna je falešná — s dvěma orly na obou stranách. Náhodně vybíráme minci, hodíme ji a vyjde orl. Jaká je pravděpodobnost, že mince je falešná? Vysvětlete řešení (pomocí Bayesova vzorce).
Pokud je optimální počet stromů pro model 500, ale náhodou jsme natrénovali jak náhodný les, tak boosting na 1000 stromů, který z modelů je pravděpodobnější, že se přetrénuje a proč?
Proč může být úloha v Spark zablokovaná a trvat velmi dlouho?