Sobes.tech

Machine Learning / AI

Jaké hlavní parametry obvykle nastavujeme pro úlohy DAG a proč musí být graf právě takový (vysoká úroveň logiky DAG)?

194

Které metriky jsou vhodné a které ne, když mluvíme o nerovnováze tříd?

167

Co se děje v Pythonu při spojování řetězců (například current += char)? Proč může být tento přístup v této úloze problémový a jak optimalizovat kód, aby se vyhnulo častému spojování řetězců?

163

Dan je řetězec obsahující písmena a číslice. Najděte největší číslo, které se v řetězci vyskytuje (považujte po sobě jdoucí číslice za jedno číslo).

162

Pracoval jste s Sparkem? Jaký máte obecný názor na to, co to je?

161

Setkal jste se někdy s náhodným lesem (v práci nebo ve škole)? Jaké jsou hlavní rozdíly mezi náhodným lesem a boostingem?

158

Jak byste vyřešili tentýž problém hledání posledního kliknutí bez použití JOIN?

157

Pracoval jste s Airflow nebo Spark? Povíte mi, co je DAG v Airflow, můžete uvést příklad ze své zkušenosti? Sám jste psal DAGy nebo je jen používal/spouštěl?

154

Máte zkušenosti s časovými řadami? Jaké metriky se používají k hodnocení kvality modelů předpovědi časových řad?

149

Proč přesnost při nerovnováze tříd ukazuje nevhodnou hodnotu kvality?

149

Dána tabulka logs s událostmi uživatelů (user_id, item_id, action_type, timestamp). Napište SQL dotaz, který pro každého uživatele najde ID posledního kliknutého produktu.

142

Existuje 100 mincí, z nichž jedna je falešná — s dvěma orly na obou stranách. Náhodně vybíráme minci, hodíme ji a vyjde orl. Jaká je pravděpodobnost, že mince je falešná? Vysvětlete řešení (pomocí Bayesova vzorce).

142

Pokud je optimální počet stromů pro model 500, ale náhodou jsme natrénovali jak náhodný les, tak boosting na 1000 stromů, který z modelů je pravděpodobnější, že se přetrénuje a proč?

137

Proč může být úloha v Spark zablokovaná a trvat velmi dlouho?

135