Machine Learning / AI
Z pohledu analytických úkolů, co to bylo? Setkal ses s A/B testy? Jaké metriky jsi používal?
Proběhlo dodatečné trénování modelu pro tento úkol (ne LLM)?
Měl jste kontakt s klienty? V jakém formátu?
Úkol v Pythonu: najděte index prvního jedinečného znaku v řetězci (First Unique Character)
Povězte o algoritmu K-means a jeho pokročilých variantách (K-means++).
Řekněte mi více o konkrétních výsledcích a projektech v současné společnosti.
Pracoval jste s Sparkem? Jaký máte obecný názor na to, co to je?
Pokud mluvíme o minimální mzdě?
Jak škálovat systém při velké zátěži?
Jsou nějaké otázky ohledně pracovních podmínek a projektu?
Co je MVCC?
Jaké je pořadí provádění operátorů v SQL dotazu?
Jaké modely byly použity v každé fázi? Pro extrakci entit, pro vektorizaci, pro generování?
Co je metoda hlavních komponent (PCA) a jak se používá?
Proč může být úloha v Spark zablokovaná a trvat velmi dlouho?
Co myslíš pod chybou (při přístupu s promptem)?
Praktický úkol SQL dotaz na 80 milionů zpráv vytváří duplicitní záznamy po JOINu. Jakou akci je nejlepší začít jako první? - Zkontrolovat kardinalitu JOINu, klíče a plán provedení před optimalizací. - Vytvořit index na jednom poli spojení. - Exportovat výsledek do CSV a odstranit duplicitní záznamy v Pythonu. - Vždy přidat DISTINCT ke všem sloupcům. - Přidat DISTINCT po kontrole výsledku na vzorku. - Zkontrolovat klíče spojení a jedinečnost obou tabulek.
Proč je potřeba normalizace (Layer Norm) — proč stabilizovat učení?
Jak byly zpracovávány špičky zátěže v systému RAG? Co se dělo při vysoké zátěži?
Jak jste hodnotili kvalitu agenta Text-to-SQL?