Machine Learning / AI
Co je CUPED a jak snižuje varianci?
Jak používat Airflow k orchestraci ETL procesů?
Jaká je pravděpodobnostní interpretace ROC-AUC?
Jak spočítat věk v letech mezi aktuálním datem a datem narození v Pythonu?
Co jsou chyby prvního a druhého druhu?
Co je to feature store a jaké úkoly řeší (Feast, Tecton)?
Jaký je rozdíl mezi DWH a Data Lake?
Jaké jsou metody odstraňování předsudků z modelu (adversarial debiasing)?
Jaké modely rozpoznávání řetězců (CRNN, TrOCR)?
Co je to ordered boosting v CatBoost?
Jaké úkoly řeší GNN v doporučovacích systémech (PinSage, LightGCN)?
Co je generování kandidátů a jaké jsou přístupy (BM25, dense, hybrid)?
Co dělat, pokud se model nevejde na GPU při dalším tréninku?
Jaké důvody mohou vést k různým hodnotám průměrné denní návštěvnosti webové služby u různých analytiků?
Co je to popularita-bayas a jak s tím bojovat?
Co je to FFN vrstva v transformátoru a proč je potřeba nelinearita mezi attention-bloky?
Co je to NF4 kvantování v QLoRA?
Co je to logistická regrese?
Co jsou kontextuální bandité?
Proč je při destilaci důležité hledat podobné vrstvy u učitele a studenta?