Wat is de HAVING-operator in SQL? Waar wordt hij gebruikt?
Machine Learning / AI
Regressie taak: het voorspellen van de aandelenprijs in het 5e jaar op basis van gegevens van 4 jaar met behulp van boosting. Welke fout hebben we gemaakt?
Wat zijn de MAPE- en SMAPE-metrics? Waar kunnen ze ineffectief zijn?
Vertel ons over het project voor het beoordelen van de kwaliteit van het werk van dispatchers: welke modellen werden gebruikt, hoe vergeleken met het referentiescript?
Waarom CatBoost in plaats van XGBoost of LightGBM? Wat zijn de verschillen?
MVP-taak: binaire classificatie met klasse-ongelijkheid, de gegevens zijn verdeeld over 10 machines, er is een tekstkenmerk. Welke aanpak zou u voorstellen?
Vertel over het clusteringproject van verzoeken met markering op basis van zakelijke belangrijkheid.
Welke metrics zijn het belangrijkst bij een grote klasse-imbalans (99 tegen 1)?
Kent u de protocollen HTTP, UDP, TLS?
Wat is het belangrijkste verschil tussen Spark en Pandas? Wat is Hadoop?
Weet je wat bagging is? Geef een voorbeeld van een algoritme.
Wat is LoRA (Low-Rank Adaptation)?
Vertel over het K-means algoritme en zijn geavanceerde varianten (K-means++).
Vertel iets over jezelf, je ervaring en projecten.
Vertel me meer over het project voor het voorspellen van personeelsverloop: wat deden jullie, welke gegevens gebruikten jullie, waarom kozen jullie voor CatBoost?
Welke metrics worden gebruikt om de kwaliteit van clustering te beoordelen? Hoe kies je het aantal clusters?