Qu'est-ce que l'opérateur HAVING en SQL ? Où est-il utilisé ?
Machine Learning / AI
Problème de régression : prédire le prix des actions pour la 5ème année en utilisant les données des 4 années précédentes avec le boosting. Quelle erreur avons-nous commise ?
Quelles sont les métriques MAPE et SMAPE ? Où peuvent-elles être inefficaces ?
Parlez-nous du projet d'évaluation de la qualité du travail des dispatchers : quels modèles ont été utilisés, comment ont-ils été comparés au script de référence ?
Pourquoi choisir CatBoost plutôt que XGBoost ou LightGBM ? Quelles sont les différences ?
Tâche MVP : classification binaire avec déséquilibre des classes, les données sont réparties sur 10 machines, il y a une caractéristique textuelle. Quelle approche proposeriez-vous ?
Parlez-nous du projet de clustering des demandes avec une annotation par importance commerciale.
Quelles métriques sont prioritaires en cas de déséquilibre important des classes (99 à 1) ?
Connaissez-vous les protocoles HTTP, UDP, TLS?
Quelle est la principale différence entre Spark et Pandas ? Qu'est-ce que Hadoop ?
Connaissez-vous le bagging ? Donnez un exemple d'algorithme.
Qu'est-ce que LoRA (Low-Rank Adaptation) ?
Parlez-moi plus en détail du projet de prévision du départ des employés : ce que vous avez fait, quelles données vous avez utilisées, pourquoi avez-vous choisi CatBoost ?
Parlez-moi de vous, de votre expérience et de vos projets.
Parlez de l'algorithme K-means et de ses variantes avancées (K-means++).
Quelles métriques sont utilisées pour évaluer la qualité du clustering ? Comment choisir le nombre de clusters ?