Comment mettre en œuvre techniquement un système de stockage de données et d'alertes pour la surveillance du modèle ?
Machine Learning / AI
En quoi la forêt aléatoire et le boosting par gradient sont-ils similaires et en quoi diffèrent-ils ? Comment sont construits les arbres dans chacun ?
Avez-vous des idées pour améliorer davantage le système de prévision de la demande ?
Parlez de la façon dont l'algorithme de clustering que vous avez utilisé fonctionnait — comment agrégeait-il les points dans l'espace ?
Comment avez-vous déterminé la qualité du clustering ? Quelles méthodes avez-vous utilisées ?
Qu'est-ce qu'une série temporelle stationnaire, comment la vérifies-tu et pourquoi est-ce important ?
Concernant Spark — quelles tâches spécifiques ont été parallélisées dessus ?
Quelle est la différence entre un intervalle de confiance et un intervalle de prédiction ? Que montrent-ils ?
Comment construire un système de suivi de la qualité et de prise de décision sur le remplacement du modèle ?
Quels modèles avez-vous utilisés pour la prévision de la demande ?
Cas : développement d'un système de tarification pour la classe affaires de S7. 300 vols par jour, ~100 avec classe affaires, 4-6 sièges. Deux objectifs : occupation maximale et revenu maximal. Tarifs mis à jour quotidiennement et après chaque achat. Actuellement, les prix sont fixés manuellement, en fonction de l'occupation. Comment aborderiez-vous cette tâche ?
Parlez de cas d'optimisation intéressants dans Spark liés aux caractéristiques et aux jointures complexes
Parlez-nous de votre expérience en Data Science
Comment résoudre le problème des données historiques décalées (les prix étaient sous-évalués, le modèle voit mal la demande à de nouveaux niveaux) ?
Comment gérer un faible volume de rétroaction sur des itinéraires calmes (peu de vols, données bruyantes) ?