Quels sont les principaux paramètres que nous configurons généralement pour les tâches DAG et pourquoi le graphique doit être exactement ainsi (logique de haut niveau de DAG) ?
Machine Learning / AI
Avez-vous travaillé avec Spark ? Quelle est votre idée générale de ce que c'est ?
Quelles sont les métriques appropriées et lesquelles ne le sont pas lorsque nous parlons de déséquilibre des classes ?
Étant donné une chaîne contenant des lettres et des chiffres. Trouvez le nombre maximum apparaissant dans la chaîne (en considérant les chiffres consécutifs comme un seul nombre).
Que se passe-t-il en Python lors de la concaténation de chaînes (par exemple, current += char) ? Pourquoi cette approche peut-elle être problématique dans cette tâche et comment optimiser le code pour éviter des concaténations fréquentes de chaînes ?
Comment résoudriez-vous ce même problème de recherche du dernier clic sans utiliser JOIN?
Avez-vous déjà rencontré une forêt aléatoire (au travail ou à l'école) ? Quelles sont les principales différences entre une forêt aléatoire et le boosting ?
Avez-vous travaillé avec Airflow ou Spark ? Parlez-moi de ce qu'est un DAG dans Airflow, pouvez-vous donner un exemple de votre expérience ? Avez-vous écrit des DAGs vous-même ou vous êtes-vous contenté de les utiliser/lancer ?
Pourquoi la précision en cas de déséquilibre des classes affiche-t-elle une valeur de qualité inadéquate?
Avez-vous de l'expérience avec les séries temporelles ? Quelles métriques sont utilisées pour évaluer la qualité des modèles de prévision des séries temporelles ?
Étant donné la table logs avec les événements des utilisateurs (user_id, item_id, action_type, timestamp). Écrivez une requête SQL pour trouver l'ID du dernier article sur lequel chaque utilisateur a cliqué.
Il y a 100 pièces, dont une est fausse — avec deux aigles de chaque côté. Nous choisissons une pièce au hasard, la lançons, et un aigle apparaît. Quelle est la probabilité que la pièce soit fausse ? Expliquez la solution (en utilisant la formule de Bayes).
Si le nombre optimal d'arbres pour le modèle est de 500, mais que nous avons accidentellement entraîné à la fois une forêt aléatoire et un boosting avec 1000 arbres, lequel des modèles est le plus susceptible de surajuster et pourquoi?
Pourquoi une tâche dans Spark peut-elle rester bloquée et prendre beaucoup de temps?