Machine Learning / AI
Raconte-moi plus en détail comment était organisé le pipeline du système RAG (filtrage, re-ranking), ce que tu as fait personnellement et ce que tes collègues ont fait?
Raconte comment fonctionne le re-ordonnanceur — est-ce que tu es allé dans les détails ou l'as-tu utilisé comme un bloc de construction prêt à l'emploi?
Quelle est la différence entre l'architecture GPT et l'architecture BERT?
-- 1.1 Que va à afficher la requête: SELECT campaign, COUNT(*) as rows, COUNT(DISTINCT co.user_id) AS users FROM campaigns AS ca INNER JOIN communications AS co ON ca.campaign = co.campaign GROUP BY ca.campaign AS campaign -- 1.2 Comment la réponse changera-t-elle si on change le type de JOIN en LEFT? -- 1.3 Indiquez l'ordre d'exécution des opérateurs dans cette requête. -- 2. La table campaigns a été corrigée : suppression des doublons, ajout d'une clé (PK). -- Plus de campagnes ont été menées, en raison de bugs, certains utilisateurs ont commencé à avoir des tentatives de livraison de communications infructueuses, et certains n'ont pas pu du tout être affichés. -- Exemple 1 : communications -- | user_id | campaign | status | -- | 1000001 | promo_cats | error | -- | 1000001 | promo_cats | error | -- | 1000001 | promo_cats | success| -- | 1000001 | promo_cats | success| -- | 1000001 | promo_cats | error | -- Exemple 2 : communications -- | user_id | campaign | status | -- | 1000002 | promo_rats | error | -- | 1000002 | promo_rats | error | -- | 1000002 | promo_rats | error | -- | 1000002 | promo_rats | error | -- | 1000002 | promo_rats | error | -- Sur les campagnes promotionnelles envoyées aux utilisateurs : -- 2.1 Écrivez une requête qui affiche le nombre d'utilisateurs ayant reçu avec succès la communication, pour chaque campagne. -- 2.2 Modifiez la requête pour afficher : le nombre d'utilisateurs n'ayant reçu aucune communication réussie, pour chaque campagne.
Quand serez-vous prêt à commencer le projet?
Parlez du cycle complet de lancement d'un produit sur un nouveau marché chez [entreprise] : que comprenez-vous par cycle complet, quelles étapes, métriques, résultats.
Quoi d'autre, en plus de l'entropie croisée, peut être utilisé comme fonction de perte?
Parlez-moi de vous et de votre expérience pertinente.
Raconte-moi l'architecture principale du transformateur, quelles sont ses parties principales.
Comment les embeddings positionnels modifient-ils Q, K, V?
Existe-t-il une méthodologie de développement spécifique (Agile, Scrum, Kanban) ?
Pourquoi choisir CatBoost plutôt que XGBoost ou LightGBM ? Quelles sont les différences ?
Qu'est-ce qui est important pour vous lors du choix d'un nouveau lieu de travail ? Les tâches ou le travail en équipe produit ?
Parlez-moi des paramètres de génération : température, Top-P et Top-K.
Qu'est-ce que le déséquilibre de classes en NER et comment y faire face?
Connaissez-vous le bagging ? Donnez un exemple d'algorithme.
Parlez de votre expérience dans le contexte du poste de Data Scientist.
Comment avez-vous mesuré la qualité de l'extraction des données?
Qu'est-ce que le RAG et quels sont ses composants principaux?
Quelles métriques ont été utilisées pour évaluer le système RAG et comment la décision de le déployer en production a-t-elle été prise?