Qu'est-ce qu'un jeton OOV et comment la sous-mot-tokenisation y fait-elle face?
Machine Learning / AI
Quelle est la différence entre le stemming et la lemmatisation ? Dans quels cas utiliser l'un ou l'autre ?
Comment profiler l'inférence LLM sur GPU (nsight, torch profiler) ?
Qu'est-ce que les images multispectrales et hyperspectrales?
Quels sont les risques de l'AutoML en termes d'interprétabilité?
Vendredi, il reste 2,5 heures jusqu'à la fin de la journée de travail. Un client d'affaires arrive et dit qu'il y a une réunion lundi à 9h30 et qu'il faut finir une tâche qui prend 5-6 heures. Que feras-tu?
Qu'est-ce que les bandits manchots et où les utiliser à la place des tests A/B?
Qu'est-ce que la rédaction et la tokenisation des PII dans les ensembles de données?
Qu'est-ce que le MIG (Multi-Instance GPU) sur A100/H100?
Qu'est-ce qu'un token et quelles sont les différences entre la tokenisation au niveau des caractères, des mots et des sous-mots?
Qu'est-ce que l'approximation de champ moyen?
Questions du candidat sur le format de travail et l'équipe.
Qu'est-ce que Medusa et les têtes de prédiction multi-token?
Qu'est-ce que les méta-apprenants (S-learner, T-learner, X-learner, R-learner) ?
Qu'est-ce qu'une attaque ciblée vs non ciblée?
Quels problèmes rencontrons-nous lors de la prévision de séries instables (démarrage à froid des produits) ?
Les données étaient-elles stockées sous forme de tableau plat ? As-tu développé toi-même les fonctionnalités ou quelqu'un d'autre l'a-t-il fait pour toi ?
Quelles sont les techniques pour travailler avec des données très dispersées?
Quelle est la différence entre la récupération sparse (BM25) et la dense?
Qu'est-ce que la compréhension de documents sans OCR (Donut, Pix2Struct) ?