Comment fonctionne la tokenisation ? Pourquoi utilise-t-on des sous-mots plutôt que des mots entiers ?
Machine Learning / AI
Parlez de BGE-M3 : trois représentations — dense, sparse, multi-vecteur.
Qu'est-ce que Recall et Precision ? Problème : 50 fruits, 30 pommes et 20 poires, un robot a trouvé correctement 20 pommes, mais a reconnu à tort 15 poires comme des pommes. Calculez les métriques.
Connaissez-vous LoRA et les méthodes de fine-tuning?
Comment ont été sélectionnés les coefficients pour la recherche hybride?
Pourquoi aviez-vous besoin de 12 000 paires question-réponse alors qu'il n'y avait que 15 modèles ?
Pourquoi avez-vous reconnu les documents comme des images plutôt que de créer un parseur?
Comment avez-vous constitué l'ensemble de données de test : à partir des mêmes 12 000 paires ou de nouvelles données?
Parlez-nous de la clustering : quel problème avez-vous résolu, quelle méthode avez-vous utilisée, comment avez-vous mesuré la qualité ?
Qu'est-ce qu'un vecteur dense (embedding dense) ? Comment est-il obtenu ? Quelle est sa taille ?
Comment fonctionne un transformateur ? Parlez-moi de BERT et GPT.
Quels modèles ont été utilisés à chaque étape ? Pour l'extraction d'entités, pour la vectorisation, pour la génération ?
Comment avez-vous évalué la qualité du système RAG ? Quelles métriques avez-vous utilisées ?
Qu'est-ce qui était envoyé à l'utilisateur final dans votre système?
Qu'est-ce qu'un cross-encoder et où l'avez-vous utilisé?
Pourquoi est-il nécessaire de réduire la taille du dictionnaire ? Qu'est-ce qui ne va pas avec un grand dictionnaire ? Dans quelle fonction la charge se produit-elle ?
Quelle est la différence entre les requêtes GET et POST?
Qu'est-ce qu'un vecteur sparse ? En quoi diffère-t-il d'un vecteur dense ?
Expliquez en termes simples comment fonctionne votre système pour un utilisateur, sans asynchronie.
Pour une requête, est-ce qu'une des 12 000 réponses suffit ou plusieurs?