Comment déterminer si un modèle d'embeddings fonctionne bien ? Quelles métriques ont été utilisées ?
Machine Learning / AI
Peux-tu expliquer la différence entre cross-encoder et bi-encoder?
Existe-t-il un moyen de vérifier que le texte généré ne contient pas d'erreurs factuelles par rapport à l'original ?
Comment les données ont-elles été extraites des documents PDF pour le système RAG?
Parlez-moi de la quantification des modèles : qu'est-ce que c'est, à quoi ça sert, quels sont les types?
Comment la stratégie de découpage (chunking) a-t-elle été choisie pour le système RAG?
Comment tester un service implémenté sur FastAPI?
Parle-moi des métriques de performance du service ML : latence, RPS, comment cela a été organisé dans ton projet ?
Parlez-moi des bases de données vectorielles, lesquelles existent, quelles sont leurs différences, pourquoi avez-vous choisi pgvector?
Parlez-moi des paramètres de génération de LLM : température, top-k, top-p et autres.
Comment Recall et Precision sont-ils liés, peut-on augmenter l'un sans diminuer l'autre ? Donnez des exemples de tâches.
Parlez-moi de la tâche la plus difficile ou de la difficulté dans l'un des projets.
Comment les données ont-elles été organisées pour la synthèse des dialogues et comment s'est déroulé l'apprentissage?
Quelle méthode de quantification (int8 ou float) détériorera le moins la qualité du modèle?
Comment évaluer la qualité de la synthèse?
Comment aborderais la tâche de résumer un dialogue de plusieurs personnes lors d'une conférence (par exemple, 10 développeurs sur Slack) ?
Quel modèle et quelle approche choisir pour traiter l'audio d'une conférence (reconnaissance vocale, diarisation) ?
Parle-moi de LoRA : qu'est-ce que c'est, à quoi ça sert ?
Comment travailler avec des données privées lors du déploiement local du système?
Pourquoi avoir choisi la recherche hybride BM25 + embeddings au lieu de la seule distance cosinus?