Que faire à la fin de la formation?
Machine Learning / AI
Qu'est-ce qui a été utilisé pour construire l'index dans RAG?
Quelle est la différence entre parallélisme de données et parallélisme de modèles?
Comment émettre une liste de résultats?
En quoi le ROC-AUC diffère-t-il des autres métriques?
Quelle est la signification de l'ancre dans Triplet Loss?
Qu'est-ce que l'attention sparse?
Quelle est la différence entre Margin Loss et Triplet Loss?
Qu'est-ce qu'une époque (epoch) ?
Qu'est-ce que n dans le contexte de la complexité de l'attention?
S'il n'y a pas de réponses de référence, il n'y a que des documents et du contexte — comment évaluer le système et d'où obtenir la réponse de référence?
Quels types d'optimisation du LLM existent?
Qu'est-ce qui a changé dans le LLM par rapport au transformateur original?
Quoi d'autre, en plus de l'entropie croisée, peut être utilisé comme fonction de perte?
Comment est formé un reranker?
Quel type d'attention permet de réduire la complexité en dessous de O(n²) ?
Qu'est-ce que la sauvegarde de gradient?
Comment évaluer un agent qui implémente RAG?
Qu'est-ce que la quantification?
Que se passe-t-il si on fournit au décodeur une séquence de 10k tokens, alors que le modèle a été entraîné sur 9k ?