Sobes.tech

Machine Learning / AI

Comment évaluer la qualité du récupérateur ? D'où obtenir une collection de documents pour évaluer les métriques ?

369

Vous avez un petit ensemble de données avec des critiques de films en russe et leur étiquette binaire de tonalité (étiquettes : 0 — négatif, 1 — positif). Votre tâche est de mettre en œuvre un pipeline complet en 15 minutes pour entraîner un modèle simple de classification de texte sans utiliser d'encodeurs pré-entraînés comme BERT, et d'afficher la précision (accuracy) sur ces données. reviews = [ "Ce film est tout simplement incroyable!", "Jeu d'acteurs horrible et intrigue ennuyeuse.", "J'ai adoré chaque instant!", "Le pire film que j'ai vu.", "Excellent travail de réalisation et histoire merveilleuse.", "Insoportable ennuyeux et prévisible." ] labels = [1, 0, 1, 0, 1, 0]

183

Quelle est la différence entre Tensor Parallel Size et Data Parallel Size dans vLLM?

183

Quel paramètre dans le modèle d'embedding détermine le nombre maximum de tokens à l'entrée ? Que se passe-t-il si l'on fournit plus de tokens que la limite ?

168

Comment l'augmentation de la taille du batch par 4 influence-t-elle le taux d'apprentissage et pourquoi ? Comment fonctionne la rétropropagation ?

163

Comment les données sont-elles extraites de la base vectorielle par une requête utilisateur?

153

Qu'est-ce que la quantification du modèle et que se passe-t-il avec les poids lors de son application dans vLLM?

153

Que se passe-t-il si on fournit un contexte de 120 000 tokens dans un LLM avec une limite de 60 000 ?

151

Comment la recherche d'informations a-t-elle été organisée dans la base vectorielle ? Pourquoi avoir utilisé Qdrant ?

141

Qu'est-ce que LangGraph, à quoi sert-il, comment sont implémentées les branches et les sauts conditionnels ? En quoi les outils diffèrent-ils des nœuds ?

140