Sobes.tech

Machine Learning / AI

Pourquoi une LLM quantifiée peut-elle fonctionner plus rapidement et pourquoi parfois la quantification, au contraire, ralentit-elle l'inférence?

Senior
144

Décrivez étape par étape le parcours du message utilisateur à travers le LLM lors de l'inférence — du chat à la réponse, en incluant les détails architecturaux du Transformer.

Senior
143

Quels outils d'IA utilisez-vous quotidiennement?

Senior
139

Pourquoi la mise en cache des requêtes utilisateur précises offre-t-elle généralement une valeur commerciale limitée et qu'entendiez-vous exactement par mise en cache des réponses?

Senior
135

Combien de temps a duré la recherche / cycle complet de réponse dans le système RAG?

Senior
133

Parle-moi de tes projets : qu'as-tu fait précisément, en détail technique ?

Senior
132

Quelle est la dimension des logits et comment en obtenir un token ?

Senior
131

Que reçoit le LLM en sortie à chaque étape de l'inférence?

Senior
131
/2