Comment concevoir un système de stockage et de recherche pour 10 000 canaux Telegram avec 300 000 publications par jour et une latence inférieure à 2 secondes?
Machine Learning / AI
Si le worker est synchrone, aura-t-il batching?
Peut-on considérer les embeddings de manière synchrone directement dans le endpoint de l'API ? Que se passera-t-il si l'on calcule des embeddings pour un grand flux de documents dans un endpoint FastAPI ?
Comment concevoir un système pour la génération automatique de contenu pour les canaux Telegram dans le style de l'auteur du canal?
Avez-vous déjà utilisé un réseau de neurones comme métrique d'évaluation de la qualité?
Pouvez-vous me parler de votre expérience avec les systèmes RAG et ce que vous avez fait dans votre dernier projet?
Comment avez-vous validé le fine-tuning de LoRA?
Quand choisir LoRA et quand la récupération par des publications similaires ? Combien de données sont nécessaires pour chaque approche ?
Quel rang as-tu attribué à LoRA et de quoi dépend-il?
Est-ce que tu as fait tout cela toi-même (RAG, LoRA, travail avec des réseaux neuronaux) ou as-tu aidé quelqu'un ?
Dans quelles couches as-tu inséré LoRA et qu'est-ce que q_proj?
As-tu déployé des réseaux neuronaux sur tes serveurs ou dans le cloud?
Quelles métriques avez-vous utilisées pour évaluer la qualité du système et comment avez-vous obtenu une amélioration de 40 %?
Pourquoi LoRA peut-il surajuster même avec un petit nombre de paramètres ? Le choix du rang influence-t-il le surapprentissage ?
Pourquoi une base de données vectorielle est-elle nécessaire dans cette architecture?