Como projetar um sistema de armazenamento e busca para 10.000 canais do Telegram com 300.000 posts por dia, com latência inferior a 2 segundos?
Machine Learning / AI
Se o worker for síncrono, terá batching?
É possível considerar as embeddings de forma síncrona diretamente no endpoint da API? O que acontecerá se calcular embeddings para um grande fluxo de documentos em um endpoint FastAPI?
Como projetar um sistema para a geração automática de conteúdo para canais do Telegram no estilo do autor do canal?
Quando escolher LoRA e quando recuperação por posts semelhantes? Quantos dados são necessários para cada abordagem?
Como validou o ajuste fino do LoRA?
Usou alguma vez uma rede neural como métrica de avaliação de qualidade?
Pode falar sobre sua experiência com sistemas RAG e o que fez no seu último projeto?
Qual foi o rank que você atribuiu ao LoRA e do que ele depende?
Fiz tudo isso você mesmo (RAG, LoRA, trabalho com redes neurais) ou ajudou alguém?
Que métricas utilizou para avaliar a qualidade do sistema e como obteve uma melhoria de 40 %?
Em que camadas você inseriu LoRA e o que é q_proj?
Já implementaste redes neurais nos teus servidores ou na cloud?
Por que o LoRA pode sobreajustar mesmo com um número pequeno de parâmetros? A escolha do rank afeta o sobreajuste?
Por que é necessária uma base de dados vetorial nesta arquitetura?