¿Cómo diseñar un sistema de almacenamiento y búsqueda para 10,000 canales de Telegram con 300,000 publicaciones al día y una latencia inferior a 2 segundos?
Machine Learning / AI
Si el worker es sincrónico, ¿tendrá batching?
¿Se pueden considerar las embeddings de forma síncrona directamente en el endpoint de la API? ¿Qué sucederá si se calculan embeddings para un gran flujo de documentos en un endpoint de FastAPI?
¿Cómo diseñar un sistema para la generación automática de contenido para canales de Telegram en el estilo del autor del canal?
¿Cómo validaste el ajuste fino de LoRA?
¿Ha utilizado alguna vez una red neuronal como métrica para evaluar la calidad?
¿Puede contarme sobre su experiencia trabajando con sistemas RAG y qué hizo en su último proyecto?
¿Cuándo elegir LoRA y cuándo recuperación por publicaciones similares? ¿Cuántos datos se necesitan para cada enfoque?
¿Qué rango estableciste para LoRA y de qué depende?
¿Hiciste todo esto tú mismo (RAG, LoRA, trabajo con redes neuronales) o ayudaste a alguien?
¿En qué capas insertaste LoRA y qué es q_proj?
¿Has desplegado redes neuronales en tus servidores o en la nube?
¿Qué métricas utilizó para evaluar la calidad del sistema y cómo logró una mejora del 40%?
¿Por qué LoRA puede sobreajustarse incluso con un número pequeño de parámetros? ¿Afecta la elección del rango al sobreajuste?
¿Por qué es necesaria una base de datos vectorial en esta arquitectura?