¿Cómo funciona la tokenización? ¿Por qué se utilizan subword tokens en lugar de palabras completas?
Machine Learning / AI
Háblame de BGE-M3: tres representaciones — denso, disperso, multi-vector.
¿Qué son Recall y Precision? Problema: 50 frutas, 30 manzanas y 20 peras, un robot encontró correctamente 20 manzanas, pero identificó incorrectamente 15 peras como manzanas. Calcule las métricas.
¿Está familiarizado con LoRA y los métodos de ajuste fino?
¿Cómo se seleccionaron los coeficientes para la búsqueda híbrida?
¿Por qué necesitabas 12,000 pares de pregunta-respuesta si solo había 15 plantillas?
¿Por qué reconociste los documentos como imágenes en lugar de crear un analizador?
¿Cómo formó el conjunto de datos de prueba: de esas mismas 12,000 pares o de nuevos datos?
Cuéntenos sobre la agrupación: qué problema resolvieron, qué método usaron, ¿cómo midieron la calidad?
¿Cómo funciona un transformador? Cuéntame sobre BERT y GPT.
¿Qué es un vector denso (embedding denso)? ¿Cómo se obtiene? ¿Cuál es su tamaño?
¿Qué modelos se utilizaron en cada etapa? ¿Para la extracción de entidades, para la vectorización, para la generación?
¿Cómo evaluó la calidad del sistema RAG? ¿Qué métricas utilizó?
¿Qué es un cross-encoder y dónde lo has utilizado?
¿Por qué es necesario reducir el tamaño del diccionario? ¿Por qué es malo tener un diccionario grande? ¿En qué función se produce la carga?
¿Qué se enviaba al usuario final en su sistema?
¿Qué es un vector disperso? ¿En qué se diferencia de uno denso?
¿Cuál es la diferencia entre las solicitudes GET y POST?
Explique en palabras simples cómo funciona su sistema para un usuario, sin asincronía.
¿Para una consulta, se ajusta una de las 12,000 respuestas o muchas?