Después de la nueva versión del modelo, la puntuación media de calidad aumentó, pero los editores dicen que las respuestas en temas jurídicos y financieros se han deteriorado notablemente. ¿Qué visualización harías primero para decidir si detener la publicación?
Machine Learning / AI
Proporcione un ejemplo en el que el uso incorrecto de BatchNorm en modo `eval()` condujo a errores en las predicciones.
Tarea práctica ¿Qué conjunto de artefactos permite reproducir honestamente la comparación de dos ejecuciones de LoRA? - Solo la tabla final de calidad. - Commit con código y captura de pantalla de la métrica final. - Código y archivo de configuración del experimento. - Código, hash de datos, modelo base, configuración de LoRA, dependencias y comando de ejecución. - Solo enlace a la rama de Git. - Código, parámetros de LoRA, versión del modelo base y dependencias.
¿Cómo gestionas normalmente las versiones de datos y modelos en tales experimentos?
¿Hay entrevistas actuales en grandes empresas tecnológicas, como Yandex o Alfa?
Tarea práctica La consulta SQL a 80 millones de mensajes crea duplicados después del JOIN. ¿Qué acción es mejor comenzar primero? - Verificar la cardinalidad del JOIN, las claves y el plan de ejecución antes de optimizar. - Crear un índice en un campo de la unión. - Exportar el resultado a CSV y eliminar duplicados en Python. - Siempre agregar DISTINCT a todas las columnas. - Agregar DISTINCT después de verificar el resultado en la muestra. - Verificar las claves de unión y la unicidad de ambas tablas.
¿Planea seguir quedándose en Filipinas o mudarse a otro país?
¿Puede contarme más detalles sobre qué exactamente le pareció "agobiante" en las preguntas y cómo esto afectó su percepción de la entrevista?
¿Tiene experiencia trabajando en equipos completamente anglófonos?
¿Tiene experiencia en entrevistas con IA?
¿Tiene ofertas en mano o etapas finales en otras empresas?
¿Cómo evaluaría cuantitativamente el impacto de las emisiones en las métricas del modelo, como la precisión o la puntuación F1?
¿Cómo optimizaría los índices en las claves de unión para reducir duplicados y acelerar las consultas?
Imagina que estás trabajando con un modelo en PyTorch y, después de convertirlo a modo evaluación eval(), ves que las métricas en un conjunto de prueba fijo de 10,000 ejemplos cambian en cada ejecución. Fijas el estado inicial de los generadores de números aleatorios para reproducibilidad: ¿dónde más podría estar oculto el origen de los cambios? Explica el papel de Dropout, BatchNorm y torch.no_grad() y nombra las métricas con umbrales con los que verificarás la estabilidad de los resultados.
Evalúe su inglés por separado para lectura/escritura y conversación según los niveles CEFR.
¿Cómo usaría exactamente `EXPLAIN` para identificar problemas de rendimiento en esta consulta?
Tarea práctica AI propone entrenar LoRA en los 2 millones de diálogos sin limpiar. ¿Cuál es la respuesta más madura del candidato? - Confiar en AI: un gran corpus compensará los errores. - Primero cambiar el prompt sin modificar los datos. - Entrenar LoRA en la parte limpia y compararla con el modelo base. - Verificar una muestra aleatoria de las etiquetas antes del entrenamiento. - Primero verificar los datos y la calidad por temas en un conjunto separado, luego entrenar LoRA de manera limitada. - Entrenar en todo el corpus, pero reducir el rango de LoRA.
¿Qué formato de formalización le resulta más conveniente: GPH, IP o TК?
En la tabla de diálogos hay 80 millones de mensajes, y la consulta analítica para el conjunto de evaluación tarda 25 minutos y a veces devuelve pares de preguntas-respuestas duplicados. ¿Qué corregirías primero y por qué?
Para generar preguntas, el gran modelo de lenguaje tiene dificultades para mantener el estilo en temas raros. El asistente de IA propone lanzar inmediatamente LoRA en todo el corpus histórico de 2 millones de diálogos, pero la anotación es parcialmente ruidosa. ¿En qué casos no confiaría en este consejo y qué elegiría primero?