¿No te importa intentar hacer una entrevista con IA?
Machine Learning / AI
¿Cuál es el nivel de ingresos mínimo y cómodo para usted en rublos?
¿Por qué está considerando una nueva oferta ahora?
¿Cuál es su educación superior y área de estudio?
¿Cómo utiliza exactamente BatchNorm las estadísticas almacenadas en modo `eval()` y por qué es importante para la estabilidad de los resultados?
¿Tiene alguna pregunta sobre los términos de la colaboración?
¿Cómo visualizaría las desviaciones en las evaluaciones temáticas para entender qué tan influyen en la imagen general?
Tarea práctica La comprobación de LLM en PyTorch da resultados diferentes en dos ejecuciones. ¿Cuál es la solución más madura? - Activar eval() y comparar los resultados nuevamente. - Aumentar el tamaño del conjunto de prueba. - Repetir la ejecución y seleccionar el mejor resultado. - Cambiar a TensorFlow sin analizar la causa. - Fijar la semilla y considerar el problema resuelto. - Verificar eval(), no_grad(), seed, DataLoader y operaciones CUDA deterministas.
Cuéntenos, ¿cómo fue su experiencia con el formato de la entrevista: qué le gustó y qué le gustaría mejorar.
Tarea práctica AI generó un código para la decisión sobre el lanzamiento de un nuevo LLM. Realiza una revisión: modifícalo para que el editor pueda comparar la calidad de las versiones por segmentos temáticos, ver la dispersión de las evaluaciones y notar el riesgo de deterioro en un pequeño grupo de datos. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Calidad de los modelos') plt.ylabel('Puntuación media') plt.show() print('Mejor versión:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Tema: {topic}") plt.suptitle("") plt.ylabel("Puntuación") plt.show() small_groups = stats[stats["count"] < 30] print("Grupos pequeños - conclusiones poco fiables:") print(small_groups)
Proporcione un ejemplo de cómo identificó y resolvió un problema de ejemplos en conflicto en un proyecto real.
Tarea práctica AI generó un código para la decisión sobre el lanzamiento de un nuevo LLM. Realiza una revisión: modifícalo para que el editor pueda comparar la calidad de las versiones por segmentos temáticos, ver la dispersión de las evaluaciones y notar el riesgo de deterioro en un pequeño grupo de datos. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Calidad de los modelos') plt.ylabel('Puntuación media') plt.show() print('Mejor versión:', summary.idxmax())
¿Cómo aseguras la procedencia de los resultados del experimento para poder entender exactamente de dónde provienen las métricas?
¿Está dispuesto a considerar proyectos a tiempo parcial y trabajos combinados?
¿Cómo te calificas a ti mismo?
¿Cómo gestionas normalmente las versiones de datos y modelos en tales experimentos?
¿Hay entrevistas actuales en grandes empresas tecnológicas, como Yandex o Alfa?
Un día antes de comparar dos versiones de LLM, se descubrió que el código del experimento en la rama está presente, pero la versión exacta de los datos y los parámetros de LoRA no están fijados. ¿Qué elegirías como el primer incremento para los próximos dos días y a qué estarías dispuesto a renunciar conscientemente?
Tarea práctica ¿Qué conjunto de artefactos permite reproducir honestamente la comparación de dos ejecuciones de LoRA? - Solo la tabla final de calidad. - Commit con código y captura de pantalla de la métrica final. - Código y archivo de configuración del experimento. - Código, hash de datos, modelo base, configuración de LoRA, dependencias y comando de ejecución. - Solo enlace a la rama de Git. - Código, parámetros de LoRA, versión del modelo base y dependencias.
Proporcione un ejemplo en el que el uso incorrecto de BatchNorm en modo `eval()` condujo a errores en las predicciones.