Machine Learning / AI
¿Te conviene el formato de trabajo: contrato laboral indefinido y período de prueba de 3 meses?
¿Qué es la probabilidad de examen?
¿Por qué en el boosting generalmente se utilizan árboles poco profundos y cómo afecta el número de árboles al sobreajuste?
¿Cómo detectar en la práctica si una prueba se ha agotado o si ha ocurrido un cambio de distribución?
¿Cómo implementar una función que devuelva una lista de los cuadrados de los elementos?
¿Qué tipos de regularización conoces?
¿Qué métodos de regularización son aplicables a las redes neuronales?
¿Cómo organizar los pipelines y el despliegue de modelos en producción?
¿Qué es la privacidad diferencial y cuál es la definición (epsilon, delta)?
¿De qué grandes partes consta el agente?
¿Qué es un modelo generativo de etiquetas en Snorkel?
¿Por qué el MAE es menos sensible a los valores atípicos que el MSE?
¿Por qué se multiplica el vector Q durante la decodificación y qué se obtiene?
¿Qué es el aprendizaje contrafactual para clasificar?
Nombra al menos tres limitaciones que es importante tener en cuenta al trabajar con LLM como tecnología.
¿Qué son las tablas históricas?
¿Qué métodos de ensamblaje conoces? ¿Qué grupos de métodos de ensamblaje existen?
¿Cuáles son las ventajas y desventajas de usar validación cruzada?
¿Cómo es en general el camino de una aplicación ML/LLM desde Dockerfile y código fuente hasta un servicio desplegado y tráfico de usuarios en Kubernetes?
Tarea práctica AI generó un código para la decisión sobre el lanzamiento de un nuevo LLM. Realiza una revisión: modifícalo para que el editor pueda comparar la calidad de las versiones por segmentos temáticos, ver la dispersión de las evaluaciones y notar el riesgo de deterioro en un pequeño grupo de datos. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Calidad de los modelos') plt.ylabel('Puntuación media') plt.show() print('Mejor versión:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Tema: {topic}") plt.suptitle("") plt.ylabel("Puntuación") plt.show() small_groups = stats[stats["count"] < 30] print("Grupos pequeños - conclusiones poco fiables:") print(small_groups)