Exercice pratique
L'IA a généré un code pour la décision concernant le lancement d'un nouveau LLM. Effectue une revue : modifie-le pour que l'éditeur puisse comparer la qualité des versions par segments thématiques, voir la dispersion des évaluations et remarquer le risque de dégradation sur un petit groupe de données.
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
summary = scores.groupby('model_version')['score'].mean()
plt.bar(summary.index, summary.values)
plt.title('Qualité des modèles')
plt.ylabel('Note moyenne')
plt.show()
print('Meilleure version :', summary.idxmax())
---
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
stats = (
scores.groupby(["topic", "model_version"])["score"]
.agg(["mean", "std", "count"])
.reset_index()
)
print(stats)
for topic, group in scores.groupby("topic"):
group.boxplot(column="score", by="model_version")
plt.title(f"Thème : {topic}")
plt.suptitle("")
plt.ylabel("Note")
plt.show()
small_groups = stats[stats["count"] < 30]
print("Petits groupes - conclusions peu fiables :")
print(small_groups)