Praktische opdracht
AI heeft code gegenereerd voor de beslissing over het uitbrengen van een nieuwe LLM. Voer een review uit: pas het aan zodat de editor de kwaliteit van de versies kan vergelijken op basis van thematische segmenten, de spreiding van beoordelingen kan zien en het risico op verslechtering in een kleine datagroep kan opmerken.
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
summary = scores.groupby('model_version')['score'].mean()
plt.bar(summary.index, summary.values)
plt.title('Kwaliteit van de modellen')
plt.ylabel('Gemiddelde beoordeling')
plt.show()
print('Beste versie:', summary.idxmax())
---
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
stats = (
scores.groupby(["topic", "model_version"])["score"]
.agg(["mean", "std", "count"])
.reset_index()
)
print(stats)
for topic, group in scores.groupby("topic"):
group.boxplot(column="score", by="model_version")
plt.title(f"Thema: {topic}")
plt.suptitle("")
plt.ylabel("Beoordeling")
plt.show()
small_groups = stats[stats["count"] < 30]
print("Kleine groepen - conclusies zijn onbetrouwbaar:")
print(small_groups)