Praktische Aufgabe
KI hat einen Code für die Entscheidung über die Einführung eines neuen LLM generiert. Überprüfe ihn: Ändere ihn so, dass der Editor die Qualität der Versionen nach thematischen Segmenten vergleichen, die Streuung der Bewertungen sehen und das Risiko einer Verschlechterung bei einer kleinen Datenmenge bemerken kann.
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
summary = scores.groupby('model_version')['score'].mean()
plt.bar(summary.index, summary.values)
plt.title('Modellqualität')
plt.ylabel('Durchschnittliche Bewertung')
plt.show()
print('Beste Version:', summary.idxmax())
---
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
stats = (
scores.groupby(["topic", "model_version"])["score"]
.agg(["mean", "std", "count"])
.reset_index()
)
print(stats)
for topic, group in scores.groupby("topic"):
group.boxplot(column="score", by="model_version")
plt.title(f"Thema: {topic}")
plt.suptitle("")
plt.ylabel("Bewertung")
plt.show()
small_groups = stats[stats["count"] < 30]
print("Kleine Gruppen - Schlussfolgerungen sind nicht zuverlässig:")
print(small_groups)