Praktische Aufgabe
KI hat einen Code generiert, um die Entscheidung über die Einführung eines neuen LLM zu treffen. Überarbeite ihn: Ändere ihn so, dass der Editor die Qualität der Versionen nach thematischen Segmenten vergleichen, die Streuung der Bewertungen sehen und das Risiko einer Verschlechterung bei einer kleinen Datenmenge bemerken kann.
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
summary = scores.groupby('model_version')['score'].mean()
plt.bar(summary.index, summary.values)
plt.title('Qualität der Modelle')
plt.ylabel('Durchschnittliche Bewertung')
plt.show()
print('Beste Version:', summary.idxmax())