Sobes.tech
Senior

Praktische Aufgabe KI hat einen Code für die Entscheidung über die Einführung eines neuen LLM generiert. Überprüfe ihn: Ändere ihn so, dass der Editor die Qualität der Versionen nach thematischen Segmenten vergleichen, die Streuung der Bewertungen sehen und das Risiko einer Verschlechterung bei einer kleinen Datenmenge bemerken kann. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Modellqualität') plt.ylabel('Durchschnittliche Bewertung') plt.show() print('Beste Version:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Thema: {topic}") plt.suptitle("") plt.ylabel("Bewertung") plt.show() small_groups = stats[stats["count"] < 30] print("Kleine Gruppen - Schlussfolgerungen sind nicht zuverlässig:") print(small_groups)