Praktikune ülesanne
Tehisintellekt on loonud koodi uue LLM-i väljaandmise otsuse jaoks. Tehke ülevaade: muutke seda nii, et toimetaja saaks võrrelda versioonide kvaliteeti temaatiliste segmentide kaupa, näha hinnangute hajuvust ja märkida väikese andmehulgaga seotud halvenemise riski.
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
summary = scores.groupby('model_version')['score'].mean()
plt.bar(summary.index, summary.values)
plt.title('Mudelite kvaliteet')
plt.ylabel('Keskmine hinnang')
plt.show()
print('Parim versioon:', summary.idxmax())
---
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
stats = (
scores.groupby(["topic", "model_version"])["score"]
.agg(["mean", "std", "count"])
.reset_index()
)
print(stats)
for topic, group in scores.groupby("topic"):
group.boxplot(column="score", by="model_version")
plt.title(f"Teema: {topic}")
plt.suptitle("")
plt.ylabel("Hinnang")
plt.show()
small_groups = stats[stats["count"] < 30]
print("Väikesed grupid - järeldused ei ole usaldusväärsed:")
print(small_groups)