Практиկայ գործառույթ
Արհեստական բանականությունը ստեղծել է կոդ նոր LLM թողարկելու որոշման համար: Կատարեք վերանայում՝ այն փոխեք այնպես, որ խմբագրողը կարողանա համեմատել տարբերակների որակը թեմատիկ հատվածներով, տեսնել գնահատականների տարածումը և նկատել փոքր տվյալների խմբում վատթարացման ռիսկը:
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
summary = scores.groupby('model_version')['score'].mean()
plt.bar(summary.index, summary.values)
plt.title('Մոդելների որակը')
plt.ylabel('Միջին գնահատական')
plt.show()
print('Լավագույն տարբերակ՝', summary.idxmax())
---
import matplotlib.pyplot as plt
import pandas as pd
scores = pd.read_csv('model_scores.csv')
stats = (
scores.groupby(["topic", "model_version"])["score"]
.agg(["mean", "std", "count"])
.reset_index()
)
print(stats)
for topic, group in scores.groupby("topic"):
group.boxplot(column="score", by="model_version")
plt.title(f"Թեմա: {topic}")
plt.suptitle("")
plt.ylabel("Գնահատում")
plt.show()
small_groups = stats[stats["count"] < 30]
print("Փոքր խմբեր - եզրակացությունները չեն վստահելի:")
print(small_groups)