Machine Learning / AI
Предложете вариант за разработване на система за препоръки на задачи за ученик на образователна платформа.
Практическо задание Изкуственият интелект генерира код за решението относно пускането на нов LLM. Направете преглед: променете го така, че редакторът да може да сравнява качеството на версиите по тематични сегменти, да вижда разпръснатостта на оценките и да забележи риска от влошаване в малка група данни. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Качество на моделите') plt.ylabel('Средна оценка') plt.show() print('Най-добра версия:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Тема: {topic}") plt.suptitle("") plt.ylabel("Оценка") plt.show() small_groups = stats[stats["count"] < 30] print("Малки групи - изводите не са надеждни:") print(small_groups)
След идентификатора на токена и вграждания, какво точно постъпва в декодера: каква е формата на представянията, как се добавя позиционната информация и какво се случва след това?
Какво е early stopping в HPO (ASHA, Hyperband)?
Какво е CV-leak и какви са неговите източници?
Как да проверите статистическата значимост на лидерството на партията [число] от [число] гласа?
Как да проектираме система за съхранение и търсене за 10 000 Telegram канала с 300 000 публикации на ден, с латентност по-малка от 2 секунди?
Какво е entity linking и кои модели го решават?
Имате ли сега оферти/предложения в ръка? Колко активно разглеждате предложенията?
В таблицата с диалози има 80 милиона съобщения, а аналитичният заявка за оценъчния набор отнема 25 минути и понякога връща дублиращи се двойки въпрос-отговор. Какво ще поправите първо и защо?
Защо статичните вграждания не са подходящи за омонимия и полисемия?
Защо е необходимо квантоването на моделите преди разгръщането?
Кой embedding модел да изберем за RAG?
Как да вземем предвид дублиращите се точки при проверка на симетрията?
Какви са изискванията за скорост на доставка на данни: в реално време или на партиди?
Какви са проблемите с умората от сигнали и как да се борим с тях?
Какво е DQN и какви проблеми решава в сравнение с Q-learning?
Какъв е минималният и максималният брой редове, които могат да се получат при левия джойн на два таблици с 10 и 50 реда?
Каква е асимптотиката при няколко преминавания през списъка?
Какво е RoseTTAFold?