Machine Learning / AI
Popište cyklus agenta ReAct: jaké byly kroky a jak končil cyklus?
Praktická úloha Umělá inteligence vygenerovala kód pro rozhodnutí o vydání nového LLM. Proveďte revizi: upravte ho tak, aby editor mohl porovnat kvalitu verzí podle tematických segmentů, vidět rozptyl hodnocení a zaznamenat riziko zhoršení na malé skupině dat. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Kvalita modelů') plt.ylabel('Průměrné hodnocení') plt.show() print('Nejlepší verze:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Téma: {topic}") plt.suptitle("") plt.ylabel("Hodnocení") plt.show() small_groups = stats[stats["count"] < 30] print("Malé skupiny - závěry nejsou spolehlivé:") print(small_groups)
Po ID tokenu a vstupech do embeddingů, co přesně přichází do dekodéru: jaký je tvar reprezentací, jak je přidávána poziční informace a co se děje dále?
Jak obvykle kontrolujete kvalitu a relevanci dat před tréninkem LoRA?
Jak můžeme porovnat plakát, který se zobrazuje na stránce uživatele, s těmi, které neviděl (částečná zpětná vazba)?
Odhadněte, kolik dat je potřeba pro dohloubení modelu v produkci, popište proces dohloubení, parametry, ztrátovou funkci (contrastive/triplet) a proč byla zvolena právě ona.
Praktický úkol Průměrné hodnocení nové LLM vzrostlo, ale redaktoři si stěžují na finanční odpovědi. Který graf nejlépe podpoří rozhodnutí o vydání? Hlavní ukazatel průměrného hodnocení. Sloupce s průměrným hodnocením všech témat. Krabice s vousy podle témat a verzí modelu. Tabulka průměrných hodnocení podle témat. Slovní mrak z nových odpovědí. Rozdělení hodnocení podle verzí a témat s velikostí každé skupiny.
A jak by to teoreticky fungovalo v boostingu, pokud je cíl minus jedna? Tegnapi, že máme pozitivní a negativní, pokud u pozitivního nastavíme cíl na 10 místo 1, co by se stalo, nic by se nezměnilo?
Jak jste implementovali a nasadili službu pro zpracování pull requestů?
Jak je orchestrátor postaven: jaký rámec a architektura jsou použity, co dělá, je to jednopásmový nebo může několikrát přemýšlet před odpovědí?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Chyba pro {brackets!r}" f"Očekávali jsme {expected}, ale dostali {actual}" ) print(f"Všechny testy prošly: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Co LLM dostává na výstupu při každém kroku inference?
Bude možnost poskytnout pracovní nebo smlouvy k potvrzení zkušeností v závěrečných fázích?
Co je to přesnost?
Povězte o úkolech posledních šesti měsíců ve vaší poslední práci v [organizace]: na čem byl váš pracovní zaměření?
Praktický úkol AI navrhuje trénovat LoRA na všech 2 milionech nezpracovaných dialogů. Jaká je nejzralejší odpověď kandidáta? - Důvěra v AI: velký korpus sám vyrovná chyby. - Nejprve změnit prompt, aniž bychom měnili data. - Vytrénovat LoRA na očištěné části a porovnat ji s základním modelem. - Před tréninkem zkontrolovat náhodný vzorek označení. - Nejprve zkontrolovat data a kvalitu podle témat na samostatném setu, poté omezeně trénovat LoRA. - Trénovat na celém korpusu, ale snížit řád LoRA.
Jaké další metody optimalizace lze použít k urychlení inference nebo alespoň k umístění modelu do 12 GB VRAM na RTX 3090?
Jak lze dosáhnout toho, aby model odpovědí dodržoval přísně stanovenou strukturu, například v JSON?
Jaké jsou rozměry logitů a jak z nich vzniká token?
Jaké nástroje AI používáte denně?