Sobes.tech

Machine Learning / AI

Jak hodnotit kvalitu retrieveru? Odkud vzít kolekci dokumentů pro hodnocení metrik?

362

Máte malou datovou sadu s recenzemi filmů v ruštině a jejich binární značkou sentimentu (štítky: 0 — negativní, 1 — pozitivní). Vaším úkolem je implementovat kompletní pipeline za 15 minut pro nácvik jednoduchého modelu klasifikace textu bez použití předtrénovaných encoderů jako BERT a zobrazit přesnost (accuracy) na těchto datech. reviews = [ "Tento film je prostě úžasný!", "Hrozné herecké výkony a nudný děj.", "Každou chvíli jsem si užil!", "Nejhorší film, který jsem viděl.", "Skvělá režie a úžasný příběh.", "Neznesitelně nudný a předvídatelný." ] labels = [1, 0, 1, 0, 1, 0]

183

Jaký parametr v modelu embedding určuje maximální počet tokenů na vstupu? Co se stane, pokud zadáte více tokenů než limit?

166

Jak ovlivňuje čtyřnásobné zvýšení velikosti batch velikost učení a proč? Jak funguje zpětné šíření chyby?

163

Jak jsou data extrahována z vektorové databáze na základě uživatelského dotazu?

151

Co se stane, pokud zadáte do LLM kontext o délce 120 000 tokenů při limitu 60 000?

149

Co je LangGraph, k čemu se používá, jak jsou implementovány větvení a podmíněné přechody? Čím se liší nástroje od uzlů?

140

Jak byla organizována hledání informací ve vektorové databázi? Proč bylo použito Qdrant?

139