Ką daryti, jei norime mokytis 4 pavyzdžiais?
Machine Learning / AI
Ką daryti mokymo pabaigoje?
Kaip išleisti rezultatų sąrašą?
Kuo skiriasi duomenų paralelizmas ir modelio paralelizmas?
Kuo skiriasi ROC-AUC nuo kitų metrikų?
Kokia yra anchor reikšmė Triplet Loss?
Kas yra sparse attention?
Kuo skiriasi Margin Loss nuo Triplet Loss?
Kas yra epoch (epoch)?
Kas yra n dėmesio sudėtingumo kontekste?
Kaip mokomas reranker?
Jei nėra nuorodinių atsakymų, yra tik dokumentai ir kontekstas — kaip įvertinti sistemą ir iš kur gauti nuorodinį atsakymą?
Kokie LLM optimizacijos tipai egzistuoja?
Kas dar daugiau, be kryžminės entropijos, gali būti naudojama kaip nuostolių funkcija?
Kas pasikeitė LLM palyginti su originaliu transformatoriumi?
Koks dėmesio tipas leidžia sumažinti sudėtingumą žemiau O(n²)?
Kas yra gradient checkpointing?
Kaip įvertinti agentą, kuris įgyvendina RAG?
Kas yra kvantizacija?
Kas nutiks, jei dekoderiui pateiksite 10k žodžių seką, o modelis buvo mokytas 9k?