Ako je worker sinhron, da li će imati batching?
Machine Learning / AI
Kako dizajnirati sistem za skladištenje i pretraživanje za 10.000 Telegram kanala sa 300.000 objava dnevno i latencijom manjom od 2 sekunde?
Da li je moguće smatrati embeddings sinhrono direktno u API endpointu? Šta će se dogoditi ako izračunavamo embeddings za veliki tok dokumenata u FastAPI endpointu?
Kako dizajnirati sistem za automatsko generisanje sadržaja za Telegram kanale u stilu autora kanala?
Kako ste validirali LoRA fine-tuning?
Можете ли да ми кажете о вашем искуству са RAG системима и шта сте радили у последњем пројекту?
Kada izabrati LoRA, a kada retrieval po sličnim postovima? Koliko podataka je potrebno za svaki pristup?
Da li si sve ovo radio sam (RAG, LoRA, rad sa neuronskim mrežama) ili si nekome pomagao?
Da li ste ikada koristili neuronsku mrežu kao metriku za ocenu kvaliteta?
Koji rang ste postavili za LoRA i od čega zavisi?
U koje slojeve si ubacio LoRA i šta je q_proj?
Da li ste implementirali neuronske mreže na svojim serverima ili u oblaku?
Koje metrike ste koristili za procenu kvaliteta sistema i kako ste postigli poboljšanje od 40%?
Zašto je u ovoj arhitekturi potrebna vektorska baza podataka?
Zašto LoRA može prekomerno učiti čak i sa malim brojem parametara? Da li izbor ranga utiče na prekomerno učenje?