Sobes.tech

Machine Learning / AI

De ce poate funcționa mai rapid LLM-ul cuantificat și de ce uneori cuantizarea, dimpotrivă, încetinește inferența?

Senior
144

Descrieți pas cu pas traseul mesajului utilizatorului prin LLM în timpul inferenței — de la chat până la răspuns, inclusiv detalii arhitecturale ale Transformer.

Senior
143

Ce instrumente de AI folosești zilnic?

Senior
139

De ce caching-ul întrebărilor exacte ale utilizatorilor oferă de obicei o valoare de afaceri limitată și ce anume ați avut în vedere prin caching-ul răspunsurilor?

Senior
135

Cât timp a durat căutarea / ciclul complet de răspuns în sistemul RAG?

Senior
133

Vorbește despre proiectele tale: ce ai făcut exact, în detaliu tehnic?

Senior
132

Care este dimensiunea logits și cum se obține un token din ele?

Senior
131

Ce primește LLM ca ieșire la fiecare pas de inferență?

Senior
131
/2