Sobes.tech

Machine Learning / AI

Czym jest akumulacja gradientów i dlaczego jest potrzebna przy ograniczonej pamięci?

194

Czym jest FlashAttention i jakie zyski pamięciowe zapewnia?

184

Czym jest Pix2Struct?

Middle — Senior
182

Czym jest Donut i dlaczego podejście bez OCR?

Middle — Senior
179

Czym jest router LLM i dlaczego kierować zapytania do różnych modeli?

173

Czym jest kwantyzacja tylko wag i kwantyzacja aktywacji?

Senior
165

Czym jest expert parallelism w modelach MoE?

Senior
155
/2