Sobes.tech

Machine Learning / AI

Cos'è l'accumulo di gradienti e perché è necessario con memoria limitata?

190

Cos'è FlashAttention e quale vantaggio di memoria offre?

180

Cos'è Pix2Struct?

Middle — Senior
179

Cos'è Donut e perché un approccio senza OCR?

Middle — Senior
176

Cos'è un router LLM e perché indirizzare le richieste a modelli diversi?

170

Cos'è la quantizzazione solo dei pesi e la quantizzazione delle attivazioni?

Senior
165

Cos'è l'expert parallelism nei modelli MoE?

Senior
154
/2