Sobes.tech

Machine Learning / AI

Was ist Gradient Accumulation und warum ist sie bei begrenztem Speicher notwendig?

192

Was ist FlashAttention und welchen Speichergewinn bietet es?

183

Was ist Pix2Struct?

Middle — Senior
180

Was ist Donut und warum ein OCR-freier Ansatz?

Middle — Senior
178

Was ist ein Router LLM und warum Anfragen an verschiedene Modelle richten?

170

Was ist Weight-Only-Quantisierung und Aktivierungsquantisierung?

Senior
165

Was ist Expert Parallelism in MoE-Modellen?

Senior
155
/2