Cos'è Megatron-LM e qual è il suo approccio al parallelismo tensoriale?
Machine Learning / AI
Cos'è la riscrittura delle query in RAG?
Cos'è la supervisione remota (NER da KB)?
Hai esperienza con compiti di NLP?
Spiega la formula dell'attenzione a prodotto scalare scalata. Perché dividere per sqrt(d_k)?
Perché i pesi del modello possono diventare grandi e perché è necessario ridurli con la regolarizzazione?
Come avete suddiviso il campione in training e test?
Perché la regolarizzazione aiuta a combattere il sovrallenamento?
Cos'è il RL basato su modelli e quali sono i suoi vantaggi rispetto al senza modello?
Come dovrebbe essere la struttura per addestrare un trasformatore a riconoscere la terminologia specializzata?
Come hanno scelto il modello e gli iperparametri, e come hanno regolato la soglia di classificazione?
Qual è la differenza tra PR-AUC e ROC-AUC?
Come vengono calcolate le metriche MAP e MRR nei compiti di ranking?
Cosa sono i recovery prompts a bassa fiducia?
Quale compito risolve il tuning del modello di trasformazione?
Qual è la differenza tra NaN e None in Python?
Come appare visivamente il risultato della decomposizione della CNN?
Cosa dovrebbe contenere il dataset di addestramento per l'addestramento con entropia incrociata?
Quale algoritmo è alla base del modello?
Cos'è la scalabilità NTK-aware RoPE per espandere la finestra di contesto?