Machine Learning / AI
Peut-on remplacer une convolution 3x3 par deux convolutions successives 3x1 et 1x3 ? Quels sont les gains et les pertes ?
Quels paramètres dans la forêt aléatoire peuvent être modifiés et comment la profondeur et le nombre d'arbres influencent-ils?
Tâche : qu'est-ce qui est plus efficace en termes de vitesse — soumettre au transformeur 2 entrées de 512 tokens séparément (2x512) ou les fusionner en 1x1024 ?
Pourquoi cherches-tu un nouveau travail?
Quels sont les risques de l'amplification du biais?
Pourquoi ont-ils presque arrêté d'utiliser de grandes convolutions 9x9, 7x7, 5x5?
Qu'est-ce que le prompting self-ask?
Quels sont les méthodes de codage des variables catégoriques?
Quand MAB est-il meilleur ou pire que A/B?
Qu'est-ce que CUDA et quels sont les concepts de base (kernel, grid, block, thread) ?
De quelles parties se compose Stable Diffusion (SD) ?
Comment le modèle aide-t-il les entreprises?
Qu'est-ce que word2vec?
Quelle est l'idée de Cycle-GAN ? Quelles pertes sont utilisées dans celui-ci ?
Quelles accélérations d'inférence sont atteintes?
ROC-AUC = 0.9. Que se passera-t-il avec cette métrique si on multiplie toutes les prédictions du modèle par 3?
Pourquoi la régularisation L1 met-elle certains poids à zéro, alors que la L2 ne le fait pas?
Quelles sont les méthodes d'optimisation des requêtes lourdes à la base de données?
Quelles vérifications effectuer lors du choix du taux d'apprentissage pour SFT LLM?
Peut-on appliquer le théorème de la limite centrale à une population non normalement distribuée?