Machine Learning / AI
Quelle est l'idée fondamentale derrière les méthodes d'ensemble ? Quels types d'ensembles connaissez-vous ?
La longueur différente des phrases (15 mots contre 5 mots) influence-t-elle la possibilité de comparer leur similarité?
Qu'est-ce qu'une API de streaming?
Que signifie le statut CrashLoopBackOff d'un pod dans Kubernetes ? Quel peut être le problème ?
Avez-vous de l'expérience avec les technologies de calcul distribué ?
Nous avons un catalogue de films classés par un modèle, ainsi que des blocs-collections de ces films avec différentes quantités de contenu et types. Il faut classer ces blocs sur la page d'accueil pour l'utilisateur. Comment aborderais-tu la résolution de cette tâche et quelles métriques proposerais-tu?
Pourquoi la formule analytique pour la régression linéaire n'est-elle pas utilisée en pratique?
Parle-moi d'un projet avec du ML classique (pas LLM) dont tu es fier.
Tu as dit 200-250 mille chunks — ce sont des documents ou des morceaux liés?
Quelles métriques sont utilisées pour évaluer la chaîne d'événements dans un pipeline multi-agent?
Qu'est-ce qu'une fuite de données (data leakage) et pourquoi est-elle dangereuse?
Parlez-moi de la signification géométrique de la régularisation.
Comment un modèle linéaire gère-t-il la multicolinéarité des caractéristiques?
Quelles sont les options d'échantillonnage de nouveaux tokens dans LLM?
Comment abordez-vous le choix des hyperparamètres pour le modèle?
Dans quelle direction aimeriez-vous évoluer à l'avenir, quels vecteurs professionnels mettez-vous en avant pour vous?
Parle-moi des ensembles en apprentissage automatique.
Qu'est-ce que la normalisation par lot ?
Étiez-vous le principal en Data Science dans l'équipe [entreprise] ? Quelles approches et technologies venaient de vous, et lesquelles étaient définies par le tech lead ?
Pour une requête, est-ce qu'une des 12 000 réponses suffit ou plusieurs?