Machine Learning / AI
Wat is data versioning en vergelijking tussen DVC, LakeFS, lakeFS?
In welke volgorde moeten de velden in een index worden vermeld bij het samenvoegen op datum, id en booleaans veld?
Wat is de rol van softmax in het model en waar wordt het voor gebruikt?
Wat is target encoding en wat zijn de problemen ervan (overfitting, leakage)?
Wat is overfitting en hoe er mee om te gaan?
Wat te doen met de dataset voordat je het model traint?
Hoe wordt parallelisme geïmplementeerd in Python met inachtneming van de GIL (multiprocessing, threads, asyncio, C-extensies)?
Wat is de bias-variance trade-off?
Kan een RandomForest gebouwd worden op KNN, lineaire modellen en neurale netwerken? Waarom?
Hoe werkt Non-Maximum Suppression (NMS) en waar is het voor nodig?
Wat is CUTLASS?
Welke datastructuur ligt ten grondslag aan dict in Python? Hoe worden botsingen opgelost?
Is het slecht om alle velden te indexeren en waarom?
Wat is bagging en waarom vermindert het de variantie van het model?
Wat is de exploration-exploitation trade-off in RL?
Welke metrics zijn belangrijker voor het beoordelen van de kwaliteit van aanbevelingen: precisie of recall?
Wat is een model registry en welke tools hebt u gebruikt (MLflow, W&B)?
Kan een atrous (uitgerekte) convolutie ooit een pixel in de originele afbeelding nooit gebruiken?
Wat is depthwise separable convolution en waar wordt het toegepast (MobileNet)?
Welke manieren zijn er om zware databasequery's te optimaliseren?