Geef een voorbeeld waarin verkeerd gebruik van BatchNorm in de `eval()`-modus heeft geleid tot fouten in de voorspellingen.
Machine Learning / AI
Praktische opdracht Welke set artefacten maakt het mogelijk om eerlijk de vergelijking van twee LoRA-uitvoeringen te reproduceren? - Alleen de uiteindelijke kwaliteits tabel. - Commit met code en screenshot van de uiteindelijke metriek. - Code en configuratiebestand van het experiment. - Code, data-hash, basismodel, LoRA-configuratie, afhankelijkheden en startcommando. - Alleen link naar de Git-branch. - Code, LoRA-parameters, versie van het basismodel en afhankelijkheden.
Zijn er momenteel sollicitatiegesprekken bij grote techbedrijven zoals Yandex of Alfa?
Praktische opdracht Een SQL-query op 80 miljoen berichten creëert duplicaten na de JOIN. Welke actie is het beste om als eerste te starten? - Controleer de kardinaliteit van de JOIN, de sleutels en het uitvoeringsplan vóór optimalisatie. - Maak een index op één verbindingsveld. - Exporteer het resultaat naar CSV en verwijder duplicaten in Python. - Voeg altijd DISTINCT toe aan alle kolommen. - Voeg DISTINCT toe na het controleren van het resultaat op de steekproef. - Controleer de verbindingssleutels en de uniciteit van beide tabellen.
Na de nieuwe versie van het model is de gemiddelde kwaliteitsbeoordeling gestegen, maar redacteuren zeggen dat de antwoorden op juridische en financiële onderwerpen aanzienlijk verslechterd zijn. Welke visualisatie zou je als eerste maken om te beslissen of je de uitgave moet stoppen?
Hoe beheert u gewoonlijk de versies van gegevens en modellen in dergelijke experimenten?
Ben je van plan om op de Filipijnen te blijven of ga je naar een ander land verhuizen?
Kunt u meer in detail vertellen wat u precies "benauwend" vond aan de vragen en hoe dit uw perceptie van het interview beïnvloedde?
Heeft u ervaring met werken in volledig Engelstalige teams?
Heeft u ervaring met sollicitatiegesprekken met AI?
Heeft u aanbiedingen in handen of eindfasen bij andere bedrijven?
Hoe zou u de kwantitatieve invloed van emissies op de modelmetriek, zoals nauwkeurigheid of F1-score, beoordelen?
Hoe zou je de indexen op de join-sleutels optimaliseren om duplicaten te verminderen en de query te versnellen?
Stel je voor dat je werkt met een model in PyTorch en nadat je het hebt gezet in eval() modus, zie je dat de metrics op een vaste testset van 10.000 voorbeelden bij elke run veranderen. Je fixeert de initiële staat van de random number generators voor reproduceerbaarheid: waar kan de bron van de veranderingen nog meer verborgen zijn? Leg de rol uit van Dropout, BatchNorm en torch.no_grad() en noem de metrics met drempels waarmee je de stabiliteit van de resultaten zult controleren.
Beoordeel je Engels apart voor lezen/schrijven en spreken volgens de CEFR-niveaus.
Praktische opdracht AI stelt voor om LoRA te trainen op alle 2 miljoen ongereinigde dialogen. Wat is het meest volwassen antwoord van de kandidaat? - Vertrouwen op AI: een grote corpus zal fouten compenseren. - Eerst de prompt wijzigen zonder de gegevens te veranderen. - LoRA trainen op het gereinigde deel en vergelijken met het basismodel. - Een willekeurige steekproef van de annotatie controleren vóór training. - Eerst de gegevens en kwaliteit per onderwerp controleren op een aparte set, daarna beperkt trainen van LoRA. - Trainen op de hele corpus, maar de rang van LoRA verminderen.
Hoe zou je `EXPLAIN` precies gebruiken om prestatieproblemen in deze query te identificeren?
Welke formaliseringsvorm is voor u het handigst: GPH, IP of TК?
In de dialoogtabel staan 80 miljoen berichten, en de analytische query voor de beoordelingsset duurt 25 minuten en geeft soms dubbele vraag-antwoordparen terug. Wat zou je als eerste corrigeren en waarom?
Voor het genereren van vragen heeft het grote taalmodel moeite om de stijl te behouden bij zeldzame onderwerpen. De AI-assistent stelt voor om onmiddellijk LoRA te starten op de hele historische corpus van 2 miljoen dialogen, maar de annotatie is gedeeltelijk ruisend. Waar zou je deze raad niet vertrouwen en wat zou je als eerste kiezen?