Hoe gedragen precisie, recall en PR-AUC zich bij ernstige klasse-imbalans?
Machine Learning / AI
Welke metrics heb je gebruikt, hoeveel data was er en wat was de balans tussen de klassen?
Vertel ons over jezelf en de taken die je hebt uitgevoerd.
Als je maar met een beperkt aantal klanten kunt communiceren, hoe evalueer je zo'n scoringmodel?
Was dit een classificatie- of tijdreeks taak? Hoe werd tijd meegenomen tijdens training en testen?
Je hebt een target en een geverifieerde feature store met ongeveer 5.000 features. Hoe zou je dat testen op deze taak?
Vind alle klanten in januari die minstens één verkoop hadden na communicatie binnen 30 dagen. verkoop id klant_id bedrag verkoop_datum [phone] communicaties id klant_id type communicatie_datum partition_datum 1 1 mail [phone] oproep [phone] oproep [phone] email [phone] sms [phone] #Er is een lijst, je moet een functie schrijven die twee lijsten teruggeeft, één met normale waarden en de andere met anomalieën. Laten we voorlopig aannemen dat een anomalie een waarde is die het gemiddelde overschrijdt data = [100, 200, 150, 5000, 1300, 120, 700, 2000, 200]
Hoe wordt de ROC-curve iteratief berekend nadat objecten op score zijn gerangschikt?
Wat laat PR-AUC zien?
Wat weet je over ROC-AUC?
Vertel ons over een van de recente classificatietaken en beschrijf de pipeline.
Was er een checklist die de operator tijdens het gesprek moest volgen, of werd de controle zonder gedaan?
Weet je wat een scoringmodel is?
Vind alle klanten in januari die minstens één verkoop hadden na communicatie binnen 30 dagen.
Vertel ons over een clustering-taak.
Vertel ons over een NLP-taak die je hebt uitgevoerd.
Is een precisie van 700 verkopen per miljoen geselecteerde klanten goed in een zeldzame conversietaak?
Hoeveel features neem je uit de feature store en hoe kies je ze als alle 5000 features geldig en zonder leaks zijn?