У случају озбиљног неравнотеже класа, како се понашају прецизност, recall и PR-AUC?
Machine Learning / AI
Које метрике сте користили, колико података је било и какав је био баланс класа?
Реците нам о себи и задацима које сте обавили.
Ако можете да комуницирате само са ограниченим бројем клијената, како бисте оценили такви модел за скорирање?
Да ли је то био задатак класификације или серије времена? Како је време било узето у обзир током тренинга и тестирања?
Шта знате о ROC-AUC?
Как се израчунава ROC крива итеративно након рангирања објеката по резултату?
Шта показује PR-AUC?
Реците нам о једном од последњих задатака класификације и опишите његов pipeline.
Да ли знате шта је модел за скорирање?
Да ли је постојао списак за проверу који је оператор морао да прати током позива, или је провера била без њега?
Реците нам о NLP задатку који сте извршили.
Реците нам о задатку кластеризације.
Пронађите све клијенте у јануару који су имали бар једну продају након комуникације у року од 30 дана.
Имаш циљ и проверену feature store са око 5000 карактеристика. Како ћеш га тестирати у овом задатку?
Да ли је добра прецизност од 700 продаја на милион изабраних клијената у задатку са ретком конверзијом?
Пронађите све клијенте у јануару који су имали бар једну продају након комуникације у року од 30 дана. продаје ид корисник_ид износ датум_продаје [phone] комуникације ид корисник_ид тип датум_комуникације датум_делења 1 1 пошта [phone] позив [phone] позив [phone] емаил [phone] sms [phone] #Постоји листа, потребно је написати функцију која враћа две листе, једну са нормалним вредностима, а другу са аномалијама. За сада претпостављамо да је аномалија вредност која прелази просек data = [100, 200, 150, 5000, 1300, 120, 700, 2000, 200]
Колико карактеристика ћете узети из feature store-а и како ћете их изабрати ако су све 5000 карактеристика валидне и без изливања?