Kas sa kaalud ainult ML-inseneri positsiooni või ka Data Scientist-i?
Machine Learning / AI
Kuidas kutsub LLM tööriistu või MCP, kui meil need on?
Millised raskused tekivad Word2Vec ja NLTK kasutamisel vene keele jaoks?
Dialoogide tabelis on 80 miljonit sõnumit, ja analüütiline päring hindamise komplektile kestab 25 minutit ning mõnikord tagastab duplikaatpaarid küsimus-vastus. Mida te kõigepealt parandaksite ja miks?
Küsimuste loomisel on suur keelemudel raskesti säilitama stiili haruldastel teemadel. Tehisintellekti-assistent soovitab kohe käivitada LoRA kogu ajaloolise korpuse 2 miljoni dialoogiga, kuid märgistamine on osaliselt mürarikas. Kus sa ei usaldaks seda nõu ja mida eelistaksid esimesena?
Mis vahe on GET ja POST päringutel?
Kuidas üldiselt erineb ChatGPT ettevõtte sees olevast assistendist (vestlusrobot vs assistent)?
Räägi oma projektidest: mida täpselt sa tegid, tehniliselt detailidena?
Milliste gradient boosting tööriistadega olete töötanud? CatBoost, LightGBM, XGBoost?
Kuidas läheneda ühe sõna joondamisele fonemide järgi? Kuidas kasutada wav2vec2, et saada täpseid fonemide piire?
Kuidas lahendada konteksti kasvamise probleemi aktiivse vestluse ajal kasutajaga?
Millised on peamise erinevused masinõppe ja süvaõppe vahel?
Miks struktureeritud väljund alati genereerib kehtiva JSON-i? Millisel tasandil see rakendatakse?
Kui palju omadusi te võtate funktsioonide poest ja kuidas te neid valite, kui kõik 5000 omadust on kehtivad ja ilma lekkedeta?
Mis sind töö juures inspireerib?
Mis juhtub, kui dekooderile sisestate 10k tokeni pikkuse järjestuse, samal ajal kui mudel oli treenitud 9k peal?
Kuidas suunati agentide vahel? Anna näide lülitustingimustest.
Mis juhtub mudeli kvaliteediga, kui eemaldame juhusliku metsa ja gradientboostingu esimese ja viimase puu?
Mis on Aston roll projekti töövoos?
Rakenda järk-järgult töötajate voolavuse prognoosimise projekti: äritegevuse ülesanne, ML ülesande sõnastamine, mõõdikud ja andmed.