Machine Learning / AI
Implementați o soluție pentru problemă în Python.
Cum să faci în practică ca un model într-un câmp specific să genereze doar valori dintr-o listă scurtă de ID-uri de șiruri și niciun alt simbol?
Te rog, explică cum funcționează un dicționar în Python la nivel de bază și ce se întâmplă în legătură cu coliziunile.
Ce este tokenizarea?
Alți ingineri ML cu experiență vor, dimpotrivă, proiecte diferite pentru a încerca totul. Iar tu, dimpotrivă, ce vrei...?
Diferenta de lungime a propozițiilor (15 cuvinte vs 5 cuvinte) afectează posibilitatea de a compara asemănarea lor?
Ce converte viteza modelului într-o etichetă de clasă?
Cum funcționează un sistem de recomandare cu două niveluri și dublu backup și la ce folosește?
Cum putem integra crearea de solicitări (de exemplu, concediu) în pipeline-ul actual RAG?
Ce este supraînvățarea și cum o putem evita?
Ce cauți acum, cu ce ar fi interesant să lucrezi?
Ce hiperparametri LoRA cunoști?
În ce mod clasifică LLM solicitarea — ce anume returnează exact pentru alegerea scenariului?
Ce este outputul structurat și cum se aplică în LLM?
Aveți experiență în interviuri cu AI?
De ce LoRA poate suferi de supraînvățare chiar și cu un număr mic de parametri? Alegerea rangului influențează supraînvățarea?
De ce nu putem să adunăm pur și simplu scorurile BM25 și embedding-urile dense?
Dacă instrumentul (backend) a greșit singur (de exemplu, timeout la accesarea sistemului), au fost transmise traceback-urile de eroare modelelor?
Aveți experiență de lucru în echipe complet anglofone?
Ce este ReLU și pentru ce este utilizat?