Machine Learning / AI
Rääkige K-means algoritmist ja selle arenenud analoogidest (K-means++).
Rääkige mulle rohkem praeguse ettevõtte konkreetsetest tulemustest ja projektidest.
Kas teiega on töötanud Sparkiga? Milline on teie üldine arusaam sellest, mis see on?
Kui räägime miinimumpalgast?
Kuidas skaleerida süsteemi suure koormuse korral?
Kas on küsimusi töötingimuste ja projekti kohta?
Kuidas positsioonilised sisestused muudavad Q, K, V?
Mis on MVCC?
Milline on operaatorite täitmise järjekord SQL-päringus?
Milliseid mudeleid kasutati igal etapil? Entiteetide eraldamiseks, vektoreerimiseks, genereerimiseks?
Mis on peamiste komponentide meetod (PCA) ja kuidas seda kasutatakse?
Miks võib Spark ülesanne kinni jääda ja töötada väga kaua?
Mida sa mõistad vea all (prompt-l lähenemises)?
Practical task An SQL query on 80 million messages creates duplicates after JOIN. Which action is best to start first? - Check the cardinality of the JOIN, keys, and execution plan before optimization. - Create an index on one join field. - Export the result to CSV and remove duplicates in Python. - Always add DISTINCT to all columns. - Add DISTINCT after verifying the result on a sample. - Check the join keys and the uniqueness of both tables.
Miks on vajalik normaliseerimine (Layer Norm) — miks stabiliseerida õppimist?
Kuidas käsitleti RAG-süsteemis koormus tippe? Mis juhtus suure koormuse korral?
Kuidas hindasite Text-to-SQL agendi kvaliteeti?
Disainige süsteem online-kino jaoks: iga filmi jaoks on mitu plakatit, tuleb valida parim plakat, et inimesed vaataks rohkem sisu. Kirjeldage lahendusplaani ja vajalikud andmed treenimiseks (võib olla ilma ML-ita).
Millist järku saatsite LoRA jaoks ja millest see sõltub?
Kuidas sorteerida 20 tükki ja valida 5 kõige asjakohasemat edastamiseks LLM-ile?