Data Analyst
Pasakokite apie indeksus ClickHouse.
val_a, val_b = 0, 0 t = None kol i < a ilgiausio arba j < b ilgiausio: a_next = a[i][0] jei i < a ilgiausio kita float('inf') b_next = b[j][0] jei j < b ilgiausio kita float('inf') eik a_next < b_next: val_a = a[i][1] t = a[i][0] i += 1 elif b_next < a_next: val_b = b[j][1] t = b[j][0] j += 1 სხვა: val_a = a[i][1] val_b = b[j][1] t = a[i][0] i += 1 j += 1 result.append((t, val_a + val_b)) return result
Užduotis 1. Klientų skaičius pagal būseną Reikalavimas: Parašyti užklausą, kuri rodo klientų skaičių kiekvienoje būsenoje (aktyvus, neaktyvus, užblokuotas ir kt.). Rezultatas turi būti sudarytas iš dviejų stulpelių: būsenos ir cnt.
Kaip gaunama galutinė prognozė boostinge iš trijų iteracijų?
Kas nutiks, jei vienu metu pradėsime tūkstančius ryšių?
Kokias integracijas įgyvendinote ir ką tiksliai darėte? (Kafka, REST, RabbitMQ, sinchroninės/asynchrone)
Turime ClickHouse ir jame yra DBT užklausa, kuri reguliariai vykdoma, bet užtrunka ilgai. Kokios galimos priežastys ir kaip prieitumėte prie optimizavimo?
Kaip techniškai įgyvendinti finansinį AI patarėją premijos klientams? Kokie yra rizikos, ką daryti pavojinga?
Elgesio klausimas: kaip dirbate su nauja ir nežinoma informacija (pavyzdžiui, didelis straipsnių rinkinys)?
Ar UPDATE pats saugo transakciją? Ar reikalinga aiški transakcija vienam atominiam UPDATE?
Produkto atvejis: esate produktų analitikas carsharing paslaugoje. Kaip įvertinti verslą ir ko reikia augimui? Kokias metrikas stebėti?
Kokioje horizontoje buvo sudarytas prognozė?
Kaip skaičiuoti unikalius užsakymus, jei duomenyse yra dubliavimai?
Kaip rinkti ground truth atsakymus geometrijos benchmarkui?
Verslo atvejis: pradėtas naujas projektas su naujomis operacijomis. Kaip nustatytumėte įtartinų operacijų stebėjimą, jei nieko nežinote apie šį projektą?
Kokios yra sudėtingiausios jūsų darbo pokalbių dalys?
Kas yra išorinis raktas ir kuo jis skiriasi nuo pirminio rakto?
Ką daryti, jei North Star metrika (sėkmingų užsakymų skaičius) mažėja?
Kas yra benchmark ir kaip įvertintumėte daugialypio modelio kokybę?
Aiškiai išvardinkite kriterijus, kurie turi būti įvykdyti, kad duomenys turėtų normalų pasiskirstymą.