Data Engineer
Ar naudojote Bridge ir PIT lenteles Data Vault? Pateikite pavyzdį ir paaiškinkite jų paskirtį.
Papaskokite apie replikacijos konfigūracijos užduotį, kurią sprendėte.
Kokia yra UDF Spark programoje ir koks jų minusas?
Kaip Spark nustato, kad lentelė yra pakankamai 'maža' broadcast jungčiai (viršutinė riba)?
PostgreSQL'e, eilutės versijos antraštėje yra xmax parametras. Kokią vaidmenį jis atlieka transakcijų valdyme? - Norint sukurti unikalų eilutės identifikatorių lentelėje - Norint patikrinti kitų transakcijų matomumą eilutės - Norint nurodyti transakcijos numerį, kuris ištrynė arba atnaujino eilutę - Norint užblokuoti eilutę nuo vienu metu atliekamų pakeitimų keliomis transakcijomis - Norint nurodyti maksimalų reikšmę, kuri gali būti įrašyta į skaitmeninį stulpelį
Apskritai papasakok apie savo patirtį ir ką mokaisi.
Kas tau svarbu naujame projekte, naujoje komandoje ar įmonėje?
Kokie procesai prasideda, kai ištriname ar keičiame įrašus ClickHouse?
Kas yra VACUUM PostgreSQL? Kokie yra jo tipai? Ar galima naudoti gamyboje?
Kas yra LEFT SEMI JOIN ir LEFT ANTI JOIN Spark SQL, ar kada nors naudojote?
Kuo skiriasi docker run ir docker exec komandos?
Ypatinga seka, pavadinta even_sequence, buvo sukurta, kad generuotų tik lyginius skaičius. Ką reikėtų įrašyti vietoje [...], kad, jei įterpiant nebuvo nurodyta even_column reikšmė, ji būtų paimta iš even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
Kokia yra algoritminė sudėtingumas gauti elementą pagal raktą iš žodyno (dict) Python?
Kaip pasirinkti tinkamą shardingo raktą duomenų tolygiam paskirstymui?
Kaip elgtumėtės su Materialized View grandine per tarpinę ReplacingMergeTree lentelę, kad teisingai užpildytumėte jau egzistuojančius duomenis prieš pradedant naują MV?
Kas yra Materialized View ir kaip jis skiriasi nuo įprasto View?
Kaip tikrinate duomenų tikslumą, kai verčiate pipeline iš SAS į DBT?
Kas tau šiuo metu nepatinka tavo darbe?
Kuo skiriasi refaktoringas nuo optimizacijos?
Kada mums nereikia duomenų saugyklos?