Data Engineer
Sual #1 İki cədvəli id atributu üzrə birləşdirərkən inner, left, right, full join ilə neçə qeyd qaytarılacaq? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Ar saugojote lentelinių vaizdų rezultatus S3, naudodami Parquet ar kitaip?
Kodėl ieškote naujo darbo?
Kuo atsakinga Eilutės grupė Parquet failo struktūroje?
Kokius Docker vaizdus reikėjo sukurti ir kodėl?
Kodėl dabar svarstai naujas pasiūlymus?
Kiek laiko iš viso dirbote su Spark ir kaip giliai įsitraukėte į jį?
Kas yra CROSS JOIN ir koks yra jo taikymo rezultatas?
Kaip sprendėte optimizavimo problemas, kai užklausa trunka ilgai ir atlieka pilną nuskaitymą? Kaip prieitumėte prie tokio naujo uždavinio?
Ką daro parametras depends_on_past Airflow?
Kodėl jums apskritai reikėjo Data Vault?
Ar buvo naudojama įrašų hash'ų palyginimo metodas, kad būtų apskaičiuotas skirtumas tarp šaltinio ir tikslo lentelės?
Kas nutiks, jei taikysite `s ** 2` sąrašui `s = [1, 2, 3]`?
Ar kada nors susidūrėte su klaida ClickHouse `Too many parts` įterpiant? Kaip ją sprendėte?
Su kokiais failų formatais dirbote?
Kokie fiziniai JOIN tipai egzistuoja Spark?
Kas fiziškai vyksta įvykdžius INSERT, UPDATE ir DELETE Greenplum; kodėl po DELETE disko vieta nėra atlaisvinama ir kuo DELETE skiriasi nuo TRUNCATE?
Kodėl duomenys gali būti prarasti? Pateikite keletą priežasčių.
Papaskinkite apie save: patirtis, užduotys, funkcijos ar pasiekimai, kurių didžiuojatės.
Ar turite patirties su FastAPI?