Data Engineer
Su kokiomis vizualizacijos priemonėmis dirbote ir kaip glaudžiai bendradarbiavote su Power BI?
Ar dirbote su kontekstų valdytojais Python? Kas jie yra ir kam skirti?
Ką žinote apie serializaciją ir deserializaciją Spark/UDF kontekste?
Papaskink apie savo supratimą apie duomenų kokybę — ar turite patirties šioje srityje?
Papaskokite apie savo dabartinę darbo vietą: pagrindinis produktas, jūsų funkcija.
Kokius klausimus turiu man?
Ar buvo papildomas registravimas, išskyrus Airflow žurnalus?
Langinio langelio funkcija SUM() OVER (PARTITION BY user_id) — vienu atveju pridedame ORDER BY pirkimo datą, kitame ne. Kuo tai skiriasi?
Koks Parquet saugojimo tipas: eilutė ar stulpelis?
Kodėl ieškote naujos darbo vietos ir ką norėtumėte daryti ateityje?
Kokios duomenų paskirstymo strategijos egzistuoja?
Kas tave traukia travel srityje? Galbūt pats mėgsti keliauti, arba travel-tech kažkaip tave sudomino?
Kodėl dabar ieškai naujos darbo vietos, nori pakeisti darbą?
Pasiūlykite sprendimą reguliariai inkrementaliai įkelti didelę lentelę su lankstia (keičiamą) atnaujinimo dažnumu iš Postgres į Data Lake.
O jei mums reikia visų klientų, net jei jie neturėjo sandorių šią datą, kaip tai parodyti?
Ar dirbote su feature store'ais?
Kuriuose laukuose įvyko duomenų sujungimas ir kaip buvo pašalinti dubliuojami elementai iš vitrinų?
LeetCode #? — PostgreSQL yra lentelė [lentelė] su vienu stulpeliu id ir reikšmėmis 1, 1, 2. Parašykite DELETE užklausą, kuri fiziškai pašalins vieną dublikatą.
Kokius Docker vaizdus reikėjo sukurti ir kodėl?
Ar turėjote problemų su laiko zonomis skaitant timestamp'us per PXF iš Parquet?