Data Engineer
Kas sa kirjutasid OpenMetadata ingestsed protsessid, mis skaneerivad allikaid?
Mis juhtub, kui luua DAG koos start_date = 1. jaanuar 2024?
Kas on võimalik välja mõelda midagi muud kui tavaline CTE, arvestades, et filtratsioon toimub ikka veel mälu kogu tabeli ulatuses?
Milliseid peamisi Linuxi käske kasutate terminalis?
Mis on tehingute logi (WAL) andmebaasi haldussüsteemis ja milleks see on vajalik?
Millises keskkonnas käivitatakse Spark?
Milleks teil üldse oli vaja Data Vaulti?
Kas teil on kogemusi mootoritega nagu Trino või tabelivormingutega (Iceberg, Parquet) Sparkis?
Millist kogemust teil on SQL-i ja suhteliselt andmebaasidega?
Miks otsid uut töökohta ja mida sooviksid tulevikus teha?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Rääkige mulle CI/CD protsessidest, andmebaasi muudatustest, versioonihaldusest ja skeemi migratsioonidest (skeemi areng).
Mis sind tõmbab travel valdkonnas? Võib-olla sulle meeldib ise reisida, või on travel-tech sind mingil moel huvitama hakanud?
Milliseid andmeedastusviise teate Airflow ülesannete vahel?
Millistel väljadelt toimus andmete ühendamine ja kuidas eemaldati duplikaadid vitriinist?
LeetCode #? — PostgreSQL-is on tabel [tabel], millel on üks veerg id ja väärtused 1, 1, 2. Kirjutage DELETE-päring, mis füüsiliselt eemaldab ühe duplikaadi.
Mida sa tead spill kohta Sparkis?
Kas kasutate oma praeguses töös tehisintellekti? Milliseid tööriistu ja kuidas täpselt?
Kas oled töötanud partii- või voogedastusega?
Rääkige meile Pythonis viimase aasta jooksul kõige olulisemast projektist või ülesandest.