Data Engineer
Vai jūs izveidojāt līniju no avota līdz patērētājam?
Vai jums ir pieredze ar tādiem motoriem kā Trino vai ar tabulas formātiem (Iceberg, Parquet) Spark?
Vai tika izmantota ierakstu hash salīdzināšanas metode, lai aprēķinātu starpību starp avotu un mērķa tabulu?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Kāpēc bool([""]) atgriež True?
# ko izvada s = 'Abracadabra' print(s[5][0]) b = 'a' b[0] print(s[::2]) s = [1, 2, 3] print(s * 2)
Un ja mums ir nepieciešami visi klienti, pat ja viņiem šajā datumā nebija darījumu, kā to parādīt?
Kas ir triggers jauna darba Spark, un kā darbs tiek sadalīts pa Stages un Tasks?
Pastāstiet par mainīgajiem un nemainīgajiem datu tipiem Python un sniedziet piemērus.
Uz kurām tehnoloģijām ir uzbūvēts jūsu lakehouse un kādas problēmas rodas, strādājot ar Apache Iceberg?
Kā tu raksturotu kodā pārbaudi, vai vērtība būtiski atšķiras no normālas (gaidāmās) sadalījuma?
Vai S3 bija vienīgā galvenā glabātuve vai izmantojāt vairākas?
Kāpēc tu tagad apsver jaunas piedāvājumus?
Pastāstiet mums par svarīgāko Python projektu vai uzdevumu pēdējā gada laikā.
Kāds ir diagnostikas algoritms un ko darīt, ja pieprasījums joprojām ir lēns pēc vairāku indeksu pievienošanas?
Kā organizēt datu ielādi ClickHouse lielā PostgreSQL tabulā, kur pastāvīgi ienāk jauni ieraksti ar monotoniski pieaugošu primāro atslēgu?
Kura komanda maina piekļuves tiesības uz failiem Linux?
Pastāsti, kur esi strādājis kā sistēmu analītiķis un kādus uzdevumus veici?
Vai jūs izmantojāt XCom Airflow?
Papildus API, ar kādiem citiem veidiem un protokoliem jūs strādājāt ar datu avotiem?