Data Engineer
Papildus API, ar kādiem citiem veidiem un protokoliem jūs strādājāt ar datu avotiem?
Pastāsti par savu izpratni par datu kvalitāti — vai tev ir pieredze šajā jomā?
Kādus aģentus un modeļus izmantojat jūsu uzņēmuma AI risinājumā? Vai tas raksta kodu jūsu vietā?
Kādam mērķim ir cache un persist Spark?
Kā jūs palaidāt DAG-us: pēc cron, datu kopām, trigeriem vai atkarībām?
importē clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Kādi Spark JDBC parametri tika izmantoti lasīšanas paralelizācijai?
Kas ir CROSS JOIN un kāds ir tā pielietošanas rezultāts?
Kādā virzienā būtu interesanti attīstīties: vitrīnās, izstrādē, analīzē, varbūt AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefons] null null 5 IZVĒLĒTIES a.num KĀ a_num, b.num KĀ b_num NO t1 a KREISĒJĀ JOIN t2 b ON a.num = b.num;
Kādi neacīmredzami problēmas var rasties, ielādējot lielas tabulas (izņemot veiktspēju)?
Logrāmatas funkcija SUM() OVER (PARTITION BY user_id) — vienā gadījumā pievienojam ORDER BY pirkuma datumu, citā — ne. Kāda ir atšķirība?
Kāpēc jums vispār bija nepieciešams Data Vault?
Kāda veida glabāšanu izmanto Parquet: rindu vai kolonnas?
Pastāstiet par replikācijas konfigurācijas uzdevumu, kuru jūs risinājāt.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Pastāsti man par CI/CD procesiem, izmaiņām datu bāzē, versiju kontroli un shēmas migrācijām (shēmas evolūcija).
Kas tevi pievelk travel jomā? Varbūt tev patīk pats ceļot, vai travel-tech tevi kaut kādā veidā interesē?
Pastāstiet man par savu pieredzi ar izplatītajām datu bāzēm (Greenplum, ClickHouse)?
Priekšlikums regulārai inkrementālai lielas tabulas ielādei ar elastīgu (maināmu) atjaunināšanas biežumu no Postgres uz Data Lake.