Data Engineer
Pored API-ja, kojim drugim metodima i protokolima ste radili sa izvorima podataka?
Ispričaj mi o svom razumijevanju kvaliteta podataka — imaš li iskustva s tim područjem?
Koje agente i modele koristite unutar vašeg korporativnog AI rešenja? Da li on piše kod za vas?
Zašto su cache i persist potrebni u Spark-u?
Kako ste pokretali DAG-ove: putem cron-a, skupova podataka, okidača ili zavisnosti?
uvozi clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Koji su parametri Spark JDBC korišćeni za paralelno čitanje?
Šta je CROSS JOIN i kakav je rezultat njegove primene?
У којем правцу би било интересно развијати се: витрине, развој, анализа, можда AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 IZABERI a.num KAO a_num, b.num KAO b_num IZ t1 a LEVO PRIDRUŽIVANJE t2 b ON a.num = b.num;
Koji nejasni problemi mogu nastati prilikom učitavanja velikih tabela (osim performansi)?
Funkcija prozora SUM() OVER (PARTITION BY user_id) — u jednom slučaju dodajemo ORDER BY datum kupovine, u drugom ne. Koja je razlika?
Zašto vam je uopšte bio potreban Data Vault?
Koji tip skladištenja ima Parquet: red ili kolona?
Ispričajte o zadatku podešavanja replikacije koji ste rešili.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Ispričaj mi o procesima CI/CD, promenama u bazi podataka, verzionisanju i migracijama šeme (evolucija šeme).
Šta te privlači u oblasti travel? Možda voliš da putuješ sam, ili te je travel-tech na neki način zainteresovao?
Можете ли да ми кажете о вашем искуству са расподељеним базама података (Greenplum, ClickHouse)?
Predložite rešenje za redovno inkrementalno učitavanje velike tabele sa fleksibilnom (menjajućom) frekvencijom ažuriranja iz Postgres u Data Lake.