Data Engineer
Lisaks API-le, milliseid teisi meetodeid ja protokolle te kasutasite andmeallikatega töötamisel?
Räägi mulle oma arusaamest andmete kvaliteedist — kas sul on kogemusi selles valdkonnas?
Milliseid agente ja mudeleid kasutatakse teie ettevõtte tehisintellekti lahenduses? Kas see kirjutab teie eest koodi?
Milleks on Sparkis kasu ja persist vajalik?
Kuidas käivitasite DAG-e: cron, andmekogumite, triggereid või sõltuvuste kaudu?
importi clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Millised Spark JDBC parameetrid kasutati lugemise paralleelimiseks?
Mis on CROSS JOIN ja milline on selle rakendamise tulemus?
Millises suundades oleks huvitav areneda: vitriinid, arendus, analüüs, võib-olla AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 VALI a.num KÄ a_num, b.num KÄ b_num FROM t1 a VASAK JOIN t2 b ON a.num = b.num;
Millised ebatüüpilised probleemid võivad tekkida suurte tabelite laadimisel (välja arvatud jõudlus)?
Aknalõike funktsioon SUM() OVER (PARTITION BY user_id) — ühes juhul lisame ORDER BY ostukuupäeva, teises mitte. Mis vahe on?
Milleks teil üldse oli vaja Data Vaulti?
Millist tüüpi salvestus on Parquet: rida või veerg?
Rääkige replikatsiooni seadistamise ülesandest, mille te lahendasite.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Rääkige mulle CI/CD protsessidest, andmebaasi muudatustest, versioonihaldusest ja skeemi migratsioonidest (skeemi areng).
Mis sind tõmbab travel valdkonnas? Võib-olla sulle meeldib ise reisida, või on travel-tech sind mingil moel huvitama hakanud?
Rääkige mulle oma kogemusest jaotatud andmebaasidega (Greenplum, ClickHouse)?
Pakun proposed solution for regular incremental loading of a large table with flexible (changeable) update frequency from Postgres to Data Lake.