Data Engineer
Pracoval si s inkrementálnym a úplným načítaním? Ako si sa vysporiadal s duplikátmi?
Ako odporúča Git Flow, ako má byť oficiálne zaznamenaná nová verzia aplikácie? - Vytvorením novej issue vetvy - Vytvorením hotfix vetvy od master - Vytvorením samostatnej release vetvy od develop - Priamy commit do vetvy master - Priame zlúčenie vetvy master do develop
[meno] sa opýtal: Ktoré stĺpce by mali byť Nullable a ako to špecifikovať v DDL?
VYBER * Z tabuľky1 ako t1 LEVO JOIN tabuľky2 ako t2 ON t1.date_start > t2.date_start --DML Vytvorte tabuľku, ak neexistuje Employee (id int, salary int, departmentId int); Vložte do Employee (id,salary,departmentId) hodnoty (1, 70000, 1),(2, 94000, 1),(3, 85000, 1),(4, 80000, 2),(5, 60000, 2),(6, 62000, 3),(7, 90000, 3),(8, 94000, 3),(9, 94000, 3); s cte ako( vyber *, rank() over(partition by departmentId order by salary desc) ako max_salary z Employee ) výber * z cte kde max_salary = 1
Aké fyzické JOIN-y poznáš?
Správa pre logistickú spoločnosť Ste analytik v logistickej spoločnosti, ktorá zaznamenáva operácie na skladoch. Musíte vypracovať správu o efektívnosti každého skladu. Pre každý sklad vypočítajte: • celkový počet operácií (count_operations); • celkový počet spracovaných tovarov na sklade (sum_quantity); • priemerný čas spracovania operácie (avg_processing_time), pričom sa berú do úvahy iba operácie s uvedeným časom (nie NULL), zaokrúhlený na celé číslo; • maximálny a minimálny počet tovarov spracovaných v jednej operácii (max_quantity, min_quantity); • počet operácií každého typu («dodávka», «odoslanie», «presun») v samostatných stĺpcoch: supply_operations, shipment_operations, transfer_operations. Filtrovať sklady, ktorých celkový počet operácií je viac ako 2 a priemerný čas spracovania nepresahuje 60 minút. Usporiadať výsledok podľa ID skladu vzostupne. Formát vstupu Tabuľka operations: • operation_id (int) — jedinečný identifikátor operácie • warehouse_id (int) — ID skladu • operation_type (text) — typ operácie: «dodaní», «odoslaní», «presun» • quantity (int) — počet jednotiek tovaru v operácii • operation_date (timestamp) — dátum a čas operácie • processing_time (int) — čas spracovania operácie Stĺpec processing_time môže obsahovať hodnoty NULL. Formát výstupu Dotaz by mal vrátiť tabuľku s poľami v nasledovnom poradí: • warehouse_id (int) — jedinečný ID skladu • count_operations (int) — celkový počet operácií vykonaných v sklade • sum_quantity (int) — celkový počet spracovaných tovarov v sklade • avg_processing_time (numeric) — priemerný čas spracovania operácie (v minútach), pričom sa berú do úvahy iba operácie s nenulovým časom, zaokrúhlené na celé číslo • max_quantity (int) — maximálny počet tovarov spracovaných v jednej operácii • min_quantity (int) — minimálny počet tovarov spracovaných v jednej operácii • supply_operations (int) — počet operácií typu «dodaní» • shipment_operations (int) — počet operácií typu «odoslaní» • transfer_operations (int) — počet operácií typu «presun»
Ako sa vyhnúť súčasnému spusteniu približne 700 DAG behov pri catchup/backfill v Airflow?
Aké motory tabuliek v ClickHouse poznáte a používali ste?
Povedz mi o svojom predchádzajúcom projekte, aké boli tvoje povinnosti?
Povedaj mi o Greenplum — formátoch ukladania dát, riadkovom a stĺpcovom uložení.
Povedaj mi, česa se rad razen kodiranja raduješ v prostem času? Kakšni so tvoji hobiji?
Čo je štatistika v kontexte systémov správy databáz a optimalizácie dopytov?
Po akých poliach si distribuoval dáta v Greenplum?
-- Nájsť všetkých cestujúcich, ktorí podnikli cesty dva alebo viac dní po sebe
Keď si staval pipeline v Airflow, ako si riešil problém junk data (neplatné/nepotrebné údaje)?
Ako funguje JOIN v ClickHouse?
Čím sa líši RANK od DENSE_RANK?
Akými druhmi distribúcie ste používali? Ako ste vyberali kľúč distribúcie?
Ako ovplyvňuje ORDER BY tabuľku ClickHouse a ktoré kľúče je lepšie vybrať?
Uveďte päť príkazov Git.