Data Engineer
Co je spouštěčem pro vytvoření nového Jobu v Spark a jak je Job rozdělen na Stages a Tasks?
Pracoval jste s dávkovým nahráváním nebo streamováním?
Proč nelze seznam použít jako klíč slovníku?
Byl S3 jediným hlavním úložištěm nebo jste používali několik?
Jaký je diagnostický algoritmus a co dělat, pokud je dotaz stále pomalý po přidání několika indexů?
Jak zorganizovat načítání dat do ClickHouse ve velké tabulce PostgreSQL, do které neustále přicházejí nové záznamy s monotonně rostoucím primárním klíčem?
Co je normalizace a ER-model, k čemu slouží?
Kromě API, jakými dalšími způsoby a protokoly pracoval s datovými zdroji?
print(len(' '.join(map(str, [0, 1]))))
Jak správně určit pole distribuce v Greenplum? Co se děje při Motion?
Pokud má na executoru 10 jader, kolik úloh bude současně prováděno v jednom okamžiku?
Máte zkušenosti s webovým frameworkem Gin? Povězte nám podrobněji, jaké úkoly jste s jeho pomocí řešili.
Na co jsou v Sparku cache a persist?
Co se stane, pokud vytvoříte DAG s start_date = 1. ledna 2024?
V jakém směru by bylo zajímavé se rozvíjet: výlohy, vývoj, analýza, možná AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 VYBER a.num AKO a_num, b.num AKO b_num Z t1 a LEVA PŘIPOJENÍ t2 b ON a.num = b.num;
Jak jste opravili zkreslení dat podle client_id, když byl jeden klient výrazně větší než ostatní? Jaké jsou možnosti?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Navrhněte řešení pro pravidelné inkrementální načítání velké tabulky s flexibilní (měnitelnou) frekvencí aktualizace z Postgres do Data Lake.
Zobrazte počet objednávek a "produkty požadované kategorie v objednávce" za rok 2021 v kategoriích "Oblečení" a za rok 2022 v kategorii "Obuv" (konečný pohled: 2 řádky. Pole: rok, počet produktů, počet objednávek) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where (g.cat_1 = 'Oblečení' and Year(o.order_date) = 2021) or (g.cat_1 = 'Obuv' and Year(o.order_date) = 2022) group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte pro rok 2025, top 3 v každé kategorii podle objemu prodeje model with cte as( select cat_1, price, quantity, model, rank() over(partition by cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) pro rok 2025, top 3 v každé kategorii podle součtu prodeje model with cte as( select g.cat_1, g.model, (price * quantity), rank() over(partition by g.cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte as( select g.cat_1, g.model, sum(price * quantity) as sum_, rank() over(partition by g.cat_1 order by sum() desc) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte1 as( select g.cat_1, g.model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ), cte2 as(select g.cat_1, g.model, sum_total, rank() over(partition by g.cat_1 order sum_total desc) as rk from cte1 ) select g.cat_1, g.model, sum_total from cte2 where rk <=3 tudja meg a kategória nevét, a modellt és az összes eladást (top 3) with cte1 as( select g.cat_1 as cat_name, g.model as model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 group by Year(o.order_date), g.model ), cte2 as(select cat_name, model, sum_total, rank() over(partition by cat_name order sum_total desc) as rk from cte1 ) select cat_name, model, sum_total from cte2 where rk <=3