Úloha #2 Napíšte dotaz, ktorý zobrazí TOP-3 zamestnancov podľa platu v každom oddelení. Zobrazte názov oddelenia, meno zamestnanca a jeho plat. tabuľka employee: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabula department: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Financie | Výstup: department_name, num, employee_name, salary s cte ako( select d.name as department_name, e.name as employee_name, e.salary, dense_rank z employee e spojte sa s department d na e.id = d.id
Data Engineer
Čo je to Adaptívne vykonávanie dopytov (AQE)?
Aký je rozdiel medzi ACID a CAP teoremou?
Konečný výsledok: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | s cte ako( vyberte order_id, customer_id, order_dt, lag(order_dt) přes(částice podle customer_id řadit podle order_dt) jako prev_order_ft, datediff(dňa, prev_order_ft, order_dt) jako gap_days z Orders ) vyberte customer_id, max(gap_days) jako gap_days z cte kde gap_days > 60 group by customer_id
Aké je nebezpečenstvo shuffle v Spark?
Z akých etáp sa skladá transakcia?
Pracoval ste niekedy s dekorátormi v Pythone? Čo sú a kde sa používajú?
V akej situácii môže vyhľadávanie v slovníku degradovať na najhorší prípad?
Povedzte o mutabilných a nemutabilných dátových typoch v Pythone a uveďte príklady.
Pracovali ste s parametrami a hintami, ktoré určujú použitie Broadcast Join?
Povedz mi viac o sieti: čo to je a prečo je to dôležité?
Ako sa vyhnúť súčasnému spusteniu približne 700 DAG behov pri catchup/backfill v Airflow?
Ako ste zvyčajne spracovávali chyby a upozornenia v pipeline-och?
Vysvetlite lenivé a okamžité výpočty v Spark.
Otázka #1 Koľko záznamov vráti dotaz s inner, left, right, full join dvoch tabuliek pri spojení podľa atribútu id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Aké sú riziká kvality údajov?
Čo vieš o serializácii a deserializácii v kontexte Spark/UDF?
Aké fyzické stratégie vykonávania join poznáte?
Ako rozlišuješ technické a obchodné kontroly dát, a kto by mal stanovovať požiadavky na ne?
Prečo bool([""]) vracia True?