Úkol #2 Írjon olyan lekérdezést, amely minden osztályban a TOP-3 alkalmazottat mutatja a fizetés szerint. Mutassa az osztály nevét, az alkalmazott nevét és fizetését. employee tábla: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department tábla: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Pénzügy | Kimenet: department_name, num, employee_name, salary cte-ként: select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
Co je to Adaptivní vykonávání dotazů (AQE)?
Jaký je rozdíl mezi ACID a CAP teoremou?
Z jakých etapů se skládá transakce?
Konečný výsledek: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | s cte jako( vyberte order_id, customer_id, order_dt, lag(order_dt) přes(částice podle customer_id řadit podle order_dt) jako prev_order_ft, datediff(dne, prev_order_ft, order_dt) jako gap_days z Orders ) vyberte customer_id, max(gap_days) jako gap_days z cte kde gap_days > 60 group by customer_id
Pracoval jste někdy s dekorátory v Pythonu? Co jsou a kde se používají?
V jaké situaci může hledání ve slovníku degradovat na nejhorší případ?
Jaké je nebezpečí shuffle v Spark?
Povězte o mutabilních a nemutabilních datových typech v Pythonu a uveďte příklady.
Pracoval jste s parametry a hinty určujícími použití Broadcast Join?
Jak jste obvykle řešili chyby a upozornění v pipelinech?
Otázka #1 Kolik záznamů vrátí dotaz s inner, left, right, full join dvou tabulek při spojení podle atributu id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Vysvětlete líné a okamžité výpočty v Spark.
Řekni mi víc o síti: co to je a proč je to důležité?
Jaká jsou rizika kvality dat?
Jak zabránit současnému spuštění přibližně 700 DAG běhů při catchup/backfill v Airflow?
Proč bool([""]) vrací True?
Co víte o serializaci a deserializaci v kontextu Spark/UDF?
Jaký je rozdíl mezi repartition a coalesce v Spark?
Jak rozlišuješ technické a obchodní kontroly dat, a kdo by měl stanovovat požadavky na ně?