Zadanie nr 2 Napisz zapytanie wyświetlające TOP-3 pracowników pod względem wynagrodzenia w każdym dziale. Wyświetl nazwę działu, imię pracownika i jego wynagrodzenie. tabela employee: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabela department: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finanse | Wynik: department_name, num, employee_name, salary with cte as( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
Czym jest Adaptacyjne Wykonanie Zapytania (AQE)?
Jaka jest różnica między ACID a twierdzeniem CAP?
Ostateczny wynik: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | z cte jako( wybierz order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) jako prev_order_ft, datediff(day, prev_order_ft, order_dt) jako gap_days z Orders ) wybierz customer_id, max(gap_days) jako gap_days z cte gdzie gap_days > 60 grupuj według customer_id
Na czym polega niebezpieczeństwo shuffle w Spark?
Z jakich etapów składa się transakcja?
Czy pracowałeś kiedyś z dekoratorami w Pythonie? Czym są i gdzie są stosowane?
W jakiej sytuacji wyszukiwanie w słowniku może się pogorszyć do najgorszego przypadku?
Opowiedz o mutowalnych i niemutowalnych typach danych w Pythonie i podaj przykłady.
Czy pracowałeś z parametrami i hintami określającymi użycie Broadcast Join?
Jak zwykle obsługiwałeś błędy i alerty w pipeline'ach?
Opowiedz więcej o sieci: czym jest i dlaczego jest ważna?
Jak uniknąć jednoczesnego uruchomienia około 700 uruchomień DAG podczas catchup/backfill w Airflow?
Pytanie #1 Ile rekordów zwróci zapytanie z inner, left, right, full join dwóch tabel podczas łączenia po atrybucie id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Wyjaśnij leniwe i natychmiastowe obliczenia w Spark.
Jakie są ryzyka związane z jakością danych?
Co wiesz o serializacji i deserializacji w kontekście Spark/UDF?
Jakie znasz fizyczne strategie wykonywania join?
Jak odróżniasz techniczne i biznesowe kontrole danych, i kto powinien ustalać ich wymagania?
Jaka jest różnica między repartition a coalesce w Spark?