Задача #2 Напишите запрос, который выводит ТОП-3 сотрудников по зарплате в каждом департаменте. Выведите название департамента, имя сотрудника и его зарплату. таблица employee: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | table department: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Вывод: department_name, num, employee_name, salary с cte как( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
Šta je Adaptivno izvršavanje upita (AQE)?
Koja je razlika između ACID i CAP teoreme?
Od kojih faza se sastoji transakcija?
Коначни резултати: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | са cte като( изберете order_id, customer_id, order_dt, lag(order_dt) върху(разделяне по customer_id поред по order_dt) като prev_order_ft, datediff(ден, prev_order_ft, order_dt) като gap_days от Orders ) изберете customer_id, max(gap_days) като gap_days от cte където gap_days > 60 grupo по customer_id
Да ли сте икада радили са декораторима у Python-у? Шта су они и где се користе?
U kojoj situaciji pretraživanje u rečniku može degradirati do najgoreg slučaja?
Koja je opasnost od shuffle u Spark-u?
Реците о mutable и immutable типовима података у Python-у и дајте примере.
Da li ste radili sa parametrima i hintovima koji određuju korišćenje Broadcast Join?
Kako ste obično obrađivali greške i upozorenja u pipeline-ovima?
Pitanje #1 Koliko zapisa će vratiti upit sa inner, left, right, full join dve tabele pri spajanju po atributu id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Реци више о мрежи: шта је то и зашто је важно?
Objasnite lenjive i odmahene izračune u Spark-u.
Kako izbeći istovremeno pokretanje otprilike 700 DAG pokretanja tokom catchup/backfill u Airflow?
Koji su rizici kvaliteta podataka?
Šta znate o serijalizaciji i deserializaciji u kontekstu Spark/UDF?
Koja je razlika između repartition i coalesce u Spark?
Zašto bool([""]) vraća True?
Koje fizičke strategije izvršavanja join poznajete?