Taak #2 Schrijf een query die de TOP-3 werknemers met het hoogste salaris in elke afdeling toont. Toon de naam van de afdeling, de naam van de werknemer en zijn salaris. employee tabel: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department tabel: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Uitvoer: department_name, num, employee_name, salary met cte als( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
Wat is het verschil tussen ACID en de CAP-theorie?
Eindresultaat: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | met cte als( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) als prev_order_ft, datediff(dag, prev_order_ft, order_dt) als gap_days van Orders ) selecteer customer_id, max(gap_days) als gap_days van cte waar gap_days > 60 group by customer_id
Wat is Adaptieve Query-uitvoering (AQE)?
Uit welke fasen bestaat een transactie?
Wat is het gevaar van shuffle in Spark?
Heeft u ooit met decorators in Python gewerkt? Wat zijn ze en waar worden ze toegepast?
In welke situatie kan zoeken in een woordenboek degraderen tot het slechtste geval?
Vertel over mutable en immutable datatypes in Python en geef voorbeelden.
Heeft u gewerkt met parameters en hints die het gebruik van Broadcast Join bepalen?
Hoe voorkom je dat ongeveer 700 DAG-uitvoeringen gelijktijdig worden gestart tijdens catchup/backfill in Airflow?
Leg uit wat lazy en immediate berekeningen in Spark zijn.
Wat zijn de risico's voor de datakwaliteit?
Vertel me meer over het netwerk: wat is het en waarom is het belangrijk?
Hoe ging je gewoonlijk om met fouten en waarschuwingen in pipelines?
Vraag #1 Hoeveel records geeft de query terug met inner, left, right, full join van twee tabellen bij het verbinden op het attribuut id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Hoe onderscheid je technische en zakelijke datavalidaties, en wie moet de eisen daarvoor opstellen?
Welke fysieke strategieën voor het uitvoeren van join kent u?
Wat weet je over serialisatie en deserialisatie in de context van Spark/UDF?
Wat is het verschil tussen repartition en coalesce in Spark?