Sobes.tech

Data Engineer

Taak #2 Schrijf een query die de TOP-3 werknemers met het hoogste salaris in elke afdeling toont. Toon de naam van de afdeling, de naam van de werknemer en zijn salaris. employee tabel: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department tabel: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Uitvoer: department_name, num, employee_name, salary met cte als( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id

235

Eindresultaat: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | met cte als( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) als prev_order_ft, datediff(dag, prev_order_ft, order_dt) als gap_days van Orders ) selecteer customer_id, max(gap_days) als gap_days van cte waar gap_days > 60 group by customer_id

199

Heeft u ooit met decorators in Python gewerkt? Wat zijn ze en waar worden ze toegepast?

189

In welke situatie kan zoeken in een woordenboek degraderen tot het slechtste geval?

185

Vertel over mutable en immutable datatypes in Python en geef voorbeelden.

182

Heeft u gewerkt met parameters en hints die het gebruik van Broadcast Join bepalen?

181

Hoe voorkom je dat ongeveer 700 DAG-uitvoeringen gelijktijdig worden gestart tijdens catchup/backfill in Airflow?

177

Leg uit wat lazy en immediate berekeningen in Spark zijn.

176

Vertel me meer over het netwerk: wat is het en waarom is het belangrijk?

174

Hoe ging je gewoonlijk om met fouten en waarschuwingen in pipelines?

172

Vraag #1 Hoeveel records geeft de query terug met inner, left, right, full join van twee tabellen bij het verbinden op het attribuut id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:

170

Hoe onderscheid je technische en zakelijke datavalidaties, en wie moet de eisen daarvoor opstellen?

166

Welke fysieke strategieën voor het uitvoeren van join kent u?

164

Wat weet je over serialisatie en deserialisatie in de context van Spark/UDF?

161

Wat is het verschil tussen repartition en coalesce in Spark?

159
/2