Ülesanne #2 Kirjutage päring, mis näitab iga osakonna TOP-3 töötajat nende palga järgi. Näidake osakonna nime, töötaja nime ja tema palka. employee tabel: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | deparment tabel: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Izlase: department_name, num, employee_name, salary ar cte kā( select d.name as department_name, e.name as employee_name, e.salary, dense_rank no employee e join department d on e.id = d.id
Data Engineer
Mis on Adaptatiivne Päringute Täitmine (AQE)?
Mis vahe on ACID ja CAP-teoreemi vahel?
Millistest etappidest koosneb tehing?
Lõplik tulemus: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Mis on shuffle oht Sparkis?
Kas olete kunagi töötanud Pythonis dekoratiividega? Mis need on ja kus neid kasutatakse?
Millises olukorras võib sõnastiku otsing halveneda kuni halvimini?
Rääkige Pythonis muudetavatest ja muutumatutest andmetüüpidest ning andke näiteid.
Kas olete töötanud parameetrite ja hintidega, mis määravad Broadcast Join kasutamise?
Räägi rohkem võrgustikust: mis see on ja miks see on oluline?
Kuidas tavaliselt töötasite vigade ja hoiatusedega pipeline'ides?
Selgitage laiskete ja kohese arvutusi Sparkis.
Küsimus #1 Kui palju kirjeid tagastab päring, kasutades inner, left, right, full join kahe tabeli ühendamisel id atribuudi järgi? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Millised on andmekvaliteedi riskid?
Kuidas vältida umbes 700 DAG-i samaaegset käivitamist catchup/backfill ajal Airflow's?
Mida teate Spark/UDF kontekstis serialiseerimisest ja deserialiseerimisest?
Kuidas sa eristad tehnilisi ja ärilisi andmekontrolle ning kes peaks neile nõudeid esitama?
Miks bool([""]) tagastab True?
Mis vahe on repartition ja coalesce vahel Sparkis?