Uzdevums #2 Rakstiet vaicājumu, kas parāda TOP-3 darbiniekus pēc algas katrā nodaļā. Parādīt nodaļas nosaukumu, darbinieka vārdu un viņa algu. employee tabula: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department tabula: | id | name | |----|-----------| | 1 | Mārketings | | 2 | IT | | 3 | Finanšu | Izvade: department_name, num, employee_name, salary ar cte kā( select d.name as department_name, e.name as employee_name, e.salary, dense_rank no employee e join department d on e.id = d.id
Data Engineer
Kas ir Adaptīvā Vaicājumu Izpilde (AQE)?
Kāda ir atšķirība starp ACID un CAP teoremu?
No kādām posmām sastāv darījums?
Galīgais rezultāts: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | ar cte kā( atlasiet order_id, customer_id, order_dt, lag(order_dt) pār(daļa pēc customer_id kārtojot pēc order_dt) kā prev_order_ft, datediff(diena, prev_order_ft, order_dt) kā gap_days no Orders ) atļaujiet customer_id, max(gap_days) kā gap_days no cte kur gap_days > 60 grupu pēc customer_id
Kāda ir shuffle bīstamība Spark?
Vai jūs kādreiz esat strādājis ar dekoratoriem Python? Kas tie ir un kur tie tiek izmantoti?
Kādā situācijā vārdnīcas meklēšana var pasliktināties līdz sliktākajam gadījumam?
Pastāstiet par mainīgajiem un nemainīgajiem datu tipiem Python un sniedziet piemērus.
Vai esat strādājis ar parametriem un hintiem, kas nosaka Broadcast Join izmantošanu?
Pastāsti vairāk par tīklu: kas tas ir un kāpēc tas ir svarīgi?
Kā parasti apstrādājāt kļūdas un brīdinājumus pipeline'os?
Izskaidrojiet lazy un tūlītējos aprēķinus Spark.
Jautājums #1 Cik ierakstus atgriezīs vaicājums ar inner, left, right, full join divās tabulās, savienojot pēc id atribūta t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Kādi ir datu kvalitātes riski?
Kā izvairīties no aptuveni 700 DAG izpildes vienlaikus catchup/backfill laikā Airflow?
Ko jūs zināt par serializāciju un deserializāciju Spark/UDF kontekstā?
Kāpēc bool([""]) atgriež True?
Kā atšķir tehnikas un biznesa datu pārbaudes, un kas būtu jānosaka to prasībām?
Kuras fiziskās apvienošanas izpildes stratēģijas jūs zināt?