Aufgabe #2 Schreiben Sie eine Abfrage, die die TOP-3-Mitarbeiter nach Gehalt in jeder Abteilung anzeigt. Geben Sie den Namen der Abteilung, den Namen des Mitarbeiters und sein Gehalt aus. Mitarbeitertabelle: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | Abteilungstabelle: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finanzen | Ausgabe: department_name, num, employee_name, salary mit cte als( select d.name als department_name, e.name als employee_name, e.salary, dense_rank von employee e join department d auf e.id = d.id
Data Engineer
Was ist Adaptive Query Execution (AQE)?
Was ist der Unterschied zwischen ACID und dem CAP-Theorem?
Aus welchen Phasen besteht eine Transaktion?
Endergebnis: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | mit cte als( select order_id, customer_id, order_dt, lag(order_dt) über(Partition by customer_id order by order_dt) als prev_order_ft, datediff(Tag, prev_order_ft, order_dt) als gap_days von Orders ) wähle customer_id, max(gap_days) als gap_days von cte wo gap_days > 60 gruppe nach customer_id
Haben Sie schon einmal mit Dekoratoren in Python gearbeitet? Was sind sie und wo werden sie angewendet?
In welcher Situation kann die Suche in einem Wörterbuch auf den schlechtesten Fall verschlechtern?
Was ist die Gefahr des Shuffle in Spark?
Erzählen Sie von den veränderlichen und unveränderlichen Datentypen in Python und geben Sie Beispiele.
Haben Sie mit Parametern und Hinweisen gearbeitet, die die Verwendung von Broadcast Join bestimmen?
Wie haben Sie Fehler und Warnungen in Pipelines normalerweise behandelt?
Frage Nr. 1 Wie viele Datensätze gibt die Abfrage mit inner, left, right, full join von zwei Tabellen zurück, wenn sie nach dem Attribut id verbunden werden t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Erklären Sie die lazy und sofortigen Berechnungen in Spark.
Erzähle mir mehr über das Netzwerk: Was ist das und warum ist es wichtig?
Welche Risiken gibt es bei der Datenqualität?
Wie kann man verhindern, dass beim Catchup/Backfill in Airflow etwa 700 DAG-Läufe gleichzeitig gestartet werden?
Warum gibt bool([""]) True zurück?
Was ist der Unterschied zwischen repartition und coalesce in Spark?
Was wissen Sie über Serialisierung und Deserialisierung im Kontext von Spark/UDF?
Wie unterscheidest du technische und geschäftliche Datenprüfungen, und wer sollte die Anforderungen dafür festlegen?