Sobes.tech

Data Engineer

Aufgabe #2 Schreiben Sie eine Abfrage, die die TOP-3-Mitarbeiter nach Gehalt in jeder Abteilung anzeigt. Geben Sie den Namen der Abteilung, den Namen des Mitarbeiters und sein Gehalt aus. Mitarbeitertabelle: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | Abteilungstabelle: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finanzen | Ausgabe: department_name, num, employee_name, salary mit cte als( select d.name als department_name, e.name als employee_name, e.salary, dense_rank von employee e join department d auf e.id = d.id

219

Was ist der Unterschied zwischen ACID und dem CAP-Theorem?

188

Endergebnis: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | mit cte als( select order_id, customer_id, order_dt, lag(order_dt) über(Partition by customer_id order by order_dt) als prev_order_ft, datediff(Tag, prev_order_ft, order_dt) als gap_days von Orders ) wähle customer_id, max(gap_days) als gap_days von cte wo gap_days > 60 gruppe nach customer_id

179

Haben Sie schon einmal mit Dekoratoren in Python gearbeitet? Was sind sie und wo werden sie angewendet?

177

In welcher Situation kann die Suche in einem Wörterbuch auf den schlechtesten Fall verschlechtern?

177

Erzählen Sie von den veränderlichen und unveränderlichen Datentypen in Python und geben Sie Beispiele.

174

Haben Sie mit Parametern und Hinweisen gearbeitet, die die Verwendung von Broadcast Join bestimmen?

173

Wie haben Sie Fehler und Warnungen in Pipelines normalerweise behandelt?

164

Frage Nr. 1 Wie viele Datensätze gibt die Abfrage mit inner, left, right, full join von zwei Tabellen zurück, wenn sie nach dem Attribut id verbunden werden t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:

163

Erklären Sie die lazy und sofortigen Berechnungen in Spark.

162

Erzähle mir mehr über das Netzwerk: Was ist das und warum ist es wichtig?

162

Wie kann man verhindern, dass beim Catchup/Backfill in Airflow etwa 700 DAG-Läufe gleichzeitig gestartet werden?

159

Was ist der Unterschied zwischen repartition und coalesce in Spark?

151

Was wissen Sie über Serialisierung und Deserialisierung im Kontext von Spark/UDF?

151

Wie unterscheidest du technische und geschäftliche Datenprüfungen, und wer sollte die Anforderungen dafür festlegen?

150
/2