Data Engineer
Welche Fragen hast du an mich?
Warum wurden für Data Quality benutzerdefinierte Skripte in Python/Airflow gewählt und kein fertiger Motor, wie Great Expectations?
Wie funktioniert der Hash-Join für Tabellen mit 1.000 und 1.000.000 Zeilen?
Gibt es etwas anderes, das man anstelle eines normalen CTEs in Betracht ziehen kann, da die Filterung immer noch im Speicher auf der gesamten Tabelle erfolgt?
Welche Linux-Befehle verwendest du im Terminal?
# was wird ausgegeben s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
1. Bestellungen: - order_date datetime NICHT NULL - user_id int NICHT NULL - order_id int NICHT NULL 2. Waren: - order_id int NICHT NULL - model int NICHT NULL - cat_1 varchar(50) NICHT NULL - price int NICHT NULL - quantity int NICHT NULL Werte in cat_1: - Kleidung - Schuhe - Kosmetik - Haushaltswaren - Spielzeug Zeigen Sie die Anzahl der Bestellungen und "Anzahl der benötigten Kategorieprodukte in der Bestellung" für das Jahr 2021 in den Kategorien "Kleidung" und für 2022 in der Kategorie "Schuhe" (Endform: 2 Zeilen. Felder: Jahr, Anzahl der Produkte, Anzahl der Bestellungen) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where g.cat_1 = 'Kleidung' and Year(o.order_date) = 2021 or g.cat_1 = 'Schuhe' and Year(o.order_date) = 2022 group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte
Welche Methoden der Datenübertragung zwischen Airflow-Aufgaben kennen Sie?
Frage Nr. 1 Wie viele Datensätze gibt die Abfrage mit inner, left, right, full join von zwei Tabellen zurück, wenn sie nach dem Attribut id verbunden werden t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Welche Arten von physischen JOINs gibt es in Spark?
Wofür ist die Zeilengruppe in der Struktur der Parquet-Datei verantwortlich?
Was passiert physisch bei INSERT, UPDATE und DELETE in Greenplum; warum wird nach DELETE der Festplattenspeicher nicht freigegeben und worin unterscheidet sich DELETE von TRUNCATE?
Für jede Zeile in der Tabelle salaries die Name des Mitarbeiters, das Datum, das Gehalt anzeigen und mit einer Fensterfunktion eine Spalte "durchschnittliches Gehalt nach Abteilung an diesem Datum" hinzufügen.
Wie hängt die Sortierung innerhalb der Fensterfunktion mit der endgültigen ORDER BY-Sortierung in der Abfrage zusammen?
Erzähle mir von deinem aktuellen Arbeitsplatz: Hauptprodukt, deine Funktion.
Was bewirkt der Parameter depends_on_past in Airflow?
Was ist der Unterschied zwischen ACID und dem CAP-Theorem?
Wie man mit Inkonsistenzen bei Daten umgeht?
Kann man einen Dekorator ohne die @-Syntax erstellen und anwenden?
Warum suchen Sie eine neue Arbeit?