Data Engineer
Aufgabe zur Gestaltung einer Microservice-Architektur: Wie stellt man Daten für die Bestelltabelle (Produkte, Preise, Bestellungen) im Frontend bereit, wenn es drei separate Microservices gibt?
Schreiben Sie ein einfaches DAG für Apache Airflow
Wie haben Sie bei der erneuten Ausführung des DAG nach einem Absturz mit den Dateien gearbeitet, um keine unvollständigen Daten in S3 zu überschreiben?
Erzähle mir von deinem Verständnis der Datenqualität — hast du Erfahrung in diesem Bereich?
Mussten Sie direkt mit Data Scientists interagieren und deren Anforderungen sammeln?
Welche SQL-Abfragen schreibst du: einfache Prüfungen oder komplexe Skripte für Data Warehouses?
Welche Arten von JOINs kennst du? Erkläre 2-3 davon.
Listen Sie die Ausführungsreihenfolge der Operationen in einer SQL-Anweisung mit SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT von der ersten bis zur letzten auf.
Wie vorgehen bei Skew (Schieflage) bezüglich user_id beim JOIN von Transaktions- und Benutzertabellen? Wie wählt man den optimalen Verteilungsschlüssel?
Erzählen Sie auf hoher Ebene, wie die Architektur von Spark aufgebaut ist: Welche Komponenten gibt es und wie interagieren sie bei der Ausführung einer SQL-Anfrage.
Warum suchst du eine neue Stelle und was möchtest du in Zukunft machen?
Nach welchen Feldern wurde die Datenzusammenführung durchgeführt und wie wurden Duplikate im Store entfernt?
Welche physikalischen JOINs kennst du?
Es wurde eine spezielle Sequenz namens even_sequence erstellt, die nur gerade Zahlen generiert. Was muss anstelle von [...] eingesetzt werden, damit im Falle, dass kein Wert für even_column bei der Einfügung angegeben wurde, der Wert aus even_sequence genommen wird? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
Wie empfiehlt Git Flow, eine neue Version der Anwendung zu erstellen? - Durch Erstellen eines neuen Issue-Branches - Durch Erstellen eines Hotfix-Branches vom Master - Durch Erstellen eines separaten Release-Branches vom Develop - Durch direkten Commit in den Master-Branch - Durch direktes Zusammenführen des Master-Branches in develop
Was ist RDD in Apache Spark und wie unterscheidet es sich von anderen Abstraktionen von Spark?
Was ist semantische Versionierung? Wann sollte man Major, Minor, Patch erhöhen?
Erzähle mir mehr über das Netzwerk: Was ist das und warum ist es wichtig?
In welchem Team und unter welcher Führung fühlst du dich am wohlsten bei der Arbeit?
Erzähle mir von deiner Erfahrung bei X5: Was hast du im Bereich DWH gemacht?