Erzählen Sie mir von der Replikationskonfigurationsaufgabe, die Sie gelöst haben.
Data Engineer
Was ist Normalisierung und ER-Modell, wozu sind sie nützlich?
Wie man Datenverzerrung in Spark vermeidet/entfernt?
In welchen Fällen wird die Normalisierung angewendet und in welchen die Denormalisierung?
Welcher Diagnostik-Algorithmus und was tun, wenn die Abfrage nach dem Hinzufügen mehrerer Indizes immer noch langsam ist?
Erzählen Sie die Grundkonzepte von Kafka (Consumer Group, Partitionen, Topics).
Was sind die typischen Ursachen dafür, dass eine Abfrage in einer relationalen Datenbank langsam läuft?
Welche nicht offensichtlichen Probleme können beim Laden großer Tabellen auftreten (außer Leistung)?
Schlagen Sie eine Lösung für das regelmäßige inkrementelle Laden einer großen Tabelle mit flexibler (änderbarer) Aktualisierungsfrequenz von Postgres in Data Lake vor.
Wie hängt die Sortierung innerhalb der Fensterfunktion mit der endgültigen ORDER BY-Sortierung in der Abfrage zusammen?
Wie verwaltet man die Ressourcen einer Spark-Anwendung, um den Speicherverbrauch bei Änderungen des Eingabedatenvolumens nicht zu überschreiten?
Wie arbeitet man mit Partitionen über coalesce und repartition?
Welche Docker-Images mussten Sie bauen und warum?
Gibt es noch andere Mechanismen zur Steuerung des Shuffle außer coalesce/repartition?
Welche Spark JDBC-Parameter wurden zur Parallelisierung des Lesens verwendet?