Wie gut kennen Sie sich mit Linux/Docker aus?
Data Engineer
Was ist Shuffle in Spark und wozu ist es notwendig?
Wie kann man Shuffle in Spark verwalten (Partitionierung, Broadcast Join usw.)?
Was bringt das Iceberg-Format im Vergleich zu herkömmlichem Parquet?
Kennen Sie sich mit Common Table Expressions (CTE) aus? Geben Sie ein Beispiel für die Verwendung.
Wie findet man eine Teilzeichenkette in einer bestimmten Spalte einer Log-Datei unter Linux (z.B. das Datum in der dritten Spalte)?
Was ist Statistik im Kontext von Datenbanksystemen und Abfrageoptimierung?
[Name] berichtete über seine Erfahrung mit verschiedenen Datenbanksystemen, wie tief er in die Optimierung und die internen Abläufe eingreifen musste.
Detaillieren Sie den Algorithmus zur Erfassung des Inkrements von der Quelle, damit bei Änderungen der Ladefrequenz nichts verloren geht.
Wie organisiert man das Lesen derselben Nachricht aus Kafka durch mehrere verschiedene Verbraucher (Fan-Out)?
Wie löst man das Problem, wenn der Leseprozess während eines mehrstufigen ETL (delete+insert) in Iceberg einen Zwischenzustand (inkonsistent) der Tabelle sehen kann?
Was ist ein "toter Tupel" (dead tuple)?
Wie vergleicht man die Originaltabelle ("live") und die Zieltabelle, wenn sich die Quelle ständig ändert?
Was ist Spark JDBC und wie lädt man effizient eine große Tabelle darüber?
Wie sind Spark-Partitionen mit Partitionen in Tabellen (z.B. in Iceberg) verbunden?
Erzählen Sie uns von Best Practices bei der Verwendung von Indizes – wann und wie oft sie eingesetzt werden.
Was ist das Transaktionsprotokoll (WAL) in einem DBMS und wozu dient es?
Wurde die Methode des Vergleichs von Hashes von Datensätzen verwendet, um die Differenz zwischen Quelle und Ziel Tabelle zu berechnen?
Wie erkennt man Data Skew in Spark?
Wozu dienen cache und persist in Spark?