Hoe goed bent u bekend met Linux/Docker?
Data Engineer
Wat is shuffle in Spark en waarom is het nodig?
Hoe beheer je shuffle in Spark (partitionering, broadcast join, etc.)?
Wat brengt het Iceberg-formaat in vergelijking met gewoon Parquet?
Kent u Common Table Expressions (CTE) bekend? Geef een voorbeeld van gebruik.
Hoe vind je een substring in een specifieke kolom van een logbestand in Linux (bijvoorbeeld de datum in de derde kolom)?
Wat is statistiek in de context van databasebeheersystemen en query-optimalisatie?
[naam] vertelde over zijn ervaring met verschillende databasebeheersystemen, hoe diep hij moest ingaan op optimalisatie en interne details.
Detailleer het algoritme voor het vastleggen van de toename vanaf de bron zodat er niets verloren gaat bij het wijzigen van de laadfrequentie.
Hoe organiseer je het lezen van hetzelfde bericht uit Kafka door meerdere verschillende consumenten (fan-out)?
Hoe los je het probleem op wanneer het leesproces een tussenliggende (inconsistente) staat van de tabel kan zien tijdens een meerfasen ETL (delete+insert) in Iceberg?
Wat is een "dode tuple" (dead tuple)?
Hoe vergelijk je de originele ("live") en de doel tabellen als de bron constant verandert?
Hoe zijn Spark-partities gerelateerd aan partities in tabellen (bijvoorbeeld in Iceberg)?
Vertel over best practices voor het gebruik van indexen - wanneer en hoe vaak ze te gebruiken.
Wat is Spark JDBC en hoe laad je efficiënt een grote tabel via deze?
Wat is het transactioneel logboek (WAL) in een DBMS en waarom is het nodig?
Hoe detecteer je data skew in Spark?
Is de methode van het vergelijken van hash-registraties gebruikt om het verschil tussen de bron en de doel tabel te berekenen?
Waarvoor dienen cache en persist in Spark?