Vertel over de replicatie-instelling die je hebt opgelost.
Data Engineer
In welke gevallen wordt normalisatie toegepast en in welke denormalisatie?
Hoe voorkom/verwijder je datavervorming in Spark?
Welk diagnoseer algoritme en wat te doen als de query nog steeds traag is na het toevoegen van meerdere indexen?
Wat is normalisatie en het ER-model, waar zijn ze voor?
Vertel over de basisconcepten van Kafka (consumer group, partitions, topics).
Wat zijn de typische oorzaken dat een query in een relationele database langzaam werkt?
Welke niet-voor de hand liggende problemen kunnen zich voordoen bij het laden van grote tabellen (behalve prestaties)?
Stel een oplossing voor voor het regelmatige incrementele laden van een grote tabel met een flexibele (wijzigbare) frequentie van updates van Postgres naar Data Lake.
Hoe zijn de sortering binnen de vensterfunctie en de uiteindelijke sortering ORDER BY in de query gerelateerd?
Hoe beheer je de bronnen van een Spark-toepassing om niet te veel geheugen te verbruiken bij het wijzigen van het volume van de invoergegevens?
Hoe werk je met partitions via coalesce en repartition?
Welke Docker-afbeeldingen moest je bouwen en waarom?
Zijn er andere mechanismen voor shuffle-beheer naast coalesce/repartition?
Welke Spark JDBC-parameters werden gebruikt om het lezen te paralleliseren?