À quel point connaissez-vous bien Linux/Docker?
Data Engineer
Qu'est-ce que shuffle dans Spark et à quoi sert-il?
Comment gérer le shuffle dans Spark (partitionnement, broadcast join, etc.)?
Qu'apporte le format Iceberg par rapport au Parquet classique?
Connaissez-vous les expressions de table communes (CTE) ? Donnez un exemple d'utilisation.
Comment rechercher une sous-chaîne dans une colonne spécifique d'un fichier journal sous Linux (par exemple, la date dans la troisième colonne) ?
Qu'est-ce que la statistique dans le contexte des SGBD et de l'optimisation des requêtes?
[nom] a parlé de son expérience avec différentes SGBD, jusqu'où il a dû approfondir l'optimisation et les détails internes.
Détaillez l'algorithme de capture d'incrément à partir de la source afin que rien ne soit perdu lors du changement de fréquence de chargement.
Comment organiser la lecture d'un même message de Kafka par plusieurs consommateurs différents (fan-out) ?
Qu'est-ce qu'une "tuples morte" (dead tuple) ?
Comment résoudre le problème lorsque le processus de lecture peut voir un état intermédiaire (incohérent) de la table lors d'un ETL en plusieurs étapes (delete+insert) dans Iceberg?
Comment comparer la table source ("live") et la table cible si la source change constamment?
Parlez des meilleures pratiques pour l'utilisation des index : quand et à quelle fréquence les utiliser.
Qu'est-ce que Spark JDBC et comment charger efficacement une grande table via celui-ci?
Comment les partitions Spark sont-elles liées aux partitions dans les tables (par exemple, dans Iceberg) ?
Qu'est-ce que le journal de transactions (WAL) dans un SGBD et à quoi sert-il?
La méthode de comparaison des hachages des enregistrements a-t-elle été utilisée pour calculer la différence entre la source et la table cible?
Comment détecter le déséquilibre des données (data skew) dans Spark?
À quoi servent cache et persist dans Spark?