Parlez-moi de la tâche de configuration de la réplication que vous avez résolue.
Data Engineer
Qu'est-ce que la normalisation et le modèle ER, à quoi servent-ils?
Comment éviter/éliminer le biais des données dans Spark?
Dans quels cas la normalisation est-elle appliquée, et dans quels cas la dénormalisation?
Quel algorithme de diagnostic et que faire si la requête est toujours lente après l'ajout de plusieurs index?
Parlez des concepts de base de Kafka (groupe de consommateurs, partitions, sujets).
Quelles sont les causes typiques d'une requête dans un SGBD qui fonctionne lentement?
Quels problèmes non évidents peuvent survenir lors du chargement de grandes tables (en dehors des performances) ?
Proposez une solution pour le chargement incrémentiel régulier d'une grande table avec une fréquence de mise à jour flexible (modifiable) de Postgres vers Data Lake.
Comment la tri dans la fonction de fenêtre est-elle liée au tri final ORDER BY dans la requête?
Comment gérer les ressources d'une application Spark pour ne pas dépasser la mémoire lors de la modification du volume de données d'entrée?
Comment travailler avec les partitions via coalesce et repartition?
Quels images Docker avez-vous dû construire et pourquoi?
Existe-t-il d'autres mécanismes de gestion du shuffle en dehors de coalesce/repartition?
Quels paramètres Spark JDBC ont été utilisés pour paralléliser la lecture?