Parlez-moi de Greenplum — formats de stockage des données, stockage en ligne et en colonnes.
Data Engineer
Qu'est-ce que ACID ? Que signifie chaque lettre ? Comment cela se rapporte-t-il aux transactions ?
Connais-tu le format Avro?
Tu as mentionné les processus Docker, peux-tu m'en dire plus sur comment cela est organisé chez vous?
Quand n'avons-nous pas besoin de stockage de données?
As-tu déjà travaillé avec des images Docker, en configurant un environnement sur une machine virtuelle?
Qu'est-ce que la typage canard (duck typing) ?
Quelles sont les limitations de l'utilisation des tables de hachage?
Quels sont les types de connexions physiques (méthodes de jointure) ?
Comment est organisée votre assurance qualité (contrôle de la qualité des données) ?
Quelle est la différence entre refactoring et optimisation?
Qu'est-ce qu'un plan de requêtes ? À quoi servent-ils ?
Parlez-moi de votre expérience avec les bases de données distribuées (Greenplum, ClickHouse) ?
Avez-vous déjà travaillé avec Table Engine Join dans ClickHouse?
Supposons que Data Vault n'est pas disponible et qu'il y a deux grandes tables à joindre. Comment optimiseriez-vous cela dans Greenplum ? Et si c'était dans ClickHouse ?
Avez-vous de l'expérience avec des moteurs comme Trino ou avec des formats tabulaires (Iceberg, Parquet) dans Spark?
Qu'est-ce qui ne vous plaît pas actuellement dans votre travail?
Peut-on envisager autre chose qu'un CTE classique, étant donné que le filtrage se fait toujours en mémoire sur toute la table?
Dans quel environnement Spark a-t-il été lancé?
Qu'est-ce que la typification dynamique?