ACID est-il respecté dans Greenplum?
Data Engineer
Data Vault est un outil pratique, mais il y a trop d'objets. Peux-tu expliquer la différence entre hubs, liens et satellites?
Quels processus sont lancés lorsque nous supprimons ou modifions des enregistrements dans ClickHouse?
Comment diviser une requête en étapes ? Que faisons-nous pour cela ?
Connaissez-vous une bibliothèque en Rust, multithread, très rapide, qui peut remplacer Pandas pour la science des données et le traitement de Big Data?
Quelle est la différence entre un CTE et une sous-requête?
Quelles technologies avez-vous utilisées pour charger les données dans Parquet, et quels mécanismes ont été utilisés pour obtenir et charger les données?
Avec des dépendances entre les jobs, entre DAGs — avez-vous utilisé des capteurs pour qu'ils s'exécutent les uns après les autres?
Avez-vous chargé des données de Spark vers S3 au format Parquet, puis de Parquet vers Greenplum — comment se déroule le processus de chargement?
Comment concevais-tu le schéma de la base de données ? Le faisais-tu manuellement dans la base, ou stockais-tu les scripts quelque part, ou utilisais-tu Liquibase ? Quel était le processus ?
Comment les données de la table externe ont-elles été chargées dans les tables cibles?
Comment as-tu écrit le DAG d'Airflow et les jobs : à la main ou avec des modèles ?
Avez-vous travaillé avec Git ? Qu'y stockiez-vous ?
Avec le streaming, Iceberg fonctionnait, tu as entendu ? C'est un stockage de fichiers poubelle.
C'est en temps réel, comment l'intégrer entre Kafka et ClickHouse Spark ?
Est-il utile d'utiliser une CTE si elle n'est utilisée qu'une seule fois dans la requête?
Avez-vous dû travailler directement avec Spark ? Quel est son inconvénient ?
Nous allons analyser JSON — qui analysera le JSON ? À ma connaissance, il n'y a pas de fonctions dans ClickHouse.
Iceberg est un moteur qui permet de faire de S3 une base de données, il respecte même ACID. Quel est son inconvénient?
Nous avons besoin d'un moteur de pipeline — un mécanisme qui permet de créer très rapidement des flux en fournissant des contrats et des paramètres en entrée. Comment le réaliserais-tu à un niveau supérieur?