Sobes.tech

Data Engineer

ACID est-il respecté dans Greenplum?

189

Data Vault est un outil pratique, mais il y a trop d'objets. Peux-tu expliquer la différence entre hubs, liens et satellites?

187

Quels processus sont lancés lorsque nous supprimons ou modifions des enregistrements dans ClickHouse?

187

Comment diviser une requête en étapes ? Que faisons-nous pour cela ?

184

Connaissez-vous une bibliothèque en Rust, multithread, très rapide, qui peut remplacer Pandas pour la science des données et le traitement de Big Data?

184

Quelle est la différence entre un CTE et une sous-requête?

183

Quelles technologies avez-vous utilisées pour charger les données dans Parquet, et quels mécanismes ont été utilisés pour obtenir et charger les données?

182

Avec des dépendances entre les jobs, entre DAGs — avez-vous utilisé des capteurs pour qu'ils s'exécutent les uns après les autres?

181

Avez-vous chargé des données de Spark vers S3 au format Parquet, puis de Parquet vers Greenplum — comment se déroule le processus de chargement?

181

Comment concevais-tu le schéma de la base de données ? Le faisais-tu manuellement dans la base, ou stockais-tu les scripts quelque part, ou utilisais-tu Liquibase ? Quel était le processus ?

177

Comment les données de la table externe ont-elles été chargées dans les tables cibles?

176

Comment as-tu écrit le DAG d'Airflow et les jobs : à la main ou avec des modèles ?

176

Avez-vous travaillé avec Git ? Qu'y stockiez-vous ?

176

Avec le streaming, Iceberg fonctionnait, tu as entendu ? C'est un stockage de fichiers poubelle.

173

C'est en temps réel, comment l'intégrer entre Kafka et ClickHouse Spark ?

170

Est-il utile d'utiliser une CTE si elle n'est utilisée qu'une seule fois dans la requête?

169

Avez-vous dû travailler directement avec Spark ? Quel est son inconvénient ?

169

Nous allons analyser JSON — qui analysera le JSON ? À ma connaissance, il n'y a pas de fonctions dans ClickHouse.

166

Iceberg est un moteur qui permet de faire de S3 une base de données, il respecte même ACID. Quel est son inconvénient?

163

Nous avons besoin d'un moteur de pipeline — un mécanisme qui permet de créer très rapidement des flux en fournissant des contrats et des paramètres en entrée. Comment le réaliserais-tu à un niveau supérieur?

163
/3