Que peux-tu me dire sur l'API SOAP?
Data Engineer
Comment avez-vous lancé les DAGs : par cron, datasets, déclencheurs ou dépendances ?
Quelles vérifications de la qualité des données ont été effectuées dans Data Vault?
Comment se sont-ils connectés à OpenMetadata et qu'ont-ils fait avec elle?
Comment suivre dans quelle exécution du DAG une ligne spécifique est apparue dans Data Vault?
Donnez un exemple de tâche typique d'écriture de DAG dans Airflow.
Avez-vous administré Airflow ou avez-vous seulement travaillé en tant que développeur?
Comment ont-ils optimisé les tables et les requêtes : partitions, index, logique de sélection ?
Peut-on utiliser une distribution aléatoire dans Greenplum et quand est-ce approprié?
Parle-moi de toi : qu'as-tu fait, quelle pile technologique as-tu utilisée et quel était le projet ?
Quels requêtes SQL écris-tu : des vérifications simples ou des scripts complexes pour les vitrines ?
Avez-vous effectué une journalisation supplémentaire en plus des journaux Airflow?
Quand peux-tu donner ton retour et as-tu des offres en main?
Avez-vous utilisé Bridge et tables PIT dans Data Vault ? Donnez un exemple et expliquez leur but.
Quelles entités supplémentaires de Data Vault, en plus du hub, du lien et du satellite, ont été utilisées : par exemple, des liens same-as ou des liens transactionnels ?
S3 était-il le seul stockage principal ou en avez-vous utilisé plusieurs?
Énumérez les fonctions de fenêtre SQL que vous connaissez.
Ont-ils utilisé un seul bucket S3 ou plusieurs ? Selon quel principe ?
Avez-vous établi la filiation de la source au consommateur?
Quel type de stockage a Parquet : ligne ou colonne ?