Data Engineer
Comment faire une extension vers le haut (remplir NULL avec la valeur non nulle précédente dans la direction inverse) ?
Quelle est la différence entre les générateurs et les listes en Python?
À quoi servent les index, quels sont leurs avantages et inconvénients?
Quel est le but de diviser les données en blocs dans HDFS?
Quels sont les inconvénients de l'architecture MPP dans Greenplum?
Greenplum est-il un OLTP ou un entrepôt analytique?
Quelle est la différence entre WHERE et HAVING?
Quels types de JOIN connais-tu ? (logiques)
Quels opérateurs Airflow avez-vous utilisés ? Comment avez-vous interagi avec dbt via Airflow ?
La traçabilité montre-t-elle uniquement les requêtes REST ou autre chose?
Comment ne pas tuer Jupyter ou Pandas par mémoire?
Quel type de lecture est utilisé dans Greenplum : ligne ou colonne?
ACID est-il respecté dans Greenplum?
-- Tableau d'origine stretch -- Il est nécessaire de remplir avec la valeur précédente (non NULL) en fonction de l'id - effectuer un remplissage vers le bas id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- La tabla original a la izquierda y la que se desea obtener a la derecha SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Qu'est-ce que le GIL (Global Interpreter Lock) ?
Quels sont les avantages et inconvénients de l'ACID, à part la vitesse de lecture?
Quelles sont les chaînes mortes dans la base de données?
Quelle est la différence entre partitionnement et sharding?
Quelles stratégies de chargement incrémental dans dbt avez-vous utilisées?
Les index améliorent-ils toujours les performances ou peuvent-ils entraîner une dégradation?