Data Engineer
Produisez une liste de réservations coûteuses Question Comment pouvez-vous produire une liste de réservations le jour de [téléphone] qui coûteront au membre (ou invité) plus de 30 $? Rappelez-vous que les invités ont des coûts différents de ceux des membres (les coûts indiqués sont par créneau de demi-heure), et l'utilisateur invité a toujours l'ID 0. Incluez dans votre sortie le nom de l'installation, le nom du membre formaté en une seule colonne, et le coût. Triez par coût décroissant, et n'utilisez pas de sous-requêtes.
Quelle est la différence entre HDFS et les systèmes de fichiers distribués classiques?
Qu'est-ce que la partition de données et comment aide-t-elle à éviter une analyse complète de la table?
Quelle est la différence entre ROWS BETWEEN et RANGE BETWEEN ?
Comment restaurer le travail à partir d'une branche distante si vous obtenez un message d'erreur disant que la branche n'existe pas lorsque vous essayez de faire `git checkout hotfix/missing-footer`?
-- Tableau d'origine stretch -- Il est nécessaire de remplir avec la valeur précédente (non NULL) en fonction de l'id - effectuer un remplissage vers le bas id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- La tabla original a la izquierda y la que se desea obtener a la derecha SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Qu'est-ce que shuffle dans Spark et pourquoi est-il important de le minimiser?
Parle-moi de ton expérience chez X5 : qu'as-tu fait dans le domaine du DWH ?
As-tu déjà travaillé avec des images Docker, en configurant un environnement sur une machine virtuelle?
Que fait OPTIMIZE dans ClickHouse et pourquoi ne pas le lancer sans réfléchir?
Quels sont les avantages et inconvénients de l'ACID, à part la vitesse de lecture?
Quelle est la complexité algorithmique pour obtenir un élément par clé dans un dictionnaire (dict) en Python?
Qu'est-ce que le GIL (Global Interpreter Lock) ?
Comment éviter/éliminer le biais des données dans Spark?
Parlez-moi de Greenplum — formats de stockage des données, stockage en ligne et en colonnes.
Comment rechercher une sous-chaîne dans une colonne spécifique d'un fichier journal sous Linux (par exemple, la date dans la troisième colonne) ?
Que faites-vous lorsque vous rencontrez un problème dans le pipeline de production?
Il y a deux structures de données à l'écran affiché; dans laquelle la recherche de la valeur 2 sera plus rapide et pourquoi?
Que s'est-il passé et comment récupérer le travail ?
Qu'est-ce qu'un décorateur en Python et à quoi sert-il (dans le contexte d'Airflow) ?