Data Engineer
Que signifie UNBOUNDED PRECEDING dans les limites de la fenêtre de la fonction de fenêtre?
Les index améliorent-ils toujours les performances ou peuvent-ils entraîner une dégradation?
Comment mettre à jour une table dans ClickHouse de manière à ce que les utilisateurs ne remarquent rien (remplacement atomique) ?
Que sera capturé comme résultat si on joint des transactions avec des clients par client_id et date_start (sans BETWEEN) ?
Qu'est-ce que la versionnage sémantique ? Quand augmenter major, minor, patch ?
Comment diviser une requête en étapes ? Que faisons-nous pour cela ?
Parle-moi de ta compréhension de la qualité des données — as-tu déjà travaillé dans ce domaine?
Une séquence spéciale, appelée even_sequence, a été créée pour générer uniquement des nombres pairs. Que doit-on mettre à la place de [...], pour que si aucune valeur n’est spécifiée pour even_column lors de l’insertion, la valeur provienne de even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
Quels types de JOIN connaissez-vous ? Expliquez 2-3 principaux.
Comment Git Flow recommande-t-il de formaliser une nouvelle version de l'application? - En créant une nouvelle branche issue - En créant une branche hotfix à partir de master - En créant une branche release séparée à partir de develop - En faisant un commit direct dans la branche master - En fusionnant directement la branche master dans develop
Quels champs ont été utilisés pour la fusion des données et comment les doublons ont-ils été éliminés dans la vitrine?
Comment diffèrent les exigences en puissance de calcul du stockage lors de ETL et ELT?
Parlez-moi de votre expérience professionnelle
Connaissez-vous la méthodologie Domain Driven Design (DDD) ? Si oui, partagez des exemples de son application dans vos projets.
Quelle des affirmations suivantes reflète les conséquences de ces actions du point de vue de la méthodologie Git Flow étendue et de la gestion de l'historique des modifications?
[nom] a demandé : Quelles colonnes doivent être Nullable et comment le spécifier dans le DDL ?
Expliquez de manière générale comment l'architecture de Spark est organisée : quels composants existent et comment ils interagissent lors de l'exécution d'une requête SQL.
Quelle expérience avez-vous avec SQL et les bases de données relationnelles?
Rapport pour l'entreprise logistique Vous êtes analyste dans une entreprise logistique qui enregistre les opérations dans les entrepôts. Vous devez établir un rapport sur l'efficacité de chaque entrepôt. Pour chaque entrepôt, calculez : • le nombre total d'opérations (count_operations); • le nombre total de produits traités dans l'entrepôt (sum_quantity); • le temps moyen de traitement d'une opération (avg_processing_time), en ne considérant que les opérations avec un temps spécifié (non NULL), arrondi à l'entier le plus proche; • le nombre maximum et minimum de produits traités dans une seule opération (max_quantity, min_quantity); • le nombre d'opérations de chaque type (« livraison », « expédition », « transfert ») dans des colonnes séparées : supply_operations, shipment_operations, transfer_operations. Filtrez les entrepôts dont le nombre total d'opérations est supérieur à 2 et dont le temps moyen de traitement ne dépasse pas 60 minutes. Triez le résultat par ID d'entrepôt par ordre croissant. Format d'entrée Tableau operations: • operation_id (int) — identifiant unique de l'opération • warehouse_id (int) — identifiant de l'entrepôt • operation_type (text) — type d'opération : « livraison », « expédition », « transfert »
Qu'est-ce que le CDC et avez-vous de l'expérience avec cela?