Data Engineer
Comment évaluer la configuration pour transférer un téraoctet de données de PostgreSQL à ClickHouse?
Quelles technologies avez-vous utilisées pour charger les données dans Parquet, et quels mécanismes ont été utilisés pour obtenir et charger les données?
As-tu travaillé avec des fonctions de fenêtre ? Quels types de fonctions de fenêtre connais-tu ?
Résultat final: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | avec cte comme( sélectionner order_id, customer_id, order_dt, lag(order_dt) sur(partition par customer_id order par order_dt) comme prev_order_ft, datediff(jour, prev_order_ft, order_dt) comme gap_days de Orders ) sélectionner customer_id, max(gap_days) comme gap_days de cte où gap_days > 60 groupé par customer_id
Quel type de typage est utilisé en Python : statique ou dynamique ?
Nous avons une table de clients (id, nom, adresse, etc.), produits (id, nom, etc.), mouvement de produits (ici, nous avons id du client, produit, date, quantité, somme), il faut trouver quels produits ont été vendus le 1er janvier, uniquement les uniques, et aussi afficher le nom de l'acheteur et...
Dans quelle équipe et sous quelle direction vous sentez-vous le plus à l'aise pour travailler?
Avez-vous de l'expérience dans l'optimisation des tâches Spark ? Pouvez-vous donner un exemple concret ?
Quel était ton rôle dans une équipe de 4 personnes, et comment vois-tu ta carrière dans 3-4 ans, quels objectifs te fixes-tu?
Le stockage a été construit selon le schéma Data Vault — tu l'as également développé, maintenu ? Ajoutais-tu manuellement des hubs, des liens ?
Il y a deux structures de données à l'écran affiché; dans laquelle la recherche de la valeur 2 sera plus rapide et pourquoi?
Comment comprends-tu le concept de clés dans les tableaux — à quoi cela sert-il?
Comment charger des données de Kafka vers ClickHouse via streaming pour des rapports en temps réel?
Parlez des concepts de base de Kafka (groupe de consommateurs, partitions, sujets).
Comment créer plusieurs tâches identiques en parallèle dans Airflow (par exemple, télécharger plusieurs fichiers identiques) ?
Quel format de travail vous convient : à distance, hybride ou en bureau ?
Peut-on voir le schéma de la table avant d'exécuter la requête dans Hive ?
Comment voyez-vous votre développement dans la nouvelle équipe et quelles tâches souhaitez-vous faire le plus?
À quoi servent les décorateurs dans Apache Airflow?
Rapport pour l'entreprise logistique Vous êtes analyste dans une entreprise logistique qui enregistre les opérations dans les entrepôts. Vous devez établir un rapport sur l'efficacité de chaque entrepôt. Pour chaque entrepôt, calculez : • le nombre total d'opérations (count_operations); • le nombre total de produits traités dans l'entrepôt (sum_quantity); • le temps moyen de traitement d'une opération (avg_processing_time), en ne considérant que les opérations avec un temps spécifié (non NULL), arrondi à l'entier le plus proche; • le nombre maximum et minimum de produits traités dans une seule opération (max_quantity, min_quantity); • le nombre d'opérations de chaque type (« livraison », « expédition », « transfert ») dans des colonnes séparées : supply_operations, shipment_operations, transfer_operations. Filtrez les entrepôts dont le nombre total d'opérations est supérieur à 2 et dont le temps moyen de traitement ne dépasse pas 60 minutes. Triez le résultat par ID d'entrepôt par ordre croissant. Format d'entrée Tableau operations: • operation_id (int) — identifiant unique de l'opération • warehouse_id (int) — identifiant de l'entrepôt • operation_type (text) — type d'opération : « livraison », « expédition », « transfert »