Data Engineer
As-tu écrit des processus d'ingestion pour OpenMetadata qui analysent les sources?
Comment gérer les ressources d'une application Spark pour ne pas dépasser la mémoire lors de la modification du volume de données d'entrée?
Que savez-vous de la sérialisation et de la désérialisation dans le contexte de Spark/UDF?
Pourquoi avoir choisi des scripts personnalisés en Python/Airflow pour la qualité des données plutôt qu'un moteur prêt à l'emploi, comme Great Expectations?
Comment fonctionne la jointure par hachage pour des tables de 1 000 et 1 000 000 de lignes?
Peut-on envisager autre chose qu'un CTE classique, étant donné que le filtrage se fait toujours en mémoire sur toute la table?
Quelles commandes Linux principales utilisez-vous dans le terminal?
Quelle est la différence entre ACID et le théorème CAP?
Comment lutter contre l'incohérence des données?
1. Commandes: - order_date datetime NON NULL - user_id int NON NULL - order_id int NON NULL 2. Biens: - order_id int NON NULL - model int NON NULL - cat_1 varchar(50) NON NULL - price int NON NULL - quantity int NON NULL Valeurs dans cat_1: - Vêtements - Chaussures - Cosmétiques - Articles pour la maison - Jouets Afficher le nombre de commandes et "le nombre de produits de la catégorie requise dans la commande" pour l'année 2021 dans les catégories "Vêtements" et pour 2022 dans la catégorie "Chaussures" (forme finale : 2 lignes. Champs : année, nombre de produits, nombre de commandes) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where g.cat_1 = 'Vêtements' and Year(o.order_date) = 2021 or g.cat_1 = 'Chaussures' and Year(o.order_date) = 2022 group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte
Quelles méthodes de transfert de données entre les tâches d'Airflow connaissez-vous?
Question #1 Combien d’enregistrements la requête renverra-t-elle avec inner, left, right, full join de deux tables lors de la jointure par l’attribut id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
À quoi sert le Groupe de Lignes dans la structure du fichier Parquet?
Que se passe-t-il physiquement lors d'un INSERT, UPDATE et DELETE dans Greenplum ; pourquoi l'espace disque n'est-il pas libéré après un DELETE et en quoi DELETE diffère-t-il de TRUNCATE ?
Pour chaque ligne dans la table salaries, afficher le nom de l'employé, la date, le salaire et, en utilisant une fonction de fenêtre, ajouter une colonne "salaire moyen par département à cette date".
Comment la tri dans la fonction de fenêtre est-elle liée au tri final ORDER BY dans la requête?
Parle-moi de ton lieu de travail actuel : produit principal, ta fonction.
Que fait le paramètre depends_on_past dans Airflow?
Peut-on créer et appliquer un décorateur sans la syntaxe @?
Pourquoi cherchez-vous un nouvel emploi?