Data Engineer
Qu'est-ce que le CDC et avez-vous de l'expérience avec cela?
Y a-t-il un concept appelé niveaux d'isolation des transactions ? Que savez-vous à ce sujet?
Avec quels outils de visualisation avez-vous travaillé et à quel point avez-vous travaillé en étroite collaboration avec Power BI?
Avez-vous travaillé avec des gestionnaires de contexte en Python ? Qu'est-ce que c'est et à quoi servent-ils ?
Que savez-vous de la sérialisation et de la désérialisation dans le contexte de Spark/UDF?
S'il y a 10 cœurs sur l'exécuteur, combien de tâches seront exécutées en parallèle à un moment donné?
Parle-moi de ton lieu de travail actuel : produit principal, ta fonction.
Quelles questions as-tu pour moi?
Tâche n°2 Écrire une requête qui affiche les 3 employés les mieux payés dans chaque département. Afficher le nom du département, le nom de l'employé et son salaire. table employee: | id | nom | salaire | dept_id | |----|-------|---------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | table department: | id | nom | |----|--------------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Sortie: department_name, num, employee_name, salary avec cte comme( sélectionner d.name comme department_name, e.name comme employee_name, e.salary, dense_rank de employee e joindre department d sur e.id = d.id
Pourquoi avoir choisi des scripts personnalisés en Python/Airflow pour la qualité des données plutôt qu'un moteur prêt à l'emploi, comme Great Expectations?
Qu'est-ce qu'un CROSS JOIN et quel est le résultat de son application?
Comment fonctionne la jointure par hachage pour des tables de 1 000 et 1 000 000 de lignes?
Parlez-moi de la tâche de configuration de la réplication que vous avez résolue.
La méthode de comparaison des hachages des enregistrements a-t-elle été utilisée pour calculer la différence entre la source et la table cible?
Parlez des concepts de base de Kafka (groupe de consommateurs, partitions, sujets).
1. Commandes: - order_date datetime NON NULL - user_id int NON NULL - order_id int NON NULL 2. Biens: - order_id int NON NULL - model int NON NULL - cat_1 varchar(50) NON NULL - price int NON NULL - quantity int NON NULL Valeurs dans cat_1: - Vêtements - Chaussures - Cosmétiques - Articles pour la maison - Jouets Afficher le nombre de commandes et "le nombre de produits de la catégorie requise dans la commande" pour l'année 2021 dans les catégories "Vêtements" et pour 2022 dans la catégorie "Chaussures" (forme finale : 2 lignes. Champs : année, nombre de produits, nombre de commandes) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where g.cat_1 = 'Vêtements' and Year(o.order_date) = 2021 or g.cat_1 = 'Chaussures' and Year(o.order_date) = 2022 group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte
Pourquoi cherchez-vous un nouvel emploi maintenant, souhaitez-vous changer de travail?
Qu'est-ce qu'une vitrine de données?
Avez-vous travaillé avec des feature store?
Pourquoi ne peut-on pas utiliser une liste comme clé de dictionnaire?