Tâche n°2 Écrire une requête qui affiche les 3 employés les mieux payés dans chaque département. Afficher le nom du département, le nom de l'employé et son salaire. table employee: | id | nom | salaire | dept_id | |----|-------|---------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | table department: | id | nom | |----|--------------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Sortie: department_name, num, employee_name, salary avec cte comme( sélectionner d.name comme department_name, e.name comme employee_name, e.salary, dense_rank de employee e joindre department d sur e.id = d.id
Data Engineer
Qu'est-ce que l'exécution de requête adaptative (AQE) ?
Quelle est la différence entre ACID et le théorème CAP?
Résultat final: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | avec cte comme( sélectionner order_id, customer_id, order_dt, lag(order_dt) sur(partition par customer_id order par order_dt) comme prev_order_ft, datediff(jour, prev_order_ft, order_dt) comme gap_days de Orders ) sélectionner customer_id, max(gap_days) comme gap_days de cte où gap_days > 60 groupé par customer_id
Quel est le danger du shuffle dans Spark?
De quelles étapes se compose une transaction?
Dans quelle situation la recherche dans un dictionnaire peut-elle se dégrader jusqu'au pire cas?
Avez-vous déjà travaillé avec des décorateurs en Python ? Qu'est-ce que c'est et où sont-ils utilisés ?
Parlez des types de données mutables et immuables en Python et donnez des exemples.
Avez-vous travaillé avec des paramètres et des hints déterminant l'utilisation de Broadcast Join?
Parle-moi plus en détail du réseau : qu'est-ce que c'est et pourquoi c'est important ?
Comment gérez-vous habituellement les erreurs et alertes dans les pipelines?
Explique les calculs paresseux et immédiats dans Spark.
Question #1 Combien d’enregistrements la requête renverra-t-elle avec inner, left, right, full join de deux tables lors de la jointure par l’attribut id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Quels sont les risques liés à la qualité des données?
Comment éviter le lancement simultané d'environ 700 exécutions de DAG lors du catchup/backfill dans Airflow?
Pourquoi bool([""]) renvoie-t-il True ?
Que savez-vous de la sérialisation et de la désérialisation dans le contexte de Spark/UDF?
Quelle est la différence entre repartition et coalesce dans Spark?
Quelles stratégies physiques d'exécution de join connaissez-vous?