Pourquoi bool([""]) renvoie-t-il True ?
Data Engineer
Exercice #3 Trouver les clients dont l'écart entre leurs commandes est supérieur à 60 jours. Pour ces clients, afficher l'écart maximal (gap_days). Tableau des commandes: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Résultat final: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Quels sont les inconvénients des UDF dans Spark et quel est leur défaut?
Comment lutter contre l'incohérence des données?
Quelle est la différence entre repartition et coalesce dans Spark?
Comment décrirais-tu dans le code une vérification que la valeur diffère de manière significative d'une distribution normale (attendue) ?
Pourquoi les données peuvent-elles être perdues ? Donne plusieurs raisons.
Avez-vous travaillé avec des gestionnaires de contexte en Python ? Qu'est-ce que c'est et à quoi servent-ils ?
Que sais-tu du spill dans Spark?
Comment empêcher que des données incorrectes chargées dans la vitrine ou dans la table intermédiaire ne parviennent aux pipelines supérieurs?
Quelles méthodes de transfert de données entre les tâches d'Airflow connaissez-vous?
Comment surveilliez-vous la qualité des données?
Que fait le paramètre depends_on_past dans Airflow?
Si l'horaire du DAG est @daily, à quelle heure se lance-t-il réellement?
Le dictionnaire en Python est-il un type mutable ou immuable ? Quelles sont les exigences pour ses clés et ses valeurs ?
As-tu effectué des vérifications statistiques?
Comment lancer le deuxième DAG d'Airflow immédiatement après la réussite du premier?
Quelle est la complexité algorithmique de la recherche dans un dictionnaire dans le pire cas?