Data Engineer
NULL plus 5, combien cela fera-t-il?
Peut-on lire des données en parallèle à partir d'un seul fichier Parquet dans Spark, ou seulement avec un seul noyau dans une tâche?
Avec quels formats de fichiers avez-vous travaillé?
Quels types de JOIN physiques existent dans Spark?
Avec quels paramètres du moteur Distributed dans ClickHouse êtes-vous familier?
Comment décrirais-tu dans le code une vérification que la valeur diffère de manière significative d'une distribution normale (attendue) ?
Parlez-moi de vous : expérience, tâches, fonctionnalités ou réalisations dont vous êtes fier.
Avez-vous de l'expérience avec FastAPI?
À quoi servent les "dossiers"/préfixes dans S3 en plus de la commodité?
Qu'est-ce qu'un décorateur en Python?
Quelles sont les opérations paresseuses dans Spark et à quoi servent-elles?
Dans quelle situation la recherche dans un dictionnaire peut-elle se dégrader jusqu'au pire cas?
Comment lutter contre l'incohérence des données?
Comment surveilliez-vous la qualité des données?
Avec quelles bases de données avez-vous travaillé ? Comment fonctionne MongoDB et comment se scale-t-elle ?
Comment avez-vous corrigé le biais des données par client_id lorsque un client était nettement plus grand que les autres ? Quelles sont les options ?
Peut-on créer et appliquer un décorateur sans la syntaxe @?
Comment travailler avec les partitions via coalesce et repartition?
Si l'horaire du DAG est @daily, à quelle heure se lance-t-il réellement?
As-tu effectué des vérifications statistiques?