Avez-vous travaillé avec les vitrines de données (couche DWH) ?
Data Engineer
Quel est ton salaire attendu?
Il y a une table T1 (10 lignes) et une table T2 (5 lignes), toutes deux avec un champ ID. Combien de lignes peuvent-il y avoir au maximum et au minimum en sortie lors d'un INNER JOIN et d'un LEFT JOIN de ces tables?
Que sera capturé comme résultat si on joint des transactions avec des clients par client_id et date_start (sans BETWEEN) ?
Pourquoi cherchez-vous un nouvel emploi maintenant, souhaitez-vous changer de travail?
Quels types de JOIN connais-tu ? (logiques)
Parlez-moi de quelques-unes de vos tâches les plus importantes liées à la qualité des données.
Peut-on lire des données en parallèle à partir d'un seul fichier Parquet dans Spark, ou seulement avec un seul noyau dans une tâche?
Qu'est-ce qu'un CROSS JOIN ? Y avez-vous déjà travaillé avec cela ?
Quels sont les avantages et inconvénients des bases de données en lignes et en colonnes ? Qu'est-ce qui est plus efficace pour le regroupement et l'agrégation ?
Parle-moi de toi — expérience professionnelle, pile technologique
S'il y a 10 cœurs sur l'exécuteur, combien de tâches seront exécutées en parallèle à un moment donné?
-- La table numbers avec une colonne num (nombres entiers, pouvant se répéter). -- Écrivez une requête SQL qui divise les nombres en deux colonnes: -- even – nombres pairs (triés par ordre croissant) -- odd – nombres impairs (triés par ordre croissant) -- Les nombres doivent être placés ligne par ligne : dans la première ligne – le premier nombre pair et le premier nombre impair, -- dans la deuxième ligne – le deuxième nombre pair et le deuxième nombre impair, etc. -- Si un groupe a plus de nombres que l'autre, les places manquantes doivent être NULL. -- table d'origine -- num -- --------- -- [phone] -- résultat de la requête -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Décrivez les fonctions de fenêtre dans la version la plus étendue : quels mots-clés sont utilisés et à quoi sert chacun.
Parle-moi de ta compréhension de la qualité des données — as-tu déjà travaillé dans ce domaine?
Comment fonctionne la jointure par boucle imbriquée et quelle est sa complexité algorithmique ? Quelle est la complexité des trois algorithmes ?
Quels JOINs physiques connais-tu?
Qu'est-ce qu'un index ? Quelle est la différence entre un index clusterisé et un index non clusterisé ?
Qu'est-ce que LEFT SEMI JOIN et LEFT ANTI JOIN dans Spark SQL, avez-vous déjà dû les utiliser?
Dans quelle direction serait-il intéressant de se développer : vitrines, développement, analyse, peut-être IA ?