Qu'est-ce qui déclenche la création d'un nouveau Job dans Spark, et comment un Job est-il divisé en Stages et Tasks?
Data Engineer
Expliquez de manière générale comment l'architecture de Spark est organisée : quels composants existent et comment ils interagissent lors de l'exécution d'une requête SQL.
Qu'est-ce que la partition ? Qu'est-ce que le sharding ? Qu'est-ce que la réplication ?
Si nous mettons une condition de filtrage par date de transaction dans WHERE (après LEFT JOIN), cela va-t-il limiter le résultat de la première table (clients) ?
## problème de mode # Il y a une liste de nombres. Écrivez une fonction qui trouve la mode de cette liste. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Que renverra la fonction find_mode pour la liste [1, 2, 3, 3, 4, 5] ? Explique étape par étape.
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [téléphone] null null 5 SÉLECTIONNER a.num AS a_num, b.num AS b_num DE t1 a JOINTURE GAUCHE t2 b SUR a.num = b.num;
À quoi sert le Groupe de Lignes dans la structure du fichier Parquet?
Raconte-moi où tu as travaillé en tant qu'analyste système et quelles tâches tu as accomplies?
Quelle est la différence entre le format de stockage Parquet et CSV?
Quelle est la différence entre partitionnement et sharding?
Avez-vous effectué vous-même les vérifications de la qualité des données, ou les exigences provenaient-elles du secteur/clients ?
Quels sont les méthodes (types) de stockage de l'historique des données que vous connaissez ? Comment l'historique s'accumule-t-il dans les tables ?
Quel format de travail préférez-vous : bureau, hybride ou télétravail ? Nous avons deux bureaux, à Kutuzovsky et à Tula.
Quels types de JOIN physiques existent dans Spark?
Comment obtenir le dernier nom complet de chaque client, si seule la date de début est connue (la date de fin n'est pas connue) ?
Quel mécanisme physique de JOIN sera utilisé lors de la jointure de la table des transactions avec la table du calendrier selon la condition d'inégalité (date <= date) ?
Que signifie UNBOUNDED PRECEDING dans les limites de la fenêtre de la fonction de fenêtre?
Avez-vous déjà travaillé avec l'optimiseur AQE (Exécution Adaptative des Requêtes) dans Spark ? Savez-vous comment il fonctionne ?