Data Engineer
Avez-vous de l'expérience dans l'optimisation des tâches Spark ? Pouvez-vous donner un exemple concret ?
À quel point connaissez-vous bien Linux/Docker?
Expliquez de manière générale comment l'architecture de Spark est organisée : quels composants existent et comment ils interagissent lors de l'exécution d'une requête SQL.
Le dictionnaire en Python est-il un type mutable ou immuable ? Quelles sont les exigences pour ses clés et ses valeurs ?
Avez-vous travaillé avec FTP pour obtenir des fichiers ou des données via le portail?
Parlez-moi de la tâche de configuration de la réplication que vous avez résolue.
Qu'est-ce que la partition ? Qu'est-ce que le sharding ? Qu'est-ce que la réplication ?
Avez-vous travaillé avec les vitrines de données (couche DWH) ?
Avez-vous travaillé avec des paramètres et des hints déterminant l'utilisation de Broadcast Join?
# ce qui est affiché s = 'Abracadabra' print(s[5][0]) b = 'a' b[0] print(s[::2]) s = [1, 2, 3] print(s * 2)
La table notifications contient un champ status, dont les valeurs sont : 'sent', 'delivered', 'read'. Laquelle des requêtes est correcte ? select * from notifications where status like '%sent%' order by created_at desc limit 5 select * from notifications where status = 'read' order by created_at desc limit 5 select * from notifications order by status desc limit 5 select * from notifications where status not in ('sent', 'delivered') order by created_at asc limit 5 select * from notifications where status in ('sent', 'delivered') order by created_at desc limit 5
Comment sont orchestrés les déploiements dans DBT ? Utilisez-vous Airflow ?
Quelle opération la commande a-t-elle effectuée? - A exécuté git revert sur le commit avec config.yaml - A exécuté git filter-branch --index-filter "git rm --cached config.yaml" -- --all - A exécuté git rebase -i en supprimant les commits contenant des modifications du fichier - A exécuté git commit --amend et git push --force - A exécuté git cherry-pick pour créer une nouvelle branche sans config.yaml
Si nous mettons une condition de filtrage par date de transaction dans WHERE (après LEFT JOIN), cela va-t-il limiter le résultat de la première table (clients) ?
Comment assurer l'unicité globale de la clé primaire dans PostgreSQL lors du sharding?
Comment empêcher que des données incorrectes chargées dans la vitrine ou dans la table intermédiaire ne parviennent aux pipelines supérieurs?
Quel est ton salaire attendu?
Dans quels cas utiliser les index B-tree et hash dans PostgreSQL?
Pourquoi ne faut-il pas faire beaucoup de petites insertions dans ClickHouse?
As-tu construit des tableaux de bord et travaillé avec des outils de visualisation de données (outils BI) ?