Data Engineer
Comment obtenir le dernier nom complet de chaque client, si seule la date de début est connue (la date de fin n'est pas connue) ?
[nom] a demandé : Que faut-il ajouter au moteur de tables pour que les données soient maintenues à jour sur tous les nœuds du cluster ?
Y a-t-il eu des cas d'interaction avec des bases de données relationnelles?
Pouvez-vous expliquer le partitionnement dans Oracle : à quoi cela sert-il et quels sont les types ?
[nom] a demandé : Le champ 'A-t-on trouvé des vols' n'a que deux valeurs (oui/non). Comment le représenter au mieux dans ClickHouse ? Quel type de données est utilisé en interne pour Bool ?
Comment organisez-vous vos projets ? Écrivez-vous un README ou autre chose ?
Avec Kafka, rien de difficile, l'essentiel est de traiter les données — quels sont les nuances à prendre en compte?
Dans quels cas utiliser les index B-tree et hash dans PostgreSQL?
Qu'est-ce qu'un plan de requêtes ? À quoi servent-ils ?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplicatedReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate Datetime ) ENGINE = Distributed('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Quelles sont les caractéristiques de l'utilisation de XCom dans Airflow?
Le stockage a été construit selon le schéma Data Vault — tu l'as également développé, maintenu ? Ajoutais-tu manuellement des hubs, des liens ?
Dans PostgreSQL, il est nécessaire d'optimiser les performances des transactions en utilisant un niveau d'isolation minimal, où : • les transactions parallèles peuvent voir des modifications non finalisées les unes des autres ; • des "lectures sales" (dirty read) sont possibles. Quel niveau d'isolation doit être spécifié pour la transaction afin d'atteindre cet objectif ? la lecture sale est impossible dans PostgreSQL lecture répétable lecture non validée lecture validée Serializable
Avez-vous travaillé avec FTP pour obtenir des fichiers ou des données via le portail?
Quels index connaissez-vous dans PostgreSQL?
Qu'est-ce que la partition ? Qu'est-ce que le sharding ? Qu'est-ce que la réplication ?
Avez-vous dû travailler directement avec Spark ? Quel est son inconvénient ?
La table notifications contient un champ status, dont les valeurs sont : 'sent', 'delivered', 'read'. Laquelle des requêtes est correcte ? select * from notifications where status like '%sent%' order by created_at desc limit 5 select * from notifications where status = 'read' order by created_at desc limit 5 select * from notifications order by status desc limit 5 select * from notifications where status not in ('sent', 'delivered') order by created_at asc limit 5 select * from notifications where status in ('sent', 'delivered') order by created_at desc limit 5
Comment les données sont-elles traitées actuellement ? Si elles sont dans différents formats, comment sont-elles normalisées et unifiées ?
Quelle opération la commande a-t-elle effectuée? - A exécuté git revert sur le commit avec config.yaml - A exécuté git filter-branch --index-filter "git rm --cached config.yaml" -- --all - A exécuté git rebase -i en supprimant les commits contenant des modifications du fichier - A exécuté git commit --amend et git push --force - A exécuté git cherry-pick pour créer une nouvelle branche sans config.yaml