Data Engineer
As-tu écrit des processus d'ingestion pour OpenMetadata qui analysent les sources?
Que se passera-t-il si on crée un DAG avec start_date = 1er janvier 2024?
Peut-on envisager autre chose qu'un CTE classique, étant donné que le filtrage se fait toujours en mémoire sur toute la table?
Quelles commandes Linux principales utilisez-vous dans le terminal?
Qu'est-ce que le journal de transactions (WAL) dans un SGBD et à quoi sert-il?
Dans quel environnement Spark a-t-il été lancé?
À quoi vous servait en général Data Vault?
Avez-vous de l'expérience avec des moteurs comme Trino ou avec des formats tabulaires (Iceberg, Parquet) dans Spark?
Quelle expérience avez-vous avec SQL et les bases de données relationnelles?
Pourquoi cherchez-vous un nouvel emploi et que souhaitez-vous faire à l'avenir?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Parlez-moi des processus CI/CD, des modifications dans la base de données, du versionnage et des migrations de schéma (évolution du schéma).
Qu'est-ce qui t'attire dans le domaine du travel ? Peut-être que tu aimes voyager toi-même, ou que le travel-tech t'a intéressé d'une manière ou d'une autre ?
Quelles méthodes de transfert de données entre les tâches d'Airflow connaissez-vous?
Quels champs ont été utilisés pour la fusion des données et comment les doublons ont-ils été éliminés dans la vitrine?
LeetCode #? — Dans PostgreSQL, il y a une table [table] avec une seule colonne id et des valeurs 1, 1, 2. Écrivez une requête DELETE qui supprime physiquement un doublon.
Que sais-tu du spill dans Spark?
Utilisez-vous l'IA dans votre travail actuel ? Quels outils et comment précisément ?
As-tu travaillé avec le chargement par lots ou le streaming?
Parlez-nous du projet ou de la tâche la plus importante en Python au cours de la dernière année.