Data Engineer
¿Qué tipos de JOIN conoces? Explica 2-3 principales.
¿Cómo recomienda Git Flow que se formalice una nueva versión de la aplicación? - Creando una nueva rama issue - Creando una rama hotfix desde master - Creando una rama release separada desde develop - Cometiendo directamente en la rama master - Fusionando la rama master directamente en develop
¿Qué verificaciones de calidad de datos se realizaron en Data Vault?
¿Qué es la tipificación dinámica?
SELECCIONAR * DE tabla1 COMO t1 LEFT JOIN tabla2 COMO t2 ON t1.date_start > t2.date_start --DML CREAR TABLA SI NO EXISTE Employee (id int, salario int, departmentId int); INSERTAR EN Employee (id,salary,departmentId) VALORES (1, 70000, 1),(2, 94000, 1),(3, 85000, 1),(4, 80000, 2),(5, 60000, 2),(6, 62000, 3),(7, 90000, 3),(8, 94000, 3),(9, 94000, 3); con cte como( seleccionar *, rank() sobre(partición por departmentId ordenar por salary desc) como max_salary de Employee ) seleccionar * de cte donde max_salary = 1
¿Cómo evitar la ejecución simultánea de aproximadamente 700 ejecuciones de DAG durante catchup/backfill en Airflow?
[nombre] preguntó: ¿Qué columnas deben ser Nullable y cómo se especifica esto en DDL?
LEFT JOIN: tabla con 10 registros LEFT JOIN tabla con 100 registros. ¿Cuál es el número mínimo y máximo de filas que se pueden obtener?
¿Qué motores de tablas en ClickHouse conoces y has utilizado?
¿Cómo abordas normalmente la construcción de procesos ETL y ELT? ¿En qué se diferencian estos procesos?
Escribe un DAG simple para Apache Airflow
¿Has trabajado con cargas incrementales y completas? ¿Cómo manejaste los duplicados?
¿Qué es la estadística en el contexto de los sistemas de gestión de bases de datos y la optimización de consultas?
Cuéntame, ¿qué te gusta hacer en tu tiempo libre además de programar? ¿Cuáles son tus pasatiempos?
¿Estás familiarizado con los cubos OLAP? Cuando trabajamos con datos multidimensionales, similares a una tabla dinámica en Excel, pero para una interacción más rápida con grandes volúmenes de datos.
Mencionaste los procesos de Docker, ¿puedes contarme más sobre cómo está organizado eso en tu empresa?
¿En qué se diferencia RANK de DENSE_RANK?
¿Creaste trabajos de dbt en Airflow manualmente o los automatizaste de alguna manera, había plantillas?
Cuéntame sobre Greenplum: formatos de almacenamiento de datos, almacenamiento en filas y columnas.
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplicatedReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate Datetime ) ENGINE = Distributed('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));