Data Engineer
¿Qué es la normalización y la desnormalización, cuándo son necesarias?
Proporcione un ejemplo de una tarea típica de escritura de DAG en Airflow.
¿Qué ocurrió y cómo se puede recuperar el trabajo?
¿Qué es ACID? ¿Qué significa cada letra? ¿Cómo se relaciona esto con las transacciones?
Evalúe la solución final en términos de tiempo y memoria.
¿Qué tan realistas son los planes de la empresa para construir un sistema de recopilación, normalización y análisis de datos?
¿En qué se diferencia EXPLAIN ANALYZE de un EXPLAIN normal? ¿Por qué no es recomendable ejecutarlo en consultas DELETE/UPDATE?
Explica los cálculos perezosos e inmediatos en Spark.
Hubo una consulta analítica lenta en Hive. ¿Cómo entender qué le sucedió y cómo arreglarla?
¿Qué recurso se consume más en un Nested Loop Join?
¿Puedes contar qué vamos a obtener al final aquí? Necesitas comentar cada paso, cómo funciona.
Hay una tabla T1 (10 filas) y una tabla T2 (5 filas), ambas con un campo ID. ¿Cuántas filas pueden ser como máximo y como mínimo en la salida al hacer un INNER JOIN y un LEFT JOIN de estas tablas?
¿Qué hay que verificar si los registros no se abren (error 403)?
¿En qué etapa se realizan las verificaciones de calidad de datos (Data Quality), qué verificaciones se llevan a cabo y qué sucede con los datos no válidos?
Data Vault es una herramienta conveniente, pero hay demasiados objetos. ¿Puedes explicar la diferencia entre hubs, enlaces y satélites?
¿De qué suelen estar compuestos los registros de tareas de Airflow?
[nombre] corrigió errores y estilo en el texto: «¡Hola! Soy [nombre], anteriormente solicitaste cambiar a Telegram» — a «tú», pero de manera respetuosa
¿Cómo agregar una media móvil de la suma de pedidos de los días actual y dos anteriores por usuario?
¿Qué es shuffle en Spark y para qué sirve?
¿En qué equipo y bajo qué liderazgo te sientes más cómodo trabajando?