¿Qué tan familiarizado estás con Linux/Docker?
Data Engineer
¿Qué es shuffle en Spark y para qué sirve?
¿Cómo se puede gestionar shuffle en Spark (particionamiento, broadcast join, etc.)?
¿Qué aporta el formato Iceberg en comparación con el Parquet convencional?
¿Está familiarizado con las expresiones de tabla comunes (CTE)? Proporcione un ejemplo de uso.
¿Cómo encontrar una subcadena en una columna específica de un archivo de registro en Linux (por ejemplo, la fecha en la tercera columna)?
¿Qué es la estadística en el contexto de los sistemas de gestión de bases de datos y la optimización de consultas?
[nombre] habló sobre su experiencia trabajando con diferentes sistemas de gestión de bases de datos, cuánto tuvo que profundizar en la optimización y en los detalles internos.
Detalla el algoritmo de captura de incremento desde la fuente para que no se pierda nada al cambiar la frecuencia de carga.
¿Cómo organizar la lectura de un mismo mensaje de Kafka por varios consumidores diferentes (fan-out)?
¿Cómo resolver el problema cuando el proceso de lectura puede ver un estado intermedio (inconsistente) de la tabla durante un ETL de múltiples etapas (delete+insert) en Iceberg?
¿Qué es un "tupla muerta" (dead tuple)?
¿Cómo están relacionadas las particiones de Spark y las particiones en las tablas (por ejemplo, en Iceberg)?
¿Cómo comparar la tabla original ("en vivo") y la tabla de destino si la fuente cambia constantemente?
Cuéntenos sobre las mejores prácticas para el uso de índices: cuándo y con qué frecuencia utilizarlos.
¿Qué es Spark JDBC y cómo cargar eficientemente una gran tabla a través de él?
¿Cómo detectar el sesgo de datos en Spark?
¿Qué es el registro de transacciones (WAL) en un sistema de gestión de bases de datos y para qué sirve?
¿Se utilizó el método de comparación de hashes de registros para calcular la diferencia entre la fuente y la tabla de destino?
¿Para qué sirven cache y persist en Spark?