¿Qué es ACID? ¿Qué significa cada letra? ¿Cómo se relaciona esto con las transacciones?
Data Engineer
¿Conoces el formato Avro?
Cuéntame sobre las bases de datos relacionales en general, ¿qué son?
¿Cuándo no necesitamos almacenamiento de datos?
¿Has tenido experiencia con imágenes de Docker, configurando entornos en una máquina virtual?
¿Qué es la tipificación pato (duck typing)?
Mencionaste los procesos de Docker, ¿puedes contarme más sobre cómo está organizado eso en tu empresa?
¿Cuáles son las limitaciones en el uso de tablas hash?
¿Cómo está organizado su control de calidad (verificación de datos)?
¿Cuál es la diferencia entre refactorización y optimización?
¿Qué tipos de conexiones físicas (métodos de unión) existen?
¿Has tenido experiencia trabajando con Table Engine Join en ClickHouse?
¿Qué es un plan de consultas? ¿Para qué sirven?
¿Puedes contarme sobre tu experiencia trabajando con bases de datos distribuidas (Greenplum, ClickHouse)?
¿Qué no te gusta actualmente en tu trabajo?
Supón que Data Vault no está disponible y hay dos tablas amplias que necesitan ser unidas. ¿Cómo optimizarías esto en Greenplum? ¿Y si fuera en ClickHouse?
¿Tiene experiencia trabajando con motores como Trino o con formatos tabulares (Iceberg, Parquet) en Spark?
¿Se puede pensar en algo más en lugar de un CTE normal, considerando que la filtración aún ocurre en memoria en toda la tabla?
¿Para qué necesitabas Data Vault en general?
¿En qué entorno se ejecutó Spark?