Data Engineer
¿Y si necesitamos todos los clientes, incluso si no tuvieron transacciones en esa fecha, cómo podemos mostrarlos?
¿Cómo garantizar la unicidad global de la clave primaria en PostgreSQL al hacer sharding?
¿Qué preguntas tienes para mí?
¿Cómo está organizado su control de calidad (verificación de datos)?
## problema de moda # Hay una lista de números. Escriba una función que encuentre la moda de esta lista. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
¿Escribieron pruebas unitarias? ¿Tiene experiencia en ello?
¿Tiene experiencia en la redacción de documentación?
¿Qué estrategias físicas de ejecución de join conoces?
¿Qué mecanismo físico de JOIN se utilizará al unir la tabla de transacciones con la tabla de calendario bajo la condición de desigualdad (fecha <= fecha)?
¿Qué sucede físicamente durante un INSERT, UPDATE y DELETE en Greenplum; por qué después de un DELETE el espacio en disco no se libera y en qué se diferencia DELETE de TRUNCATE?
¿Qué más has escrito en Python además de Airflow DAG?
¿Cómo ejecutar el segundo DAG de Airflow inmediatamente después de que el primero termine con éxito?
¿Qué es importante para ti en tu futuro trabajo?
¿Cómo se implementó técnicamente la descarga paralela de una tabla grande desde PostgreSQL a Spark en el caso [contexto]?
Cuéntenos más sobre el sesgo de datos entre los shards: ¿cómo se determinó y cómo se utilizó la función/mecanismo correspondiente?
¿Alguna vez se ha encontrado con el error ClickHouse `Too many parts` al insertar? ¿Cómo lo resolvió?
Describe el proceso de archivado de datos de Oracle a Parquet (HDFS) por particiones y el pipeline inverso de recuperación de datos. ¿Cómo resolver el problema de volver a archivar datos recuperados?
¿Qué devolverá la función find_mode para la lista [1, 2, 3, 3, 4, 5]? Explica paso a paso.
¿Por qué estás considerando ofertas de trabajo en este momento?
¿En qué orden se realizan las operaciones principales en SQL: SELECT, FROM, etc.?