Data Engineer
NULL más 5, ¿cuánto será?
¿Se puede leer datos en paralelo desde un solo archivo Parquet en Spark, o solo con un núcleo en una tarea?
¿Con qué bibliotecas de Python ha trabajado?
¿Qué son las operaciones perezosas en Spark y para qué sirven?
¿Qué es un CROSS JOIN y cuál es el resultado de su aplicación?
¿Cuál es la diferencia entre ACID y la teorema CAP?
¿En qué campos se realizó la unión de datos y cómo se eliminaron los duplicados en la vista?
¿Qué tipos de particiones existen?
¿Qué sabes sobre spill en Spark?
¿Qué sucede físicamente durante un INSERT, UPDATE y DELETE en Greenplum; por qué después de un DELETE el espacio en disco no se libera y en qué se diferencia DELETE de TRUNCATE?
¿Cómo se implementó técnicamente la descarga paralela de una tabla grande desde PostgreSQL a Spark en el caso [contexto]?
¿Cómo trabajó con los archivos al reiniciar el DAG después de que falló, para no sobrescribir los datos en S3 con datos incompletos?
¿Cómo distribuir de manera desigual los datos de la vitrina en tres shards: 50% en el primero y 25% en los otros dos?
Escriba SQL para agregar un total acumulado del monto del pedido por usuario y fecha.
¿Qué tipos de claves/estrategias de distribución existen en Greenplum?
¿Cómo se conectaron a OpenMetadata y qué hicieron con ella?
¿Se puede crear y aplicar un decorador sin la sintaxis @?
¿Cómo trabajar con particiones a través de coalesce y repartition?
Si el horario del DAG es @daily, ¿a qué hora se ejecuta realmente?
¿Está familiarizado con ReplicatedQueue? ¿Ha tenido experiencia trabajando con ella?