Data Engineer
¿Cómo sueles trabajar con Git en equipo? ¿Y qué es una Merge Request?
¿Con streaming, Iceberg funcionaba, escuchaste? Es un almacenamiento de archivos basura.
¿Qué formato de trabajo prefieres: oficina, híbrido o remoto? Tenemos dos oficinas, en Kutuzovsky y en Tula.
¿Cómo reducir el consumo de memoria del DataFrame en Pandas?
¿Cómo garantizar que el cliente móvil tenga acceso a los mismos pedidos, pero con un conjunto reducido de campos? ¿Qué es BFF?
Cuéntenos más sobre el sesgo de datos entre los shards: ¿cómo se determinó y cómo se utilizó la función/mecanismo correspondiente?
importar clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
¿Qué orden o tipo de compresión se utiliza en Parquet?
¿Qué sucede en PostgreSQL después de ejecutar la consulta SELECT * FROM [tabla]?
Describe el proceso de archivado de datos de Oracle a Parquet (HDFS) por particiones y el pipeline inverso de recuperación de datos. ¿Cómo resolver el problema de volver a archivar datos recuperados?
¿Cómo organizas normalmente tu trabajo en las tareas y cómo haces un seguimiento del progreso?
¿Cuáles son las causas típicas de que una consulta en una base de datos relacional funcione lentamente?
¿Cuántas descargas en total hubo, trabajos de alto nivel, hilos?
¿Qué desencadena la creación de un nuevo trabajo en Spark y cómo se divide un trabajo en etapas y tareas?
¿Has trabajado con feature store?
¿Tiene alguna pregunta sobre el equipo y el rol?
¿Tiene experiencia en configurar pipelines en CI/CD, por ejemplo, GitLab?
¿En qué se diferencia WHERE de HAVING en SQL?
¿Qué ocurrió y cómo puedes recuperar el trabajo?
¿En qué se diferencia Greenplum de PostgreSQL?