Data Engineer
¿Qué parámetros de Spark JDBC se utilizaron para paralelizar la lectura?
Por favor, cuéntenos, ¿por qué le interesa esta vacante?
¿Ha trabajado con FTP para obtener archivos o datos a través del portal?
Cuéntame sobre la tarea más difícil o interesante que has tenido que resolver
¿Con qué versión de Airflow ha trabajado?
¿Qué es importante para ti al diseñar un pipeline?
¿Qué es ACID? ¿Qué significa cada letra? ¿Cómo se relaciona esto con las transacciones?
¿Cuáles son las causas típicas de que una consulta en una base de datos relacional funcione lentamente?
¿Qué es una CTE (Expresión de Tabla Común)?
¿Con qué frecuencia se calculaban las vitrinas? ¿Era un cálculo incremental o completo?
Análisis del modelo dbt con estrategia incremental: ¿qué hace el modelo, hay problemas?
Descompón JSON en la tercera forma normal: ¿cómo almacenarías la lista CashBreakdown y cómo generarías claves sustitutas?
¿Cuál es la diferencia entre == y is en Python?
¿Por qué utilizaron Parquet en lugar de ORC?
¿Tiene experiencia en optimización de consultas SQL? Dé un ejemplo.
¿En qué casos se deben usar índices B-tree y hash en PostgreSQL?
Recibiste una tarea con el número ABC. ¿Cuál es tu orden de acciones en Git al comenzar a trabajar?
¿Qué ventajas ofrece el patrón Estrategia al refactorizar este código?
¿Cómo están estructurados sus modelos dbt y cómo recopila su vitrina de varias fuentes a través de Trino?
¿Cómo corregiste el sesgo de datos en client_id cuando un cliente era significativamente mayor que los demás? ¿Qué opciones hay?