Data Engineer
Cuéntenos sobre el proyecto o tarea más importante en Python en el último año.
¿Qué algoritmo de diagnóstico y qué hacer si la consulta sigue siendo lenta después de agregar varios índices?
¿Existe un concepto llamado niveles de aislamiento de transacciones? ¿Qué sabes al respecto?
Si en el executor hay 10 núcleos, ¿cuántas tareas se ejecutarán en paralelo en un momento dado?
¿Alguna vez has tenido que hacer informes, paneles, visualizaciones (BI)?
Tarea #2 Escribir una consulta que muestre los 3 empleados mejor pagados en cada departamento. Mostrar el nombre del departamento, el nombre del empleado y su salario. tabla employee: | id | nombre | salario | dept_id | |----|--------|---------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabla department: | id | nombre | |----|--------------| | 1 | Marketing | | 2 | IT | | 3 | Finanzas | Salida: department_name, num, employee_name, salary con cte como( seleccionar d.name como department_name, e.name como employee_name, e.salary, dense_rank desde employee e unirse a department d en e.id = d.id
importar clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
¿Por qué se eligieron scripts personalizados en Python/Airflow para Data Quality en lugar de un motor listo, como Great Expectations?
¿Qué marco utilizaste para escribir los pipelines? ¿Cómo usaste Airflow?
Técnicamente, ¿una base de datos en un SGBD es simplemente un archivo, de donde provienen las restricciones como NULL/NOT NULL? ¿Para qué sirven estas abstracciones lógicas?
¿En qué entorno se ejecutó Spark?
¿Qué ocurrirá al aplicar `s ** 2` a la lista `s = [1, 2, 3]`?
¿Cuál es la desventaja de las UDF en Spark y cuál es su inconveniente?
Cuente sobre los conceptos básicos de Kafka (grupo de consumidores, particiones, temas).
Cuente sobre los tipos de datos mutables e inmutables en Python y dé ejemplos.
¿Se puede usar distribución aleatoria en Greenplum y cuándo es apropiado?
¿Has trabajado con carga por lotes o streaming?
¿Por qué no se puede usar la lista como clave de un diccionario?
Para cada fila en la tabla salaries, mostrar el nombre del empleado, la fecha, el salario y, usando una función de ventana, agregar una columna "salario promedio por departamento en esa fecha".
¿Cómo están relacionados la ordenación dentro de la función de ventana y la ordenación final ORDER BY en la consulta?