Tarea #2 Escribir una consulta que muestre los 3 empleados mejor pagados en cada departamento. Mostrar el nombre del departamento, el nombre del empleado y su salario. tabla employee: | id | nombre | salario | dept_id | |----|--------|---------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabla department: | id | nombre | |----|--------------| | 1 | Marketing | | 2 | IT | | 3 | Finanzas | Salida: department_name, num, employee_name, salary con cte como( seleccionar d.name como department_name, e.name como employee_name, e.salary, dense_rank desde employee e unirse a department d en e.id = d.id
Data Engineer
¿Cuál es la diferencia entre ACID y la teorema CAP?
¿Qué es la Ejecución de Consulta Adaptativa (AQE)?
Resultado final: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | con cte como( seleccionar order_id, customer_id, order_dt, lag(order_dt) sobre(partición por customer_id ordenar por order_dt) como prev_order_ft, datediff(día, prev_order_ft, order_dt) como gap_days de Orders ) seleccionar customer_id, max(gap_days) como gap_days de cte donde gap_days > 60 grupo por customer_id
¿De qué etapas consta una transacción?
¿Alguna vez ha trabajado con decoradores en Python? ¿Qué son y dónde se aplican?
¿Cuál es el peligro del shuffle en Spark?
¿En qué situación la búsqueda en un diccionario puede degradarse hasta el peor caso?
¿Ha trabajado con parámetros y hints que determinan el uso de Broadcast Join?
Cuente sobre los tipos de datos mutables e inmutables en Python y dé ejemplos.
Explica los cálculos perezosos e inmediatos en Spark.
¿Cómo evitar la ejecución simultánea de aproximadamente 700 ejecuciones de DAG durante catchup/backfill en Airflow?
¿Cuáles son los riesgos de calidad de los datos?
Cuéntame más sobre la red: ¿qué es y por qué es importante?
¿Cómo solía manejar los errores y alertas en los pipelines?
Pregunta #1 ¿Qué cantidad de registros devolverá la consulta con inner, left, right, full join de dos tablas al unirlas por el atributo id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
¿Cómo distingues las verificaciones técnicas y comerciales de datos, y quién debe establecer los requisitos para ellas?
¿Por qué bool([""]) devuelve True?
¿Qué sabes sobre la serialización y deserialización en el contexto de Spark/UDF?
¿Cuál es la diferencia entre repartition y coalesce en Spark?