¿Qué es LEFT SEMI JOIN y LEFT ANTI JOIN en Spark SQL, has tenido que usarlos alguna vez?
Data Engineer
¿Qué es la partición? ¿Qué es el sharding? ¿Qué es la replicación?
¿Qué desencadena la creación de un nuevo trabajo en Spark y cómo se divide un trabajo en etapas y tareas?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [teléfono] null null 5 SELECCIONAR a.num COMO a_num, b.num COMO b_num DE t1 a IZQUIERDA UNIR t2 b EN a.num = b.num;
¿De qué se encarga el Grupo de Filas en la estructura del archivo Parquet?
Si establecemos una condición de filtrado por fecha de transacción en WHERE (después de LEFT JOIN), ¿esto recortará el resultado en la primera tabla (clientes)?
SELECT client_id, ФИО, SUM(сумма) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
¿Qué devolverá la función find_mode para la lista [1, 2, 3, 3, 4, 5]? Explica paso a paso.
## problema de moda # Hay una lista de números. Escriba una función que encuentre la moda de esta lista. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
¿En qué se diferencia el particionamiento del sharding?
¿En qué se diferencia el formato de almacenamiento Parquet de CSV?
Cuéntame, ¿dónde has trabajado como analista de sistemas y qué tareas realizaste?
¿Cómo obtener el último nombre completo de cada cliente, si solo se conoce la fecha de inicio (la fecha de fin no es conocida)?
¿Qué tipos de JOIN físicos existen en Spark?
¿Qué métodos (tipos) de almacenamiento de historial de datos conoces? ¿Cómo se acumula la historia en las tablas?
¿Realizaste las verificaciones de calidad de datos tú mismo, o las solicitudes provenían del negocio/clientes?
¿Qué significa UNBOUNDED PRECEDING en los límites de la ventana de la función de ventana?
¿Alguna vez has trabajado con el optimizador AQE (Ejecución Adaptativa de Consultas) en Spark? ¿Sabes cómo funciona?
¿Cómo determinar correctamente el campo de distribución en Greenplum? ¿Qué sucede durante el Motion?
¿Qué mecanismo físico de JOIN se utilizará al unir la tabla de transacciones con la tabla de calendario bajo la condición de desigualdad (fecha <= fecha)?