¿Trabajaste con las vitrinas de datos (capa DWH)?
Data Engineer
¿Cuál es tu expectativa salarial?
¿Qué tipos de JOIN conoces? (lógicos)
¿Qué es un CROSS JOIN? ¿Has trabajado con eso?
¿Se puede leer datos en paralelo desde un solo archivo Parquet en Spark, o solo con un núcleo en una tarea?
¿Por qué estás buscando un nuevo trabajo ahora, quieres cambiar de empleo?
¿Qué se capturará como resultado si se unen transacciones con clientes por client_id y date_start (sin BETWEEN)?
Hay una tabla T1 (10 filas) y una tabla T2 (5 filas), ambas con un campo ID. ¿Cuántas filas pueden ser como máximo y como mínimo en la salida al hacer un INNER JOIN y un LEFT JOIN de estas tablas?
Cuéntame sobre un par de tus tareas más importantes relacionadas con la calidad de los datos.
Cuéntame sobre ti: experiencia laboral, pila de tecnologías
¿Cuáles son las ventajas y desventajas de las bases de datos en filas y columnas? ¿Cuál es más eficiente para agrupación y agregación?
Si en el executor hay 10 núcleos, ¿cuántas tareas se ejecutarán en paralelo en un momento dado?
-- Dada la tabla numbers con una columna num (números enteros, que pueden repetirse). -- Escriba una consulta SQL que divida los números en dos columnas: -- even – números pares (ordenados ascendentemente) -- odd – números impares (ordenados ascendentemente) -- Los números deben colocarse fila por fila: en la primera fila – el primer número par y el primer número impar, -- en la segunda fila – el segundo número par y el segundo número impar, etc. -- Si en uno de los grupos hay más números que en el otro, en los lugares faltantes debe haber NULL. -- tabla original -- num -- --------- -- [phone] -- resultado de la consulta -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Cuéntame sobre tu comprensión de la calidad de los datos — ¿has tenido experiencia trabajando en este campo?
Describe las funciones de ventana en la forma más ampliada posible: qué palabras clave se utilizan y para qué sirve cada una.
¿Qué JOINs físicos conoces?
¿Cómo funciona la unión de bucle anidado y cuál es su complejidad algorítmica? ¿Cuál es la complejidad de los tres algoritmos?
¿Qué es LEFT SEMI JOIN y LEFT ANTI JOIN en Spark SQL, has tenido que usarlos alguna vez?
¿En qué dirección sería interesante desarrollarse: escaparates, desarrollo, análisis, tal vez IA?
¿Qué es la partición? ¿Qué es el sharding? ¿Qué es la replicación?