Data Engineer
¿Cómo funciona JOIN en ClickHouse?
¿Usaron un solo bucket de S3 o varios? ¿Según qué principio?
¿Por qué campos distribuiste los datos en Greenplum?
¿Qué es shuffle en Spark y por qué es importante minimizarlo?
¿Cuál es la complejidad algorítmica de buscar en un diccionario en el peor caso?
Cuéntame sobre tu proyecto anterior, ¿cuáles eran tus responsabilidades?
-- Encontrar a todos los pasajeros que realizaron viajes de dos o más días consecutivos
¿Qué recurso se consume más en un Nested Loop Join?
Cuando construías pipelines en Airflow, ¿cómo resolvías el problema de los datos basura (datos no válidos o basura)?
dict1 = {(1,2, [3,4]): 0} var = 1,
¿Tiene experiencia en la optimización de tareas Spark? ¿Puede dar un ejemplo concreto?
¿Qué se capturará como resultado si se unen transacciones con clientes por client_id y date_start (sin BETWEEN)?
¿Qué tipos de distribución utilizó? ¿Cómo eligió la clave de distribución?
¿Cómo afecta ORDER BY a la tabla ClickHouse y qué claves es mejor elegir?
Informe para la empresa logística Eres un analista de una empresa logística que lleva el registro de operaciones en los almacenes. Necesitas elaborar un informe sobre la eficiencia de cada almacén. Para cada almacén, calcula: • cantidad total de operaciones (count_operations); • cantidad total de productos procesados en el almacén (sum_quantity); • tiempo medio de procesamiento de la operación (avg_processing_time), considerando solo las operaciones con tiempo especificado (no NULL), redondeado al número entero más cercano; • cantidad máxima y mínima de productos procesados en una sola operación (max_quantity, min_quantity); • cantidad de operaciones de cada tipo («pago», «envío», «traslado») en columnas separadas: supply_operations, shipment_operations, transfer_operations. Filtra los almacenes cuya cantidad total de operaciones sea mayor a 2 y el tiempo medio de procesamiento no supere los 60 minutos. Ordena el resultado por ID del almacén en orden ascendente. Formato de entrada Tabla operations: • operation_id (int) — identificador único de la operación • warehouse_id (int) — identificador del almacén • operation_type (text) — tipo de operación: «pago», «envío», «traslado»
¿Qué significa UNBOUNDED PRECEDING en los límites de la ventana de la función de ventana?
Enumere la secuencia de operaciones en un SQL con SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT, desde la primera hasta la última.
¿Alguna vez has tenido que escribir paquetes en Oracle?
Nombra cinco comandos de Git.
[nombre] habló sobre su experiencia trabajando con diferentes sistemas de gestión de bases de datos, cuánto tuvo que profundizar en la optimización y en los detalles internos.