Data Engineer
¿Cómo evaluar la configuración para transferir un terabyte de datos de PostgreSQL a ClickHouse?
¿Qué se puede decir sobre la corrección de la siguiente consulta? select * from sessions where ended_at is null and status != 'pending';
Informe para la empresa logística Eres un analista de una empresa logística que lleva el registro de operaciones en los almacenes. Necesitas elaborar un informe sobre la eficiencia de cada almacén. Para cada almacén, calcula: • cantidad total de operaciones (count_operations); • cantidad total de productos procesados en el almacén (sum_quantity); • tiempo medio de procesamiento de la operación (avg_processing_time), considerando solo las operaciones con tiempo especificado (no NULL), redondeado al número entero más cercano; • cantidad máxima y mínima de productos procesados en una sola operación (max_quantity, min_quantity); • cantidad de operaciones de cada tipo («pago», «envío», «traslado») en columnas separadas: supply_operations, shipment_operations, transfer_operations. Filtra los almacenes cuya cantidad total de operaciones sea mayor a 2 y el tiempo medio de procesamiento no supere los 60 minutos. Ordena el resultado por ID del almacén en orden ascendente. Formato de entrada Tabla operations: • operation_id (int) — identificador único de la operación • warehouse_id (int) — identificador del almacén • operation_type (text) — tipo de operación: «pago», «envío», «traslado»
¿Cómo describirías en código una comprobación de que un valor difiere significativamente de una distribución normal (esperada)?
Cuéntenos sobre el proyecto o tarea más importante en Python en el último año.
¿Cómo organizar la carga de datos en ClickHouse en una gran tabla de PostgreSQL, en la que constantemente llegan nuevos registros con una clave primaria monotonamente creciente?
¿Qué grupos de operadores SQL conoces? ¿A qué pertenecen?
¿Está familiarizado con la metodología Domain Driven Design (DDD)? Si es así, comparta ejemplos de su aplicación en sus proyectos.
¿Qué motores de tablas en ClickHouse conoces y has utilizado?
¿Qué estrategia sería efectiva para eliminar la vulnerabilidad en todas las ramas con el mínimo riesgo de interrumpir el funcionamiento del proyecto? - Crear una serie de commits de reversión para el commit problemático y todos los commits que lo corrigieron parcialmente, luego crear un nuevo commit con la corrección completa - Crear una rama hotfix desde un punto anterior al commit problemático, realizar las correcciones y fusionar esta rama con todas las ramas afectadas - Crear un commit de corrección único usando git revert abc123 en la rama principal y luego hacer cherry-pick de este commit en todas las ramas de lanzamiento - Usar git bisect para determinar exactamente el código problemático, crear un parche y aplicarlo a todas las ramas usando git am - Usar git rebase -i para editar el commit problemático en cada rama, seguido de un push forzado (force-push)
¿Qué verificaciones de calidad de datos se realizaron en Data Vault?
¿Realizaste las verificaciones de calidad de datos tú mismo, o las solicitudes provenían del negocio/clientes?
¿Alguna vez has trabajado con el optimizador AQE (Ejecución Adaptativa de Consultas) en Spark? ¿Sabes cómo funciona?
Cuente su experiencia de migración de Spring Boot 2 a Spring Boot 3
¿Cómo guardar un JSON en una carpeta (en el contexto de Airflow DAG)?
¿En qué se diferencia EXPLAIN ANALYZE de un EXPLAIN normal? ¿Por qué no es recomendable ejecutarlo en consultas DELETE/UPDATE?
¿Ha habido casos de interacción con bases de datos relacionales?
¿Quiénes eran los consumidores de datos y cómo se construían las vitrinas?
Cuéntenos sobre el uso de procedimientos PL/SQL en su trabajo.
Cuéntame sobre el uso de Airflow: qué elementos no estándar utilizaste