Data Engineer
¿Cómo sueles trabajar con Git en equipo? ¿Y qué es una Merge Request?
¿En qué se diferencia Greenplum de PostgreSQL?
¿Está familiarizado con las expresiones de tabla comunes (CTE)? Proporcione un ejemplo de uso.
Cuéntenos más sobre el sesgo de datos entre los shards: ¿cómo se determinó y cómo se utilizó la función/mecanismo correspondiente?
Escriba SQL para agregar un total acumulado del monto del pedido por usuario y fecha.
¿Administró Airflow o solo trabajó como desarrollador?
SELECT client_id, ФИО, SUM(сумма) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Cuéntame sobre tu proyecto anterior, ¿cuáles eran tus responsabilidades?
¿Cómo transferir datos entre tareas en Airflow?
¿Existen funciones y capacidades en Greenplum que no estén en MySQL convencional y otros dialectos?
Se ha creado la estructura de tablas indicada en la imagen. Es necesario ejecutar la consulta mostrada en la imagen. ¿Qué tipo de join se debe usar en lugar de [...] para que en el resultado, las filas con type = 'table_aw' tengan la columna 'naming' llena, y las filas con type = 'table2' tengan la columna 'serial_number'? create table multirelation( type varchar not null, entity_id integer not null ); create table table_aw( id integer primary key, naming varchar not null ); create table table2( id integer primary key, serial_number varchar not null ); -- estructura de las tablas select m.type,m.entity_id, ta.naming, t2.serial_number from multirelation m [...] join table_aw ta on m.entity_id = ta.id and m.type='table_aw' [...] join table2 t2 on m.entity_id = t2.id and m.type='table2'; -- consulta Dejar en blanco inner cross right left
¿Qué formato de trabajo prefieres: oficina, híbrido o remoto? Tenemos dos oficinas, en Kutuzovsky y en Tula.
Nuestro tema está muy estructurado, en forma de árbol, los datos son crudos — ¿cómo procesarlos?
¿Cuál es tu expectativa salarial?
Cuéntenos sobre el uso de procedimientos PL/SQL en su trabajo.
¿Cuáles son las características y diferencias entre Set y List en Python? Además del rendimiento, ¿qué otras características hay?
¿Para qué sirve una restricción de clave externa y cuál es el sentido de la restricción en la eliminación/actualización cuando hay registros dependientes (lógicamente)?
Cuéntame más sobre la red: ¿qué es y por qué es importante?
¿Cómo detectar el sesgo de datos en Spark?
¿Es el diccionario en Python un tipo mutable o inmutable? ¿Cuáles son los requisitos para sus claves y valores?