Data Engineer
Já trabalhou com vitrines de dados (camada DWH)?
Por que está a considerar ofertas de emprego neste momento?
Já trabalhou com parâmetros e dicas que determinam o uso de Broadcast Join?
Como são atualmente processados os dados? Se estiverem em formatos diferentes, como são normalizados e padronizados?
Como costumavas fazer o esquema da base de dados — manualmente na base ou guardavas os scripts em algum lugar, ou usavas o Liquibase, qual era o processo?
Houve alguma experiência na área de Data Science — trabalho com modelos, estatísticas?
Com que fontes de dados conseguiu trabalhar? Como foi o processo de interação com as fontes?
O que se pode dizer sobre a correção da seguinte consulta? select * from sessions where ended_at is null and status != 'pending';
Que estratégias físicas de execução de join conhece?
Relatório para a empresa logística Você é um analista de uma empresa logística que mantém registros de operações nos armazéns. Você precisa elaborar um relatório sobre a eficiência de cada armazém. Para cada armazém, calcule: • o número total de operações (count_operations); • o número total de produtos processados no armazém (sum_quantity); • o tempo médio de processamento de uma operação (avg_processing_time), considerando apenas operações com tempo especificado (não NULL), arredondado para o número inteiro mais próximo; • o número máximo e mínimo de produtos processados em uma única operação (max_quantity, min_quantity); • o número de operações de cada tipo («fornecimento», «expedição», «transferência») em colunas separadas: supply_operations, shipment_operations, transfer_operations. Filtre os armazéns cujo número total de operações seja maior que 2 e o tempo médio de processamento não ultrapasse 60 minutos. Ordene o resultado pelo ID do armazém em ordem crescente. Formato de entrada Tabela operations: • operation_id (int) — identificador único da operação • warehouse_id (int) — identificador do armazém • operation_type (text) — tipo de operação: «fornecimento», «expedição», «transferência»
Como garantir a unicidade global da chave primária no PostgreSQL ao fazer sharding?
Qual mecanismo físico de JOIN será utilizado ao juntar a tabela de transações com a tabela de calendário pela condição de desigualdade (data <= data)?
Como funciona o Join de Loop Aninhado e qual é a sua complexidade algorítmica? Qual é a complexidade de todos os três algoritmos?
O que mais escreveste em Python além do DAG do Airflow?
Quais algoritmos físicos de JOIN funcionam em bancos de dados?
Fala-me sobre o teu nível de Python: o que usaste, quão profundamente conheces a programação orientada a objetos
Como dividir a consulta em etapas? O que fazemos para isso?
Já trabalhou com funções de janela? Quais tipos de funções de janela você conhece?
O que o motiva no trabalho? Liste as suas principais competências em hard skills.
Foi criada uma sequência especial que gera apenas números pares, chamada even_sequence. O que deve ser colocado no lugar de [...], para que, no caso de o valor de even_column não ser especificado na inserção, o valor seja retirado de even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’