Data Engineer
O que te atrai na área de travel? Talvez gostes de viajar tu mesmo, ou o travel-tech despertou teu interesse de alguma forma?
Por que estás procurando um novo emprego agora, queres mudar de trabalho?
Já trabalhou com feature store?
Por quais campos ocorreu a união de dados e como foram eliminados os duplicados na vitrine?
LeetCode #? — Na PostgreSQL há uma tabela [tabela] com uma única coluna id e valores 1, 1, 2. Escreva uma consulta DELETE que remova fisicamente um duplicado.
Que imagens Docker teve de construir e para quê?
Teve um problema com fusos horários ao ler timestamps através do PXF a partir de Parquet?
Fale sobre o projeto ou tarefa mais importante em Python no último ano.
Qual é o algoritmo de diagnóstico e o que fazer se a consulta ainda estiver lenta após adicionar vários índices?
Existe um conceito chamado níveis de isolamento de transações. O que você sabe sobre isso?
Como gerir os recursos de uma aplicação Spark para não gastar memória ao alterar o volume de dados de entrada?
Se no executor houver 10 núcleos, quantas tarefas serão executadas em paralelo num momento?
Tarefa nº2 Escrever uma consulta que exiba os 3 funcionários com maior salário em cada departamento. Mostrar o nome do departamento, o nome do funcionário e seu salário. tabela employee: | id | nome | salário | dept_id | |----|-------|---------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabela department: | id | nome | |----|-----------| | 1 | Marketing | | 2 | TI | | 3 | Finanças | Saída: department_name, num, employee_name, salary com cte como( selecionar d.name como department_name, e.name como employee_name, e.salary, dense_rank de employee e juntar a department d em e.id = d.id
importar clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Por que escolheram scripts personalizados em Python/Airflow para Data Quality em vez de um motor pronto, como Great Expectations?
Qual framework você usou para escrever os pipelines? Como você usou o Airflow?
Tecnicamente, uma base de dados num SGBD é simplesmente um arquivo, de onde vêm as restrições como NULL/NÃO NULL? Para que servem essas abstrações lógicas?
O que é um CROSS JOIN e qual é o resultado da sua aplicação?
Em que ambiente o Spark foi executado?
Quais são as desvantagens das UDF no Spark e qual é a sua principal desvantagem?