Já usaste XCom no Airflow?
Data Engineer
Fale sobre particionamento no Oracle: para que é usado e quais tipos existem?
Quais outros formatos de arquivo, além de Parquet, funcionam bem com Hadoop e Hive?
Quando é que se pode usar a família de formatos CSV?
É possível ver o esquema da tabela antes de executar a consulta no Hive?
O plano de execução do EXPLAIN corresponde sempre ao que realmente é executado?
Por que separam as visualizações (VIEW) e as tabelas? Para que servem as visualizações?
O que são as vistas (VIEW) e as vistas materializadas (MATERIALIZED VIEW) no Oracle? Como são atualizados os dados numa vista materializada?
Como saber o plano real de execução de uma consulta no Oracle?
O que são operações preguiçosas no Spark e para que servem?
Fala-me do teu projeto anterior, quais eram as tuas responsabilidades?
Como é que a sua experiência corresponde às responsabilidades do cargo: acompanhamento e análise dos processos de carregamento, monitorização e deteção de anomalias, testes e implementação de melhorias em produção, suporte de segunda linha, verificação da documentação técnica?
Já teve que trabalhar com Oracle Data Integrator (ODI)?
Consegues recordar a tua experiência na otimização de consultas? Como agiste, analisaste?
Quais são as vantagens e desvantagens dos sistemas de bases de dados distribuídos?
Qual foi a sua arquitetura no projeto? DWH ou algo mais?
Houve uma consulta analítica lenta no Hive. Como entender o que aconteceu com ela e como consertá-la?
Qual é a diferença entre multithreading e multiprocessamento? Para que tarefas usar threads e para que tarefas usar processos?
Já trabalhou com carregamento em batch ou streaming?
Já trabalhou com funções de janela? Quais tipos de funções de janela você conhece?