Data Engineer
Qual formato de trabalho lhe convém: remoto, híbrido ou escritório?
É possível ver o esquema da tabela antes de executar a consulta no Hive?
Como vê o seu desenvolvimento na nova equipa e quais as tarefas que gostaria de fazer mais?
Como costuma abordar a construção de processos ETL e ELT? Qual é a diferença entre esses processos?
Que tipos de chaves/estratégias de distribuição existem no Greenplum?
Qual foi o teu papel numa equipa de 4 pessoas e como vês a tua carreira daqui a 3-4 anos, que objetivos estabeleces?
No PostgreSQL, o cabeçalho de versão da linha inclui o parâmetro xmax. Qual é o seu papel na gestão de transações? - Para criar um identificador único de linha na tabela - Para verificar a visibilidade da linha por outras transações - Para indicar o número de transação que excluiu ou atualizou a linha - Para bloquear a linha contra alterações simultâneas por várias transações - Para indicar o valor máximo que pode ser registrado numa coluna numérica
Como criar várias tarefas iguais em paralelo no Airflow (por exemplo, carregar muitos ficheiros iguais)?
O que é VACUUM no PostgreSQL? Quais são os tipos? Pode ser usado em produção?
Para que são utilizados os decoradores no Apache Airflow?
Como obter o último nome completo de cada cliente, se apenas a data de início é conhecida (a data de fim não é conhecida)?
O que é RDD no Apache Spark e como ele difere de outras abstrações do Spark?
Você mencionou processos Docker, pode explicar com mais detalhes como isso funciona aí na sua empresa?
Como carregou os dados do S3 para o Greenplum?
Em que equipa e sob qual liderança te sentes mais confortável a trabalhar?
Fale sobre a sua experiência de migração do Spring Boot 2 para o Spring Boot 3
Como verifica a precisão dos dados ao traduzir um pipeline de SAS para DBT?
Fala-me um pouco sobre a tua experiência e o que estudaste.
Qual foi a sua arquitetura no projeto? DWH ou algo mais?
O que é importante para ti num novo projeto, numa nova equipa ou numa nova empresa?