Data Engineer
Como recuperar o trabalho de uma branch remota se ao tentar fazer `git checkout hotfix/missing-footer` receber uma mensagem de erro dizendo que a branch não foi encontrada?
De que forma é possível transferir os dados do Greenplum e Trino para o ClickHouse?
Quão bem conhece Python?
Iceberg é um motor que permite transformar o S3 numa base de dados, ele até segue os princípios ACID. Qual é a sua desvantagem?
O que gostaria de fazer na nossa equipa?
A CTE consome muita memória — quando temos um alto consumo de memória, o que acontece com os dados?
Como visualizar o plano de execução de uma consulta no Oracle? Em que o EXPLAIN PLAN difere do EXPLAIN ANALYZE?
Em que HDFS difere dos sistemas de ficheiros distribuídos comuns?
Os índices sempre aceleram o desempenho ou podem causar degradação?
O que são cadeias mortas na base de dados?
Qual é a diferença entre geradores e listas em Python?
Fala-me mais sobre o Spark: o que foi especificamente implementado, quais métodos foram utilizados
Como não matar Jupyter ou Pandas por memória?
O que é o GIL (Global Interpreter Lock)?
Qual é a diferença entre WHERE e HAVING?
Precisamos de um motor de pipeline — um mecanismo que permita criar fluxos muito rapidamente fornecendo contratos e parâmetros na entrada. Como você implementaria isso em um nível superior?
O ACID é cumprido no Greenplum?
Que vantagens e desvantagens do ACID podem ser mencionadas, além da velocidade de leitura?
Isto é em tempo real, como implementar entre Kafka e ClickHouse Spark?
Qual é o propósito de dividir os dados em blocos no HDFS?