Sobes.tech

Data Engineer

O Trino nesta arquitetura é responsável pelo processamento de dados — como é que a pilha de tecnologias permite separar o armazenamento e os cálculos?

192

Quais processos são iniciados quando removemos ou alteramos registros no ClickHouse?

187

Qual é a diferença entre CTE e uma subconsulta?

185

Como dividir a consulta em etapas? O que fazemos para isso?

184

Conhece alguma biblioteca em Rust, multithread, muito rápida, que possa substituir o Pandas para Data Science e Big Data?

184

Com dependências entre jobs, entre DAGs — usou sensores para que vários jobs fossem iniciados um após o outro?

183

Quais tecnologias foram usadas para obter e carregar os dados no Parquet, e quais mecanismos foram utilizados?

182

Como escreveste o DAG do Airflow e os jobs: manualmente ou com templates?

182

Você carregou dados do Spark para o S3 no formato Parquet, e depois do Parquet para o Greenplum — como é o processo de carregamento?

181

Como costumavas fazer o esquema da base de dados — manualmente na base ou guardavas os scripts em algum lugar, ou usavas o Liquibase, qual era o processo?

181

Já trabalhou com Git? O que armazenava no Git?

180

Com streaming, Iceberg funcionava, ouviste? É um armazenamento de ficheiros lixo.

179

Como é que os dados da tabela externa foram carregados nas tabelas de destino?

176

Isto é em tempo real, como implementar entre Kafka e ClickHouse Spark?

172

Faz sentido usar CTE se ela for usada apenas uma vez na consulta?

171

Trabalhou diretamente com Spark? Qual é a sua desvantagem?

169

Precisamos de um motor de pipeline — um mecanismo que permita criar fluxos muito rapidamente fornecendo contratos e parâmetros na entrada. Como você implementaria isso em um nível superior?

167

Vamos analisar JSON — quem vai analisar JSON? Pelo que sei, no ClickHouse não há funções.

166

Iceberg é um motor que permite transformar o S3 numa base de dados, ele até segue os princípios ACID. Qual é a sua desvantagem?

163
/3