O Trino nesta arquitetura é responsável pelo processamento de dados — como é que a pilha de tecnologias permite separar o armazenamento e os cálculos?
Data Engineer
O ACID é cumprido no Greenplum?
Quais processos são iniciados quando removemos ou alteramos registros no ClickHouse?
Qual é a diferença entre CTE e uma subconsulta?
Como dividir a consulta em etapas? O que fazemos para isso?
Conhece alguma biblioteca em Rust, multithread, muito rápida, que possa substituir o Pandas para Data Science e Big Data?
Com dependências entre jobs, entre DAGs — usou sensores para que vários jobs fossem iniciados um após o outro?
Quais tecnologias foram usadas para obter e carregar os dados no Parquet, e quais mecanismos foram utilizados?
Como escreveste o DAG do Airflow e os jobs: manualmente ou com templates?
Você carregou dados do Spark para o S3 no formato Parquet, e depois do Parquet para o Greenplum — como é o processo de carregamento?
Como costumavas fazer o esquema da base de dados — manualmente na base ou guardavas os scripts em algum lugar, ou usavas o Liquibase, qual era o processo?
Já trabalhou com Git? O que armazenava no Git?
Com streaming, Iceberg funcionava, ouviste? É um armazenamento de ficheiros lixo.
Como é que os dados da tabela externa foram carregados nas tabelas de destino?
Isto é em tempo real, como implementar entre Kafka e ClickHouse Spark?
Faz sentido usar CTE se ela for usada apenas uma vez na consulta?
Trabalhou diretamente com Spark? Qual é a sua desvantagem?
Precisamos de um motor de pipeline — um mecanismo que permita criar fluxos muito rapidamente fornecendo contratos e parâmetros na entrada. Como você implementaria isso em um nível superior?
Vamos analisar JSON — quem vai analisar JSON? Pelo que sei, no ClickHouse não há funções.
Iceberg é um motor que permite transformar o S3 numa base de dados, ele até segue os princípios ACID. Qual é a sua desvantagem?