Como transferir os dados de uma view materializada do Greenplum para o ClickHouse?
Data Engineer
Qual foi o teu papel numa equipa de 4 pessoas e como vês a tua carreira daqui a 3-4 anos, que objetivos estabeleces?
Qual foi o número total de downloads — jobs de alto nível, threads?
Quão bem conhece Python?
A CTE consome muita memória — quando temos um alto consumo de memória, o que acontece com os dados?
Fornecemos metadados na entrada, e ele cria um fluxo com base nesses metadados — como isso permitirá transferir rapidamente fluxos existentes de sistemas antigos para o planejado?
O armazenamento grande foi — quão difícil foi mantê-lo manualmente em volumes e objetos?
No que diz respeito à consulta, podemos ver o que acontece com os dados, incluindo quais tipos de joins — quais tipos de joins podemos ver lá?
Como trabalhava com funções analíticas (funções de janela)?
Com Kafka, não há nada difícil, o principal é processar os dados — que nuances é preciso ter em conta?
Como carregar dados do Kafka para o ClickHouse através de streaming para relatórios em tempo real?
Que tipo de leitura é utilizado no ClickHouse?
Havia algum líder ou alguém mais liderava a equipe de 4 pessoas?
O armazenamento foi construído de acordo com o esquema Data Vault — você também o desenvolveu, manteve? Adicionou hubs, links manualmente?
De que forma é possível transferir os dados do Greenplum e Trino para o ClickHouse?
O Greenplum pertence mais ao tipo OLTP ou OLAP?
Já tens algumas propostas de trabalho?
Conhece alguma biblioteca em Rust, multithread, muito rápida, que possa substituir o Pandas para Data Science e Big Data?
Os ficheiros de troca — como eles afetam o desempenho? Quando mais podem ocorrer ficheiros de troca?
Data Vault é uma ferramenta conveniente, mas acaba por haver muitos objetos. Pode explicar a diferença entre hubs, links e satélites?