Sobes.tech

Data Engineer

Que parâmetros adicionais de DDL/CREATE TABLE no ClickHouse conhece, a que eles afetam e em que casos são utilizados?

207

Como implementar a distribuição desigual dos dados na vitrine: 50% na primeira e 25% nas duas restantes?

192

Como foram criadas as tabelas no cluster e como resolveram o problema quando, devido ao ZooKeeper, uma réplica estava ausente em um shard?

189

Como resolveu problemas de otimização quando a consulta demora muito e realiza uma varredura completa? Como abordaria uma nova tarefa semelhante?

181

Em que casos uma Visualização Materializada no ClickHouse pode perder dados ou, pelo contrário, duplicá-los?

169

Já se deparou com o erro ClickHouse `Too many parts` ao inserir? Como resolveu?

165

Conte-nos mais sobre o viés de dados entre os shards: como foi determinado e como foi utilizada a função/mecanismo correspondente?

160

Está familiarizado com UDF (User Defined Functions) no ClickHouse, já trabalhou com eles?

141

Como corrigiu o viés dos dados por client_id quando um cliente era significativamente maior que os outros? Quais são as opções?

138

Com quais parâmetros do motor Distributed no ClickHouse você está familiarizado?

134

Como procederias com a cadeia de Materialized View através de uma tabela intermédia ReplacingMergeTree para preencher corretamente os dados já existentes antes de lançar a nova MV?

131

Por quais campos ocorreu a união de dados e como foram eliminados os duplicados na vitrine?

128

Como organizar o carregamento de dados no ClickHouse numa grande tabela PostgreSQL, na qual novas entradas com uma chave primária monotonicamente crescente chegam constantemente?

124

Está familiarizado com ReplicatedQueue? Tem experiência de trabalho com ela?

118