Que parâmetros adicionais de DDL/CREATE TABLE no ClickHouse conhece, a que eles afetam e em que casos são utilizados?
Data Engineer
Como implementar a distribuição desigual dos dados na vitrine: 50% na primeira e 25% nas duas restantes?
Como foram criadas as tabelas no cluster e como resolveram o problema quando, devido ao ZooKeeper, uma réplica estava ausente em um shard?
Como resolveu problemas de otimização quando a consulta demora muito e realiza uma varredura completa? Como abordaria uma nova tarefa semelhante?
Como exatamente você lia Parquet?
Em que casos uma Visualização Materializada no ClickHouse pode perder dados ou, pelo contrário, duplicá-los?
Já se deparou com o erro ClickHouse `Too many parts` ao inserir? Como resolveu?
Com quais bibliotecas Python trabalhou?
Conte-nos mais sobre o viés de dados entre os shards: como foi determinado e como foi utilizada a função/mecanismo correspondente?
Está familiarizado com UDF (User Defined Functions) no ClickHouse, já trabalhou com eles?
Como corrigiu o viés dos dados por client_id quando um cliente era significativamente maior que os outros? Quais são as opções?
Com quais parâmetros do motor Distributed no ClickHouse você está familiarizado?
Como procederias com a cadeia de Materialized View através de uma tabela intermédia ReplacingMergeTree para preencher corretamente os dados já existentes antes de lançar a nova MV?
Com qual versão do Airflow você trabalhou?
Por quais campos ocorreu a união de dados e como foram eliminados os duplicados na vitrine?
Como organizar o carregamento de dados no ClickHouse numa grande tabela PostgreSQL, na qual novas entradas com uma chave primária monotonicamente crescente chegam constantemente?
Está familiarizado com ReplicatedQueue? Tem experiência de trabalho com ela?