¿Qué parámetros adicionales de DDL/CREATE TABLE en ClickHouse conoces, en qué afectan y en qué casos se utilizan?
Data Engineer
¿Cómo distribuir de manera desigual los datos de la vitrina en tres shards: 50% en el primero y 25% en los otros dos?
¿Cómo se crearon las tablas en el clúster y cómo se resolvió el problema cuando, debido a ZooKeeper, faltaba una réplica en un shard?
¿Cómo abordó los problemas de optimización cuando la consulta tarda mucho y realiza un escaneo completo? ¿Cómo abordaría una tarea similar nueva?
¿Cómo exactamente leías Parquet?
¿En qué casos una Vista Materializada en ClickHouse puede omitir datos o, por el contrario, duplicarlos?
¿Alguna vez se ha encontrado con el error ClickHouse `Too many parts` al insertar? ¿Cómo lo resolvió?
¿Con qué bibliotecas de Python ha trabajado?
Cuéntenos más sobre el sesgo de datos entre los shards: ¿cómo se determinó y cómo se utilizó la función/mecanismo correspondiente?
¿Está familiarizado con las UDF (Funciones Definidas por el Usuario) en ClickHouse, ha trabajado con ellas?
¿Cómo corregiste el sesgo de datos en client_id cuando un cliente era significativamente mayor que los demás? ¿Qué opciones hay?
¿Con qué parámetros del motor Distributed en ClickHouse estás familiarizado?
¿Cómo procederías con la cadena de Materialized View a través de una tabla intermedia ReplacingMergeTree para llenar correctamente los datos que ya existían antes de lanzar la nueva MV?
¿Con qué versión de Airflow ha trabajado?
¿En qué campos se realizó la unión de datos y cómo se eliminaron los duplicados en la vista?
¿Cómo organizar la carga de datos en ClickHouse en una gran tabla de PostgreSQL, en la que constantemente llegan nuevos registros con una clave primaria monotonamente creciente?
¿Está familiarizado con ReplicatedQueue? ¿Ha tenido experiencia trabajando con ella?