Quali parametri aggiuntivi di DDL/CREATE TABLE in ClickHouse conosci, a cosa influenzano e in quali casi vengono utilizzati?
Data Engineer
Come distribuire in modo non uniforme i dati di questa vetrina su tre shard: 50% sul primo e 25% sugli altri due?
Come sono state create le tabelle nel cluster e come avete risolto il problema quando, a causa di ZooKeeper, mancava una replica su uno shard?
Come hai risolto i problemi di ottimizzazione quando la query richiede molto tempo e esegue una scansione completa? Come affronteresti un nuovo compito simile?
Come esattamente leggevi Parquet?
In quali casi una Vista Materializzata in ClickHouse può saltare dati o, al contrario, duplicarli?
Hai mai riscontrato l'errore ClickHouse `Too many parts` durante un inserimento? Come l'hai risolto?
Con quali librerie Python hai lavorato?
Raccontaci di più sul bias dei dati tra gli shard: come è stato determinato e come è stata utilizzata la funzione/meccanismo corrispondente?
Conosci le UDF (Funzioni definite dall'utente) in ClickHouse, hai lavorato con esse?
Come hai corretto il bias dei dati per client_id quando un cliente era significativamente più grande degli altri? Quali sono le opzioni?
Con quali parametri del motore Distributed in ClickHouse sei familiare?
Come procederesti con la catena di Materialized View attraverso una tabella intermedia ReplacingMergeTree per riempire correttamente i dati già esistenti prima del lancio della nuova MV?
In quali campi è avvenuta l'unione dei dati e come sono stati eliminati i duplicati dalla vetrina?
Con quale versione di Airflow hai lavorato?
Come organizzare il caricamento dei dati in ClickHouse in una grande tabella PostgreSQL, in cui arrivano costantemente nuovi record con una chiave primaria monotonicamente crescente?
Conosci ReplicatedQueue? Hai esperienza di lavoro con essa?