Jakie dodatkowe parametry DDL/CREATE TABLE w ClickHouse znasz, na co one wpływają i w jakich przypadkach są używane?
Data Engineer
Jak tworzono tabele w klastrze i jak rozwiązano problem, gdy z powodu ZooKeeper brakowało repliki na shardzie?
Jak nierównomiernie rozłożyć dane tej witryny na trzy shard'y: 50% na pierwszym i po 25% na pozostałych dwóch?
Jak rozwiązywałeś problemy optymalizacyjne, gdy zapytanie działa długo i wykonuje pełny skan? Jak podszedłbyś do nowego takiego zadania?
Jak dokładnie czytałeś Parquet?
W jakich przypadkach widok materializowany w ClickHouse może pominąć dane lub, odwrotnie, zdublować je?
Czy zdarzyło Ci się napotkać błąd ClickHouse `Too many parts` podczas wstawiania? Jak go rozwiązałeś?
Z jakimi bibliotekami Pythona pracowałeś?
Opowiedz więcej o przesunięciu danych między shardami: jak je określano i jak wykorzystywano odpowiednią funkcję/mechanizm?
Czy znasz UDF (Funkcje zdefiniowane przez użytkownika) w ClickHouse, czy pracowałeś z nimi?
Jak naprawiłeś błąd danych według client_id, gdy jeden klient był znacznie większy od pozostałych? Jakie są opcje?
Z jakimi parametrami silnika Distributed w ClickHouse jesteś zaznajomiony?
Jak postąpiłbyś z łańcuchem Materialized View przez pośrednią tabelę ReplacingMergeTree, aby poprawnie wypełnić dane już istniejące przed uruchomieniem nowej MV?
Z jaką wersją Airflow pracowałeś?
Po jakich polach odbyło się łączenie danych i jak usunięto duplikaty w witrynie?
Jak zorganizować ładowanie danych do ClickHouse w dużej tabeli PostgreSQL, do której stale trafiają nowe rekordy z monotonnie rosnącym kluczem głównym?
Czy znasz ReplicatedQueue? Czy masz doświadczenie w pracy z nią?