Data Engineer
Czym różni się Greenplum od PostgreSQL?
Opowiedz więcej o przesunięciu danych między shardami: jak je określano i jak wykorzystywano odpowiednią funkcję/mechanizm?
Czy kiedykolwiek musiałeś tworzyć raporty, pulpity nawigacyjne, wizualizacje (BI)?
Porównaj podejścia ETL i ELT: jaka jest różnica i kiedy każde z nich jest stosowane?
W jakiej kolejności wykonywane są główne operacje w SQL: SELECT, FROM itp.?
Jak dane z zewnętrznej tabeli były ładowane do tabel docelowych?
Czym jest witryna danych?
Czy masz pytania dotyczące zespołu i roli?
Z jakimi parametrami silnika Distributed w ClickHouse jesteś zaznajomiony?
Kim byli odbiorcy danych i jak budowano witryny?
Opowiedz o sobie, gdzie pracowałeś, czym się zajmowałeś, jakie były ciekawe zadania i porażki.
Jak zwykle pracujesz z Git w zespole? I czym jest Merge Request?
Jaki format pracy jest dla Ciebie wygodniejszy — biuro, hybrydowy czy zdalny? Mamy dwa biura, na Kutuzowskim i na Tuli.
Nasz temat jest mocno strukturalny, drzewiasty, dane są surowe — jak je przetwarzać?
Jak zapewnić klientowi mobilnemu dostęp do tych samych zamówień, ale z mniejszym zestawem pól? Czym jest BFF?
Utwórz tabelę raw.local_transactions NA KLASIESTERZE cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) SILNIK = ReplicatedMergeTree() PARTYCJONUJ PRZEZ amount ORDERUJ PRZEZ (transaction_id); Utwórz tabelę raw.transactions NA KLASIESTERZE cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) SILNIK = Distributed('cluster_4x2', 'raw', 'local_transactions', cityHash64(user_id));
Wymień znane Ci funkcje okienkowe SQL.
Do czego służy ograniczenie klucza obcego i jaki jest sens ograniczenia przy usuwaniu/aktualizacji przy obecności zależnych rekordów (logicznie)?
Czy pracowałeś z adnotacjami typów? Wiesz, co to jest?
Opowiedz o zadaniu związanym z konfiguracją replikacji, które rozwiązałeś.