Jak přenést data z materializovaného pohledu v Greenplum do ClickHouse?
Data Engineer
Jakou roli jsi hrál v týmu o čtyřech lidech a jak vidíš svou kariéru za 3-4 roky, jaké cíle si stanovíš?
Celkem bylo kolik stažení — vysoké úrovně práce, vlákna?
Jak dobře znáte Python?
V CTE se používá hodně paměti – když máme vysokou spotřebu paměti, co se děje s daty?
Velké skladování bylo — jak těžké bylo ho udržovat ručně v objemech a objektech?
Vkládáme metadatá jako vstup, a on na základě těchto metadat vytvoří tok — jak to umožní rychlý přenos stávajících toků ze starých systémů do plánovaných?
Co se týče dotazu, můžeme vidět, co se děje s daty, včetně jakých typů joinů — jaké typy joinů tam můžeme vidět?
Jaký typ čtení se používá v ClickHouse?
Jak načíst data z Kafka do ClickHouse pomocí streamingu pro reporty v reálném čase?
Jak fungovaly analytické funkce (okenní funkce)?
S Kafka není nic složitého, hlavní je zpracovat data — na jaké nuance je třeba dbát?
Byl v týmu složeném ze 4 lidí nějaký vůdce nebo ho vedl někdo jiný?
Jak lze přenést data z Greenplum a Trino do ClickHouse?
Úložiště bylo postaveno podle schématu Data Vault — ty jsi ho také rozvíjel, udržoval? Přidával jsi ručně huby, odkazy?
Už máš nějaké nabídky práce?
Znáš nějakou knihovnu v Rustu, která je vícevláknová, velmi rychlá a může nahradit Pandas pro Data Science a Big Data?
Greenplum patří více k typu OLTP nebo OLAP?
Je v Greenplum dodržováno ACID?
V čem se liší CTE od poddotazu?