Data Vault je užitečný nástroj, ale je tam příliš mnoho objektů. Můžeš vysvětlit rozdíl mezi huby, linky a satelity?
Data Engineer
Můžeš vysvětlit, co zde na konci získáme? Je třeba okomentovat každý krok, jak to funguje.
Trino v tomto schématu je zodpovědné za zpracování dat — jak vrstva technologií umožňuje oddělit úložiště a výpočty?
V čem se liší CTE od poddotazu?
Znáš nějakou knihovnu v Rustu, která je vícevláknová, velmi rychlá a může nahradit Pandas pro Data Science a Big Data?
Jaké technologie jste použili k načítání dat do Parquet a jaké mechanismy byly použity k získání a načtení dat?
Jak rozdělit dotaz na etapy? Co pro to děláme?
Jak jsi psal DAG a úlohy v Airflow: ručně nebo šablonami?
Při streamování Iceberg fungoval, slyšel jsi? Je to odpadové úložiště souborů.
Jak byla data z externí tabulky načtena do cílových tabulek?
Načítali jste data ze Spark do S3 ve formátu Parquet, a poté z Parquet do Greenplum — jak probíhá proces načítání?
Jedná se o v reálném čase, jak to realizovat mezi Kafka a ClickHouse Spark?
S závislostmi mezi joby, mezi DAGy — používal jsi senzory, aby se spouštěly jeden po druhém?
Jak jsi obvykle navrhoval schéma databáze? Připravoval jsi ho ručně v databázi, nebo jsi skripty někde ukládal, nebo jsi vůbec používal Liquibase? Jaký byl proces?
Má smysl používat CTE, pokud je v dotazu použita pouze jednou?
Budeme parsovat JSON — kdo bude parsovat JSON? Pokud vím, v ClickHouse nejsou žádné funkce.
Musel jste přímo pracovat se Sparkem? Jaká je jeho nevýhoda?
Pracoval jste s Gitem? Co jste v Gitu ukládali?
Potřebujeme engine pipeline — mechanismus, který umožní velmi rychle vytvářet toky zadáním kontraktů a parametrů. Hogyan valósítanád ezt magasabb szinten?
Jaký typ čtení se v Greenplum používá: řádkové nebo sloupcové?