Sobes.tech

Data Engineer

Data Vault je užitečný nástroj, ale je tam příliš mnoho objektů. Můžeš vysvětlit rozdíl mezi huby, linky a satelity?

187

Můžeš vysvětlit, co zde na konci získáme? Je třeba okomentovat každý krok, jak to funguje.

186

Trino v tomto schématu je zodpovědné za zpracování dat — jak vrstva technologií umožňuje oddělit úložiště a výpočty?

186

Znáš nějakou knihovnu v Rustu, která je vícevláknová, velmi rychlá a může nahradit Pandas pro Data Science a Big Data?

182

Jaké technologie jste použili k načítání dat do Parquet a jaké mechanismy byly použity k získání a načtení dat?

178

Jak rozdělit dotaz na etapy? Co pro to děláme?

175

Jak jsi psal DAG a úlohy v Airflow: ručně nebo šablonami?

173

Při streamování Iceberg fungoval, slyšel jsi? Je to odpadové úložiště souborů.

171

Jak byla data z externí tabulky načtena do cílových tabulek?

171

Načítali jste data ze Spark do S3 ve formátu Parquet, a poté z Parquet do Greenplum — jak probíhá proces načítání?

171

Jedná se o v reálném čase, jak to realizovat mezi Kafka a ClickHouse Spark?

170

S závislostmi mezi joby, mezi DAGy — používal jsi senzory, aby se spouštěly jeden po druhém?

169

Jak jsi obvykle navrhoval schéma databáze? Připravoval jsi ho ručně v databázi, nebo jsi skripty někde ukládal, nebo jsi vůbec používal Liquibase? Jaký byl proces?

169

Má smysl používat CTE, pokud je v dotazu použita pouze jednou?

169

Budeme parsovat JSON — kdo bude parsovat JSON? Pokud vím, v ClickHouse nejsou žádné funkce.

164

Musel jste přímo pracovat se Sparkem? Jaká je jeho nevýhoda?

163

Pracoval jste s Gitem? Co jste v Gitu ukládali?

162

Potřebujeme engine pipeline — mechanismus, který umožní velmi rychle vytvářet toky zadáním kontraktů a parametrů. Hogyan valósítanád ezt magasabb szinten?

161

Jaký typ čtení se v Greenplum používá: řádkové nebo sloupcové?

159
/3