Data Engineer
Jaké typy tabulek jste v Greenplum používal? V jakých případech se používal heap a v jakých Append-Optimized?
Co byste chtěli dělat v našem týmu?
Jak lze přenést data z Greenplum a Trino do ClickHouse?
Iceberg je engine, který umožňuje udělat z S3 databázi, dokonce dodržuje ACID. V čem je jeho nevýhoda?
V čem se HDFS liší od běžných distribuovaných souborových systémů?
Co jsou to mrtvé řádky v databázi?
Řekni mi víc o Spark: co přesně bylo realizováno, jaké metody byly použity
Zlepšují indexy vždy výkon, nebo mohou způsobit degradaci?
Potřebujeme engine pipeline — mechanismus, který umožní velmi rychle vytvářet toky zadáním kontraktů a parametrů. Hogyan valósítanád ezt magasabb szinten?
Je v Greenplum dodržováno ACID?
Jaké jsou výhody a nevýhody ACID, kromě rychlosti čtení?
V čem se generátory liší od seznamů v Pythonu?
Jedná se o v reálném čase, jak to realizovat mezi Kafka a ClickHouse Spark?
Jak nezabít Jupyter nebo Pandas kvůli paměti?
Co je GIL (Global Interpreter Lock)?
Jak zobrazit plán provádění dotazu v Oracle? Čím se liší EXPLAIN PLAN od EXPLAIN ANALYZE?
Jaký je smysl rozdělování dat na bloky v HDFS?
V CTE se používá hodně paměti – když máme vysokou spotřebu paměti, co se děje s daty?
Jak dobře znáte Python?
Jaký je rozdíl mezi WHERE a HAVING?