Data Engineer
Jak postupovat při skew (šikmosti) na user_id při JOIN tabulek transakcí a uživatelů? Jak vybrat optimální klíč rozdělení?
Jak jste načítali data z S3 do Greenplum?
Máte zkušenosti s optimalizací úloh Spark? Můžete uvést konkrétní příklad?
Na zobrazené obrazovce jsou dvě datové struktury; ve které bude hledání hodnoty 2 rychlejší a proč?
Jak načíst data z Kafka do ClickHouse pomocí streamingu pro reporty v reálném čase?
Povězte o své zkušenosti s migrací ze Spring Boot 2 na Spring Boot 3
Jak ověřujete správnost dat při překladu pipeline z SAS do DBT?
Řekni mi obecně o své zkušenosti a co jsi studoval.
Co je pro tebe důležité v novém projektu, novém týmu nebo společnosti?
Jaké procesy se spouštějí, když odstraníme nebo změníme záznamy v ClickHouse?
Jaký je rozdíl mezi refaktoringem a optimalizací?
Kdy nepotřebujeme datové úložiště?
Zpráva pro logistickou společnost Jste analytikem logistické společnosti, která zaznamenává operace na skladech. Musíte sestavit zprávu o efektivitě každého skladu. Pro každý sklad vypočtěte: • celkový počet operací (count_operations); • celkový počet zpracovaných zboží na skladě (sum_quantity); • průměrnou dobu zpracování operace (avg_processing_time), pouze pro operace s určeným časem (ne NULL), zaokrouhlenou na celé číslo; • maximální a minimální počet zpracovaných zboží v jedné operaci (max_quantity, min_quantity); • počet operací každého typu («dodávka», «odeslání», «přesun») ve zvláštních sloupcích: supply_operations, shipment_operations, transfer_operations. Filtrovat sklady, jejichž celkový počet operací je větší než 2 a průměrná doba zpracování nepřesahuje 60 minut. Seřadit výsledek podle ID skladu vzestupně. Formát vstupu Tabulka operations: • operation_id (int) — unikátní identifikátor operace • warehouse_id (int) — ID skladu • operation_type (text) — typ operace: «dodávka», «odeslání», «přesun»
Jaký je rozdíl mezi příkazy docker run a docker exec?
Úkol Kafka: producent odesílá změny ceny produktu (200 rublů, poté 300 rublů), spotřebič je replikován ve 3 podech. Bude v základní konfiguraci problém?
Jaké skupiny SQL operátorů znáte? Čemu patří?
Vkládáme metadatá jako vstup, a on na základě těchto metadat vytvoří tok — jak to umožní rychlý přenos stávajících toků ze starých systémů do plánovaných?
Analýza prodeje podle kategorií zboží v maloobchodě Pracujete jako analytik v maloobchodě. Vaším úkolem je sestavit zprávu o prodeji podle kategorií s následujícími výpočty: • celkový počet prodaných jednotek v kategorii (total_units_sold); • celkové tržby podle kategorie, s ohledem na slevy, kde sleva se počítá jako unit_price × units_sold × (1 − discount/100). Pokud je sleva NULL, považuje se za 0 %. Zaokrouhlete na dvě desetinná místa; • průměrný počet prodaných jednotek na jednu prodej (avg_units_per_sale), zaokrouhlený na dvě desetinná místa; • podíl prodejů bez slevy (no_discount_share) — počet prodejů s NULL nebo 0% slevou dělený celkovým počtem prodejů v kategorii, zaokrouhlený na tři desetinná místa. Seřaďte nejdříve podle celkových tržeb (total_revenue) sestupně, poté podle průměru jednotek na prodej (avg_units_per_sale) vzestupně, a nakonec podle názvu kategorie abecedně. Formát vstupu Tabulka sales: • sale_id (int) — unikátní identifikátor prodeje • product_id (int) — identifikátor produktu • category (text) — kategorie produktu • sale_date (timestamp) — datum a čas prodeje • units_sold (int) — prodané jednotky • unit_price (numeric) — cena za jednotku • discount (numeric) — sleva v procentech, může být NULL Sloupec discount může obsahovat chybějící hodnoty. Formát výstupu Dotaz by měl vrátit tabulku se sloupci ve stejné pořadí: • category (text) — kategorie produktu • total_units_sold (int) — celkový počet prodaných jednotek v této kategorii • total_revenue (numeric) — celkové tržby podle kategorie, zaokrouhlené na dvě desetinná místa • avg_units_per_sale (numeric) — průměrný počet jednotek na prodej, zaokrouhlený na dvě desetinná místa • no_discount_share (numeric) — podíl prodejů bez slevy (hodnota mezi 0 a 1), zaokrouhlený na tři desetinná místa Výsledek by měl být seřazen nejdříve podle total_revenue sestupně, poté podle avg_units_per_sale vzestupně, a nakonec podle názvu kategorie abecedně.
Použili jste v Data Vault Bridge a PIT tabulky? Uveďte příklad a vysvětlete jejich účel.
Jak vybrat správný klíč shardování pro rovnoměrné rozložení dat?