Data Engineer
Měl jsi zkušenosti s Docker obrazy, nastavováním prostředí na virtuálním stroji?
Proč jste se rozhodli vstoupit na trh a opustit své současné zaměstnání?
Jak nezabít Jupyter nebo Pandas kvůli paměti?
Byla použita metoda porovnání hashů záznamů k výpočtu rozdílu mezi zdrojem a cílovou tabulkou?
Napište jednoduchý DAG pro Apache Airflow
Jak zabránit současnému spuštění přibližně 700 DAG běhů při catchup/backfill v Airflow?
Máte zkušenosti s optimalizací úloh Spark? Můžete uvést konkrétní příklad?
Úložiště bylo postaveno podle schématu Data Vault — ty jsi ho také rozvíjel, udržoval? Přidával jsi ručně huby, odkazy?
Museli jste přímo komunikovat s Data Scientists a sbírat od nich požadavky?
Museli jste někdy psát balíčky v Oracle?
Co jsou pohledy (VIEW) a materializované pohledy (MATERIALIZED VIEW) v Oracle? Jak jsou aktualizována data v materializovaném pohledu?
Úkol návrhu architektury mikroservisů: jak poskytnout data pro tabulku objednávek (produkty, ceny, objednávky) ve frontendu při třech samostatných mikroservisech?
Co je to RDD v Apache Spark a čím se liší od jiných abstrakcí Spark?
Zmínil jsi procesy Docker, můžeš podrobněji vysvětlit, jak je to u vás zařízeno?
Řekni mi víc o síti: co to je a proč je to důležité?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplikovatReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = Distributed('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Co je shuffle v Spark a proč je důležité ho minimalizovat?
V jakém týmu a pod jakým vedením se cítíte nejpohodlněji při práci?
Jaké fyzické JOINy znáš?
Jak zobrazit poslední celé jméno každého klienta, pokud je známa pouze počáteční datum (konec není znám)?