Data Engineer
Úkol #3 Najděte zákazníky, u nichž je rozdíl mezi jejich objednávkami větší než 60 dní. Pro tyto zákazníky zobrazte maximální rozdíl (gap_days). Tabulka objednávek: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Finální výsledek: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Co lze říci o správnosti následujícího dotazu? select * from sessions where ended_at is null and status != 'pending';
Co je to RDD v Apache Spark a čím se liší od jiných abstrakcí Spark?
[jméno] se zeptal: Co je třeba přidat do motoru tabulek, aby byla data aktuální na všech uzlech clusteru?
Dána řetězec order, který udává požadovaný pořadí znaků. Je třeba přeuspořádat znaky v řetězci unsorted_str tak, aby pořadí bylo v souladu s řetězcem order. Oba řetězce se skládají z malých písmen anglické abecedy, všechny znaky v order jsou odlišné. Pořadí znaků v unsorted_str se nazývá v souladu s řetězcem order, pokud z toho, že znak x stojí před znakem y v order, vyplývá, že jakákoli výskyt x v unsorted_str musí být před jakýmkoli výskytem y. Situace, kdy v order nejsou znaky z unsorted_str a naopak, jsou povoleny. Vraťte jakoukoli povolenou permutaci. unsorted_str = "abcd" order = "cba" odpověď = "dcba" ("cdba", "cbda", "cbad") def CustomSort(unsorted_str: str, order: str) -> str: # kód zde
Můžete vysvětlit partitioning v Oracle: k čemu se používá a jaké typy existují?
[jméno] se zeptal: Pole 'našli le lety' má pouze dvě hodnoty (ano/ne). Jak je nejlépe reprezentovat v ClickHouse? Jaký datový typ se interně používá pro Bool?
Pracoval jste s incidenty kvality dat?
Co vás motivuje v práci? Uveďte své silné stránky v oblasti hard skills.
V jakých případech používat B-strom a hash indexy v PostgreSQL?
Co je to plán dotazů? K čemu jsou potřeba?
Jaká jsou rizika kvality dat?
Jak se připojili k OpenMetadata a co s ní dělali?
Vysvětli obecně, jak je navržena architektura Spark: jaké komponenty existují a jak spolu komunikují při vykonávání SQL dotazu.
Co je to index? Čím se liší clusterovaný index od neklausterizovaného?
Jaké indexy znáte v PostgreSQL?
Pracoval jste s datovými vitrínami (vrstva DWH)?
Co je to Adaptivní vykonávání dotazů (AQE)?
Jak rozlišuješ technické a obchodní kontroly dat, a kdo by měl stanovovat požadavky na ně?
Jak jsou nyní data zpracovávána? Pokud jsou v různých formátech, jak jsou normalizována a sjednocena?