Data Engineer
Proč jste se rozhodli přesunout žebříček do samostatné CTE? Proč ho nebylo možné použít přímo v první CTE?
Jak pracovat s partiemi pomocí coalesce a repartition?
Jak jste zjistili, že záznam již existuje a není třeba jej znovu zaznamenávat?
NULL plus 5 — kolik to bude?
Lze číst data paralelně z jednoho souboru Parquet ve Spark, nebo pouze jedním jádrem v jedné úloze?
S jakými formáty souborů jste pracoval?
Jaké typy fyzických JOINů existují v Spark?
S jakými parametry motoru Distributed v ClickHouse jste obeznámen?
Povězte nám o sobě: zkušenosti, úkoly, funkce nebo úspěchy, na které jste hrdý.
Máte zkušenosti s FastAPI?
Co je to dekorátor v Pythonu?
Co jsou to lenivé operace v Spark a k čemu slouží?
V jaké situaci může hledání ve slovníku degradovat na nejhorší případ?
Jak bojovat s nekonzistencí dat?
Jak jste sledoval kvalitu dat?
S jakými databázemi jste pracoval? Jak funguje MongoDB a jak se škáluje?
Jak jste opravili zkreslení dat podle client_id, když byl jeden klient výrazně větší než ostatní? Jaké jsou možnosti?
Lze vytvořit a použít dekorátor bez syntaxe @?
Pokud je rozvrh DAG @daily, v kolik hodin se skutečně spouští?
Co jsou to dekorátory v Pythonu?