Data Engineer
Máte skúsenosti s optimalizáciou SQL dopytov? Uveďte príklad.
V tejto schéme je Trino zodpovedný za spracovanie údajov — ako vám technológia stack umožňuje oddeliť úložisko od výpočtov?
Aké skupiny SQL operátorov poznáš? Čo k nim patrí?
Aké je nebezpečenstvo shuffle v Spark?
Čo je rozdelenie údajov a ako pomáha vyhnúť sa úplnému prehľadávaniu tabuľky?
Aká stratégia by bola účinná na odstránenie zraniteľnosti vo všetkých vetvách s minimálnym rizikom narušenia chodu projektu? - Vytvorenie série revert commitov pre problémový commit a všetky commity, ktoré ho čiastočne opravili, následne vytvorenie nového commitu s úplnou opravou - Vytvorenie hotfix vetvy od bodu pred problémovým commitom, vykonanie opráv a zlúčenie tejto vetvy so všetkými postihnutými vetvami - Vytvorenie jedného opravného commitu pomocou git revert abc123 na hlavnej vetve a následné cherry-pick tohto commitu do všetkých release vetiev - Použitie git bisect na presné určenie problémového kódu, vytvorenie záplaty a jej aplikácia na všetky vetvy pomocou git am - Použitie git rebase -i na úpravu problémového commitu v každej vetve, nasledované force-push (force-push)
Mal si skúsenosti s Docker obrázkami, nastavovaním prostredia na virtuálnom stroji?
Úložisko bolo postavené podľa schémy Data Vault — ty si ho tiež rozvíjal, udržiaval? Ručne pridával huby, linky?
Povedzte o indexoch v Greenplum a ClickHouse
V ktorých prípadoch môže Materialized View v ClickHouse vynechať údaje alebo ich naopak zdvojnásobiť?
Čo sa ti momentálne na tvojej práci nepáči?
Čo je pre teba dôležité v novom projekte, novom tíme alebo spoločnosti?
Ako odstrániť podmodul a súvisiace súbory z projektu? git submodule remove <cesta-k-podmodulu> git rm --cached <cesta-k-podmodulu>; odstrániť sekciu z .gitmodules; git commit git clean --submodules <cesta> git submodule delete <cesta> git remove submodule <cesta>
V Hive bol pomalý analytický dopyt. Ako pochopiť, čo sa stalo a ako ho opraviť?
Analýza dbt modelu s inkrementálnou stratégiou: čo robí model, sú problémy?
Čo je to CROSS JOIN? Pracoval si s tým?
Aký je rozdiel medzi == a is v Pythone?
Čo je sledovateľnosť? Máte s tým skúsenosti?
Aké typy JOIN existujú v SQL (logické a fyzické)?
Ktorý výraz na mieste [...] automaticky spôsobí vytvorenie indexu? Na mobilnej platforme je horizontálne posúvanie kódu create table some_table( col_name [...] ); unique references other_table(col_name) not null serial integer check (col_name > 0)