Data Engineer
Analýza dbt modelu s inkrementální strategií: co model dělá, jsou s tím problémy?
Který zdroj se při Nested Loop Join spotřebuje nejvíce?
Jaký je rozdíl mezi == a is v Pythonu?
Máte konkurenční nabídky nebo návrhy od jiných společností?
Jaké typy JOIN existují v SQL (logické a fyzické)?
Jaký výraz na místě [...] automaticky povede ke vzniku indexu? Na mobilní platformě je horizontální posuv kódu create table some_table( col_name [...] ); unique references other_table(col_name) not null serial integer check (col_name > 0)
Jaké skupiny SQL operátorů znáte? Čemu patří?
Jaké výhody přináší vzor Strategie při refaktoringu tohoto kódu?
Pracoval jste s Gitem? Co jste v Gitu ukládali?
Jak ovlivňují swap soubory výkon? Kdy se mohou swap soubory ještě vyskytnout?
Měl jsi zkušenosti s Docker obrazy, nastavováním prostředí na virtuálním stroji?
Jak aktualizovat tabulku v ClickHouse tak, aby si uživatelé ničeho nevšimli (atomová výměna)?
Jak Spark určuje, že tabulka je dostatečně 'malá' pro broadcast join (horní hranice)?
Co se ti momentálně na tvé práci nelíbí?
Povězte nám o své zkušenosti s Airflow (orchestrátor). Čím jste používali?
Co je pro tebe důležité v novém projektu, novém týmu nebo společnosti?
Jaké SQL dotazy píšeš: jednoduché kontroly nebo složité skripty pro vitríny?
Co je to CTE (Společný Výraz Tabulky)?
Načítali jste data ze Spark do S3 ve formátu Parquet, a poté z Parquet do Greenplum — jak probíhá proces načítání?
Jak realistické jsou plány společnosti na vybudování systému sběru, normalizace a analýzy dat?