Data Engineer
Jaký rámec jste použili pro psaní pipeline? Jak jste použili Airflow?
Vlastními slovy, co je FULL JOIN?
Technicky je databáze v systému správy databází (DBMS) pouhým souborem, odkud pocházejí omezení typu NULL/NENULL? K čemu slouží tyto logické abstrakce?
# co se zobrazí s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Setkali jste se s chybou ClickHouse `Too many parts` při vkládání? Jak jste ji řešili?
Lze v Greenplum použít náhodné rozdělení a kdy je to vhodné?
Proč hledáte novou práci?
Co se fyzicky děje při INSERT, UPDATE a DELETE v Greenplum; proč po DELETE není uvolněno místo na disku a v čem se DELETE liší od TRUNCATE?
Jak zabránit tomu, aby nesprávná data načtená do vitríny nebo mezitabulky pronikla do vyšších pipelineů?
Proč mohou být data ztracena? Uveďte několik důvodů.
Jak sou spojeny řazení uvnitř okna funkce a konečné řazení ORDER BY v dotazu?
Na co jsou v S3 potřeba "složky"/předpony kromě pohodlí?
S jakými knihovnami Python jste pracoval?
Co je to partitioning a distribuce (sharding)?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Uveď příklad, kdy jsi použil umělou inteligenci k automatizaci rutinních procesů.
Co dělá parametr depends_on_past v Airflow?
Jaký je rozdíl mezi ACID a CAP teoremou?
Jak pracovali s 1C: získávali data přímo z databáze, přes sběrnici nebo jiným způsobem?
Co se děje v PostgreSQL po provedení dotazu SELECT * FROM [tabulka]?