Co je ACID? Co znamená každé písmeno? Jak to souvisí s transakcemi?
Data Engineer
Znáš formát Avro?
Pověz mi obecně o relačních databázích — co to je?
Měl jsi zkušenosti s Docker obrazy, nastavováním prostředí na virtuálním stroji?
Co je to utying (duck typing)?
Zmínil jsi procesy Docker, můžeš podrobněji vysvětlit, jak je to u vás zařízeno?
Kdy nepotřebujeme datové úložiště?
Jaká jsou omezení při používání hash tabulek?
Jak je organizováno vaše QA (kontrola kvality dat)?
Máš zkušenosti s Table Engine Join v ClickHouse?
Povězte mi o své zkušenosti s distribuovanými databázemi (Greenplum, ClickHouse)?
Lze vymyslet něco jiného než běžné CTE, vzhledem k tomu, že filtrování se stále provádí v paměti na celé tabulce?
Jaké jsou typy fyzických spojení (metody spojení)?
Co je to plán dotazů? K čemu jsou potřeba?
Představte si, že Data Vault není dostupný a je třeba spojit dvě široké tabulky. Jak byste to optimalizoval v Greenplum? A pokud by to bylo v ClickHouse?
Jaký je rozdíl mezi refaktoringem a optimalizací?
Co se ti momentálně na tvé práci nelíbí?
V jakém prostředí byl Spark spuštěn?
Máte zkušenosti s motory jako Trino nebo s tabulárními formáty (Iceberg, Parquet) v Spark?
Jaký je rozdíl mezi == a is v Pythonu?