Data Engineer
Co se stane, když použijete `s ** 2` na seznam `s = [1, 2, 3]`?
Porovnejte přístupy ETL a ELT: v čem je rozdíl a kdy se každý z nich používá?
Jaké strategie rozdělení dat existují?
Jaké jsou typické příčiny toho, že dotaz v relační databázi funguje pomalu?
Pověz mi o sobě: čím ses zabýval, jaký stack jsi používal a o jaký projekt šlo?
Co je to datová vitrína?
Představte si, že Data Vault není dostupný a je třeba spojit dvě široké tabulky. Jak byste to optimalizoval v Greenplum? A pokud by to bylo v ClickHouse?
Jak bys implementoval filtrování před joinem v dotazu?
Jsi z Moskvy? Žiješ tu už dlouho? Proč ses přestěhoval do Moskvy?
Jak fyzicky probíhá mechanismus broadcast — jak se části malé tabulky dostávají na executor s velkou tabulkou?
Proč bylo použito Parquet místo ORC?
Jak bude řešena práce s riziky odchylek dat a odpovědností za data?
Jak jste pracoval se soubory při opětovném spuštění DAG po jeho selhání, aby nedošlo k přepsání neúplných dat v S3?
Tři hlavní kritéria pro výběr nabídky, pokud je několik návrhů.
Co je to "mrtvá n-tice" (dead tuple)?
Co je Spark JDBC a jak efektivně načíst velkou tabulku přes něj?
Funkce okna SUM() OVER (PARTITION BY user_id) — v jednom případě přidáváme ORDER BY datum nákupu, v jiném ne. V čem je rozdíl?
Jak jsou vaše modely dbt strukturovány a jak sestavujete vitrínu z více zdrojů přes Trino?
Jaký je ideální poměr mezi obchodními úkoly a infrastrukturními úkoly pro vás?
Jaký typ ukládání má Parquet: řádkový nebo sloupcový?