Data Engineer
Aké ďalšie entity Data Vault, okrem hub, link a satellite, boli použité: napríklad same-as links alebo transactional links?
Aké technické polia sa používali v satellites, links a hubs Data Vault?
Otázka #1 Koľko záznamov vráti dotaz s inner, left, right, full join dvoch tabuliek pri spojení podľa atribútu id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Ukladali ste výsledky tabuľkových zobrazení v Parquet alebo inak v S3?
Prečo hľadáte novú prácu?
Aké druhy partícií existujú?
Čo vieš o spill v Spark?
Za čo je zodpovedná Skupina riadkov v štruktúre súboru Parquet?
Čo sa fyzicky deje pri INSERT, UPDATE a DELETE v Greenplum; prečo po DELETE nie je uvoľnené miesto na disku a v čom sa DELETE líši od TRUNCATE?
Koľko ste celkovo pracovali so Sparkom a aké hlboko ste sa do neho ponorili?
Čo robí parameter depends_on_past v Airflow?
Ako pracovali s 1C: získavali údaje priamo z databázy, cez zbernicu alebo iným spôsobom?
NULL plus 5 — koľko to bude?
S akými formátmi súborov ste pracovali?
Čo je RDD v Apache Spark a čím sa líši od iných abstrakcií Spark?
Aké typy fyzických JOIN-ov existujú v Spark?
Povedzte nám o sebe: skúsenosti, úlohy, funkcie alebo úspechy, na ktoré ste hrdí.
Máte skúsenosti s FastAPI?
Ako organizovať nalaganje podatkov v ClickHouse v veliki tabeli PostgreSQL, v katero nenehno prihajajo novi zapisi z monotonim naraščajočim primarnim ključem?
Na čo sú v S3 potrebné "zložky"/predpony okrem pohodlia?