Data Engineer
Aké ďalšie parametre DDL/CREATE TABLE v ClickHouse poznáte, na čo vplývajú a v akých prípadoch sa používajú?
Aký typ ukladania má Parquet: riadkový alebo stĺpcový?
Aké máte skúsenosti s SQL a relačnými databázami?
Aké sú nevýhody UDF v Spark a aký je ich najväčší mínus?
Aké ďalšie entity Data Vault, okrem hub, link a satellite, boli použité: napríklad same-as links alebo transactional links?
Povedzte o mutabilných a nemutabilných dátových typoch v Pythone a uveďte príklady.
Aké technické polia sa používali v satellites, links a hubs Data Vault?
Je možné v Greenplum použiť náhodné rozdelenie a kedy je to vhodné?
Otázka #1 Koľko záznamov vráti dotaz s inner, left, right, full join dvoch tabuliek pri spojení podľa atribútu id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Prečo hľadáte novú prácu?
Za čo je zodpovedná Skupina riadkov v štruktúre súboru Parquet?
Aké Docker obrazy ste museli zostaviť a prečo?
Pre každého riadku v tabuľke salaries zobraziť meno zamestnanca, dátum, plat a pomocou okienkovej funkcie pridať stĺpec "priemerná mzda podľa oddelenia na tento dátum".
Koľko ste celkovo pracovali so Sparkom a aké hlboko ste sa do neho ponorili?
Čo je to partícionovanie a distribúcia (sharding)?
Povedz o zaujímavej úlohe v spoločnosti za posledných 2,5 roka, napríklad súvisiacej s ClickHouse.
Ako pridať kĺzavý priemer súčtu objednávok za aktuálny a predchádzajúce dva dni na používateľa?
Ako funguje hash join pre tabuľky s 1 000 a 1 000 000 riadkami?
Bola použitá metóda porovnávania hashov záznamov na výpočet rozdielu medzi zdrojom a cieľovou tabuľou?
Povedajte o základných konceptoch Kafka (skupina spotrebiteľov, oddiely, témy).