Data Engineer
Jaké další parametry DDL/CREATE TABLE v ClickHouse znáte, na co ovlivňují a v jakých případech se používají?
Jak se připojili k OpenMetadata a co s ní dělali?
V jakém týmu a pod jakým vedením se cítíte nejpohodlněji při práci?
Vysvětli obecně, jak je navržena architektura Spark: jaké komponenty existují a jak spolu komunikují při vykonávání SQL dotazu.
Co se dělo, když se spustilo omezení kvality dat: upozornění, pád, restart?
## úloha módu # Seznam čísel. Napište funkci, která najde mód tohoto seznamu. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Co vrátí funkce find_mode pro seznam [1, 2, 3, 3, 4, 5]? Vysvětli krok za krokem.
Proč zvažujete nyní pracovní nabídky?
Co je to Adaptivní vykonávání dotazů (AQE)?
Jaký je rozdíl mezi virtualizací a kontejnerizací (Docker)?
Pracoval jste s parametry a hinty určujícími použití Broadcast Join?
Jak jsi obvykle navrhoval schéma databáze? Připravoval jsi ho ručně v databázi, nebo jsi skripty někde ukládal, nebo jsi vůbec používal Liquibase? Jaký byl proces?
Jaký fyzický mechanismus JOIN bude použit při spojení tabulky transakcí s tabulkou kalendáře podle podmínky nerovnosti (datum <= datum)?
Jak funguje Nested Loop Join a jaká je jeho algoritmická složitost? Jaká je složitost všech tří algoritmů?
Co jsi napsal v Pythonu kromě Airflow DAG?
Jaké fyzické algoritmy JOIN fungují v databázích?
Pověz mi o své úrovni Pythonu: co jsi používal, jak hluboko znáš OOP
Jak funguje Hash Join?
Jak lze spravovat shuffle v Spark (particionace, broadcast join atd.)?
Spravoval jste Airflow nebo jste pracoval pouze jako vývojář?