Kde lze v Airflow zobrazit logy úloh?
Data Engineer
Jak funguje ClickHouse a v čem se liší od PostgreSQL?
Jak Pandas zpracovává chybějící data?
Threading, multiprocessing, asyncio: jaký je rozdíl a kdy je lepší co použít?
Kde se v Airflow objevuje paralelismus?
Jak parsovat velké XML soubory v ZIP a nahrát je do ClickHouse pomocí Pythonu?
Jak ovlivňuje ORDER BY tabulku ClickHouse a které klíče je lepší vybírat?
V čem se generátory liší od seznamů v Pythonu?
Proč je Pandas lepší než běžné seznamy a slovníky v Pythonu?
Jaké typy indexů jsou v PostgreSQL?
Jak aktualizovat tabulku v ClickHouse tak, aby si uživatelé ničeho nevšimli (atomová výměna)?
Co je GIL (Global Interpreter Lock)?
Jak nezabít Jupyter nebo Pandas kvůli paměti?
Z čeho obvykle sestávají logy úloh Airflow?
Na co jsou okénkové funkce?
Jak v Airflow vytvořit mnoho stejných úkolů paralelně (například nahrát mnoho stejných souborů)?
Jaký je rozdíl mezi WHERE a HAVING?
Jak funguje JOIN v ClickHouse?
Jak funguje komprese v ClickHouse?
Co je to idempotence v DAG/úkolu v Airflow?