Sobes.tech

Data Engineer

Jaký je rozdíl mezi repartition a coalesce v Spark?

164

Úkol #3 Najděte zákazníky, u nichž je rozdíl mezi jejich objednávkami větší než 60 dní. Pro tyto zákazníky zobrazte maximální rozdíl (gap_days). Tabulka objednávek: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Finální výsledek: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |

164

Co se stane, pokud vytvoříte DAG s start_date = 1. ledna 2024?

162

Jaké jsou nevýhody UDF v Spark a jaké je jejich mínus?

159

Pracoval jste s kontextovými manažery v Pythonu? Co jsou a k čemu slouží?

153

Jak bys popsal v kódu kontrolu, že hodnota se podstatně liší od normální (očekávané) distribuce?

151

Proč mohou být data ztracena? Uveďte několik důvodů.

149

Jak zabránit tomu, aby nesprávná data načtená do vitríny nebo mezitabulky pronikla do vyšších pipelineů?

145

Jaké způsoby přenosu dat mezi úkoly Airflow znáte?

145

Pokud je rozvrh DAG @daily, v kolik hodin se skutečně spouští?

143

Je slovník v Pythonu změnitelný nebo nezměnitelný typ? Jaké jsou požadavky na jeho klíče a hodnoty?

141

Jaká je algoritmická složitost hledání ve slovníku v nejhorším případě?

132

Jak spustit druhý DAG Airflow ihned po úspěšném dokončení prvního?

129
/2