Jaký je rozdíl mezi repartition a coalesce v Spark?
Data Engineer
Úkol #3 Najděte zákazníky, u nichž je rozdíl mezi jejich objednávkami větší než 60 dní. Pro tyto zákazníky zobrazte maximální rozdíl (gap_days). Tabulka objednávek: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Finální výsledek: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Co se stane, pokud vytvoříte DAG s start_date = 1. ledna 2024?
Jaké jsou nevýhody UDF v Spark a jaké je jejich mínus?
Jak bojovat s nekonzistencí dat?
Pracoval jste s kontextovými manažery v Pythonu? Co jsou a k čemu slouží?
Co víš o spill v Spark?
Jak bys popsal v kódu kontrolu, že hodnota se podstatně liší od normální (očekávané) distribuce?
Proč mohou být data ztracena? Uveďte několik důvodů.
Jak zabránit tomu, aby nesprávná data načtená do vitríny nebo mezitabulky pronikla do vyšších pipelineů?
Jaké způsoby přenosu dat mezi úkoly Airflow znáte?
Pokud je rozvrh DAG @daily, v kolik hodin se skutečně spouští?
Jak jste sledoval kvalitu dat?
Je slovník v Pythonu změnitelný nebo nezměnitelný typ? Jaké jsou požadavky na jeho klíče a hodnoty?
Co dělá parametr depends_on_past v Airflow?
Dělal jsi statistické kontroly?
Jaká je algoritmická složitost hledání ve slovníku v nejhorším případě?
Jak spustit druhý DAG Airflow ihned po úspěšném dokončení prvního?