Kas nutiks, jei sukursite DAG su start_date = 2024 m. sausio 1 d.?
Data Engineer
Užduotis #3 Raskite klientus, kurių užsakymų tarpas yra didesnis nei 60 dienų. Šiems klientams parodykite didžiausią tarpą (gap_days). Užsakymų lentelė: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Galutinis rezultatas: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Kuo skiriasi repartition ir coalesce Spark?
Kokia yra UDF Spark programoje ir koks jų minusas?
Kaip kovoti su duomenų neatitikimu?
Ar dirbote su kontekstų valdytojais Python? Kas jie yra ir kam skirti?
Ką žinote apie spill Spark?
Kaip apibūdintum kode patikrinimą, ar reikšmė reikšmingai skiriasi nuo įprastos (laukiamos) paskirstymo?
Kodėl duomenys gali būti prarasti? Pateikite keletą priežasčių.
Kaip užkirsti kelią neteisingų duomenų įkėlimui į vitriną ar tarpinę lentelę ir jų patekimui į aukštesnius pipeline'us?
Kokius duomenų perdavimo būdus žinote tarp Airflow užduočių?
Jei DAG tvarkaraštis yra @daily, kada jis iš tikrųjų pradeda veikti?
Kaip stebėjote duomenų kokybę?
Ar Python'o žodynas yra keičiamas ar nekintamas tipas? Kokie reikalavimai yra jo raktams ir reikšmėms?
Ką daro parametras depends_on_past Airflow?
Ar atlikote statistinius patikrinimus?
Kokia yra paieškos žodyne sudėtingumo algoritminė sudėtingumas blogiausiu atveju?
Kaip paleisti antrąjį Airflow DAG iškart po pirmojo sėkmingo užbaigimo?