Dlaczego bool([""]) zwraca True?
Data Engineer
Zadanie #3 Należy znaleźć klientów, u których przerwa między zamówieniami jest większa niż 60 dni. Dla tych klientów wyświetlić maksymalną przerwę (gap_days). Tabela zamówień: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Ostateczny wynik: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Jaka jest wada UDF w Spark i jaka jest ich minus?
Jaka jest różnica między repartition a coalesce w Spark?
Jak radzić sobie z niespójnością danych?
Czy pracowałeś z menedżerami kontekstu w Pythonie? Czym są i do czego służą?
Jak opisałbyś w kodzie sprawdzenie, czy wartość znacznie różni się od normalnego (oczekiwanego) rozkładu?
Co wiesz o spill w Spark?
Dlaczego dane mogą zostać utracone? Podaj kilka przyczyn.
Jak uniemożliwić, aby nieprawidłowe dane załadowane do witryny lub tabeli pośredniej trafiły do wyższych pipeline'ów?
Jakie metody przesyłania danych między zadaniami Airflow znasz?
Co robi parametr depends_on_past w Airflow?
Jeśli harmonogram DAG to @daily, o której godzinie jest on faktycznie uruchamiany?
Jak monitorowałeś jakość danych?
Czy słownik w Pythonie jest typem zmiennym czy niezmiennym? Jakie są wymagania dotyczące jego kluczy i wartości?
Czy przeprowadzałeś kontrole statystyczne?
Jaka jest złożoność algorytmiczna wyszukiwania w słowniku w najgorszym przypadku?
Jak uruchomić drugi DAG Airflow zaraz po pomyślnym zakończeniu pierwszego?