Data Engineer
Jak ocenić konfigurację do przeniesienia jednego terabajta danych z PostgreSQL do ClickHouse?
Jakie technologie były używane do pobierania i ładowania danych do Parquet, oraz jakie mechanizmy były stosowane?
Czy pracowałeś z funkcjami okienkowymi? Jakie rodzaje funkcji okienkowych znasz?
Ostateczny wynik: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | z cte jako( wybierz order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) jako prev_order_ft, datediff(day, prev_order_ft, order_dt) jako gap_days z Orders ) wybierz customer_id, max(gap_days) jako gap_days z cte gdzie gap_days > 60 grupuj według customer_id
Jaki typ typizacji jest używany w Pythonie: statyczny czy dynamiczny?
Mamy tabelę klientów (id, imię, adres itp.), produktów (id, nazwa itp.), ruchu towarów (tutaj mamy id klienta, towaru, data, ilość, suma), musimy znaleźć, które towary sprzedano 1 stycznia, tylko unikalne, a także wyświetlić imię kupującego i...
W jakim zespole i pod czyim kierownictwem czujesz się najbardziej komfortowo?
Czy masz doświadczenie w optymalizacji zadań Spark? Możesz podać konkretny przykład?
Jaka była Twoja rola w zespole 4-osobowym i jak widzisz swoją karierę za 3-4 lata, jakie cele sobie wyznaczasz?
Magazyn został zbudowany według schematu Data Vault — czy ty też go rozwijałeś, utrzymywałeś? Dodawałeś ręcznie huby, linki?
Na wyświetlonym ekranie znajdują się dwie struktury danych; w której z nich wyszukiwanie wartości 2 będzie szybsze i dlaczego?
Jak rozumiesz koncepcję kluczy w tabelach — do czego to jest potrzebne?
Jak ładować dane z Kafka do ClickHouse za pomocą streamingu do raportów w czasie rzeczywistym?
Jak w Airflow utworzyć wiele identycznych zadań równolegle (np. załadować wiele identycznych plików)?
Jaki format pracy ci odpowiada: zdalny, hybrydowy czy w biurze?
Czy można zobaczyć schemat tabeli przed wykonaniem zapytania w Hive?
Jak widzisz swój rozwój w nowym zespole i jakimi zadaniami chciałbyś się zajmować najbardziej?
Do czego służą dekoratory w Apache Airflow?
Raport dla firmy logistycznej Jesteś analitykiem w firmie logistycznej, która prowadzi rejestr operacji w magazynach. Musisz przygotować raport dotyczący efektywności każdego magazynu. Dla każdego magazynu oblicz: • łączną liczbę operacji (count_operations); • łączną liczbę przetworzonych towarów w magazynie (sum_quantity); • średni czas przetwarzania operacji (avg_processing_time), uwzględniając tylko operacje z określonym czasem (nie NULL), zaokrąglony do najbliższej liczby całkowitej; • maksymalną i minimalną liczbę towarów przetworzonych w jednej operacji (max_quantity, min_quantity); • liczbę operacji każdego typu («dostawa», «wysyłka», «przemieszczanie») w osobnych kolumnach: supply_operations, shipment_operations, transfer_operations. Przefiltruj magazyny, dla których łączna liczba operacji jest większa niż 2, a średni czas przetwarzania nie przekracza 60 minut. Posortuj wynik według ID magazynu rosnąco. Format wejścia Tabela operations: • operation_id (int) — unikalny identyfikator operacji • warehouse_id (int) — identyfikator magazynu • operation_type (text) — typ operacji: «dostawa», «wysyłka», «przemieszczanie»
Czym jest RDD w Apache Spark i czym różni się od innych abstrakcji Spark?