Data Engineer
Czym jest wstrzyknięcie SQL?
Czym jest VACUUM w PostgreSQL? Do czego jest potrzebny?
Jak rozwiązać problem w czasie liniowym O(n) używając słownika? Co należy przechowywać w słowniku, aby potem zbudować posortowany ciąg? Jak obsłużyć znaki, których nie ma w kolejności?
Udział ruchu botów Zespół antyfraudowy opracował mechanizm wykrywania ruchu botów na stronie sklepu — gdy bot wchodzi na stronę, do parametrów jego URL dodawany jest fragment "bot" (bez rozróżnienia wielkości liter). Jeśli user_id był zidentyfikowany jako bot przynajmniej raz w grudniu, zawsze powinien być traktowany jako bot. Przeanalizuj zestaw danych z wizytami użytkowników na stronie i oblicz udział botów w ogólnej liczbie użytkowników w grudniu 2024 roku (zaokrąglając do jednego miejsca po przecinku). Format wejścia Tabela visits: - event_date (date) — data wizyty - user_id (int) — unikalny identyfikator użytkownika - url (string) — link, na którym dokonano przejścia Dane nie zawierają braków ani nieprawidłowych wartości. Format wyjścia Zapytanie powinno zwrócić tabelę z polami: - share (float) — udział botów w ogólnej liczbie użytkowników w grudniu, zaokrąglony do jednego miejsca po przecinku.
Opisz metody optymalizacji zapytań SQL, które stosowałeś. Jak skróciłeś czas wykonania z 12-15 sekund?
Wyjaśnij, jak technicznie działa Git LFS i jakie korzyści oferuje w porównaniu z standardowym Gitem podczas pracy z dużymi plikami.
Co robisz, gdy napotkasz problem w pipeline produkcyjnym?
Na czym traci baza danych podczas szybkiego ładowania danych (COPY w Postgres, BULK INSERT)?
Czym jest DAG w Airflow, z czego się składa i jak Airflow wykonuje DAG?
Jakie są Twoje oczekiwania finansowe?
Jakie problemy może wykryć śledzenie?
Czym jest idempotentność DAG/zadania w Airflow?
Napisz DAG do ładowania danych przez API REST
Jak działa kompresja w ClickHouse?
Opowiedz o architekturze magazynu: jak był podzielony na warstwy, jakie są cechy każdej warstwy?
Do jakiego typu bardziej należy Greenplum — OLTP czy OLAP?
Jak odzyskać pracę z zdalnej gałęzi, jeśli podczas próby `git checkout hotfix/missing-footer` pojawia się komunikat o błędzie, że gałąź nie została znaleziona?
Jak może dojść do wstrzyknięcia SQL przez pole wprowadzania daty?
To jest w czasie rzeczywistym, jak to zrealizować między Kafka a ClickHouse Spark?
Czym jest YARN i do czego służy?