Data Engineer
Z jakiego frameworka korzystałeś do pisania pipeline'ów? Jak korzystałeś z Airflow?
Własnymi słowami, czym jest FULL JOIN?
Technicznie rzecz biorąc, baza danych w systemie zarządzania bazami danych (DBMS) to po prostu plik, skąd pochodzą ograniczenia typu NULL/NIE NULL? Do czego służą te abstrakcje logiczne?
Czy zdarzyło Ci się napotkać błąd ClickHouse `Too many parts` podczas wstawiania? Jak go rozwiązałeś?
Czy można używać rozkładu losowego w Greenplum i kiedy jest to odpowiednie?
Dlaczego szukasz nowej pracy?
Co się dzieje fizycznie podczas INSERT, UPDATE i DELETE w Greenplum; dlaczego po DELETE miejsce na dysku nie jest zwalniane i czym DELETE różni się od TRUNCATE?
Jak uniemożliwić, aby nieprawidłowe dane załadowane do witryny lub tabeli pośredniej trafiły do wyższych pipeline'ów?
Dlaczego dane mogą zostać utracone? Podaj kilka przyczyn.
Jak są powiązane sortowanie wewnątrz funkcji okna i końcowe sortowanie ORDER BY w zapytaniu?
Do czego służą "foldery"/prefiksy w S3 oprócz wygody?
Z jakimi bibliotekami Pythona pracowałeś?
Czym jest partycjonowanie i dystrybucja (sharding)?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Opowiedz przykład, kiedy używałeś sztucznej inteligencji do automatyzacji rutynowych procesów.
Co robi parametr depends_on_past w Airflow?
Jaka jest różnica między ACID a twierdzeniem CAP?
# co jest wyświetlane s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Jak pracowali z 1C: pobierali dane bezpośrednio z bazy danych, przez magistralę lub w inny sposób?
Co się dzieje w PostgreSQL po wykonaniu zapytania SELECT * FROM [tabela]?