Data Vault to wygodne narzędzie, ale jest za dużo obiektów. Czy możesz wyjaśnić różnicę między hubami, linkami i satelitami?
Data Engineer
Trino w tym schemacie odpowiada za przetwarzanie danych — jak stos technologiczny pozwala oddzielić przechowywanie od obliczeń?
Czy możesz opowiedzieć, co ostatecznie tutaj uzyskamy? Należy skomentować każdy krok, jak to działa.
Czy znasz bibliotekę w Rust, wielowątkową, bardzo szybką, która może zastąpić Pandas w Data Science i Big Data?
Czym różni się CTE od podzapytania?
Jak dzielić zapytanie na etapy? Co robimy w tym celu?
Jakie technologie były używane do pobierania i ładowania danych do Parquet, oraz jakie mechanizmy były stosowane?
Jak napisałeś DAG Airflow i zadania — ręcznie czy za pomocą szablonów?
Przy streamingu Iceberg działał, słyszałeś? To jest śmietnikowe przechowywanie plików.
Jak dane z zewnętrznej tabeli były ładowane do tabel docelowych?
Jak zwykle tworzyłeś schemat bazy danych — ręcznie w bazie, czy przechowywałeś skrypty gdzieś, czy korzystałeś w ogóle z Liquibase? Jaki był proces?
Czy ładowałeś dane z Spark do S3 w formacie Parquet, a następnie z Parquet do Greenplum — jak wygląda proces ładowania?
To jest w czasie rzeczywistym, jak to zrealizować między Kafka a ClickHouse Spark?
Czy ma sens używać CTE, jeśli jest używana tylko raz w zapytaniu?
Czy z zależnościami między zadaniami, między DAG-ami — używałeś czujników, aby uruchamiały się one jeden po drugim?
Będziemy parsować JSON — kto będzie parsować JSON? O ile wiem, w ClickHouse nie ma funkcji.
Czy pracowałeś z Git? Co przechowywałeś w Git?
Czy musiałeś pracować bezpośrednio z Spark? Jaka jest jego wada?
Potrzebujemy silnika pipeline — mechanizmu, który pozwoli na bardzo szybkie tworzenie przepływów poprzez podanie na wejście kontraktów i parametrów. Jak byś to zrealizował na wyższym poziomie?
Jaki typ odczytu jest używany w Greenplum: wierszowy czy kolumnowy?