Sobes.tech

Data Engineer

Data Vault to wygodne narzędzie, ale jest za dużo obiektów. Czy możesz wyjaśnić różnicę między hubami, linkami i satelitami?

187

Trino w tym schemacie odpowiada za przetwarzanie danych — jak stos technologiczny pozwala oddzielić przechowywanie od obliczeń?

186

Czy możesz opowiedzieć, co ostatecznie tutaj uzyskamy? Należy skomentować każdy krok, jak to działa.

186

Czy znasz bibliotekę w Rust, wielowątkową, bardzo szybką, która może zastąpić Pandas w Data Science i Big Data?

184

Czym różni się CTE od podzapytania?

183

Jak dzielić zapytanie na etapy? Co robimy w tym celu?

178

Jakie technologie były używane do pobierania i ładowania danych do Parquet, oraz jakie mechanizmy były stosowane?

178

Jak napisałeś DAG Airflow i zadania — ręcznie czy za pomocą szablonów?

175

Przy streamingu Iceberg działał, słyszałeś? To jest śmietnikowe przechowywanie plików.

173

Jak dane z zewnętrznej tabeli były ładowane do tabel docelowych?

171

Jak zwykle tworzyłeś schemat bazy danych — ręcznie w bazie, czy przechowywałeś skrypty gdzieś, czy korzystałeś w ogóle z Liquibase? Jaki był proces?

171

Czy ładowałeś dane z Spark do S3 w formacie Parquet, a następnie z Parquet do Greenplum — jak wygląda proces ładowania?

171

To jest w czasie rzeczywistym, jak to zrealizować między Kafka a ClickHouse Spark?

170

Czy ma sens używać CTE, jeśli jest używana tylko raz w zapytaniu?

169

Czy z zależnościami między zadaniami, między DAG-ami — używałeś czujników, aby uruchamiały się one jeden po drugim?

169

Będziemy parsować JSON — kto będzie parsować JSON? O ile wiem, w ClickHouse nie ma funkcji.

166

Czy pracowałeś z Git? Co przechowywałeś w Git?

164

Czy musiałeś pracować bezpośrednio z Spark? Jaka jest jego wada?

163

Potrzebujemy silnika pipeline — mechanizmu, który pozwoli na bardzo szybkie tworzenie przepływów poprzez podanie na wejście kontraktów i parametrów. Jak byś to zrealizował na wyższym poziomie?

161

Jaki typ odczytu jest używany w Greenplum: wierszowy czy kolumnowy?

159
/3