Sobes.tech

Data Engineer

Data Vault je zgodna stvar, ali objekata je previše. Možete li objasniti razliku između hubova, linkova i satelita?

187

Trino u ovoj šemi je zadužen za obradu podataka — kako sloj tehnologija omogućava odvajanje skladištenja i računanja?

186

Можеш ли да објасниш шта ћемо добити на крају овде? Потребно је коментарисати сваки корак, како то функционише.

186

Да ли познајеш неку библиотеку у Rust-у, мулти-тред, веома брзу, која може заменити Pandas за Data Science и Big Data?

184

Koje tehnologije ste koristili za učitavanje podataka u Parquet i koje mehanizme ste koristili za dobijanje i učitavanje podataka?

178

Kako razdeliti zahtev na faze? Šta za to radimo?

178

Kako si napisao DAG i zadatke u Airflow — ručno ili pomoću šablona?

175

Kako su podaci iz spoljne tabele učitani u ciljne tabele?

175

Sa streamingom, Iceberg je radio, čuo si? To je odlagalište fajlova smeće.

173

Da li ste učitavali podatke iz Spark u S3 u formatu Parquet, a zatim iz Parquet u Greenplum — kako se odvija proces učitavanja?

173

Kako si obično pravio šemu baze podataka — ručno u bazi ili si čuvao skripte negde, ili si uopšte koristio Liquibase? Koji je bio proces?

171

Ово је у реалном времену, како то реализовати између Kafka и ClickHouse Spark?

170

Sa zavisnostima između poslova, između DAG-ova — koristio si senzore da se oni jedan za drugim pokreću?

169

Da li ima smisla koristiti CTE ako se koristi samo jednom u upitu?

169

Bićemo parser JSON — ko će parsirati JSON? Koliko znam, u ClickHouse nema funkcija.

166

Да ли сте радили са Git-ом? Шта сте чували у Git-у?

164

Da li ste morali direktno da radite sa Spark-om? Koja je njegova mana?

163

Potrebno nam je pipeline engine — mehanizam koji će omogućiti vrlo brzo kreiranje tokova putem unosa ugovora i parametara. Kako bi to realizovao na višem nivou?

161

Koji tip čitanja se koristi u Greenplum: red ili kolona?

159
/3