Sobes.tech

Data Engineer

ClickHouse'da kayıtları sildiğimizde veya değiştirdiğimizde hangi süreçler başlatılır?

187

Data Vault kullanışlı bir araç, ama çok fazla nesne oluyor. Hublar, bağlantılar ve uydu arasındaki farkı açıklayabilir misin?

187

Data Science ve büyük veri işlemleriniz için Rust'ta yazılmış, çok iş parçacıklı ve çok hızlı olan böyle bir kütüphane biliyor musun? Pandas yerine kullanılabilir.

184

CTE ile alt sorgu arasındaki fark nedir?

183

Sorguları aşamalara nasıl bölüyoruz? Bunun için ne yapıyoruz?

180

Parquet'e veri yüklerken hangi teknolojileri kullandınız ve verileri almak ve yüklemek için hangi mekanizmalar kullanıldı?

180

Spark'tan S3'e Parquet formatında veri yüklediniz mi ve sonra Parquet'ten Greenplum'a — yükleme süreci nasıl gerçekleşiyor?

177

Airflow DAG ve işleri nasıl yazdın — elle mi yoksa şablonlar kullanarak mı?

175

Dış tablodaki veriler hedef tablolara nasıl yüklendi?

175

Git ile çalıştınız mı? Git'te ne saklardınız?

174

Veritabanı şemasini nasıl yapardın? Doğrudan veritabanında mı yapardın, yoksa betikleri bir yerde mi saklardın, yoksa Liquibase mi kullanırdın, süreç nasıldı?

173

Akışla birlikte, Iceberg çalışıyordu, duydun mu? Bu bir dosya depolama çöplüğü.

173

İşler arasındaki bağımlılıklarla, DAG'ler arasında — sensörleri kullanarak bunların sırayla birkaç işi başlatmasını sağladınız mı?

171

Bu gerçek zamanlı, Kafka ve ClickHouse Spark arasında nasıl entegre edilir?

170

Sorgulama içinde sadece bir kez kullanılıyorsa, CTE kullanmanın anlamı var mı?

169

JSON'u ayrıştıracağız — JSON'u kim ayrıştıracak? Bildiğim kadarıyla, ClickHouse'ta fonksiyonlar yok.

166

Spark ile doğrudan çalıştınız mı? Eksisi nedir?

165

Iceberg, S3'ü bir veritabanına dönüştürmenizi sağlayan bir motor, hatta ACID kurallarına da uyuyor. Eksisi nedir?

161

Bize çok hızlı akışlar oluşturmayı sağlayan sözleşmeler ve parametreler giriş olarak verildiğinde çalışan bir mekanizma olan pipeline motoruna ihtiyacımız var. Bunu üst seviyede nasıl gerçekleştirirdin?

161
/3