Greenplum'ta ACID uyuluyor mu?
Data Engineer
ClickHouse'da kayıtları sildiğimizde veya değiştirdiğimizde hangi süreçler başlatılır?
Data Vault kullanışlı bir araç, ama çok fazla nesne oluyor. Hublar, bağlantılar ve uydu arasındaki farkı açıklayabilir misin?
Data Science ve büyük veri işlemleriniz için Rust'ta yazılmış, çok iş parçacıklı ve çok hızlı olan böyle bir kütüphane biliyor musun? Pandas yerine kullanılabilir.
CTE ile alt sorgu arasındaki fark nedir?
Sorguları aşamalara nasıl bölüyoruz? Bunun için ne yapıyoruz?
Parquet'e veri yüklerken hangi teknolojileri kullandınız ve verileri almak ve yüklemek için hangi mekanizmalar kullanıldı?
Spark'tan S3'e Parquet formatında veri yüklediniz mi ve sonra Parquet'ten Greenplum'a — yükleme süreci nasıl gerçekleşiyor?
Airflow DAG ve işleri nasıl yazdın — elle mi yoksa şablonlar kullanarak mı?
Dış tablodaki veriler hedef tablolara nasıl yüklendi?
Git ile çalıştınız mı? Git'te ne saklardınız?
Veritabanı şemasini nasıl yapardın? Doğrudan veritabanında mı yapardın, yoksa betikleri bir yerde mi saklardın, yoksa Liquibase mi kullanırdın, süreç nasıldı?
Akışla birlikte, Iceberg çalışıyordu, duydun mu? Bu bir dosya depolama çöplüğü.
İşler arasındaki bağımlılıklarla, DAG'ler arasında — sensörleri kullanarak bunların sırayla birkaç işi başlatmasını sağladınız mı?
Bu gerçek zamanlı, Kafka ve ClickHouse Spark arasında nasıl entegre edilir?
Sorgulama içinde sadece bir kez kullanılıyorsa, CTE kullanmanın anlamı var mı?
JSON'u ayrıştıracağız — JSON'u kim ayrıştıracak? Bildiğim kadarıyla, ClickHouse'ta fonksiyonlar yok.
Spark ile doğrudan çalıştınız mı? Eksisi nedir?
Iceberg, S3'ü bir veritabanına dönüştürmenizi sağlayan bir motor, hatta ACID kurallarına da uyuyor. Eksisi nedir?
Bize çok hızlı akışlar oluşturmayı sağlayan sözleşmeler ve parametreler giriş olarak verildiğinde çalışan bir mekanizma olan pipeline motoruna ihtiyacımız var. Bunu üst seviyede nasıl gerçekleştirirdin?