Linux/Docker hakkında ne kadar bilgiye sahipsiniz?
Data Engineer
Spark'ta shuffle nedir ve neden gereklidir?
Spark'ta shuffle nasıl yönetilir (bölümlendirme, broadcast join vb.)?
Iceberg formatı, geleneksel Parquet'e göre ne getiriyor?
Ortak tablo ifadeleri (CTE) ile tanıyor musunuz? Bir kullanım örneği veriniz.
Linux'ta belirli bir sütundaki log dosyasında alt dize nasıl bulunur (örneğin, üçüncü sütundaki tarih)?
Veritabanı yönetim sistemleri ve sorgu optimizasyonu bağlamında istatistik nedir?
[isim] farklı veritabanı yönetim sistemleriyle çalışma deneyiminden, optimizasyon ve iç detaylarda ne kadar derinlemesine inceleme yapmak zorunda kaldığından bahsetti.
Kaynaktan artış yakalama algoritmasını, yükleme frekansı değiştirildiğinde hiçbir şeyin kaybolmaması için detaylandırın.
Kafka'dan aynı mesajın birkaç farklı tüketici tarafından okunmasını nasıl organize edilir (fan-out)?
Iceberg'te çok aşamalı ETL (delete+insert) sırasında okuma işleminin tablonun ara (tutarsız) durumunu görebileceği sorun nasıl çözülür?
"Ölü demet" (dead tuple) nedir?
Kaynak sürekli değişiyorsa, orijinal ("canlı") ve hedef tablolar nasıl karşılaştırılır?
Spark JDBC nedir ve büyük bir tabloyu onun üzerinden verimli bir şekilde nasıl yükleriz?
Spark bölümleri ve tabloların bölümleri (örneğin Iceberg'te) nasıl ilişkilidir?
İndekslerin en iyi kullanım uygulamaları hakkında bilgi verin - ne zaman ve ne sıklıkla kullanmalısınız.
Veritabanı Yönetim Sistemlerinde (DBYS) Transaction Log (WAL) nedir ve neden gereklidir?
Kayıtlardaki hash karşılaştırma yöntemi, kaynak ve hedef tablo arasındaki farkı hesaplamak için kullanıldı mı?
Spark'ta veri eğriliği (data skew) nasıl tespit edilir?
Spark'ta cache ve persist neden kullanılır?