Data Engineer
Toplamda Spark ile ne kadar süre çalıştınız ve ne kadar derinlemesine dahil oldunuz?
Veri kalitesi riskleri nelerdir?
Airflow'da depends_on_past parametresi ne yapar?
Kayıtlardaki hash karşılaştırma yöntemi, kaynak ve hedef tablo arasındaki farkı hesaplamak için kullanıldı mı?
`s ** 2` ifadesini `s = [1, 2, 3]` listesine uyguladığınızda ne olur?
ETL ve ELT yaklaşımlarını karşılaştırın: fark nedir ve her biri ne zaman kullanılır?
Hangi dosya formatlarıyla çalıştınız?
Spark'ta spill hakkında ne biliyorsun?
Spark'ta hangi fiziksel JOIN türleri vardır?
Veriler neden kaybolabilir? Birkaç neden belirt.
Kendinizden bahsedin: deneyimler, görevler, özellikler veya gurur duyduğunuz başarılar.
FastAPI ile ilgili deneyiminiz var mı?
Monoton şekilde artan bir birincil anahtarla sürekli yeni kayıtlar gelen büyük PostgreSQL tablosunda ClickHouse'a veri yükleme nasıl organize edilir?
Hangi Python kütüphaneleriyle çalıştınız?
Greenplum ile çalışırken hangi sorunlarla karşılaştınız?
Spark'ta tembel işlemler nedir ve ne işe yararlar?
Hangi durumda sözlükte arama en kötü duruma kadar gerileyebilir?
ACID ile CAP teoremi arasındaki fark nedir?
1C ile nasıl çalıştılar: verileri doğrudan veritabanından mı alıyorlardı, yoksa bir iletişim hattı veya başka bir yöntemle mi?
Hangi veritabanlarıyla çalıştınız? MongoDB nasıl çalışır ve nasıl ölçeklenir?