İndeks nedir? Küme indeks ile kümelenmemiş indeks arasındaki fark nedir?
Data Engineer
Spark mimarisinin genel hatlarıyla nasıl yapılandırıldığını anlatın: hangi bileşenler var ve SQL sorgusu yürütülürken nasıl etkileşime girerler.
find_mode fonksiyonu [1, 2, 3, 3, 4, 5] listesi için ne döndürür? Adım adım anlat.
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 SEÇ a.num AS a_num, b.num AS b_num FROM t1 a SOL JOIN t2 b ON a.num = b.num;
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Parquet dosyasının yapısında Satır Grubu ne işe yarar?
Eğer WHERE (sol JOIN'den sonra) işlem tarihi filtresi koyarsak, bu ilk tablodaki (müşteriler) sonucu kısıtlar mı?
Partitioning ile sharding arasındaki fark nedir?
Parquet depolama formatı ile CSV arasındaki fark nedir?
Bana sistem analisti olarak nerede çalıştığını ve hangi görevleri yerine getirdiğini anlat.
## mod hakkında soru # Bir sayı listesi var. Bu listenin modunu bulan bir fonksiyon yazın. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Spark'ta yeni bir Job oluşturmak için tetikleyici nedir ve Job nasıl Stages ve Tasks'a bölünür?
Veri kalite kontrollerini kendiniz mi yapıyordunuz yoksa gereksinimler iş/müşteri tarafından mı geliyordu?
PENCERELİK SINIRSIZ ÖNCE NE ANLAMA GELİR?
Greenplum'ta dağıtım alanını nasıl doğru belirlenir? Motion sırasında ne olur?
İşlem tablosu ile takvim tablosunun tarih <= tarih koşuluyla birleştirilmesinde hangi fiziksel JOIN mekanizması kullanılacaktır?
Veri geçmişi saklama yöntemleri (türleri) nelerdir? Tablolarda tarih nasıl birikir?
Sadece başlangıç tarihi bilinen müşterilerin son tam adını nasıl çıkarılır, bitiş tarihi bilinmiyor mu?
Spark'ta AQE (Uyarlanabilir Sorgu Yürütmesi) optimizasyoncusu ile çalıştınız mı? Nasıl çalıştığını biliyor musunuz?
Neden yeni bir iş arıyorsun ve gelecekte ne yapmak istiyorsun?