Data Engineer
Greenplum'taki MPP mimarisi'nin dezavantajları nelerdir?
Yukarı doğru uzatma nasıl yapılır (NULL'leri ters yönde önceki null olmayan değerle doldurun)?
Fiziksel bağlantı türleri (birleştirme yöntemleri) nelerdir?
Linux'ta belirli bir sütundaki log dosyasında alt dize nasıl bulunur (örneğin, üçüncü sütundaki tarih)?
ClickHouse'da veri silmenin hangi yöntemleri vardır?
HDFS'de verileri bloklara ayırmanın amacı nedir?
Okuma hızı dışında ACID'in hangi artı ve eksileri sayılabilir?
İzleme sadece REST isteklerini mi gösteriyor yoksa başka bir şey mi?
Jupyter veya Pandas'ı belleği nedeniyle nasıl öldürmezsiniz?
Greenplum bir OLTP mi yoksa analitik bir depo mu?
Greenplum'ta hangi tablo türlerini kullandınız? Hangi durumlarda heap, hangi durumlarda Append-Optimized kullanıldı?
Python'da jeneratörler ile listeler arasındaki fark nedir?
dbt'de hangi artımlı yükleme stratejilerini kullandınız?
İndeksler ne işe yarar, artıları ve eksileri nelerdir?
-- Orijinal stretch tablosu -- id bazında NULL olmayan önceki değerle NULL'leri doldurmak gerekiyor - aşağı doğru doldurma işlemi id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL sorgusu ile istenilen tabloyu almak SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
CI/CD ile nasıl çalıştınız?
Greenplum'ta hangi okuma türü kullanılır — satır mı yoksa sütun mu?
Veritabanında ölü satırlar nedir?
Partitioning ile sharding arasındaki fark nedir?
GIL (Global Interpreter Lock) nedir?