Data Engineer
Hive nedir ve geleneksel ilişkisel veritabanlarından nasıl ayrılır?
SEÇİL * TABLO1'den AL t1 TABLO2'yi SOL JOIN ile t2 olarak ekle ON t1.date_start > t2.date_start --DML EĞER YOKSA Employee TABLOSU OLUŞTUR (id int, salary int, departmentId int); Employee Tablosuna Ekle (id,salary,departmentId) DEĞERLERİ (1, 70000, 1),(2, 94000, 1),(3, 85000, 1),(4, 80000, 2),(5, 60000, 2),(6, 62000, 3),(7, 90000, 3),(8, 94000, 3),(9, 94000, 3); cte ile as( seç *, rank() over(partition by departmentId order by salary desc) olarak max_salary Employee'den ) select * from cte where max_salary = 1
Hangi fiziksel JOIN'leri biliyorsun?
Airflow'da catchup/backfill sırasında yaklaşık 700 DAG çalışmasının aynı anda başlamasını nasıl önleyebilirsiniz?
ClickHouse'da hangi tablo motorlarını biliyor ve kullandınız?
[isim] sordu: Hangi sütunlar Nullable olmalı ve bunu DDL'de nasıl belirtmeliyim?
Greenplum hakkında bana anlat — veri depolama formatları, satır ve sütun depolama.
Bana anlat, kodlama dışında boş zamanlarında ne yapmaktan hoşlanırsın? Hobilerin nelerdir?
LEFT JOIN: 10 kayıtlı tablo ile 100 kayıtlı tablo arasında. Alınabilecek minimum ve maksimum satır sayısı nedir?
Veritabanı yönetim sistemleri ve sorgu optimizasyonu bağlamında istatistik nedir?
Greenplum'ta verileri hangi alanlara dağıttın?
-- İki veya daha fazla gün ardışık seyahat eden tüm yolcuları bulun
Airflow'da pipeline oluştururken, çöp veriler (geçersiz/saçma veriler) sorununu nasıl çözüyorlardı?
ClickHouse'ta JOIN nasıl çalışır?
RANK ile DENSE_RANK arasındaki fark nedir?
Hangi dağıtım türlerini kullandınız? Dağıtım anahtarını nasıl seçtiniz?
ORDER BY, ClickHouse tablosunu nasıl etkiler ve hangi anahtarlar daha iyi seçilir?
Lojistik şirketi için rapor Bir lojistik şirketinde analistsiniz ve depolardaki operasyonları kaydediyorsunuz. Her depo verimliliği hakkında bir rapor hazırlamanız gerekiyor. Her depo için hesaplayın: • toplam operasyon sayısı (count_operations); • depoda işlenen toplam ürün sayısı (sum_quantity); • sadece belirtilen zamanla (NULL olmayan) işlemleri dikkate alarak ortalama işlem süresi (avg_processing_time), en yakın tam sayıya yuvarlanmış; • bir işlemde işlenen maksimum ve minimum ürün sayısı (max_quantity, min_quantity); • her işlem türü için ayrı sütunlarda: tedarik işlemleri (supply_operations), sevkiyat işlemleri (shipment_operations), transfer işlemleri (transfer_operations). Toplam işlem sayısı 2'den fazla olan ve ortalama işlem süresi 60 dakikayı aşmayan depoları filtreleyin. Sonucu depo ID'sine göre artan sırayla sıralayın. Giriş formatı operations tablosu: • operation_id (int) — işlem kimliği • warehouse_id (int) — depo kimliği • operation_type (text) — işlem türü: «tedarik», «sevkiyat», «transfer» • quantity (int) — işlemdeki ürün adedi • operation_date (timestamp) — işlem tarihi ve saati • processing_time (int) — işlem süresi processing_time sütunu NULL değerler içerebilir. Çıkış formatı Sorgu, aşağıdaki sırayla alanlar içeren bir tablo döndürmelidir: • warehouse_id (int) — depo kimliği • count_operations (int) — depoda gerçekleştirilen toplam işlem sayısı • sum_quantity (int) — depoda işlenen toplam ürün sayısı • avg_processing_time (numeric) — işlem süresinin ortalaması (dakika cinsinden), sadece NULL olmayan işlemler dikkate alınarak, en yakın tam sayıya yuvarlanmış • max_quantity (int) — bir işlemde işlenen maksimum ürün sayısı • min_quantity (int) — bir işlemde işlenen minimum ürün sayısı • supply_operations (int) — «tedarik» türündeki işlem sayısı • shipment_operations (int) — «sevkiyat» türündeki işlem sayısı • transfer_operations (int) — «transfer» türündeki işlem sayısı
[isim] farklı veritabanı yönetim sistemleriyle çalışma deneyiminden, optimizasyon ve iç detaylarda ne kadar derinlemesine inceleme yapmak zorunda kaldığından bahsetti.
Müşterilerle client_id ve date_start (BETWEEN olmadan) ile işlemleri birleştirirseniz, sonuçta ne yakalanır?