Görev #2 Her departmanındaki en yüksek maaş alan ilk 3 çalışanı gösteren sorgu yazın. Departman adını, çalışanın adını ve maaşını gösterin. employee tablosu: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department tablosu: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Çıktı: department_name, num, employee_name, salary cte olarak: select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
Uyarlanabilir Sorgu Yürütme (AQE) nedir?
ACID ile CAP teoremi arasındaki fark nedir?
Sonuç: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | with cte as( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) as prev_order_ft, datediff(day, prev_order_ft, order_dt) as gap_days from Orders ) select customer_id, max(gap_days) as gap_days from cte where gap_days > 60 group by customer_id
Bir işlem hangi aşamalardan oluşur?
Spark'ta shuffle'ın tehlikesi nedir?
Python'da dekoratörlerle çalıştınız mı? Bunlar nedir ve nerelerde kullanılırlar?
Hangi durumda sözlükte arama en kötü duruma kadar gerileyebilir?
Python'da değiştirilebilir ve değiştirilemez veri tipleri hakkında bilgi verin ve örnekler verin.
Broadcast Join kullanımını belirleyen parametreler ve ipuçlarıyla çalıştınız mı?
Ağ hakkında daha fazla bilgi ver: bu nedir ve neden önemlidir?
Pipeline'larda hataları ve uyarıları genellikle nasıl ele alıyordunuz?
Airflow'da catchup/backfill sırasında yaklaşık 700 DAG çalışmasının aynı anda başlamasını nasıl önleyebilirsiniz?
Spark'ta tembel ve anlık hesaplamaları açıklayın.
Soru #1 İki tabloyu id özniteliğine göre birleştirdiğinde inner, left, right, full join ile kaç kayıt döner? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Veri kalitesi riskleri nelerdir?
Spark/UDF bağlamında serileştirme ve deserialize hakkında ne biliyorsun?
Join yürütme için hangi fiziksel stratejileri biliyorsunuz?
Veri teknik ve iş verisi kontrollerini nasıl ayırt ediyorsun ve bunlar için kim gereksinimleri belirlemeli?
Neden bool([""]) True döndürür?