Data Engineer
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 SEÇ a.num AS a_num, b.num AS b_num FROM t1 a SOL JOIN t2 b ON a.num = b.num;
Büyük tablolar yüklenirken (performans dışında) hangi belirgin olmayan sorunlar ortaya çıkabilir?
Spark hangi ortamda çalıştırıldı?
Trino gibi motorlar veya Spark'ta tablo formatları (Iceberg, Parquet) ile çalışma deneyiminiz var mı?
Çözümlediğiniz çoğaltma yapılandırma görevi hakkında bilgi verin.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
CI/CD süreçleri, veritabanındaki değişiklikler, sürüm kontrolü ve şema göçleri (şema evrimi) hakkında bana anlat.
Seni seyahat alanında ne çekiyor? Belki de kendin seyahat etmeyi seviyorsun ya da travel-tech sana bir şekilde ilgi çekti.
Dağıtık veritabanları (Greenplum, ClickHouse) ile çalışma deneyiminizden bahsedebilir misiniz?
Postgres'ten Data Lake'e büyük bir tablonun düzenli olarak esnek (değiştirilebilir) güncelleme sıklığıyla artımlı yüklenmesi için bir çözüm önerin.
Ve eğer bu tarihte işlem yapmamış olsalar bile tüm müşterilere ihtiyacımız varsa, bunu nasıl gösterebiliriz?
Spark'ta yeni bir Job oluşturmak için tetikleyici nedir ve Job nasıl Stages ve Tasks'a bölünür?
Veri vitrini nedir?
Spark SQL'de LEFT SEMI JOIN ve LEFT ANTI JOIN nedir, hiç kullandınız mı?
Kullanıcıdan gelen yapılandırılmamış bir istekten tamamlanmış görselleştirme paneline kadar tam döngü deneyiminiz oldu mu? Bu tür çalışmaları sever misiniz?
2021 ve 2022 yıllarında "İhtiyaç duyulan kategoriye ait ürünler" ve "sipariş sayısı" ile toplam sipariş ve ürün sayısını gösterin with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where (g.cat_1 = 'Giyim' and Year(o.order_date) = 2021) or (g.cat_1 = 'Ayakkabı' and Year(o.order_date) = 2022) group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte 2025 yılı için, her kategoriye göre satış adedine göre ilk 3 model with cte as( select cat_1, price, quantity, model, rank() over(partition by cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) 2025 yılı için, her kategoriye göre toplam satış tutarına göre ilk 3 model with cte as( select g.cat_1, g.model, (price * quantity), rank() over(partition by g.cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte as( select g.cat_1, g.model, sum(price * quantity) as sum_, rank() over(partition by g.cat_1 order by sum() desc) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte1 as( select g.cat_1, g.model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ), cte2 as(select g.cat_1, g.model, sum_total, rank() over(partition by g.cat_1 order sum_total desc) as rk from cte1 ) select g.cat_1, g.model, sum_total from cte2 where rk <=3 kategori adı, model ve toplam satış tutarını gösterin (en iyi 3) with cte1 as( select g.cat_1 as cat_name, g.model as model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 group by Year(o.order_date), g.model ), cte2 as(select cat_name, model, sum_total, rank() over(partition by cat_name order sum_total desc) as rk from cte1 ) select cat_name, model, sum_total from cte2 where rk <=3
Birden fazla indeks ekledikten sonra sorgu yine yavaşsa, hangi tanılama algoritması ve ne yapılmalı?
Monoton şekilde artan bir birincil anahtarla sürekli yeni kayıtlar gelen büyük PostgreSQL tablosunda ClickHouse'a veri yükleme nasıl organize edilir?
CDC nedir ve onunla çalışma deneyiminiz var mı?
Data Vault'ta sorguları optimize etmeyi tam olarak nasıl başardınız, çünkü genellikle join sayısını artırır?