Data Engineer
Net bir netlikte teknik şartnameye sahipken ad-hoc görevleriniz oldu mu ve ad-hoc taleplere ve öncelik değişikliklerine nasıl yaklaşıyorsunuz?
Sorgulama uzun sürdüğünde ve tam tarama yaptığında optimizasyon sorunlarını nasıl çözdünüz? Yeni böyle bir göreve nasıl yaklaşırdınız?
Ağ hakkında daha fazla bilgi ver: bu nedir ve neden önemlidir?
Spark bölümleri ve tabloların bölümleri (örneğin Iceberg'te) nasıl ilişkilidir?
ClickHouse'da DDL/CREATE TABLE ile ilgili hangi ek parametreleri biliyorsunuz, bunlar nelere etkiler ve hangi durumlarda kullanılırlar?
Airflow'da XCom kullanımının özellikleri nelerdir?
CSV format ailesi ne zaman kullanılabilir?
Pandas'ta tüm satırlara veya öğelere nasıl fonksiyon uygulanır?
PostgreSQL'de, işlemlerin performansını en düşük izolasyon seviyesinde optimize etmek gerekir ki: • paralel işlemler birbirlerinin tamamlanmamış değişikliklerini görebilsin; • "kirlilikli okuma" (dirty read) mümkün olsun. Bu hedefe ulaşmak için işlemin hangi izolasyon seviyesini belirtmesi gerekir? PostgreSQL'de dirty read mümkün değildir Repeatable Read Read Uncommitted Read Committed Serializable
Portal üzerinden dosya veya veri almak için FTP ile çalıştınız mı?
Uzman olarak bireysel mi yoksa geliştirici ekibiyle mi çalışmayı tercih edersin?
Partitioning nedir? Sharding nedir? Replikasyon nedir?
notifications tablosu, değerleri 'sent', 'delivered', 'read' olan bir alan içeriyor. Hangi sorgu doğrudur? select * from notifications where status like '%sent%' order by created_at desc limit 5 select * from notifications where status = 'read' order by created_at desc limit 5 select * from notifications order by status desc limit 5 select * from notifications where status not in ('sent', 'delivered') order by created_at asc limit 5 select * from notifications where status in ('sent', 'delivered') order by created_at desc limit 5
DBT'de başlatmalar nasıl orkestre edilir? Airflow kullanıyor musunuz?
Hangi veri kaynaklarıyla çalışabildiniz? Kaynaklarla etkileşim nasıl gerçekleşti?
Soru #3 Müşterilerin siparişleri arasındaki fark 60 günden fazla olan müşterileri bulmamız gerekiyor. Belirtilen müşteriler için maksimum farkı (gap_days) gösterin. Siparişler tablosu: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Sonuç: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Aşağıdaki sorgunun doğruluğu hakkında ne söylenebilir? select * from sessions where ended_at is null and status != 'pending';
[isim] sordu: Verilerin kümedeki tüm düğümlerde güncel kalması için tablo motoruna ne eklenmeli?
Verilen bir order dizisi, istenen karakter sırasını belirten bir dizidir. unsorted_str dizisindeki karakterleri, order dizisiyle uyumlu olacak şekilde yeniden düzenlemeniz gerekir. Her iki dizi de küçük harfli İngiliz alfabesi karakterlerinden oluşur, order dizisindeki tüm karakterler farklıdır. unsorted_str içindeki karakterlerin sırası, order dizisiyle tutarlı olarak adlandırılır, eğer order'da x karakteri y karakterinden önce geliyorsa, unsorted_str'de x'in her girişinin y'den önce olması gerekir. order'da unsorted_str'den karakterler olmaması veya tam tersi durumlar mümkündür. Herhangi bir geçerli permutasyonu döndürün. unsorted_str = "abcd" order = "cba" cevap = "dcba" ("cdba", "cbda", "cbad") def CustomSort(unsorted_str: str, order: str) -> str: # kod burada
Oracle'da bölümlendirme hakkında bilgi verin: neden kullanılır ve hangi türleri vardır?