Data Engineer
Manbadan iste'molchigacha bo'ylab liniyani qurildingizmi?
Trino kabi dvigatlar yoki Sparkda jadval formatlari (Iceberg, Parquet) bilan ishlash tajribangiz bormi?
Yozuvlar hashlarini taqqoslash usuli manba va maqsad jadvali orasidagi farqni hisoblash uchun qoʻllanildimi?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Nima uchun bool([""]) True qaytaradi?
# nima chiqaradi s = 'Abracadabra' print(s[5][0]) b = 'a' b[0] print(s[::2]) s = [1, 2, 3] print(s * 2)
Agar bizga barcha mijozlar kerak bo'lsa, hatto ular bu sanada tranzaksiya qilmagan bo'lsa, uni qanday chiqaramiz?
Sparkda yangi Job yaratish uchun nima trigger bo'ladi va Job qanday qilib Stages va Tasks ga bo'linadi?
Python'da o'zgaruvchan va o'zgarmas ma'lumot turlari haqida gapiring va misollar keltiring.
Sizning lakehouse qaysi texnologiyalarga asoslangan va Apache Iceberg bilan ishlashda qanday muammolar yuzaga keladi?
Qanday qilib kodda qiymatning odatiy (kutilyotgan) taqsimotdan sezilarli darajada farq qilayotganligini tekshirishni tasvirlaysiz?
S3 yagona asosiy saqlash joyimi yoki bir nechta foydalanildimi?
Nima uchun hozir yangi takliflarni ko'rib chiqyapsiz?
So'nggi yilda Python'da eng muhim loyiha yoki vazifa haqida gapiring.
Bir nechta indeks qo'shilgandan so'ng so'rov hali ham sekin bo'lsa, qanday tashxis algoritmi va nima qilish kerak?
Monoton ravishda o'sib borayotgan birlamchi kalit bilan doimiy ravishda yangi yozuvlar keladigan katta PostgreSQL jadvalida ClickHouse ga ma'lumotlarni qanday yuklashni tashkil qilish mumkin?
Linuxda fayllarga kirish huquqlarini o'zgartiradigan buyruq nima?
Menga, tizim tahlilchisi sifatida qayerda ishlaganingiz va qanday vazifalarni bajarganingiz haqida aytib bering.
Siz Airflow'da XCom'dan foydalanganmisiz?
API dan tashqari, ma'lumot manbalar bilan ishlash uchun qanday usullar va protokollarni ishlatdingiz?