Data Engineer
API dan tashqari, ma'lumot manbalar bilan ishlash uchun qanday usullar va protokollarni ishlatdingiz?
Ma'lumotlar sifatiga bo'lgan tushunchangiz haqida gapiring — bu sohada ishlash tajribangiz bormi?
Sizning korporativ AI yechimlaringizda qanday agentlar va modellardan foydalaniladi? U siz uchun kod yozadimi?
Spark'da cache va persist nima uchun kerak?
DAG-larni qanday ishga tushirdingiz: cron, datasetlar, triggerlar yoki bog'liqliklar bo'yicha?
clickhouse_driverni import qilish from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Qaysi Spark JDBC parametrlari o'qishni parallel qilish uchun ishlatilgan?
CROSS JOIN nima va uning natijasini qanday bo'lishi?
Qaysi yo'nalishda rivojlanish qiziqarli bo'lardi: vitrinlar, rivojlanish, tahlil, ehtimol AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 Tanlang a.num Kimi a_num, b.num Kimi b_num t1 dan a Chap JOIN t2 b ON a.num = b.num;
Katta jadvallarni yuklashda (ishlashdan tashqari) qanday ko'rinmas muammolar yuzaga kelishi mumkin?
Oyna funksiyasi SUM() OVER (PARTITION BY user_id) — bir holatda xarid qilish sanasiga ORDER BY qo'shamiz, boshqasida qo'shmaymiz. Farqi nima?
Umuman olganda, Data Vault sizga nima uchun kerak edi?
Parquet qanday saqlash turi: satr yoki ustun?
Siz hal qilgan replikatsiya sozlash vazifasi haqida gapiring.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
CI/CD jarayonlari, ma'lumotlar bazasidagi o'zgarishlar, versiyalash va sxema migratsiyalari (sxema evolyutsiyasi) haqida gapir.
Sizni travel sohasiga nima jalb qilmoqda? Ehtimol, siz o'zingiz sayohat qilishni yaxshi ko'rasiz yoki travel-tech sizni qandaydir tarzda qiziqtirdi.
Tarqalgan ma'lumotlar bazalari (Greenplum, ClickHouse) bilan ishlash tajribangiz haqida gapirib bering.
Postgresdan Data Lake'ga katta jadvalni moslashuvchan (o'zgartiriladigan) yangilash chastotasi bilan muntazam inkremental yuklash uchun yechim taklif qiling.