Vazifa #2 Har bir bo‘limda eng yuqori maosh oladigan TOP-3 xodimlarni ko‘rsatuvchi so‘rov yozing. Bo‘lim nomi, xodim nomi va uning maoshini ko‘rsating. employee jadvali: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | department jadvali: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Natija: department_name, num, employee_name, salary cte sifatida: select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
Moslashuvchan So'rovni Ishga Tushirish (AQE) nima?
ACID va CAP nazariyasi orasidagi farq nima?
Qanday bosqichlardan iborat tranzaksiya?
Natijaviy natija: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | with cte as( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) as prev_order_ft, datediff(day, prev_order_ft, order_dt) as gap_days from Orders ) select customer_id, max(gap_days) as gap_days from cte where gap_days > 60 group by customer_id
Python'da dekoratorlar bilan ishlaganmisiz? Ular nima va qayerda qo'llaniladi?
Qaysi holatda lug'at bo'yicha qidiruv eng yomon holatga tushishi mumkin?
Spark'da shuffle xavfi nima?
Python'da o'zgaruvchan va o'zgarmas ma'lumot turlari haqida gapiring va misollar keltiring.
Broadcast Join'dan foydalanishni belgilovchi parametrlar va hintlar bilan ishladingizmi?
Odatiy ravishda pipeline'larda xatoliklar va ogohlantirishlarni qanday boshqargansiz?
Savol #1 Id atributi bo‘yicha ikkita jadvalni birlashtirganda inner, left, right, full join bilan qaysi yozuvlar soni qaytariladi? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Spark'da sustli va darhol hisoblashlarni tushuntiring.
Tarmoq haqida batafsilroq aytib bering: bu nima va nima uchun muhim?
Ma'lumotlar sifatining xavflari qanday?
Airflow'da catchup/backfill vaqtida taxminan 700 DAG ishini bir vaqtning o'zida boshlashdan qanday qochish mumkin?
Nima uchun bool([""]) True qaytaradi?
Spark/UDF kontekstida serializatsiya va deserializatsiya haqida nima bilasiz?
Spark'da repartition va coalesce o'rtasidagi farq nima?
Ma'lumotlarning texnik va biznes tekshiruvlarini qanday ajratasiz, va ular uchun talablarni kim belgilashi kerak?