Data Engineer
Жогорго узартууну кантип жасоого болот (NULL-дарды тескерисинче багытта мурдагы нөл эмес мааниге толтуруу)?
Pythonдеги генераторлор менен тизмелердин айырмасы эмнеде?
Индекстер эмне үчүн керек, алардын артыкчылыктары жана кемчиликтери кандай?
HDFSте маалыматтарды блокторго бөлүүнүн мааниси эмнеде?
Greenplum'ta MPP архитектурасынын кемчиликтери кандай?
Greenplum OLTPпи же аналитикалык сактагычпы?
WHERE жана HAVING ортосунда кандай айырма бар?
Кайсы JOIN түрлөрүн билесиң? (логикалык)
Airflow операторлору кандай колдондуңуз? Airflow аркылуу dbt менен кандай иштештиңиз?
Трассировка гана REST-сурамдарды көрсөтөбү же башка нерсе?
Jupyter же Pandas-ты эс тутуму менен өлтүрбөстөн кантип сактануу керек?
Greenplumта кайсы окуу түрү колдонулат: саптык же баганалык?
Greenplumта ACID сакталабы?
-- Баштапкы stretch таблицасы -- id боюнча NULL эмес алдынкы маанини толтуруу керек - төмөндө кеңейтүү id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL суроо талапталган таблицаны алуу үчүн SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
GIL (Global Interpreter Lock) эмне?
Маалыматтар базасындағы өлгөн саптар эмне?
Партициялоо менен шарддоо кандай айырмаланат?
ACIDтин окулуш ылдамдыгынан башка кандай артыкчылыктар жана кемчиликтер бар?
dbt-деги инкрементал жүктөө стратегияларын кайсынысы колдондуңуз?
Индекстер дайым иштегечти жакшыртабы, же деградацияга алып келеби?