Маалымат витриналары (DWH катмары) менен иштедиңизби?
Data Engineer
Кайсы маянага ишенесиз?
T1 (10 сап) жана T2 (5 сап) таблицалары бар, экөдөсүндө да ID талаа бар. Бул таблицаларды INNER JOIN жана LEFT JOIN кылганда чыгышта максимум жана минимум саптар канча болушу мүмкүн?
Неге азыр жаңы жумуш издеп жатасың, жумушуңду алмашкың келеби?
Кайсы JOIN түрлөрүн билесиң? (логикалык)
Эгер транзакцияларды клиенттер менен client_id жана date_start боюнча (BETWEENсиз) бириктирсеңиз, натыйжада эмне болот?
CROSS JOIN деген эмне? Мындай иштедиңби?
Sparkта бир эле Parquet файлынан маалыматтарды параллелдүү окуу мүмкүнбү, же бир гана ядро менен бир тапшырмадабы?
Маалыматтардын сапаты менен байланыштуу эң маанилүү бир нече тапшырмаларыңыз жөнүндө айтып бериңиз.
Төрт жана баганалардын маалымат базаларынын артыкчылыктары жана кемчиликтери эмне? Групптоо жана жыйынтыктоо үчүн кайсысы натыйжалуураак?
Өзүңүз жөнүндө айтып бер — иш тажрыйбасы, технологиялар стеги
Терезе функцияларын мүмкүн болушунча кеңири түрдө сүрөттөп бериңиз: кайсы ачкыч сөздөр колдонулат жана ар биринин милдети эмне.
Эгерде executor'де 10 ядро болсо, бир убакта канча Tasks параллель ишке ашырылат?
-- Берилген таблица numbers бир колонка менен, аты num (түз сандар, кайталанышы мүмкүн). -- Сантарды эки колонкага бөлгөн SQL суроосун жазгыла: -- even – жуп сандар (өсүү тартибинде) -- odd – так сандар (өсүү тартибинде) -- Сантар сап-са сап жайгаштырылышы керек: биринчи сапта – биринчи жуп жана биринчи так, -- экинчи сапта – экинчи жуп жана экинчи так жана т.т. -- Эгер бир топто башка топко караганда көбүрөөк сандар болсо, жетишпеген орундар NULL болушу керек. -- баштапкы таблица -- num -- --------- -- [phone] -- суроонун жыйынтыгы -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Маалыматтын сапаты жөнүндө түшүнүгүңүз тууралуу айтып бериңиз — бул тармакта иш тажрыйбаңыз барбы?
Nested Loop Join кантип иштейт жана анын алгоритмдик татаалдыгы кандай? Үч алгоритмдин татаалдыгы кандай?
Индекс деген эмне? Кластерленген индекс менен кластерленбеген индекс кандай айырмаланат?
Кайсы физикалык JOINдерди билесиз?
Spark архитектурасынын түзүлүшү жөнүндө жалпы түшүндүрүңүз: кайсы компоненттер бар жана алар SQL суроо-талапты аткарууда кандайча өз ара аракеттенет.
Кай жакка өнүгүү кызыктуу болмок: витриналар, өнүктүрүү, аналитика, балким AI?