Data Engineer
Greenplum'ta MPP архитектурасынын кемчиликтери кандай?
HDFS-деги файлды, мисалы Parquet, кантип окуйт — толугу мененби же блокторго бөлүнгөнбү?
Python колдонуп ZIP ичиндеги чоң XML файлдарды кантип талдап, ClickHouseка жүктөөгө болот?
Алыстагы тармактан ишти кантип калыбына келтирсе болот, эгер сиз `git checkout hotfix/missing-footer` деп аракет кылганда тармак табылбаганын билдирген катаны алсаңыз?
YARN деген эмне жана ал эмне үчүн керек?
HDFS башка бөлүштүрүлгөн файл системдеринен эмнеге айырмаланат?
UNION жана UNION ALL ортосунда кандай айырма бар? Канча шарттар аткарылышы керек?
Merge Join (жыйындысы менен бириктирүү) кантип иштейт?
Индекстер эмне үчүн керек, алардын артыкчылыктары жана кемчиликтери кандай?
Бул реал убакыт, аны Kafka жана ClickHouse Spark ортосунда кантип ишке ашыруу керек?
Трассировка гана REST-сурамдарды көрсөтөбү же башка нерсе?
Аналитикалык функциялар (терезе функциялары) кандай иштеди?
Өзүңүз жөнүндө айтып бер — иш тажрыйбасы, технологиялар стеги
ACIDтин окулуш ылдамдыгынан башка кандай артыкчылыктар жана кемчиликтер бар?
Airflow операторлору кандай колдондуңуз? Airflow аркылуу dbt менен кандай иштештиңиз?
Суроо боюнча, биз маалыматтар менен эмне болуп жатканын көрө алабыз, кайсы түрдөгү кошулмалар — кайсы түрдөгү кошулмаларды биз ошол жерден көрө алабыз?
Hive-деги бөлүү кандай иштейт жана ал файлдык системада кандайча физикалык түрдө көрсөтүлгөн?
Greenplumда кайсы түрдөгү таблицаларды колдондуңуз? Канча учурда heap, канча учурда Append-Optimized колдонулду?
Физикалык байланыштардын (бириктирүү ыкмаларынын) кайсылары бар?
Неге кийинки суроо индекс колдонбойт, эгер records таблицасында (id) жөнөкөй B-Tree индекси түзүлгөн болсо? select * from records where id % 2 = 0 - Id үчүн GIN түрү индекси керек - Индекстер WHERE шарттарында колдонулбайт - % салыстыру операциясы, фильтр эмес - limit жана offset индекстин оптимизациясы үчүн милдеттүү - Суроо сандык талаага кайрылат, текст эмес