Чӣ қадар бо Linux/Docker шинос ҳастед?
Data Engineer
Shuffle дар Spark чист ва барои чӣ лозим аст?
Чӣ гуна метавон shuffle-ро дар Spark идора кард (таҳзиб, пайвастшавии паҳнӣ ва ғайра)?
Формати Iceberg чӣ гуна дар муқоиса бо Parquet оддӣ меорад?
Оё шумо бо ифодаҳои умумии ҷадвалҳо (CTE) шиносед? Мисоли истифода диҳед.
Чӣ гуна дар Linux дар сутуни мушаххас дар файли лог (масалан, сана дар сутуни сеюм) зерсатрро ёфтан мумкин аст?
Статистика дар контексти системаи идоракунии маълумотҳо ва оптимизатсияи дархостҳо чист?
[ном] дар бораи таҷрибаи кор бо системҳои идоракунии маълумотҳои гуногун, ки чӣ қадар бояд дар оптимизатсия ва тафсилоти дохилӣ амиқтар шаванд, нақл кард.
Тафсилан алгоритми гирифтани иловаро аз манбаъро тавсиф кунед, то ҳеҷ чиз дар тағйири басомади боркунӣ гум нашавад.
Чӣ гуна ташкил кардан мумкин аст, ки як паёми Kafka-ро чанд истеъмолкунандагони гуногун хонанд (fan-out)?
Чӣ гуна масъалаи ҳалли вақте ки равандҳои хондан метавонанд ҳолати миёна (ғайриустувор) дар ҷадвалро дар вақти ETL-и бисёрмарҳилавӣ (delete+insert) дар Iceberg бубинанд?
Таврии "мёртвая кортежа" (dead tuple) чӣ аст?
Чӣ тавр муқоиса кардани ҷадвали асосӣ ("зинда") ва ҷадвали ҳадафӣ, агар манбаъ доимо тағйир ёбад?
Чӣ гуна тақсимотҳои Spark бо тақсимотҳо дар ҷадвалҳо (масалан, дар Iceberg) алоқаманданд?
Дар бораи беҳтарин амалҳо барои истифодаи индексҳо нақл кунед - кай ва чанд вақт онҳоро истифода бурдан лозим аст.
Spark JDBC чист ва чӣ гуна тавассути он як ҷадвали калонро самаранок боргирӣ кардан мумкин аст?
Чӣ тавр журнали транзаксия (WAL) дар системаи идоракунии маълумот ва барои чӣ лозим аст?
Чӣ гуна муайян кардани перекоси маълумот (data skew) дар Spark?
Омӯзиши усулҳои муқоисаи хеши сабтҳо барои ҳисоб кардани фарқият байни манбаъ ва ҷадвали ҳадаф истифода шуд?
Cache ва persist дар Spark барои чӣ лозим аст?