Linux/Docker менен канчалык жакшы тааныссыз?
Data Engineer
Sparkтеги shuffle эмне жана ал эмне үчүн керек?
Spark'ta shuffle кандай башкарылат (бөлүштүрүү, broadcast join жана башка)?
Iceberg форматы обычный Parquetке салыштырганда эмне алып келет?
Кеңири таблицалардын жалпы билдирүүлөрү (CTE) менен таанышыңызбы? Колдонуу мисалын келтірүңүз.
Маалыматтар базасын башкаруу системалары жана суроолорду оптималдаштыруу контекстинде статистика эмне?
Linuxта лог файлынын белгилүү бир баганасынан субсөздү кантип табуу керек (мисалы, үчүнчү баганада датаны)?
[аты] ар кандай маалымат базасын башкаруу системаларында иштеген тажрыйбасы, оптимизация жана ички деталдарга канчалык терең кириш керектиги тууралуу айтып берди.
Kafka-дан бир эле билдирүүнү бир нече ар башка керектөөчүлөрдүн окулушун кантип уюштурууга болот (fan-out)?
Iceberg'te көп баскычтуу ETL (delete+insert) учурунда окуу процесси таблицанын аралык (үйлесимдүү эмес) абалын көрө алса, бул маселени кантип чечсе болот?
Багыттан инкрементти кармоо алгоритмин кеңири сүрөттөп бериңиз, жүктөө ылдамдыгын өзгөртүп жатканда эч нерсе жоголбошу үчүн.
Эмне үчүн негизги («живая») жана максаттык таблицаны салыштыруу керек, эгерде булагы дайым өзгөрүп турса?
"Өлгөн кортеж" (dead tuple) деген эмне?
Spark бөлүмдөрү жана таблицалардагы бөлүмдөр (мисалы, Icebergте) кандайча байланыштуу?
Индекстерди колдонуу боюнча эң жакшы практика жөнүндө айтып бериңиз - качан жана канча убакыт колдонуш керек.
Spark JDBC эмне жана анын аркылуу чоң таблицаны натыйжалуу жүктөө кандай?
Sparkта маалыматтардын бурмалануусун (data skew) кантип аныктоо керек?
DBMSтеги транзакция журналы (WAL) эмне жана ал эмне үчүн керек?
Жазуулардын хештерин салыштыруу ыкмасы колдонулду беле, бу менен булак жана максат таблицасынын ортосундагы айырманы эсептөө үчүн?
Spark'ta cache жана persist эмне үчүн керек?