Linux/Docker-мен жақсы таныссың ба?
Data Engineer
Spark-те shuffle дегеніміз не және ол не үшін қажет?
Spark-те shuffle-ды қалай басқаруға болады (бөлуді, broadcast қосылуды және т.б.)?
Iceberg форматы кәдімгі Parquet-ке қарағанда не әкеледі?
Сіз CTE (жалпы кесте өрнектері) туралы білесіз бе? Оның қолданылуына мысал келтіріңіз.
Linux-та лог файлының нақты бағанында (мысалы, үшінші бағанда күн) ішкі жолды қалай табуға болады?
DBMS және сұрау оптимизациясы контекстінде статистика ұғымы қандай?
[аты] әртүрлі дерекқор басқару жүйелерімен жұмыс істеу тәжірибесі туралы айтып берді, ол оңтайландыру мен ішкі құрылымдарды қаншалықты терең түсіну керек болды.
Жүктеу жиілігі өзгерген кезде ештеңе жоғалмайтындай етіп, көзден инкрементті ұстау алгоритмін егжей-тегжейлі сипаттаңыз.
Kafka-дан бір хабарламаны бірнеше тұтынушы (fan-out) қалай оқуға ұйымдастыруға болады?
Iceberg-те көп сатылы ETL (delete+insert) кезінде оқитын процесс кестенің аралық (бейтарап) күйін көруі мүмкін болса, оны қалай шешуге болады?
Мёртвая кортежа" (dead tuple) дегеніміз не?
Spark бөлімдері кесте бөлімдерімен қалай байланысты (мысалы, Iceberg-те)?
Бастапқы ("тірі") және мақсатты кестелерді қалай салыстыруға болады, егер дерек көзі үнемі өзгеріп отырса?
Индекстерді қолданудың ең жақсы тәжірибелері туралы айтыңыз - қашан және қанша жиі қолдану керек.
Spark JDBC дегеніміз не және үлкен кестені арқылы оны қалай тиімді жүктеуге болады?
Spark-те деректердің бұрмалануын қалай анықтауға болады?
DBMS-те транзакциялар журналы (WAL) не және ол не үшін қажет?
Деректердің хэштерін салыстыру әдісі көзден және мақсатты кестелер арасындағы айырмашылықты есептеу үшін қолданылды ма?
Spark-те cache және persist не үшін қажет?