Data Engineer
Greenplum-те қандай кесте түрлерін қолдандыңыз? Heap қашан қолданылды, ал Append-Optimized қашан?
Біздің командада не істегіңіз келеді?
Greenplum және Trino деректерін ClickHouse-қа қалай жеткізуге болады?
Iceberg — бұл S3-ті дерекқорға айналдыруға мүмкіндік беретін қозғалтқыш, ол тіпті ACID-ке сай келеді. Оның кемшілігі неде?
HDFS кәдімгі таралған файл жүйелерінен қалай ерекшеленеді?
Spark туралы толығырақ айта аласыз ба: нақты не жүзеге асырылды, қандай әдістер қолданылды?
Индекстер әрқашан өнімділікті арттыра ма, әлде деградацияға әкелуі мүмкін бе?
Деректер қорындағы өлі жолдар дегеніміз не?
Бізге pipeline engine керек — бұл механизм, ол арқылы келісімшарттар мен параметрлерді енгізу арқылы ағындарды өте тез құруға болады. Сен оны жоғарғы деңгейде қалай жүзеге асырар едің?
Greenplum-да ACID сақтала ма?
ACID-тың оқу жылдамдығынан басқа қандай артықшылықтары мен кемшіліктері бар?
Python-да генераторлар мен тізімдер қалай ерекшеленеді?
Бұл нақты уақыт режимі, Kafka мен ClickHouse Spark арасында қалай қосылуды жүзеге асыру керек?
Jupyter немесе Pandas-ты жадпен өлтірмеу үшін қалай?
GIL (Global Interpreter Lock) дегеніміз не?
Oracle-да сұраудың орындалу жоспарын қалай көруге болады? EXPLAIN PLAN мен EXPLAIN ANALYZE қалай ерекшеленеді?
HDFS-те деректерді блоктарға бөлу мақсаты неде?
CTE-де жадының жоғары тұтынуы кезінде деректерге не болады?
Python-ды қаншалықты жақсы білесіз?
Airflow операторларын қайсысын қолдандыңыз? Airflow арқылы dbt-пен қалай өзара әрекеттестіңіз?