Data Engineer
Spark JDBC-да оқуды параллелдеу үшін қандай параметрлер қолданылды?
Қай бағытта даму қызықты болар еді — бақылау тақталары, әзірлеу, аналитика немесе мүмкін AI?
-- t1 -- сан --------- -- 1 -- 2 2 null null 4 -- t2 -- сан --------- -- [телефон] null null 5 ТАҢДАУ a.num AS a_num, b.num AS b_num FROM t1 a LEFT JOIN t2 b ON a.num = b.num;
Үлкен кестелерді жүктегенде (өнімділіктен басқа) қандай байқалмайтын мәселелер туындауы мүмкін?
Терезе функциясы SUM() OVER (PARTITION BY user_id) — бір жағдайда сатып алу күнін сұрыптау қосылады, басқа жағдайда қосылмайды. Айырмашылығы неде?
Сіздің dbt модельдеріңіз қалай құрылымдалған және бірнеше дереккөзден Trino арқылы деректер базасын қалай жинайсыз?
Parquet қандай сақтау түрін пайдаланады: жол негізделген немесе баған негізделген?
Жобаңызда қандай архитектура болды? DWH немесе басқа бір нәрсе?
Неге bool([""]) шын мәнінде True қайтару керек?
Таралған дерекқорлармен (Greenplum, ClickHouse) жұмыс тәжірибеңіз туралы айтыңыз.
Postgres-тан Data Lake-ке үлкен кестені өзгермелі (өзгермелі) жаңарту жиілігімен тұрақты инкременттік жүктеу тапсырмасына шешім ұсыныңыз.
Егер бізге барлық клиенттер керек болса, тіпті оларда сол күні транзакциялар болмаса — оны қалай көрсетуге болады?
Spark-те жаңа Job-ты құруға не әсер етеді, және ол қалай Stage-тарға және Tasks-тарға бөлінеді?
Spark SQL-да LEFT SEMI JOIN және LEFT ANTI JOIN дегеніміз не, қолдандың ба?
Сіздің lakehouse қай технологиялар негізінде салынған және Apache Iceberg-пен жұмыс істегенде қандай мәселелер туындайды?
Apache Spark-те RDD деген не және ол басқа Spark абстракцияларынан қалай ерекшеленеді?
Пайдаланушының құрылымсыз сұрауынан бастап дайын визуализация панеліне дейін толық циклдік тәжірибеңіз бар ма? Мұндай жұмысты ұнатасыз ба?
Data Vault сұрауларын қалай оңтайландыруға болды, себебі ол әдетте қосылулар санын арттырады?
Airflow-те XCom-ды қолдандыңыз ба?
Нормализация және ER моделі дегеніміз не, олар не үшін қажет?