Data Engineer
Kokios yra MPP architektūros trūkumai Greenplum'e?
Kaip padaryti aukštyn pratęsimą (NULL užpildyti ankstesne ne nuline verte atvirkštine kryptimi)?
Kokie yra fizinių jungčių (jungimo metodų) tipai?
Kaip Linux'e rasti eilutės dalį konkrečioje log failo stulpelyje (pavyzdžiui, datą trečiame stulpelyje)?
Kokie būdai yra duomenų šalinimui ClickHouse?
Koks yra tikslas duomenų skaidymo į blokus HDFS?
Kokios yra ACID privalumai ir trūkumai, išskyrus skaitymo greitį?
Ar trasa rodo tik REST užklausas ar kažką kitą?
Kaip ne nužudyti Jupyter ar Pandas dėl atminties?
Ar Greenplum yra OLTP ar analitinis saugykla?
Kokius lentelių tipus naudojote Greenplum? Kokiais atvejais naudotas heap, o kokiais - Append-Optimized?
Kuo skiriasi generatoriai nuo sąrašų Python?
Kokias inkrementinio įkėlimo strategijas naudojote dbt?
Kam reikalingi indeksai, kokie yra jų privalumai ir trūkumai?
-- Pradinė stretch lentelė -- Reikia užpildyti NULL reikšmes ankstesne (ne NULL) reikšme pagal id - atlikti užpildymą žemyn id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | NULL 1 | 16:12 | NULL 2 | 09:42 | 133 2 | 15:20 | NULL 2 | 21:33 | NULL 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | NULL 3 | 16:17 | NULL 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | NULL 4 | 16:31 | 7 4 | 17:44 | NULL id | ttime | val ---|-------|----- 1 | 07:30 | NULL 1 | 09:21 | 10 1 | 13:53 | 10 1 | 16:12 | 10 2 | 09:42 | 133 2 | 15:20 | 133 2 | 21:33 | 133 3 | 08:01 | NULL 3 | 11:41 | 8 3 | 14:23 | 8 3 | 16:17 | 8 3 | 19:54 | 2 4 | 13:10 | 312 4 | 14:42 | 312 4 | 16:31 | 7 4 | 17:44 | 7 -- SQL užklausa norimai lentelei gauti SELECT id, ttime, COALESCE(val, LAST_VALUE(val) OVER(PARTITION BY id ORDER BY ttime)) as val FROM stretch
Kaip dirbote su CI/CD?
Kokio tipo skaitymas naudojamas Greenplum: eilutės ar stulpelio?
Kas yra mirusios eilutės duomenų bazėje?
Kuo skiriasi partizavimas nuo sharding'o?
Kas yra GIL (Global Interpreter Lock)?