Data Engineer
Kokius lentelių tipus naudojote Greenplum? Kokiais atvejais naudotas heap, o kokiais - Append-Optimized?
Ką norėtumėte daryti mūsų komandoje?
Kaip perduoti duomenis iš Greenplum ir Trino į ClickHouse?
Iceberg yra variklis, kuris leidžia S3 paversti duomenų baze, jis netgi laikosi ACID. Kuo jis neigiamas?
Kuo HDFS skiriasi nuo įprastų paskirstytų failų sistemų?
Papaskink man daugiau apie Spark: kas tiksliai buvo įgyvendinta, kokios metodikos buvo naudojamos
Ar indeksai visada gerina našumą, ar gali būti degradacija?
Kas yra mirusios eilutės duomenų bazėje?
Mums reikia pipeline variklio — mechanizmo, kuris leidžia labai greitai kurti srautus pateikiant sutartis ir parametrus. Kaip tai įgyvendintum aukštesniame lygyje?
Ar Greenplum'eje taikomas ACID?
Kokios yra ACID privalumai ir trūkumai, išskyrus skaitymo greitį?
Kuo skiriasi generatoriai nuo sąrašų Python?
Tai yra realiu laiku, kaip tai įgyvendinti tarp Kafka ir ClickHouse Spark?
Kaip ne nužudyti Jupyter ar Pandas dėl atminties?
Kas yra GIL (Global Interpreter Lock)?
Kaip peržiūrėti užklausos vykdymo planą Oracle? Kuo skiriasi EXPLAIN PLAN nuo EXPLAIN ANALYZE?
Koks yra tikslas duomenų skaidymo į blokus HDFS?
CTE daug atminties naudoja – kai turime didelį atminties suvartojimą, kas vyksta su duomenimis?
Kaip gerai pažįstate Python?
Kokius Airflow operatorius naudojote? Kaip bendradarbiavote su dbt per Airflow?