Šajā shēmā Trino ir atbildīgs par datu apstrādi — kā tehnoloģiju slānis ļauj atdalīt glabātuvi un aprēķinus?
Data Engineer
Vai Greenplum ievēro ACID?
Kādi procesi tiek uzsākti, kad dzēšam vai mainām ierakstus ClickHouse?
Kā atšķiras CTE no apakšvaicājuma?
Kā sadalīt pieprasījumu posmos? Ko darām tam?
Vai jūs zināt Rust valodā uzrakstītu daudzprocesuālu, ļoti ātru bibliotēku, kas var aizstāt Pandas?
Ar ar darba starpā, starp DAG — izmantojāt sensorus, lai tie viens pēc otra tiktu palaisti?
Kuras tehnoloģijas jūs izmantojāt, lai iegūtu un ielādētu datus Parquet, un kādi mehānismi tika izmantoti datu iegūšanai un ielādei?
Kā tu uzrakstīji Airflow DAG un uzdevumus: ar roku vai ar šabloniem?
Vai jūs ielādējāt datus no Spark uz S3 Parquet formātā, un pēc tam no Parquet uz Greenplum — kā notiek ielādes process?
Kā parasti tu veidoji datu bāzes shēmu — vai to darīji tieši datu bāzē ar rokām, vai skriptus glabāji kaut kur, vai vispār izmantoji Liquibase? Kāds bija process?
Vai esat strādājis ar Git? Ko glabājāt Git?
Ar straumēšanu Iceberg darbojās, dzirdēji? Tā ir atkritumu failu glabātuve.
Kā dati no ārējās tabulas tika ielādēti galamērķa tabulās?
Tas ir reāllaikā, kā to īstenot starp Kafka un ClickHouse Spark?
Vai ir jēga izmantot CTE, ja tā tiek izmantota tikai vienu reizi vaicājumā?
Vai jums nācās tieši strādāt ar Spark? Kāds ir tā trūkums?
Mums nepieciešams pipeline dzinējs — mehānisms, kas ļauj ļoti ātri veidot plūsmas, ievadot līgumus un parametrus. Kā tu to realizētu augstākā līmenī?
Mēs analizēsim JSON — kurš analizēs JSON? Cik zinu, ClickHouse nav funkciju.
Iceberg ir dzinējs, kas ļauj S3 pārvērst datu bāzē, tas pat ievēro ACID. Kāds ir tā trūkums?