Արդյո՞ք Greenplum-ում պահպանվում է ACID-ը։
Data Engineer
Ի՞նչ գործընթացներ են սկսվում, երբ մենք հեռացնում կամ փոխում ենք գրառումները ClickHouse-ում:
Data Vault հարմար գործիք է, բայց օբյեկտները շատ են։ Կարող եք բացատրել հաբերի, լինքերի և սատելիտների տարբերությունը։
Նո՞ւյն եք գիտե՞լ Rust-ով գրված բազմատողային, շատ արագ գրադարան, որը կարող է փոխարինել Pandas-ին Data Science և Big Data-ի համար։
Ի՞նչ տարբերություն կա CTE-ի և ենթադրության միջև։
Ինչպե՞ս բաժանել հարցումը փուլերի: Ինչ ենք անում դրա համար:
Ի՞նչ տեխնոլոգիաներ եք օգտագործել տվյալները Parquet-ում լցնելու համար, և ինչ մեխանիզմներ են օգտագործվել տվյալները ստանալու և լցնելու համար։
Դուք տվյալներ եք բեռնել Spark-ից S3-ին Parquet ձևաչափով, ապա Parquet-ից Greenplum — բեռնման գործընթացը ինչպես է տեղի ունենում?
Ինչպե՞ս էին տվյալները արտաքին աղյուսակից բեռնվում նպատակային աղյուսակների մեջ։
Ինչպե՞ս գրել ես Airflow DAG-ը և աշխատանքները՝ ձեռքով կամ ձևանմուշներով:
Սթրիմինգով, Iceberg աշխատում էր, լսեցիր? Դա ֆայլերի աղբանոց է։
Դու աշխատե՞լ եք Git-ի հետ: Ի՞նչ եք պահում Git-ում։
Աշխատանքների միջև, DAG-ների միջև կախվածություններով — օգտագործե՞լ եք սենսորներ, որպեսզի նրանք մեկը մյուսի հետևից սկսվեն:
Ինչպե՞ս էր սովորական կերպով նախագծում ձեր տվյալների բազայի սխեման — ձեռքով բազայում, թե՞ սցենարները պահում էիք ինչ-որ տեղ, կամ ընդհանրապես Liquibase-ով աշխատում էիք, ինչ էր գործընթացը։
Սա իրական ժամանակ է, ինչպես իրականացնել դա Kafka և ClickHouse Spark միջև?
Արդյոք իմաստ ունի օգտագործել CTE, եթե այն օգտագործվում է միայն մեկ անգամ հարցումում?
Մենք JSON-ը կպարսենք — ով է պարսկելու JSON-ը: Ինչպես գիտեմ, ClickHouse-ում ֆունկցիաներ չկան։
Դուք պետք է ուղղակի աշխատեիք Spark-ով: Ի՞նչ է նրա թերությունը։
Iceberg-ը շարժական է, որը թույլ է տալիս S3-ը դարձնել տվյալների բազա, նույնիսկ պահպանում է ACID-ը: Ի՞նչ է դրա թերությունը։
Մենք պետք է ունենանք pipeline շարժիչ՝ մեխանիզմ, որը թույլ կտա շատ արագ ստեղծել հոսքեր՝ մատակարարելով պայմանագրեր և պարամետրեր։ Ինչպե՞ս կիրականացնեիր դա վերին մակարդակում։