Պատմեք ռեպլիկացիայի կարգավորման խնդիրն մասին, որը դուք լուծել եք։
Data Engineer
Ի՞նչ է նորմալիզացիան և ER մոդելը, ինչու են դրանք անհրաժեշտ:
Ինչպես խուսափել/հեռացնել տվյալների կողմնապահությունը Spark-ում?
Որ դեպքերում է կիրառվում նորմալիզացիան և որ դեպքերում՝ դենորմալիզացիան:
Ի՞նչ ախտորոշման ալգորիթմ և ինչ անել, եթե հարցումը դեռևս դանդաղ է մի քանի ինդեքսներ ավելացնելուց հետո։
Պատմեք Kafka-ի հիմնական հասկացությունների մասին (օգտագործողների խումբ, բաժիններ, թեմաներ):
Ի՞նչ են սովորական պատճառները, որ ռելացիոն տվյալների բազայում հարցումը աշխատում է դանդաղ։
Ի՞նչ աննկատ խնդիրներ կարող են առաջանալ մեծ աղյուսակների բեռնումիս (բացի կատարողականությունից):
Ներկայացրեք լուծում մեծ աղյուսակի կանոնավոր ինկրեմենտալ բեռնման համար՝ ճկուն (փոփոխվող) թարմացման հաճախականությամբ՝ Postgres-ից Data Lake։
Ինչպե՞ս են կապված պատուհանի ֆունկցիայի ներսում դասավորումը և հարցումում վերջնական ORDER BY դասավորումը։
Ինչպես կառավարել Spark հավելվածի ռեսուրսները, որպեսզի փոփոխության ժամանակ չծախսենք ավելին հիշողություն՝ մուտքային տվյալների ծավալը փոխելիս?
Ինչպես աշխատել բաժինների հետ coalesce և repartition միջոցով։
Որ Docker պատկերները պետք է կառուցեիք և ինչու՞:
Կա՞ն այլ մեխանիզմներ shuffle- ի կառավարումից բացի coalesce/repartition- ից։
Որոնք Spark JDBC պարամետրեր են օգտագործվել ընթերցումը պառալելացնելու համար։