Data Engineer
Ի՞նչ է ֆիզիկապես տեղի ունենում Greenplum-ում INSERT, UPDATE և DELETE գործողությունների ժամանակ; ինչու՞ DELETE-ից հետո disk-ի տարածքը չի ազատվում և ինչ տարբերություն կա DELETE և TRUNCATE-ի միջև։
Ինչու կարող են տվյալները կորել: Տվեք մի քանի պատճառներ։
Իմացեք ձեր մասին: փորձ, առաջադրանքներ, հատկություններ կամ ձեռքբերումներ, որոնցով եք հպարտանում։
Կա՞ք փորձ FastAPI-ով։
Ի՞նչ Python գրադարանների հետ եք աշխատել:
Ի՞նչ են Spark-ի դանդաղ գործողությունները և ինչու են դրանք անհրաժեշտ:
Որ իրավիճակում բառարանի որոնումը կարող է վատթարանալ մինչև ամենավատ դեպքը?
Ինչպես միացաք OpenMetadata-ին և ինչ արեցիք նրա հետ?
Ի՞նչ է տարբերությունը ACID և CAP տեսության միջև։
Համեմատեք ETL և ELT մոտեցումները՝ ինչն է տարբերությունը և երբ է կիրառվում յուրաքանչյուրնը։
Ինչպե՞ս աշխատում էին 1C-ով. տվյալները ուղղակի տվյալների բազայից էին վերցնում, թե՞ շինով կամ այլ կերպ։
Ի՞նչ տվյալների բազաների հետ եք աշխատել: Ինչպե՞ս է աշխատում MongoDB-ն և ինչպես է այն ընդլայնվում:
Ինչպե՞ս որոշեցիք, որ գրառումը արդեն գոյություն ունի և այն կրկնակի գրանցելու կարիք չկա։
NULL plus 5 — ինչքա՞ն կլինի։
Կարո՞ղ է Spark-ում միևնույն ժամանակ ընթերցել տվյալներ մեկ Parquet ֆայլից, թե միայն մեկ միջուկով մեկ հանձնարարությունում:
Որ դաշտերում էր տվյալների միացումը և ինչպես հեռացվեցին կրկնօրինակները վիտրինայում?
Ինչ եք գիտակցում spill- ի մասին Spark-ում?
Ի՞նչ է RDD-ը Apache Spark-ում և ինչպե՞ս է այն տարբերվում մյուս Spark-ի ամփոփումներից։
Կատարե՞լ եք վիճակագրական ստուգումներ:
Ի՞նչ ռիսկեր կան տվյալների որակի համար։