Մեր մոտ հաճախորդների աղյուսակ կա (id, անուն, հասցե և այլն), ապրանքներ (id, անուն և այլն), ապրանքների շարժում (այստեղ ունենք հաճախորդի id, ապրանք, ամսաթիվ, քանակ, գումար), պետք է գտնենք, թե որ ապրանքները վաճառվել են 1 հունվարի, միայն եզակի, և նաև ցույց տալ գնորդի անունը և...
Data Engineer
Որքան աշխատավարձ եք սպասում?
Դուք աշխատե՞լ եք տվյալների վիտրինաների (DWH շերտ) հետ։
Եթե միացնեք գործարքները հաճախորդների հետ ըստ client_id և date_start (չի օգտագործվում BETWEEN), ինչ կվերցվի արդյունքում?
Ի՞նչ է CROSS JOIN-ը: Դու աշխատե՞լ ես դրա հետ։
Պատմեք ձեր տվյալների որակի հետ կապված մի քանի կարևոր գործերի մասին։
Ինչու՞ հիմա նոր աշխատանք եք փնտրում, ուզում եք փոխել աշխատանքը։
Ի՞նչ տեսակների JOIN-ներ գիտես: (գործնական)
Կարո՞ղ է Spark-ում միևնույն ժամանակ ընթերցել տվյալներ մեկ Parquet ֆայլից, թե միայն մեկ միջուկով մեկ հանձնարարությունում:
Ի՞նչ են տողային և սյունակային տվյալների բազաների առավելությունները և թերությունները: Ի՞նչն է ավելի արդյունավետ խմբավորելու և ամփոփելու համար։
Իմացրու ինձ մասին — աշխատանքային փորձ, տեխնոլոգիական շերտ
Նկարագրեք պատուհանային ֆունկցիաները հնարավոր ամենամեծ ընդարձակությամբ՝ որոնք են հիմնական բառերը և ինչի համար են դրանք։
Պատմիր տվյալների որակի մասին քո ըմբռնման մասին — արդյոք ունե՞ս այդ ոլորտում փորձառություն։
-- Տվյալ table numbers- ը մեկ սյունակով, անունը num (ամբողջ թվեր, որոնք կարող են կրկնվել): -- Գրեք SQL հարցում, որը կբաժանի թվերը երկու սյունակների. -- even – զույգ թվեր (վերևից ներքև դասավորված) -- odd – անհատ թվեր (վերևից ներքև դասավորված) -- Թվերը պետք է տեղադրվեն տող առ տող. առաջին տողում՝ առաջին զույգ և առաջին անհատ, -- երկրորդ տողում՝ երկրորդ զույգ և երկրորդ անհատ և այլն: -- Եթե մի խմբում ավելի շատ թվեր են, քան մյուսում, բացակա տեղերը պետք է լինեն NULL: -- սկզբնական աղյուսակ -- num -- --------- -- [phone] -- հարցման արդյունք -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Եթե executor-ում 10 միջուկ կա, քանի Tasks միաժամանակ կիրականացվեն մի պահում?
Որ ուղղությամբ կլինի հետաքրքիր զարգանալ՝ վիտրիններ, զարգացում, վերլուծություն, գուցե AI?
Ինչպես է աշխատում Nested Loop Join-ը և ինչ է նրա ալգորիթմական բարդությունը: Ինչ է բոլոր երեք ալգորիթմների բարդությունը?
Ինդեքսը ինչ է: Ինչպե՞ս է տարբերվում կլաստերացված ինդեքսը ոչ կլաստերացվածից:
Ի՞նչ ֆիզիկական JOIN-ներ գիտեք։
Ընդհանուր առմամբ բացատրեք, թե ինչպես է կառուցված Spark-ի ճարտարապետությունը՝ ինչ բաղադրիչներ կան և ինչպես են նրանք փոխազդում SQL հարցում կատարելու ժամանակ։