Sobes.tech

Data Analyst

Ի՞նչ է p-արժեքը և ինչպես է այն օգտագործվում A/B թեստի վերլուծության ժամանակ (զրո հիպոթեզը մերժել կամ չմերժել):

360

Ներկայացրեք բառերով երկու սեղմված (RLE-կոդավորված) վեկտորների սիմետրիկ արտադրյալի հաշվարկման ալգորիթմը մեկ անցումով առանց դրանց բացման: Ինչ է ժամանակային ասիմպտոտիկ բարդությունը?

318

Օգտագործվել է ML ավտոմեքենաների դասակարգման խնդիրում հատկությունների ընտրության համար:

301

Իմացեք ձեր ամենահետաքրքիր նախագծերի մասին և թե ինչու եք ուզում զարգանալ վերլուծության մեջ։

268

D. Չինական կրակոցներ Վլադիմիրն առել է 3 չինական կրակոցների հավաքածու։ Նրանք շատ նման են և խառնված են տուփում, բայց ըստ հրահանգների, ունեն տարբեր հուսալիություն: 1. "Էլիտ" — թերության մակարդակ 10% (հաջողության հավանականություն 0.9): 2. "Ստանդարտ" — թերության մակարդակ 20% (հաջողության հավանականություն 0.8): 3. "Իկոնոմ" — թերության մակարդակ 40% (հաջողության հավանականություն 0.6): Վլադիմիրը պատահականորեն վերցնում է առաջին կրակոցը, վառում է, և այն հաջողությամբ աշխատում է։ Ուրախ, Վլադիմիրը որոշում է վառել մնացած երկու կրակոցները մեկը մյուսի հետևից։ Երկրորդ և երրորդ կրակոցների նույնպես հաջողությամբ աշխատելու հավանականությունը — առանց թերության? Զուգահեռեք պատասխանը երեք տասնորդական թվով։

152

Կարող է առաջարկվող լուծումը աշխատի SQLite-ի համար?

150

Եղել է մի անգամ, երբ Yandex գովազդների հակաակաունտի ստաժյորն անդամագրվեց թիմին։ Երբ խարդախության խումբը ակտիվ էր, որը սիմուլյատորային տրաֆիկ էր ստեղծում իրենց կայքերում բոտ այցելությունների միջոցով, և այդպես ստանում էր գումար բոտերից գովազդի ցուցադրությունների համար, ստաժյորի գործն էր գտնել այդպիսի բոլոր կեղծ կայքերը՝ կեղծ տրաֆիկով։ Հետաքրքիր է, որ այդ կայքերի ամբողջ տրաֆիկը ստեղծվում էր IP փոխարինմամբ, ինչը դարձնում էր, որ կարծես թե բոտը այցելում է քաղաք A-ից, բայց իրականում սարքը գտնվում էր լրիվ այլ տեղում։ Շատ ժամանակ անցավ, և ստաժյորը փորձեց ծածկել այդ ամբողջ խարդախության խմբին, նույնիսկ որոշ կայքեր մասամբ բռնեց։ Բայց ամբողջ ցանցը բռնել չհաջողվեց։ Որոշ ժամանակ անց նա նկատեց նորություն՝ քաղաք A-ում, 2025 թվականի 02.08-ին, մոբայլ ինտերնետը լրիվ բացակայում էր։ Սակայն, կաբելային (տան) ինտերնետը շարունակվում էր աշխատել։ Հաշվի առնելով դա, ինչպես կարող է ստաժյորը գտնել բոլոր կեղծ կայքերը։ Դուք ունեք կայքերի լոգեր տախտակային ձևաչափով՝ 30.07.2025-ից մինչև 10.08.2025 ժամանակահատվածի համար։ timestamp | site_id | city_id Յուրաքանչյուր գրառում համապատասխանում է մի սարքից կայք այցելությանը։ Նման է, որ բոտերի տրաֆիկը շատ ավելի քիչ է փոխվում, քան իրական տրաֆիկը օրական։ Ձեր խնդիրն է գտնել բոլոր այն կայքերը, որոնց տրաֆիկը հիմնականում կազմված էր բոտերից, որոնք իրենց շրջանը փոխել էին քաղաք A-ին։ Նշում Տախտակամատյանում տվյալները կոչվում են logs։ Օրինակ տախտակամատյանային գրառում: timestamp | site_id | city_id [phone]:13:53 | 6e84d9b71ca44aea | A

148

Ի՞նչ է առաջարկվող լուծման ասիմպտոտիկ բարդությունը ժամանակի և հիշողության առումով։

148

Ինչու՞ է դեռևս իմաստ ունի պատասխան ձևաչափի ստանդարտացումը բենչմարկում, նույնիսկ եթե դա սահմանափակում է մոդելը։

140

Կարո՞ղ է ավելի հեշտ լուծել Array Except Self-ի արտադրանքը, եթե թույլատրվում է օգտագործել ցանկացած գործողություն։

138

-- 1.2 Ինչպե՞ս կփոխվի պատասխանն, եթե փոխենք JOIN տեսակը LEFT-ով: -- 1.3 Նշեք այս հարցման օպերատորների կատարման կարգը: from join group by select order by limit -- 2. campaigns աղյուսակը վերանորոգվել է՝ հանվել են կրկնօրինակները, ավելացվել է բանալի (PK): -- Ավելի շատ արշավներ են իրականացվել, սխալների պատճառով օգտվողները սկսել են ստանալ անհաջող հաղորդակցությունների փորձեր, և որոշներին ընդհանրապես չի հաջողվել ցուցադրել: -- Օգտվողներին ուղարկված պրոմո-արշավների մասին: -- 2.1 Գրեք հարցում, որը ցույց է տալիս, թե քանի օգտվող է հաջողությամբ ստացել հաղորդակցությունը յուրաքանչյուր արշավի համար: -- 2.2 Փոխեք հարցումը, որպեսզի ցույց տա՝՝ ընդհանուր առմամբ ոչ մի հաջող հաղորդակցություն չստացած օգտվողների թիվը, յուրաքանչյուր արշավի համար։

133

Ի՞նչ է հիշողության բարդությունը լուծման համար, որը վերաբերում է Product of Array Except Self խնդրին, և ինչ լրացուցիչ փոփոխականներ են օգտագործվում:

131

Ինչպե՞ս համեմատել մոդելի պատասխանն իրական արժեքի (ground truth) հետ բենչմարկում: Ո՞ր մետրիկային պետք է օգտագործել։

127

A. Լավագույն Գիտական Լաբորատորիա Նշված քաղաքում մի քանի գիտական լաբորատորիաներ զբաղվում են բակտերիալ մշակույթների հետազոտությամբ: Նրանք ուսումնասիրում են նմուշների հաջորդականությունը, որտեղ յուրաքանչյուր նմուշ պատկանում է որոշակի սելեկցիային (բակտերիայի տեսակ): Հիմնական կենսաբանական հետազոտական համալսարանը հայտարարեց մրցույթ՝ հաշվի առնելով սահմանափակումը, գտնել առավելագույն հաջորդական նմուշների քանակը, որոնք կարելի է վերլուծել: Կատարյալ՝ ցանկացած շարունակական հատվածում պետք է լինի ոչ ավել քան K տարբեր սելեկցիա: Մեր լաբորատորիան ձգտում է դառնալ լավագույնը քաղաքում: Մրցույթում հաղթելու համար, մենք պետք է գտնենք հենց այդպիսի առավելագույն երկարության հատված, որը համապատասխանում է խիստ պայմանին: Մենք հույս ունենք ձեզ վրա, քանի որ հաղթանակի դեպքում, լաբորատորիան կստանա դրամաշնորհ, որը կբացի նոր հորիզոններ մեր հետազոտությունների համար: Մուտքի ձևաչափ Առաջին տողում նշված են երկու թիվ՝ N — նմուշների հաջորդականության երկարությունը և K — տարբեր սելեկցիաների քանակի սահմանափակում: Երկրորդ տողում՝ N թիվ՝ հաջորդականության տարրերը: Ելքի ձևաչափ Ծրագիրը պետք է արտածի առավելագույն երկարության հատվածի թիվը: Օրինակ 1 Մուտք [phone] Ելք 3

125

Ամենամեծ թվերի ցանկի համար վերադարձեք նույն չափի ցանկ, որտեղ i-երորդ դիրքում՝ բոլոր տարրերի արտադրյալը, բացառությամբ սկզբնական ցանկի i-երորդ դիրքի տարր Օրինակներ՝ [2, 3, 4] -> [3*4, 2*4, 2*3] -> [12, 8, 6] def product_except_self(nums: list[int]) -> list[int]: # ձեր կոդը այստեղ

122

Կարող եք պատմել, թե ինչ տեխնոլոգիական շերտ եք օգտագործել և ինչ գործիքներ եք սովորել և mastery եք ձեռք բերել?

121

Գրեք լրիվ sum_series ֆունկցիան Python-ով և փորձեք այն գործառնական օրինակով։

121

Ինչքան եք հետաքրքրված մեքենայական ուսուցմամբ և արդյոք ցանկանում եք այն կիրառել ձեր աշխատանքի մեջ որպես գործիք?

120

Ի՞նչ կփոխվի, եթե փոխարինեք COUNT(*)-ը COUNT()-ով առանց արգումենտի։

118

Ինչպե՞ս կստեղծեիք գեոմետրիայի բենչմարկը: Նկարագրեք շղթան գաղափարից մինչև վերջնական տվյալների հավաքածու։

118
/3