Čo je p-hodnota a ako z nej vyvodzovať závery pri výpočte A/B testu (zamietnuť alebo nezamietnuť nulovú hypotézu)?
Data Analyst
Vysvetlite slovami algoritmus výpočtu skalárneho súčinu dvoch komprimovaných (RLE-kódovaných) vektorov v jednom prechode bez ich rozbalenia. Aká je asymptotická zložitosť z hľadiska času?
Bolo použité ML na výber vlastností v úlohe klasifikácie automobilov?
Povedz mi o svojich najzaujímavejších projektoch a prečo chceš rozvíjať v analytike.
D. Čínsky ohňostroj Vladimir kúpil sadu 3 čínskych ohňostrojov. Vyzerajú úplne rovnako a sú zmiešané v krabici, ale podľa návodu majú rôznu spoľahlivosť: 1. "Elitný" — miera závad 10% (pravdepodobnosť úspechu 0.9). 2. "Štandardný" — miera závad 20% (pravdepodobnosť úspechu 0.8). 3. "Ekonomický" — miera závad 40% (pravdepodobnosť úspechu 0.6). Vladimir náhodne vyberie prvý ohňostroj, zapáli ho, a ten úspešne vystrelí. Šťastný Vladimir sa rozhodne spustiť zvyšné dva jeden po druhom. Aká je pravdepodobnosť, že aj druhý, aj tretí ohňostroj budú úspešne vystrelené — bez vady? Zaokrúhlite odpoveď na tri desatinné miesta.
Bolo by navrhované riešenie funkčné pre SQLite?
Raz, kedy sa do tímu pripojil stážista proti podvodom v Yandex Ads. Keď skupina podvodníkov fungovala, simulovala prevádzku na svojich stránkach prostredníctvom botov, a tak dostávala peniaze za zobrazenia reklám od botov, úlohou stážistu bolo nájsť všetky tieto podvodné stránky s falošnou prevádzkou. Zaujímavé je, že celá prevádzka na týchto stránkach bola generovaná s IP substitúciou, čo spôsobovalo, že vyzeralo, akoby bot navštevoval stránku z mesta A, ale v skutočnosti bol zariadenie úplne inde. Ubehlo veľa času a stážista sa snažil pokryť celú túto skupinu podvodníkov, dokonca sa mu podarilo čiastočne chytiť niektoré stránky. Ale celú sieť sa mu nepodarilo chytiť. Po určitom čase si všimol správu: v meste A, dňa 02.08.2025, úplne chýbal mobilný internet. Avšak, káblový (domáci) internet naďalej fungoval. Vzhľadom na to, ako môže stážista nájsť všetky falošné stránky? Máte logy stránok vo formáte tabuľky za obdobie od 30.07.2025 do 10.08.2025: timestamp | site_id | city_id Každý záznam zodpovedá návšteve stránky jedným zariadením. Je známe, že prevádzka botov sa mení oveľa menej ako skutočná prevádzka za deň. Vašou úlohou je nájsť všetky stránky, ktorých prevádzka sa skladala prevažne z botov, ktorí falšovali svoj región na mesto A. Poznámka Tabuľka obsahujúca údaje sa nazýva logs. Príklad záznamu v tabuľke: timestamp | site_id | city_id [phone]:13:53 | 6e84d9b71ca44aea | A
Aká je asymptotická zložitosť navrhovaného riešenia z hľadiska času a pamäte?
Prečo má zmysel ešte stále štandardizovať formát odpovede v benchmarku, aj keď obmedzuje model?
Je možné riešiť Product of Array Except Self jednoduchšie, ak je povolené používať akékoľvek operácie?
-- 1.2 Ako zmeníme typ JOIN na LEFT, ako sa odpoveďou? -- 1.3 Uveďte poradie vykonávania operátorov v tomto dopyte. from join group by select order by limit -- 2. Tabuľka campaigns bola opravená: odstránené duplicity, pridaný kľúč (PK). -- Bolo vykonaných viac kampaní, kvôli chybám začali používatelia dostávať neúspešné pokusy o doručenie komunikácií, a niektorí ich vôbec nemohli zobraziť. -- O promo kampaniach odoslaných používateľom: -- 2. Napíšte dopyt, ktorý ukazuje počet používateľov, ktorí úspešne dostali komunikáciu pre každú kampaň. -- 2.2 Zmeňte dopyt tak, aby ukazoval: počet používateľov, ktorí nakoniec nedostali žiadnu úspešnú komunikáciu, pre každú kampaň.
Aká je pamäťová zložitosť riešenia úlohy Product of Array Except Self a aké ďalšie premenné sa používajú?
Ako porovnáme odpoveď modelu s etalonom (ground truth) v benchmarku? Ktorú metriku použiť?
A. Najlepšia Vedecká Laboratórium V určitom meste niekoľko vedeckých laboratórií skúma baktériové kultúry. Študujú sekvenciu vzoriek, kde každá vzorka patrí k určitému kmenu (typu baktérie). Hlavná biologická výskumná univerzita vyhlásila súťaž: nájsť maximálny počet po sebe idúcich vzoriek, ktoré je možné analyzovať s ohľadom na obmedzenie. Konkrétne: v akomkoľvek súvislom úseku sekvencie by nemalo byť viac ako K rôznych kmeňov. Naša laboratórium sa snaží stať najlepším v meste. Aby sme vyhrali súťaž, musíme nájsť presne takúto maximálnu dĺžku úseku, ktorá spĺňa prísnu podmienku. Spoľahnite sa na nás, pretože v prípade víťazstva laboratórium dostane grant, ktorý otvorí nové horizonty pre naše výskumy. Formát vstupu Prvý riadok obsahuje dve čísla: N — dĺžku sekvencie vzoriek a K — obmedzenie na počet rôznych kmeňov. Druhý riadok obsahuje N čísel — prvky sekvencie. Formát výstupu Program by mal vypísať číslo maximálnej dĺžky úseku sekvencie vzoriek. Príklad 1 Vstup [phone] Výstup 3
Za seznam celých čísel vráťte zoznam rovnakej veľkosti, kde na i-tej pozícii je súčin všetkých prvkov zoznamu, kromě samotného prvku na pozícii i pôvodného zoznamu Príklady: [2, 3, 4] -> [3*4, 2*4, 2*3] -> [12, 8, 6] def product_except_self(nums: list[int]) -> list[int]: # váš kód tu
Môžete povedať, aký ste technológický stack a aké nástroje používali a zvládli?
Napíšte úplnú funkciu sum_series v Pythone a otestujte ju na príklade z úlohy.
Ako veľmi vás zaujíma strojové učenie a či by ste ho chceli použiť vo svojej práci ako nástroj?
Čo sa zmení, ak nahradíte COUNT(*) za COUNT() bez argumentu?
Ako bi ustvaril benchmark za geometrijo? Opisati verigo od ideje do končnega nabor podatkov.