Co je p-hodnota a jak se používá při vyhodnocování A/B testu (zamítnout nebo nezamítnout nulovou hypotézu)?
Data Analyst
Vysvětlete slovně algoritmus výpočtu skalárního součinu dvou komprimovaných (RLE-kódovaných) vektorů v jednom průchodu bez jejich rozbalení. Jaká je asymptotická složitost z hlediska času?
Bylo v úloze klasifikace automobilů použito ML pro výběr vlastností?
Pověz mi o svých nejzajímavějších projektech a proč chceš rozvíjet v analytice.
D. Čínské ohňostroje Vladimir koupil sadu 3 čínských ohňostrojů. Vypadají naprosto stejně a jsou zamíchány v krabici, ale podle návodu mají různou spolehlivost: 1. "Elitní" — míra vad 10 % (pravděpodobnost úspěchu 0.9). 2. "Standard" — míra vad 20 % (pravděpodobnost úspěchu 0.8). 3. "Ekonomický" — míra vad 40 % (pravděpodobnost úspěchu 0.6). Vladimir náhodně vezme první ohňostroj, zapálí ho a ten úspěšně vystřelí. Šťastný Vladimir se rozhodne spustit zbylé dva jeden po druhém. Jaká je pravděpodobnost, že i druhý a třetí ohňostroj budou úspěšně vystřeleni — bez vady? Zaokrouhlete odpověď na tři desetinná místa.
Fungovala by navrhované řešení pro SQLite?
Byla jednou jedna stážistka proti podvodům v Yandex Ads, která se připojila k týmu. Zatímco skupina podvodníků byla aktivní, simulovala provoz na svých stránkách prostřednictvím botů, a tím získávala peníze za zobrazení reklamy od botů, úkolem stážistky bylo najít všechny takové podvodné stránky s falešným provozem. Zajímavé je, že veškerý provoz na těchto stránkách byl generován s IP substitucí, takže to vypadalo, jako by bot navštěvoval stránku z města A, ale ve skutečnosti bylo zařízení úplně jinde. Uplynulo hodně času a stážistka se snažila pokrýt celou tuto skupinu podvodníků, dokonce se jí podařilo částečně chytit některé stránky. Ale celou síť se jí nepodařilo chytit. Po nějaké době si všimla zprávy: ve městě A, dne 02.08.2025, úplně chyběl mobilní internet. Nicméně, kabelový (domácí) internet stále fungoval. S tímto vědomím, jak může stážistka najít všechny falešné stránky? Máte logy stránek ve formátu tabulky za období od 30.07.2025 do 10.08.2025: timestamp | site_id | city_id Každý záznam odpovídá návštěvě stránky jedním zařízením. Je známo, že botí provoz se mění podstatně méně než skutečný provoz denně. Vaším úkolem je najít všechny stránky, jejichž provoz se skládal převážně z botů, kteří falšovali svůj region na město A. Poznámka Tabulka obsahující data se nazývá logs. Příklad záznamu v tabulce: timestamp | site_id | city_id [phone]:13:53 | 6e84d9b71ca44aea | A
Jaká je asymptotická složitost navrhovaného řešení z hlediska času a paměti?
Proč má stále smysl standardizovat formát odpovědi v benchmarku, i když omezuje model?
Lze problém Product of Array Except Self vyřešit jednodušeji, pokud je povoleno používat jakékoli operace?
-- 1.2 Jak se změní odpověď, pokud změníme typ JOIN na LEFT? -- 1.3 Uveďte pořadí provádění operátorů v tomto dotazu. from join group by select order by limit -- 2. Tabulka campaigns byla opravena: odstraněny duplicity, přidán klíč (PK). -- Bylo provedeno více kampaní, kvůli chybám začali uživatelé dostávat neúspěšné pokusy o doručení komunikací, a někteří je vůbec nemohli zobrazit. -- O promo kampaních odeslaných uživatelům: -- 2.1 Napište dotaz, který ukazuje počet uživatelů, kteří úspěšně obdrželi komunikaci, pro každou kampaň. -- 2.2 Změňte dotaz tak, aby ukazoval: počet uživatelů, kteří nakonec nedostali žádnou úspěšnou komunikaci, pro každou kampaň.
Jaká je paměťová složitost řešení úlohy Product of Array Except Self a jaké další proměnné jsou používány?
A. Nejlepší Vědecká Laboratoř V určitém městě se několik vědeckých laboratoří zabývá výzkumem bakteriálních kultur. Zkoumají sekvenci vzorků, kde každý vzorek patří k určitému kmenu (typu bakterií). Hlavní biologická výzkumná univerzita vyhlásila soutěž: najít maximální počet po sobě jdoucích vzorků, které lze analyzovat s ohledem na omezení. Konkrétně: v jakémkoli spojitém úseku sekvence by nemělo být více než K různých kmenů. Naše laboratoř usiluje stát se nejlepší ve městě. Abychom vyhráli soutěž, musíme najít právě takovou maximální délku úseku, která splňuje přísnou podmínku. Spoléháme na vás, protože v případě vítězství laboratoř obdrží grant, který otevře nové horizonty pro naše výzkumy. Formát vstupu První řádek obsahuje dvě čísla: N — délku sekvence vzorků a K — omezení na počet různých kmenů. Druhý řádek obsahuje N čísel — prvky sekvence. Formát výstupu Program by měl vytisknout číslo maximální délky úseku sekvence vzorků. Příklad 1 Vstup [phone] Výstup 3
Jak porovnat odpověď modelu s etalonem (ground truth) v benchmarku? Jakou metriku použít?
Pro seznam celých čísel vraťte seznam stejné velikosti, kde na i-té pozici je součin všech prvků seznamu, kromě samotného prvku na pozici i původního seznamu Příklady: [2, 3, 4] -> [3*4, 2*4, 2*3] -> [12, 8, 6] def product_except_self(nums: list[int]) -> list[int]: # váš kód zde
Můžete říct, jaký technologický stack a jaké nástroje jste používali a zvládli?
Napište kompletní funkci sum_series v Pythonu a otestujte ji na příkladu z úlohy.
Jak moc vás zajímá strojové učení a chtěli byste ho používat ve své práci jako nástroj?
Jak bys vytvořil benchmark pro geometrii? Popiš řetězec od nápadu po konečný dataset.
Co se změní, pokud nahradíte COUNT(*) za COUNT() bez argumentu?