Sobes.tech

Data Analyst

Czym jest wartość p i jak na jej podstawie wyciągać wnioski podczas analizy testu A/B (odrzucać lub nie odrzucać hipotezy zerowej)?

366

Wyjaśnij słowami algorytm obliczania iloczynu skalarnego dwóch skompresowanych (kodowanych w RLE) wektorów w jednym przebiegu bez ich rozpakowywania. Jaka jest asymptotyczna złożoność czasowa?

321

Czy w zadaniu klasyfikacji samochodów użyto ML do wyboru cech?

302

Opowiedz o swoich najciekawszych projektach i dlaczego chcesz rozwijać się w analizie.

268

D. Chińskie fajerwerki Vladimir kupił zestaw 3 chińskich fajerwerków. Wyglądają dokładnie tak samo i są pomieszane w pudełku, ale zgodnie z instrukcją, mają różną niezawodność: 1. "Elita" — wskaźnik wadliwych 10% (prawdopodobieństwo sukcesu 0.9). 2. "Standard" — wskaźnik wadliwych 20% (prawdopodobieństwo sukcesu 0.8). 3. "Ekonomiczny" — wskaźnik wadliwych 40% (prawdopodobieństwo sukcesu 0.6). Vladimir losowo bierze pierwszy fajerwerk, zapala go, i działa pomyślnie. Szczęśliwy Vladimir decyduje się wystrzelić pozostałe dwa jeden po drugim. Jaka jest szansa, że zarówno drugi, jak i trzeci fajerwerk będą sukcesem — bez defektu? Zaokrąglij odpowiedź do trzech miejsc po przecinku.

154

Pewnego razu, stażystka ds. oszustw w Yandex Ads dołączyła do zespołu. Gdy grupa oszustów działała, symulując ruch na swoich stronach za pomocą botów, i tym samym otrzymywała pieniądze za wyświetlenia reklam od botów, zadaniem stażystki było znaleźć wszystkie takie fałszywe strony z fałszywym ruchem. Co ciekawe, cały ruch na tych stronach był generowany z podmiany IP, co sprawiało, że wyglądało, jakby bot odwiedzał stronę z miasta A, ale w rzeczywistości urządzenie znajdowało się w zupełnie innym miejscu. Minęło dużo czasu, a stażystka próbowała objąć całą tę grupę oszustów, nawet udawało jej się częściowo złapać niektóre strony. Ale nie udało się złapać całej sieci. Po pewnym czasie zauważyła wiadomość: w mieście A, 02.08.2025, całkowicie zniknął internet mobilny. Jednak internet przewodowy (domowy) nadal działał. Biorąc to pod uwagę, jak stażystka może znaleźć wszystkie fałszywe strony? Posiadasz logi stron w formacie tabeli za okres od 30.07.2025 do 10.08.2025: timestamp | site_id | city_id Każdy wpis odpowiada odwiedzinom strony przez jedno urządzenie. Wiemy, że ruch botów zmienia się znacznie mniej niż ruch rzeczywisty na co dzień. Twoim zadaniem jest znaleźć wszystkie strony, których ruch składał się głównie z botów, które podmieniły swój region na miasto A. Uwaga Tabela zawierająca dane nazywa się logs. Przykład wpisu w tabeli: timestamp | site_id | city_id [phone]:13:53 | 6e84d9b71ca44aea | A

152

Czy proponowane rozwiązanie zadziała dla SQLite?

152

Jaka jest asymptotyczna złożoność proponowanego rozwiązania pod względem czasu i pamięci?

148

Dlaczego standaryzacja formatu odpowiedzi w benchmarku ma nadal sens, nawet jeśli ogranicza model?

140

Czy można rozwiązać Product of Array Except Self prościej, jeśli dozwolone jest używanie dowolnych operacji?

139

-- 1.2 Jak zmieni się odpowiedź, jeśli zmienisz typ JOIN na LEFT? -- 1.3 Podaj kolejność wykonywania operatorów w tym zapytaniu. from join group by select order by limit -- 2. Tabela campaigns została naprawiona: usunięto duplikaty, dodano klucz (PK). -- Przeprowadzono więcej kampanii, z powodu błędów użytkownicy zaczęli mieć nieudane próby dostarczenia komunikacji, a niektórym w ogóle się nie udało jej wyświetlić. -- O wysłanych do użytkowników kampaniach promocyjnych: -- 2.1 Napisz zapytanie, które wyświetla liczbę użytkowników, którzy pomyślnie otrzymali komunikację, dla każdej kampanii. -- 2.2 Zmień zapytanie, aby wyświetlić: liczbę użytkowników, którzy ostatecznie nie otrzymali żadnej udanej komunikacji, dla każdej kampanii.

136

Jaka jest złożoność pamięciowa rozwiązania problemu Product of Array Except Self i jakie dodatkowe zmienne są używane?

131

A. Najlepsza Laboratorium Naukowe W pewnym mieście kilka laboratoriów naukowych zajmuje się badaniem kultur bakteryjnych. Analizują ciąg próbek, gdzie każda próbka należy do określonego szczepu (typu bakterii). Główny uniwersytet badawczy biologii ogłosił konkurs: należy znaleźć maksymalną liczbę kolejnych próbek, które można przeanalizować, uwzględniając ograniczenie. Mianowicie: w dowolnym ciągłym odcinku analizowanej sekwencji nie może być więcej niż K różnych szczepów. Nasze laboratorium dąży do zostania najlepszym w mieście. Aby wygrać konkurs, musimy znaleźć dokładnie taką maksymalną długość odcinka, który spełnia surowy warunek. Liczymy na Ciebie, ponieważ w przypadku zwycięstwa laboratorium otrzyma grant, który otworzy nowe horyzonty dla naszych badań. Format wejścia W pierwszej linii podano dwie liczby: N — długość sekwencji próbek i K — ograniczenie na liczbę różnych szczepów. Druga linia zawiera N liczb — elementy sekwencji. Format wyjścia Program powinien wypisać liczbę maksymalnej długości odcinka sekwencji próbek. Przykład 1 Wprowadzenie [phone] Wyjście 3

130

Jak porównywać odpowiedź modelu z etalonem (ground truth) w benchmarku? Jaką metrykę użyć?

128

Dla listy liczb całkowitych zwróć listę tego samego rozmiaru, w której na i-tym miejscu znajduje się iloczyn wszystkich elementów listy, z wyjątkiem elementu na pozycji i oryginalnej listy Przykłady: [2, 3, 4] -> [3*4, 2*4, 2*3] -> [12, 8, 6] def product_except_self(nums: list[int]) -> list[int]: # twój kod tutaj

124

Czy możesz opowiedzieć, jakiego stosu technologicznego i jakich narzędzi używałeś i opanowałeś?

123

Napisz kompletną funkcję sum_series w Pythonie i sprawdź ją na przykładzie z zadania.

121

Jak bardzo interesuje Cię uczenie maszynowe i czy chciałbyś je stosować w pracy jako narzędzie?

121

Jak stworzyłbyś benchmark dotyczący geometrii? Opisz ciąg od pomysłu do końcowego zbioru danych.

119

Co się zmieni, jeśli zamienisz COUNT(*) na COUNT() bez argumentu?

118
/3