Sobes.tech

Machine Learning / AI

Jakie główne parametry zwykle ustawiamy dla zadań DAG i dlaczego graf musi być właśnie taki (logika wysokiego poziomu DAG)?

203

Czy pracowałeś z Spark? Jakie masz ogólne wyobrażenie o tym, czym to jest?

167

Jakie metryki są odpowiednie, a które nie, gdy mówimy o nierównowadze klas?

167

Dany jest ciąg zawierający litery i cyfry. Znajdź największą liczbę występującą w ciągu (traktując kolejne cyfry jako jedną liczbę).

166

Co się dzieje w Pythonie podczas łączenia łańcuchów (np. current += char)? Dlaczego takie podejście może być złe w tym zadaniu i jak zoptymalizować kod, unikając częstego łączenia łańcuchów?

163

Jak rozwiązałbyś ten sam problem wyszukiwania ostatniego kliknięcia bez użycia JOIN?

159

Czy miałeś do czynienia z lasem losowym (w pracy lub w nauce)? Jakie są główne różnice między lasem losowym a boostingiem?

158

Czy pracowałeś z Airflow lub Spark? Opowiedz, czym jest DAG w Airflow, możesz podać przykład z własnego doświadczenia? Sam pisałeś DAGi czy tylko je używałeś/uruchamiałeś?

156

Czy masz doświadczenie w pracy z szeregami czasowymi? Jakie metryki są używane do oceny jakości modeli prognozowania szeregów czasowych?

151

Dlaczego dokładność przy nierównowadze klas pokazuje nieadekwatną wartość jakości?

151

Dane są tabelę logs z wydarzeniami użytkowników (user_id, item_id, action_type, timestamp). Napisz zapytanie SQL, aby dla każdego użytkownika znaleźć ID ostatniego klikniętego przez niego produktu.

146

Jest 100 monet, z nich jedna jest fałszywa — z dwoma orłami po obu stronach. Wybieramy losowo monetę, rzucamy nią i wypada orzeł. Jakie jest prawdopodobieństwo, że moneta jest fałszywa? Opisz rozwiązanie (za pomocą wzoru Bayesa).

142

Jeśli optymalna liczba drzew dla modelu to 500, ale przypadkowo wytrenowaliśmy zarówno las losowy, jak i boosting na 1000 drzewach, który z modeli jest bardziej prawdopodobny, że się przeuczy i dlaczego?

137

Dlaczego zadanie w Spark może utknąć i trwać bardzo długo?

135