Jakie główne parametry zwykle ustawiamy dla zadań DAG i dlaczego graf musi być właśnie taki (logika wysokiego poziomu DAG)?
Machine Learning / AI
Czy pracowałeś z Spark? Jakie masz ogólne wyobrażenie o tym, czym to jest?
Jakie metryki są odpowiednie, a które nie, gdy mówimy o nierównowadze klas?
Dany jest ciąg zawierający litery i cyfry. Znajdź największą liczbę występującą w ciągu (traktując kolejne cyfry jako jedną liczbę).
Co się dzieje w Pythonie podczas łączenia łańcuchów (np. current += char)? Dlaczego takie podejście może być złe w tym zadaniu i jak zoptymalizować kod, unikając częstego łączenia łańcuchów?
Jak rozwiązałbyś ten sam problem wyszukiwania ostatniego kliknięcia bez użycia JOIN?
Czy miałeś do czynienia z lasem losowym (w pracy lub w nauce)? Jakie są główne różnice między lasem losowym a boostingiem?
Czy pracowałeś z Airflow lub Spark? Opowiedz, czym jest DAG w Airflow, możesz podać przykład z własnego doświadczenia? Sam pisałeś DAGi czy tylko je używałeś/uruchamiałeś?
Czy masz doświadczenie w pracy z szeregami czasowymi? Jakie metryki są używane do oceny jakości modeli prognozowania szeregów czasowych?
Dlaczego dokładność przy nierównowadze klas pokazuje nieadekwatną wartość jakości?
Dane są tabelę logs z wydarzeniami użytkowników (user_id, item_id, action_type, timestamp). Napisz zapytanie SQL, aby dla każdego użytkownika znaleźć ID ostatniego klikniętego przez niego produktu.
Jest 100 monet, z nich jedna jest fałszywa — z dwoma orłami po obu stronach. Wybieramy losowo monetę, rzucamy nią i wypada orzeł. Jakie jest prawdopodobieństwo, że moneta jest fałszywa? Opisz rozwiązanie (za pomocą wzoru Bayesa).
Jeśli optymalna liczba drzew dla modelu to 500, ale przypadkowo wytrenowaliśmy zarówno las losowy, jak i boosting na 1000 drzewach, który z modeli jest bardziej prawdopodobny, że się przeuczy i dlaczego?
Dlaczego zadanie w Spark może utknąć i trwać bardzo długo?