Czy możesz wyjaśnić różnicę między cross-encoder a bi-encoder?
Machine Learning / AI
Czy istnieje sposób na sprawdzenie, czy wygenerowany tekst nie zawiera faktualnych błędów w porównaniu z oryginałem?
Jak ocenić, czy model osadzeń działa dobrze? Jakie metryki zostały użyte?
Jak wybrano strategię dzielenia na fragmenty (chunking) dla systemu RAG?
Jak dane z dokumentów PDF były wyodrębniane dla systemu RAG?
Jak przetestować zaimplementowaną usługę na FastAPI?
Opowiedz o metrykach wydajności ML-serwisu: opóźnienie, RPS, jak to było zorganizowane w twoim projekcie?
Opowiedz o parametrach generacji LLM: temperatura, top-k, top-p i inne.
Opowiedz o bazach danych wektorowych, jakie istnieją, czym się różnią, dlaczego wybrali pgvector?
Opowiedz mi o kwantowaniu modeli: czym jest, do czego służy, jakie są jego rodzaje?
Jak się mają Recall i Precision, czy można zwiększyć jedno, nie obniżając drugiego? Podaj przykłady zadań.
Jak zorganizowano dane do podsumowania dialogów i jak przebiegało szkolenie?
Która metoda kwantowania (int8 czy float) zepsuje jakość modelu mniej?
Jak ocenić jakość streszczenia?
Opowiedz o najtrudniejszym zadaniu lub trudnościach w jednym z projektów.
Jak podszedłbyś do zadania podsumowania dialogu wielu osób z konferencji (np. 10 programistów na Slacku)?
Opowiedz mi o LoRA: czym jest, do czego służy?
Jaki model i podejście wybrać do przetwarzania dźwięku z konferencji (speech-to-text, diarization)?
Jak pracować z danymi prywatnymi podczas lokalnego wdrożenia systemu?
Dlaczego wybrano hybrydowe wyszukiwanie BM25 + osadzenia zamiast samej odległości kosinusowej?