Co oznaczają składniki TF i IDF?
sobes.tech AI
Odpowiedź od AI
TF i IDF są kluczowymi składnikami metody TF-IDF, używanej do oceny ważności słów w dokumentach.
-
TF (Częstość występowania terminu) — częstotliwość występowania terminu w konkretnym dokumencie. Pokazuje, jak często słowo pojawia się w tym tekście.
-
IDF (Odwrócona częstość dokumentu) — odwrotna częstość dokumentu, mierzy, jak rzadkie lub powszechne jest słowo w całej kolekcji dokumentów.
Idea jest taka, że słowa, które często występują w konkretnym dokumencie (wysoki TF), ale rzadko w innych (wysoki IDF), mają większe znaczenie dla tego dokumentu.
Wzór:
[ \text{TF-IDF}(t, d) = \text{TF}(t, d) \times \log\left(\frac{N}{DF(t)}\right) ]
gdzie:
- (t) — termin,
- (d) — dokument,
- (N) — łączna liczba dokumentów,
- (DF(t)) — liczba dokumentów zawierających termin (t).
TF-IDF jest szeroko stosowany w wyszukiwaniu informacji, analizie tekstu i uczeniu maszynowym do wyróżniania słów kluczowych.