Middle+
Какво е TF-IDF?
sobes.tech AI
Отговор от AI
TF-IDF (Term Frequency-Inverse Document Frequency) е статистическа мярка, използвана за оценка на важността на дума в документ спрямо целия корпус документи.
- TF (Честота на Термина) — честотата на термина в конкретен документ, обикновено се счита като броя на срещанията на думата, нормализирана спрямо дължината на документа.
- IDF (Обратна честота на документа) — обратната честота, отразява колко рядка е думата в целия корпус. Изчислява се като логаритъм на отношението между общия брой документи и броя на документите, съдържащи думата.
Крайната стойност на TF-IDF за дума в документ е произведението на TF и IDF. Висока стойност означава, че думата често се среща в този документ, но рядко в други, което я прави добър индикатор за подчертаване на темата на документа.
Пример на Python с sklearn:
from sklearn.feature_extraction.text import TfidfVectorizer
docs = ["машинно обучение и изкуствен интелект",
"изкуствен интелект и дълбоко обучение"]
vectorizer = TfidfVectorizer()
tfidf_matrix = vectorizer.fit_transform(docs)
print(vectorizer.get_feature_names_out())
print(tfidf_matrix.toarray())