Middle+
TF-IDF nedir?
sobes.tech yapay zeka
AI'dan gelen yanıt
TF-IDF (Term Frequency-Inverse Document Frequency), bir belgenin tüm belge kümesine göre kelimenin önemini değerlendirmek için kullanılan istatistiksel bir ölçüdür.
- TF (Terim Frekansı) — belirli bir belgede terimin frekansı, genellikle kelimenin belgeye kaç kez girdiği olarak hesaplanır ve belgenin uzunluğuna normalize edilir.
- IDF (Ters Belge Frekansı) — belgenin ters frekansı, kelimenin tüm kümede ne kadar nadir olduğunu yansıtır. Toplam belge sayısının, kelimeyi içeren belge sayısına oranının logaritması alınır.
Bir kelimenin belge içindeki TF-IDF değeri, TF ile IDF'nin çarpımıdır. Yüksek bir değer, kelimenin bu belgede sıkça göründüğünü, ancak diğer belgelerde nadir olduğunu gösterir ve bu da belgenin konusunu vurgulamak için iyi bir gösterge olur.
Python'da sklearn kullanarak örnek:
from sklearn.feature_extraction.text import TfidfVectorizer
docs = ["makine öğrenimi ve yapay zeka",
"yapay zeka ve derin öğrenme"]
vectorizer = TfidfVectorizer()
tfidf_matrix = vectorizer.fit_transform(docs)
print(vectorizer.get_feature_names_out())
print(tfidf_matrix.toarray())