Middle+
Qu'est-ce que TF-IDF?
sobes.tech IA
Réponse de l'IA
TF-IDF (Term Frequency-Inverse Document Frequency) est une mesure statistique utilisée pour évaluer l'importance d'un mot dans un document par rapport à l'ensemble du corpus.
- TF (Term Frequency) — la fréquence du terme dans un document spécifique, généralement considérée comme le nombre d'occurrences du mot, normalisé par la longueur du document.
- IDF (Inverse Document Frequency) — la fréquence inverse du document, reflète à quel point le mot est rare dans tout le corpus. Elle est calculée comme le logarithme du rapport entre le nombre total de documents et le nombre de documents contenant le mot.
La valeur finale de TF-IDF pour un mot dans un document est le produit de TF par IDF. Une valeur élevée indique que le mot apparaît fréquemment dans ce document, mais rarement dans d'autres, ce qui en fait un bon indicateur pour mettre en évidence la thématique du document.
Exemple en Python avec sklearn:
from sklearn.feature_extraction.text import TfidfVectorizer
docs = ["apprentissage automatique et intelligence artificielle",
"intelligence artificielle et apprentissage profond"]
vectorizer = TfidfVectorizer()
tfidf_matrix = vectorizer.fit_transform(docs)
print(vectorizer.get_feature_names_out())
print(tfidf_matrix.toarray())