Sobes.tech
Senior

Vous avez un petit ensemble de données avec des critiques de films en russe et leur étiquette binaire de tonalité (étiquettes : 0 — négatif, 1 — positif). Votre tâche est de mettre en œuvre un pipeline complet en 15 minutes pour entraîner un modèle simple de classification de texte sans utiliser d'encodeurs pré-entraînés comme BERT, et d'afficher la précision (accuracy) sur ces données. reviews = [ "Ce film est tout simplement incroyable!", "Jeu d'acteurs horrible et intrigue ennuyeuse.", "J'ai adoré chaque instant!", "Le pire film que j'ai vu.", "Excellent travail de réalisation et histoire merveilleuse.", "Insoportable ennuyeux et prévisible." ] labels = [1, 0, 1, 0, 1, 0]

sobes.tech IA

Réponse de l'IA

Для быстрого решения задачи классификации текстов на русском языке без использования готовых энкодеров можно сделать следующий pipeline:

  1. Токенизация и простая предобработка (приведение к нижнему регистру, удаление знаков препинания).
  2. Векторизация текста с помощью мешка слов (Bag of Words) с помощью sklearn CountVectorizer.
  3. Обучение простой модели, например, логистической регрессии.
  4. Оценка точности на тех же данных (так как датасет очень маленький).

Пример кода на Python:

from sklearn.feature_extraction.text import CountVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score

reviews = [
    "Этот фильм просто потрясающий!",
    "Ужасная игра актёров и скучный сюжет.",
    "Мне очень понравилось каждое мгновение!",
    "Самый худший фильм, который я видел.",
    "Отличная операторская работа и замечательная история.",
    "Невыносимо скучно и предсказуемо."
]
labels = [1, 0, 1, 0, 1, 0]

# Векторизация
vectorizer = CountVectorizer(lowercase=True)
X = vectorizer.fit_transform(reviews)

# Обучение модели
model = LogisticRegression()
model.fit(X, labels)

# Предсказание и оценка
preds = model.predict(X)
accuracy = accuracy_score(labels, preds)
print(f"Accuracy: {accuracy:.2f}")

Такой подход позволит за 15 минут получить базовую модель классификации с приемлемой точностью на маленьком датасете.