Senior
Сизде орус тилиндеги кино сын-пикирлер жана алардын бинардуу сезим белгиси (белгилер: 0 — терс, 1 — оң) менен кичинекей маалымат топтому бар. Сиздин милдетиңиз — даяр энкодерлерди (мисалы, BERT) колдонбостон, 15 мүнөттө жөнөкөй текст классификациялоо моделин үйрөтүү үчүн толук pipeline ишке ашыруу жана бул маалыматтар боюнча тактыкты (accuracy) көрсөтүү. reviews = [ "Бул фильм жөн гана укмуштуу!", "Ужасный актердук оюн жана канааттандырарлык эмес сюжет.", "Ар бир мүнөттү жактырдым!", "Мен көргөн эң жаман фильм.", "Жакшы режиссура жана укмуштуу баяндама.", "Тамашалуу жана алдын ала болжолдонгон." ] labels = [1, 0, 1, 0, 1, 0]
sobes.tech AI
AIден жооп
Для быстрого решения задачи классификации текстов на русском языке без использования готовых энкодеров можно сделать следующий pipeline:
- Токенизация и простая предобработка (приведение к нижнему регистру, удаление знаков препинания).
- Векторизация текста с помощью мешка слов (Bag of Words) с помощью sklearn CountVectorizer.
- Обучение простой модели, например, логистической регрессии.
- Оценка точности на тех же данных (так как датасет очень маленький).
Пример кода на Python:
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score
reviews = [
"Этот фильм просто потрясающий!",
"Ужасная игра актёров и скучный сюжет.",
"Мне очень понравилось каждое мгновение!",
"Самый худший фильм, который я видел.",
"Отличная операторская работа и замечательная история.",
"Невыносимо скучно и предсказуемо."
]
labels = [1, 0, 1, 0, 1, 0]
# Векторизация
vectorizer = CountVectorizer(lowercase=True)
X = vectorizer.fit_transform(reviews)
# Обучение модели
model = LogisticRegression()
model.fit(X, labels)
# Предсказание и оценка
preds = model.predict(X)
accuracy = accuracy_score(labels, preds)
print(f"Accuracy: {accuracy:.2f}")
Такой подход позволит за 15 минут получить базовую модель классификации с приемлемой точностью на маленьком датасете.