RuModernBERT Tagger (FineWeb‑Tuned)
Модель для мульти‑лейбл теггирования русскоязычных текстов
Дообучена на базе deepvk/RuModernBERT-base с использованием синтетических тегов,
сгенерированных Qwen3‑235B‑A22B‑Instruct‑2507 для выборки из 140 000 текстов из датасета FineWeb (русскоязычный подкорпус rus_Cyrl).
Задача
Модель решает задачу мульти‑лейбл классификации и возвращает вектор логитов длины 796, где каждый элемент соответствует одному из заранее заданных тегов.
Данные для обучения
- Источник: подмножество русскоязычных текстов из датасета FineWeb2
- Объём: 140 000 текстов
- Разметка: изначальные теги сгенерированы моделью Qwen3‑235B‑A22B‑Instruct‑2507 (каждый текст содержит 5 тегов)
- Стратегия: теги кластеризовались и каждый кластер обозначал новый тег - наиболее частотный из близких к центру
Особенность второй версии
В данной версии модель обучалась на тегах, которые были наиболее близки к центру кластера схожих тегов. Также остался тег, который обозначал кластер различных аббревиатур.
- Downloads last month
- 9
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support