ORCNEIT Lab / № 02 / Эксперимент с дообучением
Дообучение для диалога: меньше повторов, но ещё недостаточно правильных ответов
- Проведено
- Опубликовано
Аннотация
Сравнили базовую модель и её дообученную версию на одинаковых заданиях. Завершение ответов улучшилось, тяжёлые повторы сократились, однако критерии приёмки ассистента не выполнены.
Постановка задачи
Поможет ли дополнительное обучение на диалогах не только правильно завершать реплики, но и решать поставленные задачи?
Условия и методика
Исходной точкой стала модель из завершённого запуска базового обучения. Затем выполнено дообучение с учителем: 1 144 шага оптимизатора, без NaN/Inf. Результат сравнили с той же базовой моделью.
Проверка включала 128 заданий в двух режимах генерации — детерминированном и с выборкой. Получены 256 ответов от каждой модели. Это 256 результатов, а не 256 независимых заданий.
Набор заданий и смысловые критерии были зафиксированы до подготовки данных дообучения. Для поддержки формата сохранённой дообученной модели пришлось исправить загрузчик проверки; после исправления обе модели проверили заново. Сами задания и правила оценки не менялись.
Отдельно считали правильность решения, тяжёлую дегенерацию текста, обычное завершение ответа, остановку по лимиту и остановку из-за петли повторов. У этих показателей разный смысл: хороший способ завершения не делает ответ правильным.
Измерения
До и после дообучения
Ответов из 256Таблица значений
| Показатель | Базовая модель | После дообучения |
|---|---|---|
| Правильные ответы ↑ | 0 / 256 | 43 / 256 |
| Тяжёлая дегенерация ↓ | 238 / 256 | 36 / 256 |
| Обычное завершение ↑ | 18 / 256 | 239 / 256 |
Результат
Форма ответа заметно улучшилась. Дообученная модель не принята как готовый ассистент.
| Показатель | Наблюдение | Интерпретация |
|---|---|---|
| Правильно решённые задачи | 0 → 43 / 256 | Больше — лучше |
| Тяжёлая дегенерация | 238 → 36 / 256 | Меньше — лучше |
| Обычное завершение | 18 → 239 / 256 | Больше — лучше |
| Остановка по лимиту | 210 → 7 / 256 | Меньше — лучше |
| Остановка из-за повторов | 28 → 10 / 256 | Меньше — лучше |
| Средняя доля повторных 4-грамм | 0,134705 → 0,060744 | Механическая мера повторов |
Обсуждение
После дообучения модель стала чаще завершать ответ обычным образом: 239 случаев вместо 18. Число генераций с тяжёлой дегенерацией сократилось с 238 до 36. Это конкретный результат изменения весов в эксперименте, а не эффект правил интерфейса.
При этом правильными оказались только 43 ответа из 256. В арифметике, точном выполнении инструкции, ответах по предоставленному материалу, многошаговом диалоге и структурированном JSON результат остался нулевым. В заданиях на Python — 1 из 32, на уточнение запроса — 18 из 32, на признание ограничений — 24 из 32.
Такой результат нельзя назвать готовым ассистентом. Эксперимент показал, что уменьшение повторов и освоение формы диалога сами по себе не решают проблему правильности ответов.
Ограничения
Сравнение относится к одному эксперименту и одному внутреннему набору. Оно не описывает качество на всех пользовательских запросах и не позволяет сравнивать модель с чужими продуктами.
Обе модели проходили одинаковые задания. Результаты разных режимов генерации на одном задании связаны; интервалы статистической неопределённости для этого сравнения не рассчитывались.
Данные взяты из журнала и итогового отчёта ORCNEIT. Независимая переоценка этого эксперимента не проводилась.
Источник данных: журналы обучения и итоговые проверки ORCNEIT.