Перейти к содержимому
Новости
Исследования
← Все исследования

ORCNEIT Lab / № 02 / Эксперимент с дообучением

Дообучение для диалога: меньше повторов, но ещё недостаточно правильных ответов

Проведено
Опубликовано

Аннотация

Сравнили базовую модель и её дообученную версию на одинаковых заданиях. Завершение ответов улучшилось, тяжёлые повторы сократились, однако критерии приёмки ассистента не выполнены.

Постановка задачи

Поможет ли дополнительное обучение на диалогах не только правильно завершать реплики, но и решать поставленные задачи?

Условия и методика

Исходной точкой стала модель из завершённого запуска базового обучения. Затем выполнено дообучение с учителем: 1 144 шага оптимизатора, без NaN/Inf. Результат сравнили с той же базовой моделью.

Проверка включала 128 заданий в двух режимах генерации — детерминированном и с выборкой. Получены 256 ответов от каждой модели. Это 256 результатов, а не 256 независимых заданий.

Набор заданий и смысловые критерии были зафиксированы до подготовки данных дообучения. Для поддержки формата сохранённой дообученной модели пришлось исправить загрузчик проверки; после исправления обе модели проверили заново. Сами задания и правила оценки не менялись.

Отдельно считали правильность решения, тяжёлую дегенерацию текста, обычное завершение ответа, остановку по лимиту и остановку из-за петли повторов. У этих показателей разный смысл: хороший способ завершения не делает ответ правильным.

Измерения

До и после дообучения

Ответов из 256

Правильные ответы ↑

Базовая модель: 0 / 256
После дообучения: 43 / 256

Тяжёлая дегенерация ↓

Базовая модель: 238 / 256
После дообучения: 36 / 256

Обычное завершение ↑

Базовая модель: 18 / 256
После дообучения: 239 / 256
Каждая модель: 128 заданий × 2 режима = 256 ответов. Ось начинается с нуля. Правильность, дегенерация и завершение — разные показатели, а не части одной суммы.
Таблица значений
До и после дообучения
ПоказательБазовая модельПосле дообучения
Правильные ответы ↑0 / 25643 / 256
Тяжёлая дегенерация ↓238 / 25636 / 256
Обычное завершение ↑18 / 256239 / 256
Значения графика · CSV ↓

Результат

Форма ответа заметно улучшилась. Дообученная модель не принята как готовый ассистент.

Дообучение для диалога: меньше повторов, но ещё недостаточно правильных ответов — Результат
ПоказательНаблюдениеИнтерпретация
Правильно решённые задачи0 → 43 / 256Больше — лучше
Тяжёлая дегенерация238 → 36 / 256Меньше — лучше
Обычное завершение18 → 239 / 256Больше — лучше
Остановка по лимиту210 → 7 / 256Меньше — лучше
Остановка из-за повторов28 → 10 / 256Меньше — лучше
Средняя доля повторных 4-грамм0,134705 → 0,060744Механическая мера повторов

Обсуждение

После дообучения модель стала чаще завершать ответ обычным образом: 239 случаев вместо 18. Число генераций с тяжёлой дегенерацией сократилось с 238 до 36. Это конкретный результат изменения весов в эксперименте, а не эффект правил интерфейса.

При этом правильными оказались только 43 ответа из 256. В арифметике, точном выполнении инструкции, ответах по предоставленному материалу, многошаговом диалоге и структурированном JSON результат остался нулевым. В заданиях на Python — 1 из 32, на уточнение запроса — 18 из 32, на признание ограничений — 24 из 32.

Такой результат нельзя назвать готовым ассистентом. Эксперимент показал, что уменьшение повторов и освоение формы диалога сами по себе не решают проблему правильности ответов.

Ограничения

Сравнение относится к одному эксперименту и одному внутреннему набору. Оно не описывает качество на всех пользовательских запросах и не позволяет сравнивать модель с чужими продуктами.

Обе модели проходили одинаковые задания. Результаты разных режимов генерации на одном задании связаны; интервалы статистической неопределённости для этого сравнения не рассчитывались.

Данные взяты из журнала и итогового отчёта ORCNEIT. Независимая переоценка этого эксперимента не проводилась.

Источник данных: журналы обучения и итоговые проверки ORCNEIT.