ORCNEIT Lab / № 01 / Обучение модели
Обучение языковой модели с нуля: измерения и проверка результата
- Проведено
- —
- Опубликовано
Аннотация
Завершённый запуск на 80 000 шагов и 327,68 млн обучающих токенов. Публикуем кривые обучения и результат отдельной проверки способностей — включая непройденные критерии.
Постановка задачи
Как меняется ошибка предсказания при обучении собственной языковой модели и достаточно ли этого изменения для решения проверяемых задач?
Условия и методика
Модель ORCNEIT обучалась с новой случайной инициализации, без загрузки ранее обученных весов. Запуск начался 22 августа и завершился 23 августа 2026 года: выполнены все 80 000 шагов, численных сбоев NaN/Inf не зарегистрировано.
327 680 000 — число предъявленных обучающих токенов с учётом повторных проходов, а не объём уникальных данных. Эту величину нельзя трактовать как размер исходного набора текстов.
На графике показаны 17 наблюдений из журнала телеметрии: шаг 1 000, затем каждый 5 000-й шаг. Train loss — среднее за последние 250 шагов; dev loss — контрольное измерение на 8 192 токенах. Точки соединены прямыми отрезками, дополнительное сглаживание не применяется.
После обучения выполнена отдельная оценка с заранее зафиксированными заданиями и правилами подсчёта: 640 основных заданий, 64 контекстных, 640 генераций и 256 окон отложенного текста. Все 1 600 результатов получены; веса модели во время оценки не изменялись. Регрессии считали относительно ранее обученной внутренней контрольной модели на тех же заданиях: это случаи, где контрольная модель отвечала правильно, а проверяемая — нет.
Измерения
Изменение ошибки при обучении
LossШаг обучения
Таблица значений
| Шаг обучения | Обучение · train | Проверка · dev |
|---|---|---|
| 1 000 | 4,121886 | 4,778937 |
| 5 000 | 3,456732 | 4,340733 |
| 10 000 | 3,125353 | 3,67446 |
| 15 000 | 2,959091 | 3,385636 |
| 20 000 | 2,826652 | 3,283477 |
| 25 000 | 2,685255 | 3,178718 |
| 30 000 | 2,634553 | 3,151255 |
| 35 000 | 2,43181 | 3,006875 |
| 40 000 | 2,537828 | 3,055179 |
| 45 000 | 2,333696 | 3,045179 |
| 50 000 | 2,339327 | 2,961016 |
| 55 000 | 2,256835 | 2,975927 |
| 60 000 | 2,045726 | 2,912342 |
| 65 000 | 2,188968 | 2,966833 |
| 70 000 | 1,98551 | 2,98157 |
| 75 000 | 2,092879 | 2,896243 |
| 80 000 | 1,63502 | 2,912363 |
Результат
Обучение завершилось, но модель не прошла совокупный критерий качества.
| Показатель | Наблюдение | Интерпретация |
|---|---|---|
| Шаги обучения | 80 000 / 80 000 | Выполнено |
| Обучающие токены, включая повторы | 327 680 000 | Не число уникальных токенов |
| Dev loss в конце запуска | 2,912363 | Отдельно от held-out оценки ниже |
| Held-out loss | 2,669892 | 262 144 токена отдельной оценки |
| Правильные ответы | 161 / 640 | Не достигнут минимум 167 / 640 |
| Контекстные задания | 24 / 64 | Достигнут минимум 17 / 64 |
| Генерации с тяжёлой дегенерацией | 203 / 640 | В пределах установленного максимума 271 |
| Регрессии в заданиях при парном сравнении | 178 | Превышен допустимый максимум 7 |
Обсуждение
На контрольных точках dev loss снизился с 4,778937 до 2,912363. Это измеренное улучшение предсказания текста, а не доказательство общего понимания или готовности к диалогу.
В отдельной проверке основной результат составил 161 правильный ответ из 640. Нижняя 95%-ная bootstrap-граница — 0,21875 — не превысила контрольный уровень 0,25. Поэтому по этому критерию нельзя заявить подтверждённое превосходство над случайным выбором.
Некоторые суммарные показатели улучшились, но парное сравнение выявило слишком много новых ошибок. Проверка не пройдена: улучшение loss и работы с контекстом не отменяет этих регрессий.
Ограничения
Это один внутренний эксперимент, а не сравнение с коммерческими моделями и не независимая оценка. Повторные запуски для оценки разброса здесь не представлены.
Dev loss на кривой и held-out loss в таблице получены на разных проверочных выборках. Напрямую сравнивать эти два числа нельзя.
Публикация описывает завершённый эксперимент августа 2026 года, а не текущую доступность модели. Опубликованных значений недостаточно для независимого повторения всего запуска.
Источник данных: журналы обучения и итоговые проверки ORCNEIT.