Перейти к содержимому
Новости
Исследования
← Все исследования

ORCNEIT Lab / № 01 / Обучение модели

Обучение языковой модели с нуля: измерения и проверка результата

Проведено
—
Опубликовано

Аннотация

Завершённый запуск на 80 000 шагов и 327,68 млн обучающих токенов. Публикуем кривые обучения и результат отдельной проверки способностей — включая непройденные критерии.

Постановка задачи

Как меняется ошибка предсказания при обучении собственной языковой модели и достаточно ли этого изменения для решения проверяемых задач?

Условия и методика

Модель ORCNEIT обучалась с новой случайной инициализации, без загрузки ранее обученных весов. Запуск начался 22 августа и завершился 23 августа 2026 года: выполнены все 80 000 шагов, численных сбоев NaN/Inf не зарегистрировано.

327 680 000 — число предъявленных обучающих токенов с учётом повторных проходов, а не объём уникальных данных. Эту величину нельзя трактовать как размер исходного набора текстов.

На графике показаны 17 наблюдений из журнала телеметрии: шаг 1 000, затем каждый 5 000-й шаг. Train loss — среднее за последние 250 шагов; dev loss — контрольное измерение на 8 192 токенах. Точки соединены прямыми отрезками, дополнительное сглаживание не применяется.

После обучения выполнена отдельная оценка с заранее зафиксированными заданиями и правилами подсчёта: 640 основных заданий, 64 контекстных, 640 генераций и 256 окон отложенного текста. Все 1 600 результатов получены; веса модели во время оценки не изменялись. Регрессии считали относительно ранее обученной внутренней контрольной модели на тех же заданиях: это случаи, где контрольная модель отвечала правильно, а проверяемая — нет.

Измерения

Изменение ошибки при обучении

Loss
040 00080 000

Шаг обучения

Меньше — лучше. 17 наблюдений; train — среднее за 250 шагов, dev — контрольная выборка. Линии соединяют измеренные точки и не изображают непрерывное наблюдение.
Таблица значений
Изменение ошибки при обучении
Шаг обученияОбучение · trainПроверка · dev
1 0004,1218864,778937
5 0003,4567324,340733
10 0003,1253533,67446
15 0002,9590913,385636
20 0002,8266523,283477
25 0002,6852553,178718
30 0002,6345533,151255
35 0002,431813,006875
40 0002,5378283,055179
45 0002,3336963,045179
50 0002,3393272,961016
55 0002,2568352,975927
60 0002,0457262,912342
65 0002,1889682,966833
70 0001,985512,98157
75 0002,0928792,896243
80 0001,635022,912363
Значения графика · CSV ↓

Результат

Обучение завершилось, но модель не прошла совокупный критерий качества.

Обучение языковой модели с нуля: измерения и проверка результата — Результат
ПоказательНаблюдениеИнтерпретация
Шаги обучения80 000 / 80 000Выполнено
Обучающие токены, включая повторы327 680 000Не число уникальных токенов
Dev loss в конце запуска2,912363Отдельно от held-out оценки ниже
Held-out loss2,669892262 144 токена отдельной оценки
Правильные ответы161 / 640Не достигнут минимум 167 / 640
Контекстные задания24 / 64Достигнут минимум 17 / 64
Генерации с тяжёлой дегенерацией203 / 640В пределах установленного максимума 271
Регрессии в заданиях при парном сравнении178Превышен допустимый максимум 7

Обсуждение

На контрольных точках dev loss снизился с 4,778937 до 2,912363. Это измеренное улучшение предсказания текста, а не доказательство общего понимания или готовности к диалогу.

В отдельной проверке основной результат составил 161 правильный ответ из 640. Нижняя 95%-ная bootstrap-граница — 0,21875 — не превысила контрольный уровень 0,25. Поэтому по этому критерию нельзя заявить подтверждённое превосходство над случайным выбором.

Некоторые суммарные показатели улучшились, но парное сравнение выявило слишком много новых ошибок. Проверка не пройдена: улучшение loss и работы с контекстом не отменяет этих регрессий.

Ограничения

Это один внутренний эксперимент, а не сравнение с коммерческими моделями и не независимая оценка. Повторные запуски для оценки разброса здесь не представлены.

Dev loss на кривой и held-out loss в таблице получены на разных проверочных выборках. Напрямую сравнивать эти два числа нельзя.

Публикация описывает завершённый эксперимент августа 2026 года, а не текущую доступность модели. Опубликованных значений недостаточно для независимого повторения всего запуска.

Источник данных: журналы обучения и итоговые проверки ORCNEIT.