Завершённый запуск на 80 000 шагов и 327,68 млн обучающих токенов. Публикуем кривые обучения и результат отдельной проверки способностей — включая непройденные критерии.
Меньше — лучше. 17 наблюдений; train — среднее за 250 шагов, dev — контрольная выборка. Линии соединяют измеренные точки и не изображают непрерывное наблюдение.
Сравнили базовую модель и её дообученную версию на одинаковых заданиях. Завершение ответов улучшилось, тяжёлые повторы сократились, однако критерии приёмки ассистента не выполнены.
Каждая модель: 128 заданий × 2 режима = 256 ответов. Ось начинается с нуля. Правильность, дегенерация и завершение — разные показатели, а не части одной суммы.
Неудачные проверки модели заставили пересмотреть не только обучение, но и данные, токенизацию и саму оценку. Разбираем измеренные результаты этих изменений и работу над новым корпусом, которая продолжается на 26 сентября 2026 года.
Меньше — компактнее. Среднее с равным весом четырёх групп текста на одной выборке. Сравнение проведено 20 августа 2026 года; это не метрика качества ответов модели.
Дата эксперимента сверена с рабочим журналом. Дата публикации — день появления материала на сайте. Эти исследования не являются объявлением готового продукта или независимой сертификацией модели.