Перейти к содержимому
Новости
Исследования
Все новости

Компания · ORCNEIT

ORCNEIT теперь на GitHub: исследования, данные и развитие проекта

Открыли GitHub компании и опубликовали материалы о развитии ORCNEITGPT. Рассказываем, что уже доступно, зачем нужны числовые приложения и как хотим развивать публичные публикации.

Опубликовано:

Открытая площадка компании

У ORCNEIT появился официальный GitHub — организация ORCNEIT-LLC. Первый публичный репозиторий, research, посвящён исследовательским результатам ORCNEITGPT. Это место для подробных материалов, к которым можно вернуться, сопоставить числа и увидеть изменения публикации.

На сайте LAB исследования остаются оформленными статьями. На GitHub те же материалы доступны на русском и английском в Markdown, рядом с графиками и CSV. GitHub дополняет сайт, а не заменяет его: читатель выбирает удобный формат, содержание и ограничения результата сохраняются.

Что уже опубликовано

Сейчас в research восемь публикаций: общий рассказ о развитии проекта и семь научно-инженерных работ. Три ранее опубликованные статьи о базовом обучении, диалоговом дообучении и пересборке обучающей основы сохранены. К ним добавили обзор и четыре исследования.

Обзор охватывает подтверждённые работы с июня до конца сентября 2026 года: небольшой прототип, расширение проверок, эксперименты с памятью, собственное обучение и переход к подготовке новой обучающей основы. Это история решений и измеренных результатов, а не объявление готового ассистента.

Четыре новых исследовательских вопроса

Память: что происходит с прежними навыками при обучении новой задаче? В небольшом тесте выполнение инструкций изменилось с 23 до 5 правильных ответов из 25, а в следующей попытке с повторением прежнего материала вернулось к 23. При этом финальная проверка протокола памяти дала 0 успешных случаев из 246. В статье отдельно разобран дефект раннего измерителя и объяснено, почему его нулевые оценки нельзя считать чистым результатом модели.

Численная точность: как записывать обновление, которое меньше шага представления веса? В коротком контролируемом сравнении стохастическое округление уменьшило модуль среднего знакового отклонения записи примерно в 90 раз. Это локальный численный эффект, не 90-кратное улучшение ответов. Отдельный запуск с точным состоянием обучения прошёл без NaN/Inf, но не прошёл поведенческую проверку.

Токенизация: достаточно ли выбирать по сжатию текста? При одинаковых исходных документах предварительный лидер проиграл по метрике пробного обучения: 2,374638 против 2,288238 бит на байт у выбранного варианта. В работе указаны текстовый бюджет, число обновлений и ограничение одного seed; равный текст не выдаётся за равные вычисления.

Управление ответами: что дают внешние правила без изменения весов? В августовском сравнении тяжёлые нарушения сократились с 499 до 433 из 1 600 генераций. Парное сравнение обнаружило и 141 улучшение, и 75 ухудшений. Отсутствие ошибок UTF-8 после защиты не означает смысловой правильности. Раннюю систему, где правила иногда вообще заменяли модель, рассматриваем отдельно.

Не только рассказ, но и проверяемые числа

У каждой работы есть вопрос, методика, результат, обсуждение и ограничения. Приведены даты самого эксперимента и размещения материала. Графики сопровождаются таблицами и CSV; приложения поясняют единицы, знаменатели и то, какие величины нельзя объединять.

Например, 1 600 генераций — это результаты 400 запросов в нескольких режимах, а не столько же независимых заданий. 327,68 млн токенов — предъявления при обучении с повторами, не объём уникального текста. Цель подготовки корпуса в 4 млрд токенов не означает, что этот набор уже принят. Эти различия оставлены рядом с результатами, а не спрятаны в общем описании.

Числовые приложения позволяют проверить арифметику и соответствие графика опубликованным значениям. Они не заменяют независимое повторение обучения: публикация агрегатов сама по себе не даёт полного комплекта для воспроизведения эксперимента.

Что планируем дальше

Хотим развивать GitHub как последовательную библиотеку завершённых исследований: публиковать новые сравнения, условия проверки, числовые приложения и объяснения решений. При уточнении результата важно сохранять понятную историю исправлений, а не молча менять прежние выводы.

Отдельное направление — материалы о методах подготовки данных, проверке качества и оценке ответов. Если в будущем будут подготовлены самостоятельные инструменты для публичного использования, их состав, условия и лицензии объявим отдельно. Нынешний репозиторий с отчётами не означает публикации всего исходного кода, весов или обучающих данных.

Это направление развития, не календарь обещанных релизов. Новые материалы появятся по мере готовности результатов. ORCNEITGPT остаётся исследовательским проектом: сначала проверка и вывод, затем публикация — включая случаи, когда подход не сработал.

Обзор, семь работ, графики и числовые приложения на русском и английском.

Открыть исследования на GitHub