Ornith-1.5: как LLM учится сама на себе

Команда Ornith выпустила новое семейство языковых моделей Ornith-1.5, которое замыкает цикл самоулучшения: модель сама генерирует задачи, строит под них scaffolds, решает их и забирает reward в reinforcement learning. Три варианта — 397B MoE, 35B MoE и 9B Dense — нацелены на разные сценарии: от облачного агента-кодера до мобильного edge-ассистента.

Ornith-1.5: как LLM учится сама на себе

Команда Ornith выпустила новое семейство языковых моделей Ornith-1.5, которое замыкает цикл самоулучшения: модель сама генерирует задачи, строит под них scaffolds, решает их и забирает reward в reinforcement learning. Три варианта — 397B MoE, 35B MoE и 9B Dense — нацелены на разные сценарии: от облачного агента-кодера до мобильного edge-ассистента.

Главные цифры

Флагман Ornith-1.5-397B (MoE) показывает результаты уровня Claude Opus 4.8 на агентных кодовых бенчмарках: 86.1 на Terminal-Bench 2.1 и 56.0 на DeepSWE. При этом модель опережает GLM-5.2 (82.7 / 46.2) и DeepSeek-V4-Flash-0731 (82.7 / 54.4). Средняя версия Ornith-1.5-35B активирует только 3B параметров на токен, но обходит Qwen 3.6-35B, Gemma 4-31B и Muse Glimmer-30B. Компактная Ornith-1.5-9B при 9B параметрах даёт 70.6 на SWE-Bench Verified — результат, сравнимый с моделями в 3–4 раза крупнее.

Не просто масштаб, а замкнутый цикл обучения

Если в Ornith-1.0 основной трюк был в self-scaffolding — когда модель сама генерировала промпты и стратегии решения, — то Ornith-1.5 расширяет это до трёх связанных стадий: генерация задачи, построение scaffold, создание rollout. Все три стадии обучаются совместно через GRPO, а не только финальная генерация ответа.

Почему это важно: классический RL для LLM обычно учится на фиксированной human-выборке задач. Ornith-1.5 вместо этого строит живую учебную программу, которая меняется по мере роста способностей модели. Сложные задачи не даются заранее — они порождаются самой моделью.

Как выбираются задачи

Сигнал reward для генератора задач состоит из трёх множителей:

  • Validity — задача и scaffold должны быть валидны и проверяемы: scaffold запускается, правильное решение проходит, неправильное падает.
  • Frontier difficulty — модель сэмплирует N rollout-ов и считает success rate. Reward максимален, когда этот rate близок к 0.2: задача достаточно сложная, но при этом даёт достаточно успешных траекторий для обучения. Когда модель начинает решать задачу надёжнее, reward падает, и генератор переходит к более сложным.
  • Novelty — через similarity относительно буфера уже сгенерированных задач. Терм не должен доминировать, иначе модель будет искать странности ради странностей.

Множители, а не сумма, означают, что слабое звено обнуляет reward: нет смысла генерировать сложную задачу, если scaffold для неё не работает.

Harness и rollout reward

Scaffold — это не просто prompt. В Ornith-1.5 он обучается отдельно: harness reward оценивает соответствие задаче (alignment), точность оценки качества решения (fidelity) и устойчивость к reward hacking. Rollout же оценивается непосредственно harness-ом: для верифицируемых задач это pass/fail, для более богатых сред — корректность, завершённость, эффективность, соблюдение ограничений.

Три модели под разные задачи

Ornith-1.5-397B — это тяжёлый облачный вариант для комплексных агентных задач, DeepSWE и больших codebase. Ornith-1.5-35B — баланс между качеством и стоимостью вывода: 3B активных параметров на токен делают её дешевле флагмана при сохранении сильных агентных навыков. Ornith-1.5-9B и её квантованная версия 9B-Mobile рассчитаны на iPhone и Android, но при этом уверенно обгоняют модели в десятки миллиардов параметров на кодовых бенчмарках.

Почему это интересно для vibe-кодинга

Главная идея Ornith-1.5 — уменьшить зависимость от человеческой курирования обучающих данных. Модель сама создаёт задачи, сама проверяет себя и сама подбирает сложность. Для разработки это означает: в перспективе агент, который пишет код, может сам генерировать реалистичные репозитории, тесты и edge-cases для своего дообучения. Самоулучшающийся coding-агент становится меньше фантастикой и больше архитектурой.

Итог

Ornith-1.5 — это не просто очередной анонс большой модели. Это попытка сделать самоулучшение LLM системным: задачи, scaffolds и rollouts развиваются в одном цикле. В сочетании с сильными бенчмарками на агентном кодировании это делает семейство одним из самых интересных релизов для тех, кто следит за автономными coding-агентами и vibe-разработкой.

Теги: ИИ-агент, Большая языковая модель, Нейросеть, Промпт, Токен, Файнтюнинг, Skill, Репозиторий, Фикс, Бенчмарк, IDE, Claude, Терминал