OpenAI представила GPT-6 Astra, новый флагман, который в ближайшие дни должен добраться до платных пользователей ChatGPT. По первым цифрам это серьёзный скачок относительно GPT-5.6 Sol.

В Terminal-Bench 4.0, где модели решают сложные задачи через терминал, Astra набрала 57,9%. У Claude Fable 5.1 результат составил 55,8%, у GPT-5.6 Sol - 37,3%. В научной версии теста разрыв ещё заметнее: 64,6% против 52,6% у Fable 5.1 и 22,4% у Sol.

Сравнение результатов GPT-6 Astra, Claude Fable 5.1 и GPT-5.6 Sol, а также двух вариантов обвязки ARC-AGI-3
Результаты из релиза OpenAI и проверки ARC Prize. 99,9% относится к запуску с Provider Adapter, а не к стандартной обвязке.

Главная цифра идёт со сноской

Самая громкая цифра в релизе, конечно, 99,9% на ARC-AGI-3. В этом тесте агент должен без инструкции разобраться в правилах незнакомой интерактивной среды.

Здесь важна методика. Со стандартной обвязкой лучший результат Astra составил 62,7%. До 99,9% показатель вырос с Provider Adapter: он сохраняет скрытое состояние рассуждений между запросами и использует компакцию для длинных взаимодействий.

Поэтому 99,9% измеряет уже не модель в вакууме, а модель вместе с инфраструктурой вокруг неё. И, по-моему, это даже интереснее самого рекорда. Конкуренция постепенно смещается от вопроса «у кого модель умнее» к вопросу «у кого вся агентная система реже теряет контекст и лучше доводит длинную задачу до конца».

Источники: релиз GPT-6 Astra и разбор ARC Prize.

Спокойный ролик тоже сработал

Отдельный плюс OpenAI за видео. Оно короткое и довольно простое: одна студия, несколько обычных рабочих задач и никакой попытки устроить голливудское будущее. Но почему-то именно поэтому ролик работает. Как по мне.

AGI стало заметно ближе

Я довольно спокойно отношусь к заявлениям про AGI. У термина нет нормальной финишной ленточки, а его граница после каждого нового релиза отодвигается чуть дальше. Но здесь впервые за какое-то время поймал себя на мысли, что AGI правда стало ближе.

Скорее всего, AGI вообще окажется связкой из сильной модели, памяти, инструментов и правильной обвязки. Astra хорошо показывает, насколько быстро эта конструкция собирается. Система уже может разбираться в незнакомой среде, работать с компьютером и не рассыпаться на длинной задаче.

Независимые тесты всё равно нужны. А ещё мне хочется самому неделю попробовать работу с моделью: длинные задачи, кривые сайты, большой код и обычные запросы.

Не знаю, Astra уже AGI или нет. Скорее нет. Но расстояние до него снова стало заметно короче. Такими темпами спор о термине может закончиться позже, чем сам переход.