OpenAI представила GPT-6 Astra, новый флагман, который в ближайшие дни должен добраться до платных пользователей ChatGPT. По первым цифрам это серьёзный скачок относительно GPT-5.6 Sol.
В Terminal-Bench 4.0, где модели решают сложные задачи через терминал, Astra набрала 57,9%. У Claude Fable 5.1 результат составил 55,8%, у GPT-5.6 Sol - 37,3%. В научной версии теста разрыв ещё заметнее: 64,6% против 52,6% у Fable 5.1 и 22,4% у Sol.
Главная цифра идёт со сноской
Самая громкая цифра в релизе, конечно, 99,9% на ARC-AGI-3. В этом тесте агент должен без инструкции разобраться в правилах незнакомой интерактивной среды.
Здесь важна методика. Со стандартной обвязкой лучший результат Astra составил 62,7%. До 99,9% показатель вырос с Provider Adapter: он сохраняет скрытое состояние рассуждений между запросами и использует компакцию для длинных взаимодействий.
Поэтому 99,9% измеряет уже не модель в вакууме, а модель вместе с инфраструктурой вокруг неё. И, по-моему, это даже интереснее самого рекорда. Конкуренция постепенно смещается от вопроса «у кого модель умнее» к вопросу «у кого вся агентная система реже теряет контекст и лучше доводит длинную задачу до конца».
Источники: релиз GPT-6 Astra и разбор ARC Prize.
Спокойный ролик тоже сработал
Отдельный плюс OpenAI за видео. Оно короткое и довольно простое: одна студия, несколько обычных рабочих задач и никакой попытки устроить голливудское будущее. Но почему-то именно поэтому ролик работает. Как по мне.
AGI стало заметно ближе
Я довольно спокойно отношусь к заявлениям про AGI. У термина нет нормальной финишной ленточки, а его граница после каждого нового релиза отодвигается чуть дальше. Но здесь впервые за какое-то время поймал себя на мысли, что AGI правда стало ближе.
Скорее всего, AGI вообще окажется связкой из сильной модели, памяти, инструментов и правильной обвязки. Astra хорошо показывает, насколько быстро эта конструкция собирается. Система уже может разбираться в незнакомой среде, работать с компьютером и не рассыпаться на длинной задаче.
Независимые тесты всё равно нужны. А ещё мне хочется самому неделю попробовать работу с моделью: длинные задачи, кривые сайты, большой код и обычные запросы.
Не знаю, Astra уже AGI или нет. Скорее нет. Но расстояние до него снова стало заметно короче. Такими темпами спор о термине может закончиться позже, чем сам переход.