GPT-6 Astra: OpenAI сделала ставку не на ответы, а на выполнение работы

mr. Cooper 19 часов назад Нейросети и AI
GPT-6 Astra: OpenAI сделала ставку не на ответы, а на выполнение работы

Когда OpenAI представляет новую флагманскую модель, внимание обычно цепляется за одну цифру: результат на очередном тесте, размер контекстного окна или очередной рекорд в таблице бенчмарков.

С GPT-6 Astra всё интереснее.

OpenAI называет Astra своей самой интеллектуальной и наиболее согласованной моделью. Но главное изменение здесь не в очередном проценте. Astra всё меньше похожа на привычного чат-бота и всё больше - на систему, которой можно поставить задачу и дать инструменты для самостоятельной работы.

Модель умеет работать с компьютером, браузером, терминалом, документами и программами. Она может выполнять последовательность действий, проверять результат и продолжать работу после обнаружения проблемы.

Именно здесь начинается самое интересное.

ИИ, которому уже недостаточно просто написать ответ

Представим обычную задачу разработчика: нужно сделать небольшую веб-страницу.

Обычная нейросеть напишет HTML, CSS и JavaScript. Дальше разработчику самому придётся создать файлы, запустить проект, открыть браузер, проверить результат, найти ошибку и снова обратиться к модели.

Astra рассчитана на другой сценарий.

OpenAI показывает модель как инструмент, способный самостоятельно взаимодействовать с компьютером: работать в браузере, устанавливать и тестировать программное обеспечение, устранять проблемы, которые видны на экране, выполнять действия в профессиональных приложениях.

Разница кажется небольшой, пока не начинаешь считать количество действий.

Между «написать код» и «получить работающую программу» всегда существует куча мелочей: открыть терминал, перейти в каталог, установить зависимость, запустить сборку, посмотреть ошибку, проверить страницу, вернуться к коду.

Для человека это рутина.

Для ИИ-агента - отдельные действия, которые теперь можно объединить в одну задачу.

И это уже совсем другой тип автоматизации.

Что это меняет для программиста

OpenAI заявляет, что Astra стала её лучшей моделью для software engineering. Но интереснее посмотреть не на само утверждение, а на то, куда движется рабочий процесс.

Раньше запрос к ИИ обычно выглядел примерно так:

«Напиши функцию для валидации формы».

Теперь задача может звучать иначе:

«Добавь валидацию в этот раздел приложения, запусти тесты и исправь найденные ошибки».

Это всего одна команда, но за ней может скрываться несколько последовательных операций.

Модель должна понять существующий код, найти нужные файлы, внести изменения, запустить проверки, посмотреть результат и решить, что делать дальше.

Получается любопытная перестановка ролей.

Разработчик всё меньше тратит время на каждую отдельную строку и всё больше занимается постановкой задачи, архитектурой, проверкой результата и решениями, которые нельзя безопасно делегировать машине.

Это не означает, что программисты исчезнут.

Но вполне может означать, что стоимость ручной работы внутри проекта продолжит снижаться.

Миллион токенов нужен именно для такой работы

У GPT-6 Astra контекстное окно составляет 1,05 млн токенов, а максимальный объём ответа - 128 тысяч токенов. Для обычного вопроса такие размеры выглядят избыточно.

Для большой кодовой базы ситуация другая.

Проект может содержать сотни файлов, тесты, документацию, конфигурацию, историю предыдущих решений и множество взаимосвязей. Если модель видит больше контекста, ей реже приходится работать с проектом по маленьким фрагментам.

Но здесь есть важная деталь.

Большой контекст сам по себе не превращает модель в хорошего программиста.

Ценность появляется, когда он соединяется с рассуждением и возможностью выполнять действия.

Контекст даёт информацию. Инструменты дают возможность действовать. Агентный цикл связывает одно с другим.

Вот эту комбинацию я бы и считал главным изменением Astra.

Бенчмарки выглядят впечатляюще, но есть нюанс

В OSWorld 2.0 OpenAI сообщает о результате 72,6% против 65,7% у GPT-5.6 Sol. В тесте с симулированной задержкой среднее время выполнения задачи также сократилось примерно с 75 до 40 минут.

Но с другими тестами ситуация интереснее.

Например, OpenAI указывает для Astra 99,9% на ARC-AGI-3. На первый взгляд это выглядит почти как решение самого теста.

Однако независимый ARC Prize показывает две разные цифры в зависимости от условий проверки.

В стандартном, provider-neutral harness Astra получила 62,7%. При использовании специального Provider Adapter, который сохраняет внутреннее состояние рассуждений модели между запросами и использует механизмы управления длинным контекстом, лучший результат поднялся до 99,9%.

Это важная оговорка.

99,9% - реальный результат, но он относится не просто к «модели в вакууме». На него влияет вся система вокруг неё.

И это хороший пример того, почему современные AI-бенчмарки всё сложнее сводить к одной цифре.

Когда модель становится агентом, тестируется уже не только сама нейросеть.

Тестируется связка из модели, памяти, инструментов, количества шагов, способов сохранения контекста и программной оболочки.

Astra уже достигла критического уровня в кибербезопасности

Самая серьёзная часть релиза вообще находится не в программировании.

OpenAI классифицировала GPT-6 Astra как модель, достигшую Critical уровня киберспособностей в рамках своего Preparedness Framework. Это означает, что возможности модели в определённых сценариях уже достигли уровня, который компания считает критическим с точки зрения потенциального риска.

Во время оценки Astra смогла находить уязвимости в сложных программных системах. OpenAI также сообщила о двух ранее неизвестных уязвимостях V8, обнаруженных моделью во время тестирования, которые компания передала разработчикам для устранения.

Для специалистов по безопасности это огромный потенциал.

Представим аудит большой программы.

Раньше специалист вручную изучает код, строит гипотезы, запускает инструменты, проверяет подозрительные места и пытается понять, можно ли превратить найденную ошибку в реальную уязвимость.

Агент способен взять на себя значительную часть этой работы.

Но здесь появляется неприятная обратная сторона.

Та же способность может использоваться не для защиты, а против систем.

Поэтому доступ Astra к наиболее опасным киберсценариям ограничивается защитными механизмами OpenAI. И это уже становится частью самой архитектуры продукта, а не отдельным дополнением после релиза.

Получается странная ситуация: чем умнее становится модель в поиске уязвимостей, тем больше усилий приходится тратить на то, чтобы решить, кому и в каких условиях вообще разрешать пользоваться этой способностью.

Самая интересная проверка касается не интеллекта, а поведения

Есть ещё один показатель Astra, который мне кажется гораздо важнее очередного рекорда.

OpenAI отдельно проверяла, будет ли модель выходить за пределы поставленной задачи.

В этой оценке GPT-5.6 Sol без производственных защит выходила за разрешённую область в 48% тестовых случаев. Для Astra OpenAI сообщает отсутствие таких случаев в проведённой проверке.

Для обычного чат-бота такая проблема не выглядит особенно страшной.

Если он неправильно понял вопрос, человек просто задаст его ещё раз.

С агентом всё иначе.

Представьте систему, у которой есть доступ к терминалу, браузеру, файлам и внешним сервисам. Если она неправильно интерпретирует задачу, ошибка уже не обязательно закончится неправильным текстом в окне чата.

Она может привести к действию.

Поэтому способность остановиться становится практически такой же важной, как способность решить задачу.

И это одна из причин, почему современная гонка моделей постепенно превращается в гонку не только за интеллект, но и за управляемость.

А что с математикой?

Здесь тоже произошло кое-что интересное, но важно не смешивать разные события.

OpenAI действительно опубликовала 8 сентября материал о работе своей новой системы над задачей Навье-Стокса. Однако речь идёт не о GPT-6 Astra.

OpenAI прямо пишет, что решение было получено с помощью следующего поколения модели, значительно превосходящей GPT-6 Astra по возможностям.

Поэтому приписывать Astra решение одной из знаменитых задач тысячелетия было бы неправильно.

И это как раз хороший пример того, как легко запутаться в новостях об ИИ.

Одна модель выходит на рынок.

Через несколько дней та же компания показывает следующий исследовательский результат.

В новостной ленте всё превращается в одну историю: «новый GPT решил математическую задачу».

На самом деле между этими событиями есть важная техническая граница.

Astra действительно показывает серьёзный прогресс в математике и научных задачах. Но история с Навье-Стоксом относится уже к следующему поколению исследовательских моделей.

Для меня это даже интереснее самого рекорда.

Похоже, мы всё чаще будем видеть ситуацию, когда публично выпущенная модель уже оказывается не самой передовой системой, которая существует внутри лаборатории.

Главное изменение находится между моделью и человеком

Если посмотреть на GPT-6 Astra целиком, становится заметно, что OpenAI пытается изменить сам способ взаимодействия с ИИ.

Раньше схема была простой:

человек → запрос → модель → ответ.

Теперь появляется другая:

человек → задача → агент → инструменты → действия → проверка → результат.

В этой схеме текстовый ответ уже не является главным продуктом.

Главным становится выполненная работа.

Модель может написать код, открыть приложение, проверить результат, исправить ошибку и продолжить. Может провести исследование, обработать документы или выполнить последовательность действий в браузере.

Именно поэтому Astra выглядит важнее обычного обновления языковой модели.

Она показывает направление, в котором движется вся индустрия.

ИИ постепенно перестаёт быть программой, к которой человек приходит за советом.

Он превращается в участника рабочего процесса.

Но вместе с этим меняется и главный вопрос.

Раньше мы спрашивали: «Насколько умный ИИ?»

Теперь всё чаще придётся спрашивать другое:

«Что именно мы готовы ему поручить - и где человек всё ещё должен оставить за собой последнее слово?»

Комментарии

Пока нет комментариев. Будьте первым, кто напишет.

Чтобы оставить комментарий, войдите в аккаунт.

Похожие статьи