2 мин чтения

GPT-6 Astra: мультимодальность и риск для агентов

GPT-6 AstraOpenAIбезопасность ИИ

OpenAI выпустила GPT-6 Astra и поэтапно открывает ее в ChatGPT, API и AWS. Мультимодальность и computer use расширяют агентные сценарии, но повышают риск prompt injection: скрытый текст может изменить цель агента без запуска вредоносного кода.

Что именно получила GPT-6 Astra

Меня в этом релизе цепляет не ярлык «самая мощная», а широкий выход GPT-6 Astra сразу в ChatGPT Plus, Pro, Business, Enterprise, API и AWS. В официальной документации и материалах запуска OpenAI модель названа наиболее способной в линейке, а отдельная запись gpt-6-astra на странице цен подтверждает доступ через платформу OpenAI.

На момент анонса развертывание идет поэтапно. Для Enterprise доступ контролируют администраторы, причем при запуске он выключен по умолчанию. Это разумная пауза: модель ориентирована не только на ответы в чате, но и на computer use, агентное поведение и работу с мультимодальными задачами.

Обсуждаемый Jarvis-режим пока стоит отделять от подтвержденных возможностей. В доступных официальных материалах OpenAI такого названия нет. Computer use подтвержден, а конкретный режим с этим именем пока остается частью обсуждения, не спецификацией продукта.

Сравнение с Fable 5.1 тоже не дает простого победителя. По независимым оценкам Astra уступает ей в кодинге и дизайне, зато выглядит сильнее в математике, 3D, компьютерном зрении и науке. При этом сторонние сводки приписывают Fable 5.1 результат 55,8% на Terminal-Bench 4.0, 73,4% на CursorBench 3.2.0 и 100% на ProofBench v1.1.

Я бы не собирал из этих цифр единый рейтинг. Они получены в разных задачах и пересказаны сторонними источниками, а не сопоставлены в общей карточке моделей. Для агентной системы особенно важно, измеряет ли тест только успешность задания или еще устойчивость к вредоносным инструкциям.

Почему безопасность здесь важнее рейтинга

Главный инженерный риск Astra связан с тем, что хороший агент получает больше способов ошибиться с последствиями. В обзоре безопасности OpenAI модель названа первой, достигшей уровня Critical по киберспособностям в рамках Preparedness Framework, поэтому доступ для защитного тестирования вводится поэтапно.

Prompt injection не требует запуска вредоносного кода. Скрытая инструкция в документе или на странице может заставить агента изменить цель, раскрыть доступный контекст либо неправильно использовать инструмент. Для пользователя это выглядит как заражение агента, хотя фактически модель просто приняла чужой текст за более приоритетную команду.

В продакшене я бы первым проверял изоляцию инструментов, границы полномочий и обработку недоверенного контента. Бенчмарк по математике или кодингу этого не покажет. Реальная планка для GPT-6 Astra определяется не тем, насколько далеко агент способен пройти сам, а тем, насколько надежно он умеет остановиться перед чужой инструкцией.

Мы уже разбирали, как появление Codex в ChatGPT на Android меняет сценарии удалённой разработки и автоматизации. Запуск GPT-6 Astra продолжает эту линию, расширяя возможности ассистента за счёт нового режима и мультимодальности.