GPT-6 Sol не доказал регресс против GPT-5.6
GPT-6 SolGPT-5.6регресс моделей
Что известно о сравнении GPT-6 Sol и GPT-5.6
Я бы не спешил хоронить GPT-6 Sol по одной эмоциональной реплике. Исходное сообщение утверждает, что модель сильно глупее GPT-5.6, но не содержит описания задачи, повторных запусков, оценок или даже условий доступа. Это наблюдение пользователя, а не воспроизводимое сравнение.
В официальной документации OpenAI по GPT-5.6 модель показана как сильная на BrowseComp, OSWorld 2.0, ExploitBench, ExploitGym и SEC-Bench Pro. Публикации сообщества OpenAI о GPT-6 Astra, в свою очередь, заявляют передовые результаты на FrontierMath Tier 4, ARC-AGI 3 и TerminalBench-4.0. Проблема очевидна: Astra и Sol нельзя молча считать одной конфигурацией.
Сторонние сводки также сообщают, что GPT-6 Astra превосходит GPT-5.6 на ARC-AGI-3, FrontierMath Tier 4, OSWorld 2.0 и ExploitBench. В отдельном обсуждении возможный регресс связывают с GPT-6 Luna и одним индексом для программирования, тогда как GPT-6 Sol там, наоборот, приписывают улучшение. LiveBench показывает сильный общий результат GPT-6 Astra Max Effort, особенно в рассуждениях и математике.
Есть и путаница с доступом. В разъяснении сообщества утверждается, что GPT-5.6 Sol остается самой высокой доступной моделью в стандартном чате. На момент обсуждения названия, варианты и развертывание выглядят достаточно запутанно, чтобы пользователь мог сравнивать не те режимы, которые предполагает.
Почему субъективная жалоба все равно имеет значение
Общий регресс не доказан, но локальная деградация вполне может быть реальной для конкретного рабочего процесса. Совокупный рост на тестах не гарантирует одинакового поведения в коде, длинных диалогах, работе с инструментами или задачах, где важнее стабильность, чем лучший единичный ответ.
Как инженер, я бы сначала проверил точное имя варианта, режим вычислений, ограничения доступа, исходный запрос и серию повторов. Без этого слово «глупее» смешивает качество рассуждения, стиль ответа, отказоустойчивость и эффективность. Получается яркий диагноз без локализации неисправности.
Пока факты говорят не о провале поколения, а о разрыве между агрегированными тестами и опытом отдельных пользователей. Самый интересный вопрос здесь не в том, вырос ли средний балл, а в том, почему конкретный сценарий мог стать хуже при общем движении метрик вверх.