GPT-6 Sol не довів регресію порівняно з GPT-5.6
GPT-6 SolGPT-5.6регресс моделей
Що відомо про порівняння GPT-6 Sol і GPT-5.6
Я б не поспішав списувати GPT-6 Sol через один емоційний коментар. Початкове повідомлення стверджує, що модель значно слабша за GPT-5.6, але не містить опису завдання, повторних запусків, оцінок чи навіть умов доступу. Це спостереження користувача, а не відтворюване порівняння.
В офіційній документації OpenAI GPT-5.6 показано як сильну модель у BrowseComp, OSWorld 2.0, ExploitBench, ExploitGym і SEC-Bench Pro. Водночас публікації спільноти про GPT-6 Astra заявляють про передові результати на FrontierMath Tier 4, ARC-AGI 3 і TerminalBench-4.0. Проблема очевидна: Astra та Sol не можна мовчки вважати однією конфігурацією.
Зовнішні зведення також повідомляють, що GPT-6 Astra перевершує GPT-5.6 на ARC-AGI-3, FrontierMath Tier 4, OSWorld 2.0 та ExploitBench. В окремому обговоренні можливу регресію пов’язують із GPT-6 Luna та одним індексом програмування, тоді як GPT-6 Sol там, навпаки, приписують покращення. LiveBench демонструє сильний загальний результат GPT-6 Astra Max Effort, особливо в міркуванні та математиці.
Є також плутанина з доступом. В одному роз’ясненні спільноти стверджується, що GPT-5.6 Sol лишається найпотужнішою доступною моделлю у стандартному чаті. На час обговорення назви, варіанти та розгортання виглядають досить заплутаними, тож користувачі можуть порівнювати не ті режими, які, на їхню думку, використовують.
Чому суб’єктивна скарга все одно важлива
Загальна регресія не доведена, але локальне погіршення цілком може бути реальним для конкретного робочого процесу. Сукупне зростання результатів тестів не гарантує однакової поведінки в коді, довгих діалогах, роботі з інструментами чи завданнях, де стабільність важливіша за найкращу одиничну відповідь.
Як інженер, я б спочатку перевірив точну назву варіанта, режим обчислень, обмеження доступу, початковий запит і серію повторів. Без цього слово «дурніша» змішує якість міркування, стиль відповіді, надійність та ефективність. Це яскравий діагноз без локалізації несправності.
Наразі факти свідчать не про провал покоління, а про розрив між агрегованими тестами та досвідом окремих користувачів. Найцікавіше питання не в тому, чи зріс середній бал, а в тому, чому конкретний сценарій міг погіршитися за загального зростання метрик.