2 мин чтения

Qwen 3.8 уступила 3.6 в тесте NVFP4

Qwen 3.8Qwen 3.6NVFP4

В пользовательском тесте NVFP4 для аналитики звонков Qwen 3.8 уступила Qwen 3.6. На 200 запросах новая версия выдала 10 битых JSON, тогда как у 3.6 таких ответов не было, и чаще искажала факты. Для продакшена это повышает риск ошибок в структурированном конвейере.

Что именно показал тест

Для меня главный результат этого сравнения неприятно практичный: Qwen 3.8 не прошла в прод там, где Qwen 3.6 уже держит формат и факты. В полевом отчёте пользователя 438528858 из обсуждения описана аналитика звонков колл-центра одним запросом без thinking. По итогам недельного теста автор решил не менять рабочую версию.

Нагрузка вполне конкретная: в среднем около 10 тыс. токенов на входе, включая транскрипцию и промпт, затем 400–500 токенов аналитики в JSON. Сравнение провели на 200 звонках с одним и тем же промптом. Qwen 3.8 выдала 10 битых JSON, тогда как у Qwen 3.6 таких ответов не было.

Формат оказался не единственной проблемой. По наблюдению автора теста, 3.8 чаще переворачивала факты и делала выводы, которых не было в исходной транскрипции. Для аналитики звонков это хуже обычной стилистической просадки: валидный JSON можно проверить автоматически, а уверенно искажённый факт легко проходит дальше по конвейеру.

Есть важная оговорка: сравнивались не исходные модели, а сильно сжатые сборки unsloth/Qwen3.8-27B-NVFP4 и sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP. Аппаратная конфигурация автора поддерживает нативные вычисления NVFP4, поэтому именно этот формат для него критичен. Причина отставания пока не отделена от качества конкретной сборки и самой квантизации.

Thinking в тесте был отключён. Это существенная деталь: возможное преимущество Qwen 3.8 в thinking-режиме ничего не решает для однопроходного конвейера, где нужны предсказуемая задержка, сохранение фактов и строгая структура ответа.

Почему обновление пока не выглядит обновлением

Вывод здесь узкий, но полезный: для этого NVFP4-сценария Qwen 3.6 оказалась безопаснее как продакшен-компонент. Десять битых ответов можно перехватить валидатором, но более частое искажение фактов требует отдельной проверки содержания и быстро съедает выгоду от смены модели.

Я бы первым делом разделял три возможных источника проблемы: поведение базовой модели, качество NVFP4-квантизации и особенности конкретного репака. Этот тест не доказывает общее превосходство 3.6 над 3.8, зато хорошо показывает цену поспешного обновления по номеру версии.

Пока главный нерешённый вопрос не в том, сильнее ли Qwen 3.8 вообще, а в том, останется ли её преимущество после сжатия и отключения режима, на который она рассчитывает.

Ранее мы сравнивали точность и риски галлюцинаций у ИИ-инструментов для подготовки итогов встреч в бизнес-процессах. Эти выводы помогают интерпретировать ошибки Qwen 3.8 в аналитике колл-центра.