Qwen 3.8 уступила 3.6 в тесте NVFP4
Qwen 3.8Qwen 3.6NVFP4
Что именно показал тест
Для меня главный результат этого сравнения неприятно практичный: Qwen 3.8 не прошла в прод там, где Qwen 3.6 уже держит формат и факты. В полевом отчёте пользователя 438528858 из обсуждения описана аналитика звонков колл-центра одним запросом без thinking. По итогам недельного теста автор решил не менять рабочую версию.
Нагрузка вполне конкретная: в среднем около 10 тыс. токенов на входе, включая транскрипцию и промпт, затем 400–500 токенов аналитики в JSON. Сравнение провели на 200 звонках с одним и тем же промптом. Qwen 3.8 выдала 10 битых JSON, тогда как у Qwen 3.6 таких ответов не было.
Формат оказался не единственной проблемой. По наблюдению автора теста, 3.8 чаще переворачивала факты и делала выводы, которых не было в исходной транскрипции. Для аналитики звонков это хуже обычной стилистической просадки: валидный JSON можно проверить автоматически, а уверенно искажённый факт легко проходит дальше по конвейеру.
Есть важная оговорка: сравнивались не исходные модели, а сильно сжатые сборки unsloth/Qwen3.8-27B-NVFP4 и sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP. Аппаратная конфигурация автора поддерживает нативные вычисления NVFP4, поэтому именно этот формат для него критичен. Причина отставания пока не отделена от качества конкретной сборки и самой квантизации.
Thinking в тесте был отключён. Это существенная деталь: возможное преимущество Qwen 3.8 в thinking-режиме ничего не решает для однопроходного конвейера, где нужны предсказуемая задержка, сохранение фактов и строгая структура ответа.
Почему обновление пока не выглядит обновлением
Вывод здесь узкий, но полезный: для этого NVFP4-сценария Qwen 3.6 оказалась безопаснее как продакшен-компонент. Десять битых ответов можно перехватить валидатором, но более частое искажение фактов требует отдельной проверки содержания и быстро съедает выгоду от смены модели.
Я бы первым делом разделял три возможных источника проблемы: поведение базовой модели, качество NVFP4-квантизации и особенности конкретного репака. Этот тест не доказывает общее превосходство 3.6 над 3.8, зато хорошо показывает цену поспешного обновления по номеру версии.
Пока главный нерешённый вопрос не в том, сильнее ли Qwen 3.8 вообще, а в том, останется ли её преимущество после сжатия и отключения режима, на который она рассчитывает.