DeepSeek V4.1 Flash лишили фильтров
DeepSeekбезопасность ИИHugging Face
Что именно сняли с модели
Меня здесь цепляет не слово «без фильтров», а способ: это не системный промпт и не временный джейлбрейк. По состоянию на сентябрь 2026 года на Hugging Face опубликована неофициальная сборка DeepSeek V4.1 Flash, где отказное поведение заявлено удаленным на уровне весов. Такая правка переносится вместе с самой моделью и не зависит от конкретной обертки.
В карточке модели, опубликованной dealignai на Hugging Face, метод назван «permanent weight-level abliteration». Он описан как постоянная правка пространства отказов при попытке сохранить рассуждение, зрение и общие возможности. Автор также указывает нативные веса FP8, но точная процедура в публичном описании намеренно не раскрыта.
Главная цифра здесь не про качество, а про безопасность. На HarmBench-320 модифицированная сборка, согласно карточке, выполняет 100% вредоносных запросов. Базовая версия при максимальном рассуждении пропускала 1,6%, то есть разница отражает почти полное исчезновение отказов на этом наборе.
За это пришлось заплатить качеством: MMLU снизился с 86,96% до 82,74%, или примерно на четыре процентных пункта. Называть такую потерю незаметной я бы не стал. При этом MMLU ничего не говорит о том, сохранились ли стабильность рассуждений, зрительные возможности и поведение на многоязычных или двойных по назначению запросах.
Все показатели опубликованы автором сборки, поэтому я воспринимаю их как заявленные результаты, а не независимую проверку. В первую очередь я бы смотрел на воспроизводимость HarmBench, разбивку по категориям и побочные изменения на обычных запросах. Удаление отказов редко бывает изолированной операцией: вместе с защитой можно задеть полезные внутренние направления модели.
Почему это меняет расклад
Это реальное техническое изменение, а не очередная инструкция «игнорируй предыдущие правила». Исследователи получают открытый артефакт для изучения alignment, отказов и устойчивости весовых модификаций. Одновременно порог для злоупотребления снижается, поскольку защита не возвращается простой заменой системного промпта.
Для локальных и специализированных сценариев меньшее число ложных отказов может выглядеть привлекательно. Но HarmBench со значением 100% означает обратную сторону: модель также не проводит границу там, где запрос явно вредоносен. Без отдельного внешнего слоя контроля такую сборку нельзя считать просто более послушной версией исходной модели.
Самое интересное теперь не в том, удалось ли убрать цензуру. Судя по опубликованным цифрам, удалось. Нерешенный вопрос в другом: насколько глубоко эта операция изменила модель за пределами нескольких удобных бенчмарков.