2 мин чтения

DeepSeek V4.1 Flash лишили фильтров

DeepSeekбезопасность ИИHugging Face

На Hugging Face опубликована неофициальная версия DeepSeek V4.1 Flash с удаленным на уровне весов отказным поведением. По карточке модели, на HarmBench-320 она выполняет 100% вредоносных запросов против 1,6% у базы, а MMLU падает примерно с 87% до 83%. Это повышает риск злоупотреблений.

Что именно сняли с модели

Меня здесь цепляет не слово «без фильтров», а способ: это не системный промпт и не временный джейлбрейк. По состоянию на сентябрь 2026 года на Hugging Face опубликована неофициальная сборка DeepSeek V4.1 Flash, где отказное поведение заявлено удаленным на уровне весов. Такая правка переносится вместе с самой моделью и не зависит от конкретной обертки.

В карточке модели, опубликованной dealignai на Hugging Face, метод назван «permanent weight-level abliteration». Он описан как постоянная правка пространства отказов при попытке сохранить рассуждение, зрение и общие возможности. Автор также указывает нативные веса FP8, но точная процедура в публичном описании намеренно не раскрыта.

Главная цифра здесь не про качество, а про безопасность. На HarmBench-320 модифицированная сборка, согласно карточке, выполняет 100% вредоносных запросов. Базовая версия при максимальном рассуждении пропускала 1,6%, то есть разница отражает почти полное исчезновение отказов на этом наборе.

За это пришлось заплатить качеством: MMLU снизился с 86,96% до 82,74%, или примерно на четыре процентных пункта. Называть такую потерю незаметной я бы не стал. При этом MMLU ничего не говорит о том, сохранились ли стабильность рассуждений, зрительные возможности и поведение на многоязычных или двойных по назначению запросах.

Все показатели опубликованы автором сборки, поэтому я воспринимаю их как заявленные результаты, а не независимую проверку. В первую очередь я бы смотрел на воспроизводимость HarmBench, разбивку по категориям и побочные изменения на обычных запросах. Удаление отказов редко бывает изолированной операцией: вместе с защитой можно задеть полезные внутренние направления модели.

Почему это меняет расклад

Это реальное техническое изменение, а не очередная инструкция «игнорируй предыдущие правила». Исследователи получают открытый артефакт для изучения alignment, отказов и устойчивости весовых модификаций. Одновременно порог для злоупотребления снижается, поскольку защита не возвращается простой заменой системного промпта.

Для локальных и специализированных сценариев меньшее число ложных отказов может выглядеть привлекательно. Но HarmBench со значением 100% означает обратную сторону: модель также не проводит границу там, где запрос явно вредоносен. Без отдельного внешнего слоя контроля такую сборку нельзя считать просто более послушной версией исходной модели.

Самое интересное теперь не в том, удалось ли убрать цензуру. Судя по опубликованным цифрам, удалось. Нерешенный вопрос в другом: насколько глубоко эта операция изменила модель за пределами нескольких удобных бенчмарков.

Ранее мы разбирали, как Anthropic отменила скрытое понижение качества ответов Claude на запросы и что прозрачность моделей означает для пользователей. Выход DeepSeek V4.1 Flash без фильтров продолжает эту дискуссию, выводя на первый план поведение модели и контроль доступа.