2 хв читання

DeepSeek V4.1 Flash позбавили фільтрів

DeepSeekбезопасность ИИHugging Face

На Hugging Face опубліковано неофіційну збірку DeepSeek V4.1 Flash із поведінкою відмов, нібито вилученою на рівні ваг. Її картка заявляє 100% виконання шкідливих запитів у HarmBench-320 проти 1,6% у базової моделі, тоді як MMLU знижується приблизно з 87% до 83%.

Що саме прибрали з моделі

Тут привертає увагу не словосполучення «без фільтрів», а спосіб: це не системний промпт і не тимчасовий джейлбрейк. Станом на вересень 2026 року на Hugging Face опубліковано неофіційну збірку DeepSeek V4.1 Flash, у якій поведінку відмов нібито вилучено на рівні ваг. Така правка переноситься разом із самою моделлю й не залежить від конкретної оболонки.

У картці моделі, опублікованій dealignai на Hugging Face, метод названо «permanent weight-level abliteration». Його описують як постійну зміну простору відмов зі спробою зберегти міркування, зорові можливості та загальні здібності. Автор також зазначає нативні ваги FP8, але точна процедура навмисно не розкривається в публічному описі.

Головна цифра тут стосується не якості, а безпеки. Згідно з карткою, модифікована збірка виконує 100% шкідливих запитів у HarmBench-320. Базова версія за максимального режиму міркування пропускала 1,6%, тому різниця вказує на майже повне зникнення відмов у цьому наборі.

За це довелося заплатити якістю: MMLU знизився з 86,96% до 82,74%, тобто приблизно на чотири відсоткові пункти. Назвати таку втрату непомітною не можна. Водночас MMLU не показує, чи збереглися стабільність міркувань, зорові можливості та поведінка на багатомовних або подвійного призначення запитах.

Усі показники опублікував автор збірки, тому їх варто сприймати як заявлені результати, а не незалежну перевірку. Насамперед слід перевірити відтворюваність HarmBench, розподіл за категоріями та побічні зміни на звичайних запитах. Усунення відмов рідко буває ізольованою операцією: разом із захистом можна зачепити корисні внутрішні напрями моделі.

Чому це змінює ситуацію

Це справжня технічна модифікація, а не чергова інструкція «ігноруй попередні правила». Дослідники отримують відкритий артефакт для вивчення alignment, відмов і стійкості змін на рівні ваг. Водночас поріг для зловживань знижується, адже захист не повертається простою заміною системного промпту.

Для локальних і спеціалізованих сценаріїв менша кількість хибних відмов може здаватися привабливою. Але результат 100% у HarmBench має очевидний зворотний бік: модель також не проводить межу, коли запит явно шкідливий. Без окремого зовнішнього рівня контролю цю збірку не можна вважати просто слухнянішою версією початкової моделі.

Найцікавіше питання тепер не в тому, чи вдалося прибрати цензуру. Судячи з опублікованих цифр, вдалося. Невирішеним залишається інше: наскільки глибоко ця операція змінила модель за межами кількох зручних бенчмарків.

Раніше ми розглядали, як Anthropic скасувала приховане зниження якості відповідей Claude на запити та що прозорість моделей означає для користувачів. Випуск DeepSeek V4.1 Flash без фільтрів продовжує цю розмову, зосереджуючи увагу на поведінці моделі й контролі доступу.