3 min de lectura

DeepSeek V4.1 Flash se queda sin filtros

DeepSeekбезопасность ИИHugging Face

Una compilación no oficial de DeepSeek V4.1 Flash en Hugging Face afirma haber eliminado las negativas directamente de los pesos. Su ficha declara un 100% de cumplimiento de solicitudes dañinas en HarmBench-320, frente al 1,6% de la versión base, mientras MMLU baja aproximadamente del 87% al 83%.

Qué se eliminó exactamente del modelo

Lo relevante no es la etiqueta «sin filtros», sino el método: no se trata de un prompt de sistema ni de un jailbreak temporal. En septiembre de 2026, Hugging Face aloja una compilación no oficial de DeepSeek V4.1 Flash cuyo comportamiento de rechazo supuestamente fue eliminado a nivel de pesos. Una modificación así acompaña al propio modelo y no depende de una interfaz concreta.

En la ficha publicada por dealignai en Hugging Face, el método recibe el nombre de «permanent weight-level abliteration». Se describe como una edición permanente del espacio de rechazos que intenta conservar el razonamiento, la visión y las capacidades generales. El autor también indica pesos FP8 nativos, aunque el procedimiento exacto se omite deliberadamente de la descripción pública.

La cifra clave no habla de calidad, sino de seguridad. Según la ficha, la compilación modificada ejecuta el 100% de las solicitudes dañinas en HarmBench-320. La versión base, con el razonamiento al máximo, permitía un 1,6%, por lo que la diferencia refleja una desaparición casi total de los rechazos en ese conjunto.

El precio fue una caída de calidad: MMLU pasó del 86,96% al 82,74%, unos cuatro puntos porcentuales. No consideraría insignificante esa pérdida. Además, MMLU no dice nada sobre si se conservaron la estabilidad del razonamiento, las capacidades visuales o el comportamiento ante consultas multilingües y de doble uso.

Todas las cifras fueron publicadas por el autor de la compilación, así que las considero resultados declarados, no una verificación independiente. Primero habría que revisar la reproducibilidad de HarmBench, los resultados por categoría y los efectos secundarios en consultas normales. Eliminar rechazos rara vez es una operación aislada: junto a las salvaguardas pueden alterarse direcciones internas útiles del modelo.

Por qué esto cambia el panorama

Es una modificación técnica real, no otra receta de «ignora las instrucciones anteriores». Los investigadores obtienen un artefacto abierto para estudiar alignment, rechazos y la solidez de las modificaciones de pesos. A la vez, baja el umbral para el abuso, porque la protección no vuelve con solo cambiar el prompt de sistema.

En escenarios locales y especializados, tener menos rechazos falsos puede parecer atractivo. Pero un 100% en HarmBench tiene una cara opuesta evidente: el modelo tampoco marca límites cuando la solicitud es claramente dañina. Sin una capa externa de control independiente, esta compilación no debe verse como una versión simplemente más obediente del modelo original.

La cuestión más interesante ya no es si se podía eliminar la censura. Según las cifras publicadas, sí. Lo que sigue sin resolverse es hasta qué punto la operación cambió el modelo más allá de unos pocos benchmarks convenientes.

Anteriormente analizamos cómo Anthropic revirtió las degradaciones ocultas de consultas de Claude y qué significa la transparencia de los modelos para los usuarios. El lanzamiento sin filtros de DeepSeek V4.1 Flash amplía ese debate al poner el comportamiento del modelo y los controles de acceso en el centro.