Wink Pings

0%拒答率,6轮手术:Qwen3.8-27B-OBLITERATED把安全对齐拆了

OBLITERATUS发布Qwen3.8-27B-OBLITERATED,号称最激进的未审查版本。6轮手术,842条有害提示零拒绝,代价是MMLU下降6个百分点。

8月20日,OBLITERATUS放出了Qwen3.8-27B-OBLITERATED。基座是阿里的Qwen3.8-27B,按项目页的说法,这是目前最激进的未审查版本:842条有害提示,硬拒绝率0%;AI红队测试18/18;jailbreak、RAT、攻击链,全给。

![Hugging Face项目页面截图](https://wink.run/image?url=https%3A%2F%2Fpbs.twimg.com%2Fmedia%2FHQKUe0XaMAAxvgt%3Fformat%3Djpg%26name%3Dlarge)

普通abliteration(一种通过移除权重方向来去除拒绝行为的技术)只找一个拒绝方向,投影掉就完事。但单方向会漏掉只在特定类别上激活的拒绝轴。OBLITERATUS的做法是:5个SVD方向,6轮迭代,每轮把上一轮冠军模型自己失败的拒绝样本作为加权硬负样本,挖出残留拒绝方向。第6轮试了三种方法,只有最终这个Aggressive方案成功。前两种要么把模型搞到无法停止生成,要么直接融化。

代价也明确:MMLU从87.4%掉到81.4%,-6pp。作为对比,单方向abliteration大约只掉1pp,但会残留部分拒绝行为。OBLITERATUS选择用6pp通用能力换绝对服从。

项目页强调,设置很重要:temperature=0,repetition_penalty=1.15,不要系统提示,关闭思考。否则greedy解码会循环。Q4_K_M量化约15GB,本地能跑。

模型提供GGUF、Safetensors和MLX三种格式,链接在[这里](https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED)。另外有网友在推文下提到,这类模型真正的价值是数据本地化:离线运行意味着可以把真实客户的重现、内部发现、敏感payload直接喂给模型,不需要走法律审查。对受监管行业和渗透测试来说,这是实际解锁。

也有网友泼冷水:用harmful prompts这种措辞,等于给Anthropic和政府递刀子,推动对开源模型的打压。还有人对比了其他选择,比如有网友提到另一个orca版本有Q8几乎全精度、0拒答,还有Cisco的Foundation-Sec-8B,以及一个土耳其语网络安全模型Titus-CybersecurityLLM。

![用户晒出的硬件配置](https://wink.run/image?url=https%3A%2F%2Fpbs.twimg.com%2Fmedia%2FHQMHby6WcAA5F9y%3Fformat%3Dpng%26name%3Dlarge)

评论区有位用户晒出自己的ThinkBook 16 G7 IML,96GB内存,还在纠结跑什么模型。这大概是另一层面的硬件焦虑了。

安全对齐可以被拆掉,但能力也会掉。OBLITERATUS选择把通用能力换成交付度。划不划算,取决于你要拿它干什么。

发布时间: 2026-08-21 05:40