你问模型一个敏感问题,它常常直接拒答。Heretic 想把这种“刹车”自动拆掉:不用再做成本较高的后训练,也不要求使用者理解模型内部结构。单日新增257星,说明这类修改工具正快速吸引关注,也让模型该由谁控制、边界放在哪里变得更难回避。
它采用 Directional ablation(方向消融)——找到模型内部与拒答相关的方向,再将其削弱;随后用 Optuna 自动寻找参数,同时压低拒答次数和 KL divergence(衡量修改前后输出分布差异的指标)。在项目给出的 Gemma 3 12B 测试中,原模型对100条“有害”提示拒答97次,Heretic 版本只拒答3次;其 KL 散度为0.16,低于两个人工消融版本的1.04和0.45。作者据此认为,它在减少拒答的同时较少损伤原模型能力。
不过,这些数字来自项目方测试,且作者注明结果可能随平台和硬件变化;自动指标也不能替代人工评估。更关键的是,减少拒答既意味着更强的使用者控制,也意味着原有安全边界被主动移除。