Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
NEWS HN 163 约 1 分钟

蒸馏没有复制DeepSeek审查倾向

实测显示:向 DeepSeek 学金融推理,并未把其敏感话题回避倾向一并学走。

IMAGE — Hacker News 高分帖(24h+ 滚动窗口)

让学生照着老师的答案练习,不代表连老师避而不谈的话题也会学走。一项社区实验用 DeepSeek V4 Flash 生成的内容训练开放权重模型 GPT-OSS-120B,目标是提升金融推理能力。这个过程叫知识蒸馏——学生模型模仿教师输出,迁移其中呈现的能力和行为。

团队设计了 152 组配对问题:每组结构相同,一道涉及中国敏感议题,另一道是对照题,例如“大跃进饥荒”对应“乌克兰大饥荒”。四家美国前沿模型实验室的四个模型担任评审。作者报告称,DeepSeek 在中国相关问题上的“审查”得分比对照题高 45.45 分;但蒸馏后的 GPT-OSS 与未经蒸馏的底座相比,行为差异没有统计显著性。

这提示,金融能力可以迁移,拒答或淡化表述却未必随之迁移。限制可能存在于模型权重、后训练数据、系统提示或在线过滤等不同层,不能只凭产品回答判断来源。不过,这项结论目前只覆盖该团队公布的 304 道提示词及其评审方法,尚不能外推到所有模型、主题和蒸馏方式。


供稿材料 SOURCES — 1

← 返回 2026-08-01 · 科技板块