Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.088 — 2026-09-30
REPO 92 STARS 约 5 分钟

SkillOpt:让Agent自己打磨技能文件

SkillOpt把技能文档当作可训练对象,让Agent从任务反馈中改写、验证并保留更好的工作方法。

IMAGE — GitHub Trending(Python·日榜)

你教 AI 助手做事,常见办法是写一份说明书:先查什么、后做什么、遇到例外怎么办。任务一变,这份说明书又得靠人反复修补。微软开源的 SkillOpt 想把这件事变成一套自动循环:让 Agent 实际做题,根据成败修改说明,再用没参与修改的任务检验新版。值得关注的不是模型突然学会了新知识,而是“怎么使用模型”这层经验,开始有了接近训练流程的管理方式。

这里的 Skill,指教 Agent 完成某类任务的自然语言说明、示例或脚本。SkillOpt 不修改模型权重,而是把这份技能文档当作“可训练状态”。下文的功能、日期和主要成绩均来自 Microsoft 项目仓库这一单一机构信源;项目方未提供足够材料供本文独立复核全部实验结论。

把说明书送进训练闭环

SkillOpt 的基本循环可以概括为:执行任务、收集评分、反思问题、汇总建议、选择修改、更新文档,再做评估。一个独立的 optimizer model——专门负责改技能文件的模型——读取带分数的运行轨迹,只能对单份文档执行受约束的新增、删除或替换。

它借用了神经网络训练的词汇。Epoch 原指完整跑过一轮训练数据;mini-batch 是每次处理的一小批样本。SkillOpt 用这些概念安排文档的多轮迭代,还设置“文本学习率”,限制一次能改多少。被拒绝的修改会留下记录,系统也会按轮次做较慢的汇总更新。最终交付的是一份通常为 300—2,000 tokens 的 best_skill.md,目标模型本身保持不变,部署时也不额外调用模型。

真正关键的是 validation gate,即验证门控。候选修改不能因为在眼前几道题上表现好就直接上岗;默认论文式流程要求它在独立留出的验证任务上严格提高分数,才替换旧版本。这像修改操作手册后先让另一组人试用,避免新规则只会迎合刚才的案例。

“睡一觉再进步”也可能睡坏

2026 年 7 月 2 日发布的 v0.2.0 加入 SkillOpt-Sleep。它面向本地编码 Agent,在夜间回顾历史会话、挖掘重复任务、重新执行,并把通过验证的经验固化为技能。版本还加入实验性的多目标、回放和 dream-rollout 控制;源码仓库提供 Claude Code、Codex、Copilot、Devin 的集成外壳及 OpenClaw 参考适配,但相关 plugin/MCP 文件不在 PyPI wheel 中。

这套门控不是装饰。据 Microsoft SkillOpt Technical Blog,一次没有验证门控的压力测试中,Agent 总结出“回答时原样输出文档标题”的坏规则。错误经过几个夜间循环不断放大,SearchQA 成绩从 55.4%跌至 2.6%;启用门控的对照运行挡住了坏提案,成绩维持在 57.0%。它说明自动学习并不天然等于进步:如果只会总结经验,却没有独立检查,系统也可能稳定地把错误写进制度。

它为什么值得关注

项目方称,SkillOpt 在六个 benchmark、七个目标模型和三种执行框架组成的 52 个组合中,全部达到最好或并列最好。其报告还称,在 GPT-5.5 上,相比没有技能文件的基线,平均准确率分别提升 23.5 个百分点(直接聊天)、24.8 个百分点(Codex Agent 循环)和 19.1 个百分点(Claude Code)。项目还宣称,优化后的技能可以跨模型规模、跨 Codex 与 Claude Code,并迁移到相近 benchmark。

如果这些结果能在更多真实任务上复现,Skill 的生产方式可能从“高手凭经验写提示词”,转向带轨迹、版本、检查点和回滚的工程流程。它优化的是可读、可编辑的文本,因此人仍能检查 Agent 究竟学到了什么。这比把变化全部藏在模型权重里,更容易审计和撤销。

局限与未知

  • 现有材料没有给出具体对照组配置、样本量或重复实验结果,不能据此认定 SkillOpt 已普遍优于其他方法。
  • 一项独立的真实代码仓库研究给出了相反信号:在还原 Kotlin 项目已合并 Pull Request 的任务上,GEPA 平均提高 4.9 个百分点,SkillOpt 生成的技能仅比初始版本高 0.1 个百分点。整洁 benchmark 上的优势能否进入有历史包袱的仓库,仍未解决。
  • “像训练神经网络一样训练技能”和“self-evolution”是项目方的类比与定位。实际被修改的是技能文档,不是模型参数;自动循环能否产生可靠改进,仍取决于评分、验证集和门控设计。

供稿材料 SOURCES — 1
01
microsoft/SkillOpt GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-09-30 · 开源板块