Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
PAPER 约 1 分钟

小模型在笔记本上也能办成事

Mingbird重做本地Agent脚手架,让2B小模型的真实任务成绩大幅提升。

让笔记本上的小模型整理文件、写代码,它可能明明知道下一步该做什么,却因工具说明塞满“工作台”、调用失败后反复打转,最后甚至在文件尚未生成时宣布完成。Mingbird把这些问题归因于Agent Harness——包在模型外、负责提供工具、保存进度和决定下一步的执行脚手架——并为Windows与Ollama本地运行环境重新设计了十项机制。

最具体的结果来自作者自建的LRAB测试:在机器、模型、时间预算和评分方式不变时,Mingbird让2B开放权重模型——可下载到个人电脑运行的约20亿参数模型——取得0.821分,其他三套脚手架为0.017至0.271。关键做法之一是“完成闸门”:模型说做完后,系统会重新读取任务并检查产物;作者称移除它后总分下降0.098。这个差值只能视作方向性证据,因为重复实验本身最多波动0.069。论文的主要限制也很明确:核心测试由作者自建,只用一台机器,且多数单元仅运行一次。


供稿材料 SOURCES — 1

← 返回 2026-10-05 · 学术板块