Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.030 — 2026-08-03
PAPER 约 1 分钟

临床报表让多智能体交叉验算

PROVE让语言模型负责“看懂报表”,把数字对错交给可重复执行的统计规则。

临床试验报表最怕一种错:文字看着合理,数字却对不上。比如安全性汇总里的总人数,与各分组之和不一致。PROVE(Programmatic Reporting and Output Verification Engine)尝试给多智能体加一道“硬校验”:语言模型负责理解措辞、查找文件;最终的算术和逻辑判断,则交给同样输入必然得到同样结果的程序规则。

它检查的是 TFLs——临床试验报告中的表、图和逐条清单。系统先把不同输出里的数字、临床含义和来源位置连成一张语义关系图,再跨表核对分母、百分比和层级关系。最值得注意的结果出现在措辞变化时:同一概念换一种写法,纯匹配方案的召回率为 0.588;加入语言模型做语义匹配后升至 0.993,F1 从 0.735 升至 0.996。换句话说,模型擅长认出“说的是不是一回事”,程序负责判定“算得对不对”。不过这些数字来自作者构造的十套合成肿瘤试验报告,且只覆盖已实现的规则,真实项目中的表现仍待验证。


供稿材料 SOURCES — 1

← 返回 2026-08-03 · 数据板块