想从5万条客服工单里找出“客户是否愤怒”,关键词搜索往往不够,逐条让聊天模型写一段回答又难以直接计算。DuckDB博客介绍的Jev换了种做法:它不生成句子,只返回布尔值、固定类别或评分,并附上概率。比如“客户是否愤怒”可以直接变成SQL里WHERE后的判断条件。
这点比“让AI读懂数据”更具体:类型固定后,结果可以继续筛选、分组、排序,也能按概率设门槛,语义判断因此更像一个可组合、可校验的SQL算子。已有DuckDB扩展把它接到CSV、Parquet和数据表上;据该博客转述,Hamilton Ulmer制作的扩展可在约10秒内分类约1000行。Parquet是一种按列存放的分析文件,DuckDB则能直接用SQL查询这类本地文件,无需先部署数据库服务器。
边界也很明确:这些扩展会把行内容发送给第三方API,不适合未经许可共享的数据;多数扩展尚需自行编译,且速度与成本数据主要来自厂商或开发者披露。