数据团队常遇到一种麻烦:先在笔记本上拿小样本试算法,数据变大后又换一套工具重写。两份代码要同步维护,久而久之,笔记本和线上看板甚至会算出不同答案。Polars 博客作者 Thijs Nieuwdorp 展示了一条少重写的路径:用 Polars——一种筛选、连接和汇总表格数据的开源工具——在本地开发,再把同一套查询交给云端执行。
作者先取 Polymarket 订单簿三小时的数据,共 9700 万行。这份样本跨越多个文件分区,因此结构接近完整月份。查询采用“惰性执行”:先记下所有处理步骤,最后统一优化和计算。本地验证后,团队只更换决定执行位置的方法调用,便在 Polars Cloud 上把原查询用于一个月的数据:160 亿行、约 500 GB 压缩 Parquet 文件。结果被预先汇总成少量小文件,再供 Plotly Dash 看板读取。
值得注意的不是单次跑出一个大数字,而是本地原型与规模化执行开始共用查询逻辑,减少重写和结果漂移。不过这些规模与流程均来自作者自述,材料未披露运行时间、成本或与其他方案的对比。