Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.022 — 2026-07-26
NEWS 约 1 分钟

The Stack v3扩建开放代码语料

The Stack v3开放114 TB代码语料,并提供清洗版与完整底稿两种入口。

IMAGE — r/LocalLLaMA 日榜

训练代码模型,像给学生准备一座程序仓库:同一份代码抄了几十遍、文件质量参差不齐,甚至夹着姓名和邮箱,都会影响它学到什么,也带来记忆与隐私风险。The Stack v3把重点放在这层“教材”上。据发布信息,新版提供两个入口,让训练者在开箱即用与自行清洗之间选择。

stack-v3-train是处理好的训练版:做了近似去重——删除相同或高度相似的文件,并加入质量过滤和PII脱敏;PII指姓名、邮箱、电话号码等可识别个人身份的信息。代码内容直接放在数据集中,可用Hugging Face的load_dataset加载。另一套stack-v3-full则保留完整的114 TB语料,包括所有重复文件及其聚类编号,并为被排除文件留下记录。研究者因此可以自己决定如何去重、过滤和混合不同子集。值得注意的是,目前材料来自社区帖子转述的发布信息,未披露各项清洗规则、语言构成及其对模型训练效果的具体影响。


供稿材料 SOURCES — 1

← 返回 2026-07-26 · 开源板块