开源
Unbounded Labs 开源 2.82B 参数「复古」大模型 Bart
独立团队 Unbounded Labs 用不到 $1000 在单卡 H100 上从零训练 2.82B 参数的复古语言模型…
2026.08.25 · 周二约 3 分钟阅读
独立研究团队 Unbounded Labs 近日发布并完全开源了名为 Bart 的「复古」语言模型(vintage LLM):参数量 2.82B,从零开始训练,使用了 20.1B token 的 1931 年前英文文本语料。整个项目自掏腰包花费约 $807,最终模型在一张 H100 上训练 5 天完成,训练全程保持约 60% MFU(Model FLOPs Utilization)。团队同步开放了 Demo、博客文章、模型权重以及全部训练代码与数据集。
项目动机:用旧语料检验 LLM 推理上限
团队在博文中解释了做「复古 LLM」的原因:受 Demis Hassabis 启发,他们想探索「如果只用过去的文本训练,LLM 能否得出与历史上伟大科学家相同的结论」。他们认为这一方向触及 AI 研究的本质问题——模型究竟是在产生原创思考,还是仅仅在做 next-token 预测。受限于预算,他们没能复现广义相对论级别的成果,但希望通过精细的数据策展与高效训练,在受限领域逼近最优解。
数据、基准与训练细节
- 数据集清理:对哈佛大学 Institutional Books 数据集(原始 242B token)做了清洗,最终保留约 23B token 的高质量 1931 年前文本;
- 新基准 Vintage CORE:由于缺乏现成的复古场景评估集,团队自建了包含 20 个任务的 Vintage CORE 套件,专门用于评估 vintage LLM;
- 自主实验:在 H100 上运行了约 10 小时的自动化研究流程,共跑了 100 个实验,其中 26 项带来改进;
- 后训练 SFT:发布了一个含 41.6 万条问答对的 SFT 数据集,答案均基于 1930 年前文本,团队称这是目前已知的最大复古 SFT 数据集;
- 性能表现:在 Vintage CORE 上以更小的 token 预算取得同规模下的最佳成绩,超过了他们对比的 GPT-1900 基线。
全部开源与下一步诉求
Bart 的模型权重、训练数据、清洗流程、训练代码、评测脚本以及训练运行日志均已开源(Hugging Face 模型 ID 为 jbduran/bart-sft)。团队坦言「资金是限制我们跑更大规模实验的唯一瓶颈」,并公开寻求算力资助、经费以及 pre-training / post-training 方向的导师支持。
作为一个完全自筹、单卡完成的小规模实验,Bart 在算力受限条件下展示了较高的训练效率与完整的工程闭环,其开源的复古语料与基准对相关研究具备参考价值,但对当前主流大模型格局影响有限。
