研究论文
Pistis 多模态大模型技术报告:融合蒸馏与强化学习的 IDRL 后训练范式
arXiv 发布 Pistis 模型技术报告,基于 Qwen3 构建 27B 与 9B 两种规模多模态大模型,提出交错式…
2026.09.25 · 周五约 3 分钟阅读
arXiv 近日发布 Pistis 模型系列的技术报告,提出了一套面向多模态大模型的可扩展后训练框架,并在 Qwen3 基础上衍生出两个参数量级的模型与多种专用变体。报告重点介绍了一种名为 IDRL(Interleaved Distillation and Reinforcement Learning,交错式蒸馏与强化学习)的新训练范式,以及一种无需更新模型参数即可提升智能体表现的系统级方法 PAH。
模型规格与定位
Pistis 模型家族包含两种参数规模:
- 27B 参数版本:基于 Qwen3.6 构建,主打多模态推理与长链路智能体能力。
- 9B 参数版本:基于 Qwen3.5 构建,强调轻量化部署与多模态搜索。
在两个规模上各衍生出两种专用变体:
- Pistis-Thinking:侧重强化深度多模态推理。
- Pistis-Agentic:在 Thinking 基础上额外引入智能体轨迹数据,支持长链路规划、迭代推理与工具调用,且在多模态搜索任务上表现尤为突出。
报告称,两个规模的所有 Pistis 变体在评测中均超过对应的基座模型。
后训练框架:SFT + IDRL
报告描述的训练流程分为两步:
- 大规模多模态监督微调(SFT):先通过大规模多模态 SFT 建立统一基础能力。
- IDRL 后训练范式:在 SFT 基础上,将 on-policy 蒸馏与强化学习紧密耦合到同一个训练循环中,通过两种目标交替优化,避免单独训练或以静态联合损失简单混合。
报告指出,IDRL 设计带来三点收益:
- 更高效的知识迁移;
- 更稳定的优化过程;
- 更精确的信用分配,尤其针对长链路智能体轨迹。
IDRL 在减少常见能力之间此消彼长的同时,提升模型整体表现。
Pistis-Auto-Harnessing:自动优化推理脚手架
除模型参数层面的优化外,报告还提出系统级方法 Pistis-Auto-Harnessing(PAH)。其特点包括:
- 通过迭代优化自动改进智能体的推理脚手架(inference harness);
- 不更新模型参数即可提升模型表现;
- 不增加交互预算,适合资源受限或延迟敏感的场景。
报告称实验显示 PAH 在多种任务上一致性地提升 Pistis 各变体的成绩,表明推理脚手架本身仍有显著可优化空间。
意义与局限
从研究方向看,IDRL 把「训练阶段」与「推理脚手架」视为两个独立的可优化维度,并分别给出改进方案,对后续智能体大模型的训练流程设计具有参考价值。不过报告未在摘要中公布具体 benchmark 数字、对比模型列表或训练数据规模等技术细节,实质性评估仍需阅读全文。截至目前,该报告为 arXiv 首版(v1),尚未见后续修订或正式同行评审信息。
