桃子桃子快讯
←返回首页
产品功能

前 OpenAI 研究员发布 Jev:让代码直接消费模型输出

前 OpenAI 研究员 Diogo Almeida 创立 TypeSafe,推出 Jev 模型,主打面向代码调用的「S…

2026.09.25 · 周五约 5 分钟阅读

由前 OpenAI 研究员、InstructGPT 项目参与者 Diogo Almeida 创办的 TypeSafe 公司近日正式推出首个模型 Jev。与当前主流大语言模型以「文本回复」为目标不同,Jev 将自己定位为「System 1 模型」或「大型可编程模型」,其核心优化目标是「每美元智能」——名字正源自经济学中的「杰文斯悖论」(Jevons Paradox)。

Diogo Almeida 在 Latent Space 播客中直言,在 Jev 出现之前的 AI 世界「简直是个悲剧」:强大的智能引擎已经存在,但把它接进实际业务流程的接口却依然欠缺。在他看来,无论是 Claude Code 还是 Codex,本质上都仍属于以「围绕人提供辅助」为主的阶段,AI 距离「像数据库一样隐身于软件后台」还很远。

一种新模型类别:让代码成为模型的直接消费者

Diogo 强调,Jev 并非简单的「决策模型」。在 TypeSafe 内部,团队曾用 machine-native model、System 1 model、large programmable model 等多个词描述这类新模型。无论叫法如何,它们共享一个核心设计取向:模型输出应当被代码直接消费,而不是被人类阅读后再转写。

  • 预训练 LLM:面向互联网文本补全。
  • RLHF 聊天模型:面向文本回复与指令遵循。
  • RLVR 推理模型:与 RLHF 之间界限模糊。
  • Jev/TypeSafe System 1 模型:面向代码直接调用的输出,包括选择(Choice)、条件判断(Noul)、评分与排序(Score)等结构化结果。

Diogo 表示,TypeSafe 在模型外部使用方式与内部机制上都针对软件调用做了优化,未来 Jev 将代表一系列在「每美元智能」维度处于领先位置的模型。

批评 RLHF 的「模式坍缩」与校准失真

Diogo 此次访谈的一个核心观点,是 RLHF 训练带来的「模式坍缩」(mode dropping)问题。他指出,RLHF 会让模型偏向生成更安全、更常见的答案,牺牲概率分布的真实校准——这既掩盖了长文本中的错误累积,也是当前文本模型不擅长承担决策任务的重要原因。

为应对这一问题,Jev 采用了 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。其优化目标与 RLHF 截然不同:

  • RLHF:让模型遵循人的指令、给出获得认可的回答。
  • RLCD:让模型输出可供代码直接使用的选择、评分和概率,使开发者能依据不确定性设置阈值,决定何时执行、何时交给人处理。

针对「为什么不在底层加入拒答机制」的追问,Diogo 表示并不反对安全本身,但认为不应将特定价值判断写进通用模型的底层能力,应像数据库那样划清「技术能力」与「使用责任」的边界。

可靠性、版本策略与评测立场

在可靠性问题上,Diogo 强调团队更看重「稳健性」而非简单的「确定性」:当问题语义不变时,加入无关字符不应大幅改变模型判断。已部署的模型不会悄悄修改,但 TypeSafe 也不会承诺永久维护每一个旧版本,会通过快速发布新版本来迭代。

对于评测,他反对围绕公开榜单进行优化,主张通过内部评测比较成本与能力,追求同等成本下更强、同等能力下更便宜。「开发者最终要把模型放进工作流里,测量它的实际表现,而不能只看价格、速度或一个总分。」

落地建议与四类应用方向

Diogo 给开发者的使用建议是:把复杂任务拆成最小、可以独立判断的语义单元,用结构化输入提供必要信息,再由代码控制最终行为。Choice 对应选择分支,Noul 对应条件判断,Score 对应评分、排序与筛选,每一步都可以单独评估并调整阈值,能力不足时则转交人工或暂不部署。

TypeSafe 梳理的四类值得尝试的应用方向包括:

  • 因处理成本太高而长期闲置的「暗数据」分析。
  • 为实时流程提供快速判断。
  • 检查其他模型的调用与输出。
  • 把智能判断嵌入软件核心逻辑。

Diogo 个人尤其看好暗数据分析与编程 Agent,但他也提醒,具体如何组合模型仍取决于能否真正降低成本、解决原本解决不了的问题。

创业与研究路径的取舍

在被问到「前沿实验室之外的研究者是否应出来创业」时,Diogo 表示这取决于离开的原因:若只是想自由尝试课题,现有实验室可能仍然最合适;若找到了值得长期投入的新任务,他会支持创业。他强调「漂亮的研究履历不会自动创造价值」,更不看好拿到资金后重复已有工作的做法。

在被问及前沿 AI 风险时,他反对把「放慢发展速度」默认为唯一选项,认为「为了提升表现而给模型多大行动空间本身就是设计决定,不该被当作不可避免的前提」。对他而言,更值得探索的方向是:让已有的智能可靠地进入软件,真正自动化实际工作。

信源