TS TypeSafe 文档中文版 原文 ↗

AI 入门

为什么 TypeSafe 训练的是带校准概率的决策模型,而不是针对生成文本做优化。

大多数 AI 产品都建立在模型与人之间的对话之上。TypeSafe 的出发点是一个不同的判断:大规模自动化将由 AI 与 AI、AI 与软件之间的交互主导,因此机器接口比聊天接口更重要。

我们称之为 Machine Native Intelligence:

具备软件式特性的 AI:结构化、可靠、可观测、可测试、快速、一致且低成本。

构建生产系统,而非上帝

TypeSafe 并不试图构建一个无所不能的模型。它是为生产系统设计的,在这些系统里,代码需要的只是一个可以被检查、并据此采取行动的狭窄决策。

我们的预期是,大规模 AI 自动化中接近 99% 会是机器与机器的交互,只有 1% 是人的交互。这让设计目标从「读起来感觉不错的回复」转向「在软件内部行为可预测的输出」。

请阅读 TypeSafe 宣言。

三种后训练路径

预训练语言模型主要有两种改造方式。TypeSafe 增加了第三种。这里展示 RLHF 和 RLVR 是为了提供背景;TypeSafe 的训练路径是 RLCD。

RLHF

基于人类反馈的强化学习把预训练模型变成了聊天机器人。它训练模型产出人们更偏好的回复。

RLVR

带可验证奖励的强化学习造就了推理模型,它们在数学等任务上很强,但更慢、也更贵。

RLCD

面向校准决策的强化学习训练 TypeSafe 返回决策和校准过的概率,而不是生成文本。

RLHF 曾用于训练 InstructGPT 和 ChatGPT,它由 Diogo Almeida 共同发明,他是 TypeSafe 的联合创始人。

预训练语言模型分出两条被弱化的路径 RLHF 和 RLVR,以及一条被强调的 RLCD 决策模型路径。 预训练语言模型分出两条被弱化的路径 RLHF 和 RLVR,以及一条被强调的 RLCD 决策模型路径。

RLCD 与校准过的决策

RLCD 优化的是一份不同的输出契约:

  • 模型不生成文本。
  • 它返回决策和概率。
  • 概率越高,应当对应答案正确的可能性越大。

校准让不确定性变得可被软件利用。在一个校准良好的模型的大量预测中:

  • 被赋予 0.2 概率的结果,应当大约有 20% 的时间真的发生。
  • 被赋予 0.8 概率的结果,应当大约有 80% 的时间真的发生。
  • 被赋予 1.0 概率的结果,应当 100% 的时间真的发生。

这些比率描述的是成组的预测,而不是对任何单个答案的保证。关于软件何时应当行动、何时应当升级处理,参见置信度。

RLHF 的问题

RLHF 教模型说出人们偏好的话。这个目标对聊天机器人很有效,但它也可能奖励谄媚,以及听起来很自信的幻觉。

偏好优化还会造成模式丢失:模型学会偏爱某种特定风格,比如遵循指令,同时压低其他可能输出的概率。

基础模型的概率分布,与经过 RLHF 后变窄、发生模式丢失的分布对比。 基础模型的概率分布,与经过 RLHF 后变窄、发生模式丢失的分布对比。
警告

一段输出可能对人很有说服力,却不足以可靠到可以无人值守地自动化。人的偏好与机器的可信赖性是两种不同的优化目标。

模式丢失是模式崩溃的较温和版本。在生成对抗网络的经典失效模式中,生成器学会反复产出同一种输出,因为这种输出能持续骗过判别器。

模式崩溃的类比
重复出现的字符展示了陷入模式崩溃的 GAN。 重复出现的字符展示了陷入模式崩溃的 GAN。

RLHF 仍然很适合对话模型。TypeSafe 的立场是,生产环境中的自动化需要一种不同的训练目标——以受约束的决策和校准过的不确定性为核心。