AI 入门
为什么 TypeSafe 训练的是带校准概率的决策模型,而不是针对生成文本做优化。
大多数 AI 产品都建立在模型与人之间的对话之上。TypeSafe 的出发点是一个不同的判断:大规模自动化将由 AI 与 AI、AI 与软件之间的交互主导,因此机器接口比聊天接口更重要。
我们称之为 Machine Native Intelligence:
具备软件式特性的 AI:结构化、可靠、可观测、可测试、快速、一致且低成本。
构建生产系统,而非上帝
TypeSafe 并不试图构建一个无所不能的模型。它是为生产系统设计的,在这些系统里,代码需要的只是一个可以被检查、并据此采取行动的狭窄决策。
我们的预期是,大规模 AI 自动化中接近 99% 会是机器与机器的交互,只有 1% 是人的交互。这让设计目标从「读起来感觉不错的回复」转向「在软件内部行为可预测的输出」。
请阅读 TypeSafe 宣言。
三种后训练路径
预训练语言模型主要有两种改造方式。TypeSafe 增加了第三种。这里展示 RLHF 和 RLVR 是为了提供背景;TypeSafe 的训练路径是 RLCD。
基于人类反馈的强化学习把预训练模型变成了聊天机器人。它训练模型产出人们更偏好的回复。
带可验证奖励的强化学习造就了推理模型,它们在数学等任务上很强,但更慢、也更贵。
面向校准决策的强化学习训练 TypeSafe 返回决策和校准过的概率,而不是生成文本。
RLHF 曾用于训练 InstructGPT 和 ChatGPT,它由 Diogo Almeida 共同发明,他是 TypeSafe 的联合创始人。
RLCD 与校准过的决策
RLCD 优化的是一份不同的输出契约:
- 模型不生成文本。
- 它返回决策和概率。
- 概率越高,应当对应答案正确的可能性越大。
校准让不确定性变得可被软件利用。在一个校准良好的模型的大量预测中:
- 被赋予
0.2概率的结果,应当大约有 20% 的时间真的发生。 - 被赋予
0.8概率的结果,应当大约有 80% 的时间真的发生。 - 被赋予
1.0概率的结果,应当 100% 的时间真的发生。
这些比率描述的是成组的预测,而不是对任何单个答案的保证。关于软件何时应当行动、何时应当升级处理,参见置信度。
RLHF 的问题
RLHF 教模型说出人们偏好的话。这个目标对聊天机器人很有效,但它也可能奖励谄媚,以及听起来很自信的幻觉。
偏好优化还会造成模式丢失:模型学会偏爱某种特定风格,比如遵循指令,同时压低其他可能输出的概率。
一段输出可能对人很有说服力,却不足以可靠到可以无人值守地自动化。人的偏好与机器的可信赖性是两种不同的优化目标。
模式丢失是模式崩溃的较温和版本。在生成对抗网络的经典失效模式中,生成器学会反复产出同一种输出,因为这种输出能持续骗过判别器。
模式崩溃的类比
RLHF 仍然很适合对话模型。TypeSafe 的立场是,生产环境中的自动化需要一种不同的训练目标——以受约束的决策和校准过的不确定性为核心。