写作现场:2022 年 11 月 30 日。 OpenAI 当天发布 ChatGPT 免费研究预览。官方只说明 ChatGPT 从 GPT-3.5 系列中的模型微调而来,该系列在 2022 年初完成训练;没有公布 ChatGPT 参数量,也没有给出依据把“3.5”解释成某个精确的代际增幅。这个版本更值得分析的是训练目标与产品接口如何共同变化。

从 next-token prediction 到偏好优化

基础语言模型学习预测下一个 token,但“高概率续写”不等同于“按用户意图完成任务”。ChatGPT 延续 InstructGPT 的 RLHF 流程,并针对对话数据作了调整:

人类示范对话
→ supervised fine-tuning(SFT)
→ 对同一输入采样多个回答
→ 人类排序回答
→ 训练 reward model(RM)
→ 通过 PPO 优化策略模型
→ 重复收集与微调

SFT 给出可模仿的助手行为;reward model 将标注者的相对偏好压缩为可优化信号;PPO 再提高策略模型获得高奖励的概率。这个过程主要改变能力的可调用方式和输出分布,并没有为模型增加实时事实数据库。

发布页已经列出由此产生的边界:模型会生成貌似合理但错误的答案;输入措辞轻微变化可能改变结果;训练者偏好较长回答会造成冗长;面对含糊问题,模型常常猜测意图而不是请求澄清。官方还明确指出,强化学习阶段没有可直接使用的“真相来源”。因此,RLHF 优化的是一组人对回答质量的判断,不是形式化的正确性证明。

这也解释了为什么流畅度是一个危险指标。对话连续、语气合作、能够引用上文,只能说明接口与偏好模型工作得更好,不能说明事实误差被解决。对于学习、写作和分析任务,ChatGPT 更适合作为可迭代草稿生成器;引用、计算和关键判断仍需要外部验证。

对话接口与部署反馈循环

此前的大模型通常通过 API 或 Playground 暴露,使用者需要理解 prompt 结构和请求参数。ChatGPT 将交互压缩为消息序列:用户可以追问、修正上下文,也可以要求模型解释上一轮。这一变化没有扩展 context window,却显著降低了表达任务和迭代结果的接口成本。

免费 research preview 同时构成部署反馈机制。更多真实对话会暴露静态评测覆盖不到的失败模式,产品团队可以据此修改数据收集、拒答策略和界面提示。由此形成的竞争不只发生在预训练规模上,还发生在分发入口、反馈质量、迭代速度和安全观测能力上。

该循环也有治理问题。偏好数据来自特定训练者与产品政策,不能代表抽象的“全体人类价值”;真实用户反馈若进入改进流程,还涉及隐私、代表性和对高频行为的过拟合。对学生、初入职场者和小团队而言,对话框降低了获得语言能力的门槛,但也降低了接受未经核对答案的摩擦。

截至当天,能够确认的只是一个免费研究预览及其已披露方法。用户规模、商业模式和长期生产力影响都尚未形成证据。技术上的开端不是“模型已经可靠”,而是通用语言模型第一次以低门槛对话产品进入大规模公开试用。

时间边界与来源

信息边界:本文停在 2022 年 11 月 30 日。ChatGPT 此时只是免费的研究预览;不借用之后的用户规模、订阅产品、API、GPT-4 或市场结果。