写作现场:2025 年 1 月 27 日。 DeepSeek-R1 发布一周后,英伟达等 AI 相关股票大幅下跌。市场讨论集中在“约 560 万美元完成模型训练”,但这个数字来自 DeepSeek-V3 报告,不是 R1 的完整研发账单。分析效率变化前,必须先统一成本对象和分母。
557.6 万美元具体计算了什么
DeepSeek-V3 报告披露:正式预训练使用约 266.4 万个 H800 GPU 小时,上下文扩展和后训练等阶段使完整训练计算达到约 278.8 万个 GPU 小时。以每 GPU 小时 2 美元估算:
2,788,000 H800 GPU hours × $2 / GPU hour
= $5,576,000
该数字是一次已披露训练流程的计算成本估算,不包括数据获取与处理、研究人员、失败实验、架构搜索、集群建设、折旧、电力、网络和推理服务。它也不能直接归入 R1,因为 R1 建立在 V3 基础模型之上,并使用另一套推理训练流程。
因此至少要区分四个口径:
- successful training run 的计算量;
- 得到该方案之前的研发与实验成本;
- 模型服务期内的推理和运维成本;
- 公司长期积累的基础设施与人才投入。
把第一个数字写成“全部研发成本”,会同时低估模型工程和组织能力。更严格的比较应报告硬件型号、利用率、精度、训练 token、模型结构、失败运行是否计入,以及成本采用市场租赁价还是自有设备边际成本。
R1 的训练路线与推理侧影响
R1 报告将推理能力训练拆成不同阶段。R1-Zero 展示了在缺少初始 SFT 的情况下,通过大规模 reinforcement learning 诱导自验证、反思和更长推理行为;完整 R1 再加入 cold-start 数据、多阶段训练与后续监督微调,以改善可读性和通用能力。六款 distilled models 则把大模型生成的数据用于训练较小底座。
这里的核心不是“蒸馏等于压缩文件”,而是改变能力传递方式:小模型学习教师模型产生的输出分布,不会完整继承教师的内部表示与所有任务能力。实际收益必须按目标领域、上下文长度和部署硬件重新评估。
训练效率提高也不等于 GPU 需求线性下降。推理模型可能在每次请求中生成更多 token、执行更长 test-time compute;单位调用价格下降后,调用量还可能增加。市场需要分别估计训练侧节省、推理侧计算强度和需求弹性,而不能用单日股价完成技术判断。
R1 对大学实验室、小团队和重视本地部署的企业最直接的价值,是权重、报告与蒸馏模型提供了可检查和改造的材料。开放降低了实验门槛,但不会消除评测、部署、数据治理和安全成本。到本文日期,能够确认的是另一条训练与开放路线具有竞争力;完整成本优势和市场均衡仍没有足够证据。
时间边界与来源
- DeepSeek:DeepSeek-R1 Release(2025-01-20)
- DeepSeek-R1 技术报告
- DeepSeek-V3 技术报告
- Axios:Nvidia shares plunge as DeepSeek promises new AI path(2025-01-27)
信息边界:本文停在 2025 年 1 月 27 日。市场仍在判断当天抛售是否过度;557.6 万美元只指 V3 报告披露的完整训练计算成本估算,不代表 R1 或 DeepSeek 的完整研发投入。