OpenAI发布AI时代评分卡,倡导以‘每美元有用智能’衡量AI价值
OpenAI推出‘人工智能时代评分卡’,提出‘每美元产生的有用智能’作为新价值衡量标准,强调以实际工作产出、总成本、可靠性和规模经济效益四大原则评估AI投资成效,而非仅关注token价格或用户数量。

提出新价值衡量标准
OpenAI表示,担忧采购和部署人工智能潜在成本的企业应重新思考评估其价值的方式。为协助企业实现这一目标,这家前沿人工智能实验室发布了一份“人工智能时代评分卡”,旨在最大化其人工智能投资的价值。
首席财务官萨拉·弗里尔(Sarah Friar)在一篇博客文章中表示:“多年来,市场通过采用率来衡量软件的成功:购买的席位数、活跃用户数、续订的许可证数量。而理解人工智能的价值则需要一种更有力的衡量标准:完成的工作量。”
这种思维转变超越了廉价的token,转而更优先考察模型交付了什么成果以及如何交付这些成果。弗里尔指出,token价格低廉的模型并不总能等同于价值,有时完成一项任务所需时间反而比更昂贵的模型更长。
正因如此,OpenAI正在推广其指标——“每美元产生的有用智能”(Useful Intelligence Per Dollar),博客文章称,“关键在于成功产出的全部成本,与该产出所创造的价值进行对比。”
四大评估原则
该评分卡基于若干原则。
首先,OpenAI希望企业衡量自身完成了多少有用的工作。这要求企业明确界定其运营中“完成”究竟意味着什么,并将这一结果与引入人工智能之前的工作方式加以比较。
其次,弗里尔认为,企业需考量成功产出的成本,包括员工时间、人工审核、重试及返工。通过引入这一方法论,企业将能洞察所需模型的层级。例如,ChatGPT-5.6分为三个层级——Sol(最全面)、Terra(中等级别)和Luna(最经济实惠)。
OpenAI指出,企业还应考虑的第三个问题是可靠性。弗里尔表示,准确且一致的结果可减少人力投入,从而为企业带来长期成本节约。她认为,这具有“直接的经济价值”。
最后,OpenAI希望企业评估:随着使用量增长,投资是否能带来更多的工作产出——换言之,即经济效益是否随规模扩大而提升。
追踪指标驱动决策
通过持续追踪产出、总成本及单位产出成本,企业可判断其人工智能投资是否正在增值。
近期,企业引入人工智能的价值正面临前所未有的严格审视,一份普华永道(PWC)研究报告今年1月显示,仅有12%的首席执行官认为人工智能已带来成本节约和收入增长效益。
JOTO 企业落地观察
- 企业部署AI系统时,若仅依据模型调用单价或API吞吐量做选型,可能掩盖真实成本结构;‘每美元有用智能’要求将人工审核、重试、返工等隐性开销纳入核算,这对RAG知识工程中检索-生成链路的稳定性设计提出更高要求。
- 评分卡强调‘完成的工作量’需明确定义并前后可比,这意味着企业在构建智能体时,必须预先锚定业务闭环中的可度量终点(如合同审核通过、工单自动结案),而非仅优化中间环节响应速度。
- 将可靠性视为具‘直接经济价值’的维度,反映出高精度、低幻觉输出对降低人工复核依赖的关键作用;这对AI安全治理实践构成约束——模型选型不能仅看基准测试分数,而需结合具体任务场景下的失败代价建模。
- ‘规模经济效益是否随使用量增长而提升’这一原则,挑战了传统SaaS式线性扩容逻辑;企业需评估智能体编排架构是否支持任务级弹性伸缩,避免因固定推理路径导致单位产出成本不降反升。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


