JOTO
联系我们
← AI 智库
多模态模型

Runway 将 AI 视频模型缺陷转化为前端功能:实时虚拟形象的工程实践

2026 年 7 月 28 日

Runway 在开发实时视频模型 Runway Characters 过程中,将模型固有偏移缺陷转化为前端「优化图像质量」功能,通过图像自动居中规避问题。其工程实践强调跨职能评估数据集构建、知识蒸馏与对抗性后训练、全栈基础设施调试,以及将模型局限性产品化的思维转变。

Runway 将 AI 视频模型缺陷转化为前端功能:实时虚拟形象的工程实践

Runway 花费数周时间试图通过工程手段解决一个顽固的漏洞:AI 生成的虚拟形象在实时视频生成过程中会偏离画面中心。该问题的修复方案并非后端补丁——而是一个全新的前端功能,仅通过绕过问题的方式就奏效了。Runway ML 企业产品负责人 Ryan Phillips 在 VB Transform 2026大会上分享了这一经验,并指出,即便那些自身并不构建基础模型的公司,也能从 Runway 构建、评估和发布这些模型的方式中获益。

“我认为,即便你们并未全部自行构建模型,了解我们的做法仍大有裨益,因为我认为几乎所有这些经验都适用于你们日常所从事的工作。”Phillips 表示。

Runway 是一家应用型人工智能研究公司,致力于构建通用世界模型,以驱动生成式工具。在其演讲中,Phillips 展示了 Runway Characters——一款实时视频模型,支持零延迟、双向交互式 AI 虚拟形象。他指出,五年前,艺术家需耗费数百小时逐帧拼接,才能制作出文字模糊、帧率偏低的视频;而如今,Runway 的模型可即时生成交互式视频。

“研究我们如何构建这些实时模型,可为你们当前在各自公司中构建与部署实时体验(无论是否具备智能体特性)提供启发。”他说。

评估流程去神秘化

构建稳健的 AI 产品始于高质量的评估数据集。然而,创建该数据集不能仅被视为一项工程任务,它需要产品、设计、研究及销售等职能团队深度协同,共同定义“质量”究竟意味着什么。

Phillips 强调,应开展内部研讨会,让团队成员共同审阅生成样本。其目标是使整个组织就特定失效模式达成一致,从而共享对成功生成的统一定义。

“我们花了大量时间与团队一起,逐一梳理……成功与失败的具体表现,细致到极其琐碎、严苛的程度。”Phillips 表示。

最终形成的评估数据集必须覆盖广泛的客户使用场景,同时兼顾极端边缘案例。例如,Phillips 特别指出,为确保模型在超出标准人类面部结构的条件下仍能稳定运行,他们采用了名为“Tooth”的非人类角色——该角色没有鼻子,牙齿形态极为异常。

在对这些生成结果进行评分时,Runway 团队关注细微的人工痕迹。在一个示例中,某段视频中人物面部保持完整,但背景元素(如一张网)开始发生形变,该输出被严格判定为失败。

尽管产品本身处于前沿水平,Runway 用于追踪这些评估工作的工具却十分简单:一份 Excel 电子表格。团队每日记录测试结果,并依据预设的通过率,将输出归类为“轻微”或“严重”失效。 

“我们在启动工作前即设定通过率门槛,一旦达标,便发布模型。”Phillips 表示,“因此这并非什么魔法。”

对于面临自身实时管道中非确定性质量漂移问题的企业开发者而言,大规模人工评估已成为瓶颈。为解决此问题,Phillips 指出,开发者可借助语言模型自动化视觉评分流程。 

“大型语言模型(LLM)在充当此类内容的评判者方面已日趋成熟,尤其是针对评估数据集中常见的形变或变化类型。”他表示。团队还可向 LLM 输入幕后上下文(例如手绘草图或广告的结构布局),以指导生成与验证流程,在不增加终端用户认知负荷的前提下保障质量。

模型训练与将漏洞转化为功能

交付实时生成式视频需要高度优化的技术栈。该流程始于对一个庞大的基础模型进行预训练,该过程资源密集且输出生成缓慢。为实现实时延迟,Runway 依赖于 知识蒸馏(distillation)技术,即训练一个更小、更快的“学生”模型来模仿大型“教师”模型。据 Phillips 称,知识蒸馏帮助 Runway 将“生成时间缩短了 80% 至 90%”。

随后,团队对蒸馏后的模型应用对抗性后训练(Adversarial Post-Training, APT)。该技术通过让模型持续接受专为暴露其缺陷而设计的系统测试,促使其不断改进,从而恢复蒸馏过程中损失的视觉锐度。

然而,调整模型架构会引发新问题。知识蒸馏与 APT 阶段引入了一个顽固漏洞:角色在实时生成过程中会左右摇摆或偏离画面中心。

他表示,团队花费数周时间尝试修复核心模型以消除偏移现象。最终发现,若用户初始输入图像完全居中,则生成的视频保持稳定。团队并未继续投入时间开发后端工程补丁,而是转向用户体验解决方案。

“我们所做的,是在评估中注意到这一现象后,随即提出:‘如果我们将此直接作为一项功能提供呢?’当用户提交一张向左偏转的角色图像时,我们知道视频将发生形变。那我们就直接为其修复。”Phillips 表示。 

他们推出了一项名为“优化图像质量(Optimize for Image Quality)”的前端功能,该功能在生成开始前自动将用户图像重新居中。通过将后端模型局限性封装为前端工具,用户感知到的是一个有益功能,而非工程缺陷。

“将模型局限性转化为产品功能,从而实际拓展模型能力范围。”Phillips 建议道,“这在内部可能看似一种局限,但只要你将其作为产品功能来构建,你的客户并不会这样看待它。”

魔鬼藏在基础设施细节中

在全球范围内以每秒 24 帧速率交付视频,要求对基础设施栈每一层均进行优化。这涵盖缓存与并行解码,乃至与英伟达(Nvidia)等硬件供应商合作进行深度内核修改。

他称,在 Runway Characters 上线后不久,团队注意到 8% 的 API 调用帧率降至每秒 16 帧,导致客户视频出现卡顿。 

定位根本原因需要深度可观测性。团队结合 Claude 驱动的 AI 代理,以及 Datadog 和 Sentry 等监控工具,追踪该异常。调试过程将问题隔离至 us-east-1 区域内的单一数据中心。

“实际上,解决方案并非修复任何代码或更改配置。”Phillips 解释道,“他们真正采取的措施是,亲自前往该数据中心,物理更换了那些 GPU,最终解决了问题。”

对于部署实时应用的企业团队而言,关键启示显而易见:硬件与基础设施异常将直接影响模型性能,因而需要严谨、全栈式的调试能力。 

“切勿忽视所有微小细节,因为部署这些模型时,此类细节数量庞大。”Phillips 表示。

挺过‘失败地狱’以及世界构建的未来

开发 AI 系统很少是一个线性过程。团队常常会在单个问题上卡住数周,且看不到尽头,菲利普斯将这一阶段称为‘失败地狱’(failure hell)。

“我们认为,你必须经历这种痛苦,并真正为这个问题挣扎一段时间,之后才能取得突破,”他说。持续的迭代最终会拉平难度曲线,从而触发突然且呈指数级的改进。

随着底层模型逐步克服这些技术障碍,企业创意人员的角色也在发生根本性变化。传统上,营销和设计团队专注于创建单个资产,例如一则特定广告或一幅插图。而在实时生成与智能体(agentic)工作流时代,这一范式正转向定义参数、美学风格及知识产权。

菲利普斯(Phillips)表示:“你可能不再设计单条广告,而是设计一个世界,随后由智能体(agent)或实时视频模型从中生成广告。”

JOTO 企业落地观察

  • 企业部署实时生成式视频系统时,需明确区分“模型能力边界”与“用户体验预期”,前端封装比后端硬修复更具交付效率。
  • 评估数据集的构建不应由算法团队单点负责,而应成为产品、设计、法务等多职能共同参与的协作过程,尤其需覆盖非人类/超现实等边缘输入。
  • 当基础设施异常(如GPU老化)导致模型输出质量下降时,企业需建立从API指标到底层硬件的可观测链路,避免将问题误判为模型退化。
  • 将模型缺陷转化为功能的前提,是建立清晰的用户输入-输出映射关系;若输入不可控(如用户上传任意构图图像),则该转化策略将失效。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。