Anthropic 9 月 22 日发布的 Opus 5.5 这几天被叫成了「最强视频生成模型」,因为它做了一批看起来像视频生成的东西,把宜家说明书变成 3D 语音导览视频、在虚幻引擎里重建旧金山街区、甚至搓了一个能玩的黑暗之魂仿作。但先把定义掰正,Opus 5.5 不是文生视频模型,它不直接输出画面。它写的是代码,浏览器或游戏引擎把代码跑出来,才有了你看到的视频和 3D 场景。这个差别决定了它适合干什么、边界在哪。
这几天它都干了什么
传播最广的几个案例值得逐个看。
Hugging Face 产品负责人 Victor Mustar 让它用真实在售的乐高零件设计一台等身 Microduck 机器人。Opus 5.5 给出的方案用了 1113 个真实零件,检查了 3204 处连接和碰撞、重心,最后产出一份 141 页、237 步的拼装说明书,附可采购的零件清单,连演示视频都是它自己渲的。Mustar 已经把整本说明书传上了 Hugging Face,零件实买验证还在进行中。
另一个案例是把宜家那种几乎无字的拼装说明书转成 3D 动画加语音讲解的教程视频。投资人 Deedy Das 看完的反应是,「通过写代码,Opus 一夜之间成了一个实际上很好用的视频生成模型。」
更激进的测试是有人让 Opus 5.5、GPT-6 Astra、Fable 5.1 同题重造《塞尔达传说:时之笛》的开场,不用现成游戏引擎,让模型自己写游戏逻辑和视觉。成品离真正能玩的塞尔达还很远,但几天前大家还在用「画一只骑自行车的鹈鹕」测模型懂不懂现实,现在已经有人在让模型交付可建造的东西了。

代码是中间层
严格说,这是「写代码渲染画面」而不是「生成视频」。Opus 5.5 有 100 万 token 的上下文容量和最多 12.8 万 token 的输出长度,这让它能一口气写完一个场景的渲染代码、动画逻辑和交互指令,交给浏览器或引擎执行。
这个路径解释了为什么它的「视频」画风和 Sora 那类模型完全不同。文生视频产出的是像素,改了 prompt 一切重来;Opus 产出的是可检查、可修改的程序,说明书里哪个零件悬空了,你能翻到那一行改掉它。代码在这成了通用中间件,用户全程可以不用看代码。

旧金山 demo 还有个幕后帮手
传播最广的旧金山重现不全是 Opus 一个人干的。场景里的动态元素由 TypeSafe AI 的 Jev 模型处理,这是一个 system-1 决策模型,不做语言生成,专门高速输出带约束的结构化决策,号称在这类高频小决策任务上比大模型快百倍、便宜百倍。Opus 当创意总监写高层架构和动画代码,Jev 负责海量具体的摆放和状态判断。「大模型编排小模型」这个分工,可能比单个模型本身更值得开发者注意。
数据与价格
模型本身的成绩单是实的,Code Arena WebDev 榜第一,编程和 agent 能力有明显提升。API 定价是每百万输入 token 4 美元、输出 20 美元(约合 29 元和 145 元人民币),比上一代 Opus 5 快三成以上、典型负载便宜约四成,比榜上第二的 GPT-6 Astra (Max) 便宜约六成。
边界在哪
回到那本乐高说明书,有人仔细翻完发现里面有悬空的零件和没锁死的连接。也就是说 Opus 5.5 能把一个想法包装得非常像成品,但「看着能搭」和「真能搭」之间还差最后一道人工验收。视频和 demo 同理,渲出来的画面惊艳,生产可用的还差一轮工程校对。
它对谁有用也更清楚了,需要把想法快速变成可操作物的人。说明书、原型、交互动画、可执行的可视化,都是这条路径的产物。想拿它替代文生视频做影视素材的,方向不对。
最后记住的一点
「能写代码」这个词的内涵正在被改写。以前是让 AI 画个网页画个 SVG,现在是让它设计一个现实世界能装配的东西,连同工程校验、文档和采购清单一起交付。Opus 5.5 的意义不在「又出了一个视频模型」,而在代码作为中间层这条路跑通了,演示里的每个案例都在证明同一件事。
参考来源
- 机器之心/36kr Opus 5.5 案例盘点(2026/9/28)
- Stork.AI 机制与定价分析
- Hugging Face 上的 Microduck 乐高说明书原件
- Anthropic 官方定价页
案例均为社区演示,工程可靠性以实际构建结果为准。
