大语言模型
Opus 5发布,Loopal接入,实测对比 Fable 5、Kimi K3、GPT5.6 Sol

刚刚,Opus 5 发布,在多数任务上甚至比 Fable 5 更强,尤其是在 Agentic Coding 任务上,相比 Fable 5 优势很明显。
在知识型任务上,比如解决全新问题的 ARC-AGI 3 任务,相比 Opus 8 和 GPT5.6 Sol 领先明显。Computer Use 能力方面,也大幅领先 Fable 5、GPT 5.6 Sol。
生命科学方面,在生物学、有机化学、生物信息学等场景,相比 Opus 4.8 也有明显提升。
多模态、网页、动画、游戏方面,官方在 Model Card 里面也提到,Opus 5 更加擅长图表理解、UI 截图复刻、复杂公式理解、结构完整的演示文稿、动画/游戏/3D 和交互式网页产物。

Opus 5 与 Fable 5、Opus 4.8、GPT-5.6 Sol 的综合能力对比。
对齐方面,比 Opus 4.8,甚至比 Mythos 5 还要优秀。安全方面,网络安全漏洞发现方面相比 Mythos 5 是要落后一些。

Opus 5 的自动化行为审计结果。
价格还是保持和 Opus 4.8 一样:每百万输入 token 5 美元;每百万输出 token 25 美元。
估计也是 Kimi K3 的强势表现,以及 GPT5.6 Sol 的更高性价比和 tibo 的无限 reset,给到了 Anthropic 巨大的压力。
这种定价,也没有太多人会考虑使用 Fable 5 了,相当于变相降价了。
Loopal(loopal.app) 也在第一时间完成了接入,并在前端设计、游戏开发、3D 制作、PPT 等任务上和一些比较有竞争力的模型进行实测对比。
这几个模型的对比,都是相同 Harness 框架下(Loopal Harness)进行对比的,能够公平地体现出纯模型侧的差异。
前端设计
这个任务,我们让 Opus 5、Fable 5、GPT5.6-Sol、Kimi K3 分别设计一个创意型公司的官网,来对比模型在前端设计美感和交互上的差异。
测试用例
打造一款风格前卫大胆、带有粗野主义设计风格的创意公司作品集首页,搭载动态交互动画、案例预览板块、团队成员展示区以及联系表单,整体突出创意感与独特性。将最终完成的代码写入当前目录下的 index.html 文件,文件仅可使用语义化 HTML、原生 CSS 与原生 JavaScript 编写,禁止引入图片资源、外部资源链接、构建工具及第三方依赖项。该页面需可直接在浏览器打开运行,同时适配电脑端与移动端多尺寸屏幕;添加无障碍聚焦样式与减弱动画偏好适配模式,仅产出这一个 HTML 文件,不额外生成其他文件。
结果来看,Opus 5 在设计美感和整个项目的完成度上和 Fable 5 相比都是更好的,Fable 细节不如 Opus 5 做得好。
单论美感的话,GPT5.6 Sol 是最好的,但是项目完成度上不如 Opus 5。Kimi K3 和 Fable 5 不差上下。
这个任务,我的综合排序是:Opus 5 > GPT5.6 Sol > Kimi K3 = Fable 5。
游戏开发
这个任务我们测试了 Opus 5、Fable 5、GPT5.6-Sol、Kimi K3 在开发游戏上的表现,主要衡量游戏交付是否可玩、游戏的动画流畅度和美感。
测试用例
打造一款能直接在浏览器中游玩、《星际火狐》风格的复古 3D 游戏。玩家将向前飞行,穿越科尼利厄斯风格的地表关卡,随行还有电脑 AI 操控的僚机。玩家可以躲避障碍物、攻击敌方单位、拾取增益道具,并在关卡末尾挑战 BOSS;将 BOSS 初始血量削减至一半,再新增若干强化拾取道具,让游戏画面表现与游玩手感都达到绝佳效果。
游戏开发这个任务,我们从游戏是否可玩,画面流畅度和美感上分别排序:
游戏可玩程度: Opus 5 > Fable 5 = Kimi K3 > GPT 5.6 Sol,Opus 5 在游戏里考虑到的细节比较多,能够玩下去。
游戏设计美感: GPT5.6 Sol > Fable 5 = Kimi K3 > Opus 5,在这个任务的游戏设计美感上 Opus 5 逊色一些。
3D 制作
这个任务我们测试了 GPT5.6-Sol 和 Opus 5 在开发 3D 动画上的表现,提供一张图片,让这两个模型分别转成 3D 动画,主要衡量交付的 3D 动画是否具有高级、动画是否流畅,以及是否遵循了要求。
测试用例
基于 img2threejs 项目完成下述任务:依据一套专业影棚实拍参考素材,通过代码重构索尼 WF-1000XM3 真无线蓝牙耳机及其充电盒模型,建模核心要求为色彩还原与轮廓线条精度。
充电盒:哑光黑色盒体;盒盖为抛光玫瑰金 / 红铜金属质感,表面蚀刻 SONY 品牌标识;盒盖内侧为黑色基底,搭配红铜包边边框,内嵌蚀刻规格铭牌(参数:WF-1000XM3R / BC-WF1000XM3 / 5V)。
耳机本体:缎面石墨灰耳塞机身,刻印红铜色 SONY 字样 + 红铜麦克风装饰环,镀金顶针充电触点;腔体标注灰色 L 左声道标识、红色 R 右声道标识及 NFC 符号。
循环动态交互动画(无限循环):盒盖向上翻开 → 充电盒整体小幅倾斜,两只耳机同步向上抬升 → 左右耳机各自原地完整自转一圈 → 耳机回落归位至充电仓槽内 → 盒盖闭合复位。
上传的图片如下:

索尼 WF-1000XM3 耳机与充电盒的 3D 制作参考图。
GPT 5.6 Sol 和 Opus 5 两个模型都很好地按照我的要求实现了功能,但 Opus 5 交付的有一些瑕疵,耳机盒一直在闪,而且耳机盒是灰白色的,我要求是黑色基底,整体动画也不如 GPT 5.6 Sol 高级和流畅。
但现在模型在 3D 动画这个任务上已经很强了,上传一张图片,就能做出这么高级的 3D 动画,确实很厉害。
PPT 制作
这个任务上,主要对比 Opus 5、Fable 5、GPT5.6-Sol、Kimi K3 这几个模型在 PPT 信息收集、整理和交付美感上的差异。
测试用例
基于 GPT-5.6、Claude Fable 5 / Mythos 5、Grok 4.5 这三个文档,写一个对比 GPT 5.6、Fable 5、Grok 4.5 三家模型的 PPT,要求逻辑严谨,内容详实,突出各模型的特点和优势,以及各家想重点突出的核心点,要有数据洞察。
PPT 制作这个任务,Fable 5、GPT5.6 Sol、Kimi K3 三个模型表现基本一致,无论从数据的严谨性,还是 PPT 的排版上,还是内容的组织上都非常接近,很难给出谁好谁坏。
但是比较意外的是 Opus 5 在这一块提升得比较明显,信息收集的完整性、数据的对比分析和 PPT 制作的美感和细节上都明显要比其他三个模型生成的要好不少,整体交付的质量非常高,非常推荐大家用这个模型做一个 PPT 试一试,确实有些小惊艳。
这也和官方提到的在知识型任务和演示文稿提升比较多较为吻合。可以去这个链接看一下 Opus 5 制作的 PPT 效果,相信你也会和我有一样感觉。
结论
实测下来,Opus 5 是一个很有竞争力的模型,在不少任务上都表现得很不错。
看来 Anthropic 在 Opus 系列模型上的后训练上做了不少工作,相比 Opus 4.8 提升的还是很明显的。