大语言模型
Loopal接入Qwen 3.8,和Kimi K3、Fable5、GPT5.6 Sol实测对比

昨天,千问团队官宣 Qwen3.8-Max 即将发布预告,预告称是除了 Fable 5 外最强大的模型,新模型参数 2.4T。
Loopal(loopal.app) 也在第一时间完成了接入,并在工具开发、前端设计、视频制作、游戏开发、PPT 制作等任务上和一些比较有竞争力的模型进行实测对比。
这几个模型的对比,都是在相同 Harness 框架下(Loopal Harness)进行的,能够公平地体现出纯模型侧的差异。
工具开发
这里对比一下 GPT5.6-Sol 和 Qwen3.8-Max 在开发工具任务上的效果,主要衡量模型在 Coding、工具设计和 tokens 消耗上的差别。我们让它们开发一个简易的视频剪辑工具。
测试用例
请在当前空目录创建一个 React + TypeScript + Vite 单页应用,实现一条 0~20 秒的吸附式单轨时间线,并使用 CSS 色块表示片段。支持片段拖动、双侧裁剪、0.5 秒网格及片段边缘吸附、Alt 临时关闭吸附、重叠检测回滚、重命名、重置,以及 Cmd/Ctrl+Z 撤销和重做。
增加剪刀工具:进入剪切模式后,在片段上实时显示剪切位置,点击即可将其拆成两个可独立编辑的片段;支持网格吸附、Alt 精确剪切、最短 0.5 秒保护和剪切历史撤销。
所有交互使用 React Pointer Events 和普通 CSS,禁止时间线库、拖拽库、状态库、UI 套件、Canvas、后端及远程 API,时间业务状态统一使用 number 秒。最终交付可运行代码,确保
npm run build通过,并实际验证拖动、裁剪、吸附、冲突回滚、指针移出释放、剪切及撤销重做功能。
结果上来看,两个模型都很好地完成了任务。但从细节上,GPT5.6-Sol 考虑得更加全面,比如遇到错误操作会提示用户,但 Qwen3.8 却没有考虑这么细。
此外,GPT5.6-Sol 交付的工具使用起来更加流畅,动效做得更加丝滑,前端设计也更加好看。
成本上,Qwen3.8 消耗了更多 tokens,差不多是 GPT5.6-Sol 的 1.5 倍,思考过程比较长。这个任务上,显然没有 GPT5.6-Sol 完成度好,和官方宣传的除 Fable 5 之外最强模型有些出入。
前端设计
这个任务,我们让 Qwen3.8-Max 和 Kimi K3 分别设计一个创意型公司的官网,来对比模型在前端设计美感和交互上的差异。
测试用例
打造一款风格前卫大胆、带有粗野主义设计风格的创意公司作品集首页,搭载动态交互动画、案例预览板块、团队成员展示区以及联系表单,整体突出创意感与独特性。
将最终完成的代码写入当前目录下的 index.html 文件,文件仅可使用语义化 HTML、原生 CSS 与原生 JavaScript 编写,禁止引入图片资源、外部资源链接、构建工具及第三方依赖项。该页面需可直接在浏览器打开运行,同时适配电脑端与移动端多尺寸屏幕;添加无障碍聚焦样式与减弱动画偏好适配模式,仅产出这一个 HTML 文件,不额外生成其他文件。
视频展示的第一个是 Qwen3.8-Max 的结果,第二个是 Kimi K3 的结果。
效果上,Qwen3.8-Max 设计的官网无论是设计美感上,还是交互上,都要略优于 Kimi K3,考虑得更加全面一些,包括卡片点击后的交互细节都考虑到了。
视频制作
这个任务上,我们让 Qwen3.8-Max、Kimi K3、Fable 5 分别制作一个介绍 GPT5.6 的宣传视频,测试一下这几个模型在 Coding、长程任务上的效果。
测试用例
基于 GPT-5.6 官方页面 做一个介绍 GPT5.6 的视频,严格使用该网页里面的图文素材,要求科学逻辑严谨,能够把该模型的特点和优势介绍出来,视频时长 2 分钟左右。
效果上,Fable 5 是绝对第一梯队,交付的视频质量很高,基本上没有瑕疵,图文并茂,视频逻辑性更强。
Qwen3.8-Max 和 Kimi K3 交付效果相当,都有一些小瑕疵,有些截图和讲述的内容图文不符,但整体质量都还是不错的。
我们也在这个任务上测试了 Qwen3.7-Max,效果比较一般,Qwen3.8 相比上一代提升的还是非常明显的。
Qwen3.8-Max 制作的 GPT5.6 Sol 介绍视频
GPT5.6 Sol 制作的 GPT5.6 Sol 介绍视频
Fable 5 制作的 GPT5.6 Sol 介绍视频
游戏开发
这个任务我们测试了 Qwen3.8-Max、Kimi K3、Fable 5、GPT5.6-Sol 在开发游戏上的表现,主要衡量游戏交付是否可玩、游戏的动画流畅度和美感。
测试用例
打造一款能直接在浏览器中游玩、《星际火狐》风格的复古 3D 游戏。玩家将向前飞行,穿越科尼利厄斯风格的地表关卡,随行还有电脑 AI 操控的僚机。玩家可以躲避障碍物、攻击敌方单位、拾取增益道具,并在关卡末尾挑战 BOSS;将 BOSS 初始血量削减至一半,再新增若干强化拾取道具,让游戏画面表现与游玩手感都达到绝佳效果。
先说游戏设计美感,Qwen3.8-Max 在这几个模型里面表现得最差。游戏策略上也比较乱,整体玩下来不太知道游戏规则,可玩性不好。
在游戏策略上,感觉 Fable 5 还是要明显强一些的,交付的游戏是明显可以玩起来的,而且还有游戏环节的互动和指引。这一点 Kimi K3 和 Fable 5 基本上一致。
设计美感: GPT5.6 Sol > Fable 5 = Kimi K3 > Qwen3.8-Max
游戏可玩程度: Fable 5 = Kimi K3 > GPT5.6 Sol > Qwen3.8-Max
PPT 制作
这个任务上,主要对比 Qwen3.8-Max 和 Kimi K3 在 PPT 信息收集、整理和交付美感上的差异。
测试用例
基于 GPT-5.6、Claude Fable 5 / Mythos 5、Grok 4.5 这三个文档,写一个对比 GPT5.6、Fable 5、Grok 4.5 三家模型的 PPT,要求逻辑严谨,内容详实,突出各模型的特点和优势,以及各家想重点突出的核心点,要有数据洞察。
结果上,两者在交付美感上不相上下,都是图文并茂,图表都整理得不错。
但是在信息收集和整理上,Qwen3.8-Max 收集的信息不如 Kimi K3 详实,数据分析和对比的洞察也不如 Kimi K3 做得好。
结论
实测对比下来,Qwen3.8-Max 是一个比较有竞争力的模型,应该是 Opus 4.8、至少 Opus 4.7 级别的模型,相比上一代 Qwen3.7 提升幅度较大。
当和 GPT5.6 Sol、Kimi K3 相比,并没有体现出优势,很多任务上反而不如后者,这个和其宣传的结论有一些出入。
当然,我认为这个 Qwen3.8-Max 新模型的预训练阶段还是很有竞争力的,后训练还有很大的提升空间。再过一两个月,应该是一个非常有想象空间的模型。
这里从 Hunyuan 3 Preview 和 Hunyuan 3 正式版的差异就能看出来,后训练的提升空间很大。