DeepSeek 新模型设计得分接近 GPT-6 Astra,成本仅约 1.4%
Decrypt · · 发布于 2026-09-10 · 14 分钟阅读
OpenDesign 本周用同一批设计任务测试了 13 款人工智能模型。OpenAI 的 GPT-6 Astra 以 82.7 分居首,DeepSeek 的 V4.1 Flash 以 81.2 分达到其 98% 的水平,平均耗时 5.3 分钟,单次完成设计收费 0.023 美元,而 GPT-6 Astra 耗时 11.1 分钟、收费 1.61 美元,前者成本约为后者的 1.4%。13 款受测模型中,有 11 款得分低于 V4.1 Flash 且运行成本更高,仅 GPT-6 Astra 得分略高。该模型总参数为 5520 亿,读取提示时仅激活 80 亿参数,生成回答时激活 160 亿。其交付率为 57.7%,GPT-6 Astra 为 60%。
榜单格局
OpenDesign Arena 本轮测试 13 款模型,GPT-6 Astra 以 82.7 分居首,DeepSeek V4.1 Flash 以 81.2 分位居其后,仅差 1.5 分。
成本差距
V4.1 Flash 每份成品设计收费 0.023 美元,GPT-6 Astra 为 1.61 美元,前者约为后者的 1.4%,导语称两者成本相差约 70 倍;Claude Fable 5.1 为 3.66 美元。
速度对比
V4.1 Flash 平均 5.3 分钟完成一项设计,Astra 需要 11.1 分钟,Claude Fable 5.1 需要 12.8 分钟。
其他模型表现
包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash、Gemini 3.8 Flash 在内的 11 款模型分数低于 V4.1 Flash,且运行成本更高。
评分口径
满分 100 分,其中 30 分检查输出是否符合需求说明,70 分评估版式、层级、配色与风格匹配度。
低成本来源
技术报告显示,V4.1 Flash 总参数 5520 亿,读取提示仅激活 80 亿、生成回答激活 160 亿,DeepSeek 称之为因果编码器—解码器设计。
此前的动作
数周前 DeepSeek V4 Pro 在另一项基准对比中与 Claude Fable 5 相差不到 5%,价格仅为后者一小部分;公司还在北京招募工程师建设自有 Code Harness。
评测边界
只有能正常渲染为网页的输出才被计分,空白、损坏或截断的输出记 0 分且不重测,因此衡量的是可靠的日常设计产出,而非通用推理或编程能力。
交付率
V4.1 Flash 的交付率为 57.7%,GPT-6 Astra 为 60%,Claude Fable 5.1 为 56.7%;交付率指无需返工即可交付的比例。
Astra 的定位
GPT-6 Astra 于 9 月 3 日发布,以多任务通吃著称,但早期测试者认为其写作能力弱于它所替代的模型。
原文构成
原文除评测内容外,还附有一长串加密货币价格列表,如 BTC 77,228.00 美元、ETH 2,460.26 美元、SOL 100.03 美元,与设计评测主题无关。