NewsFi.AI
返回今日
已核验来源

DeepSeek 新模型设计得分接近 GPT-6 Astra,成本仅约 1.4%

Decrypt · · 发布于 2026-09-10 · 14 分钟阅读

NewsFi 导读14 分钟速览

OpenDesign 本周用同一批设计任务测试了 13 款人工智能模型。OpenAI 的 GPT-6 Astra 以 82.7 分居首,DeepSeek 的 V4.1 Flash 以 81.2 分达到其 98% 的水平,平均耗时 5.3 分钟,单次完成设计收费 0.023 美元,而 GPT-6 Astra 耗时 11.1 分钟、收费 1.61 美元,前者成本约为后者的 1.4%。13 款受测模型中,有 11 款得分低于 V4.1 Flash 且运行成本更高,仅 GPT-6 Astra 得分略高。该模型总参数为 5520 亿,读取提示时仅激活 80 亿参数,生成回答时激活 160 亿。其交付率为 57.7%,GPT-6 Astra 为 60%。

1

榜单格局

OpenDesign Arena 本轮测试 13 款模型,GPT-6 Astra 以 82.7 分居首,DeepSeek V4.1 Flash 以 81.2 分位居其后,仅差 1.5 分。

2

成本差距

V4.1 Flash 每份成品设计收费 0.023 美元,GPT-6 Astra 为 1.61 美元,前者约为后者的 1.4%,导语称两者成本相差约 70 倍;Claude Fable 5.1 为 3.66 美元。

3

速度对比

V4.1 Flash 平均 5.3 分钟完成一项设计,Astra 需要 11.1 分钟,Claude Fable 5.1 需要 12.8 分钟。

4

其他模型表现

包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash、Gemini 3.8 Flash 在内的 11 款模型分数低于 V4.1 Flash,且运行成本更高。

5

评分口径

满分 100 分,其中 30 分检查输出是否符合需求说明,70 分评估版式、层级、配色与风格匹配度。

6

低成本来源

技术报告显示,V4.1 Flash 总参数 5520 亿,读取提示仅激活 80 亿、生成回答激活 160 亿,DeepSeek 称之为因果编码器—解码器设计。

7

此前的动作

数周前 DeepSeek V4 Pro 在另一项基准对比中与 Claude Fable 5 相差不到 5%,价格仅为后者一小部分;公司还在北京招募工程师建设自有 Code Harness。

8

评测边界

只有能正常渲染为网页的输出才被计分,空白、损坏或截断的输出记 0 分且不重测,因此衡量的是可靠的日常设计产出,而非通用推理或编程能力。

9

交付率

V4.1 Flash 的交付率为 57.7%,GPT-6 Astra 为 60%,Claude Fable 5.1 为 56.7%;交付率指无需返工即可交付的比例。

10

Astra 的定位

GPT-6 Astra 于 9 月 3 日发布,以多任务通吃著称,但早期测试者认为其写作能力弱于它所替代的模型。

11

原文构成

原文除评测内容外,还附有一长串加密货币价格列表,如 BTC 77,228.00 美元、ETH 2,460.26 美元、SOL 100.03 美元,与设计评测主题无关。

SOURCES

来源与引用

共 1 个来源
官方原文Decrypt 原始发布2026-09-10 · 一手信息
https://decrypt.co/377917/deepseek-openai-gpt-6-astra-design-benchmark