郭震 AI公众号:郭震AI

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

发布日期:

分类: AI消息

预计阅读: 7 分钟

你好,我是郭震!

这两天,阿里发布Qwen3.8-Flash大模型。

这篇文章是我的一手实测,感兴趣的可以看下。

实测思路:先介绍最近广为流传的性价比斩杀线,之后实测对比Qwen3.8-Flash,Claude Opus 4.6、Doubao-Seed-Evolving和 DeepSeek V4 Flash,最后一轮上强度,实测Qwen3.8-Flash 对比Opus 4.8

1 性价比斩杀线

最近,大模型圈里有一张“性价比斩杀线”图流传很广。

如下图所示,它看起来有点复杂,其实核心逻辑非常简单: 用更少的钱,还能高效的完成任务。

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

纵轴代表模型的综合能力,位置越高,说明模型越强;横轴代表完成一个任务的平均成本,越靠左,说明花的钱越少。

箭头所示这条黑色虚线叫作Pareto line,也就是帕累托前沿。

简单来说,这条虚线连接的是当前最划算的模型:在相同价格下,它的能力更强;在相同能力下,它的成本更低。

这张图里最值得关注的是DeepSeek V4 Flash 0731。直接站到了帕累托前沿上。换句话说,V4 Flash用极低的价格,干掉了一批价格比它高、能力却没有它强的模型。

不过,这张图发布时还没有收录刚刚推出的Qwen3.8-Flash。

先看成本。Qwen3.8-Flash拥有125B主模型参数,但每个Token只激活6B参数;API输入、输出分别为每百万Token 0.16美元和0.47美元,推理成本很低。

再看Agent能力。Qwen3.8-Flash-Next在长程办公、专业任务和真实工具调用三项得分均很不错:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

因此综合以上两点,它有希望提升斩杀线,从而让我们花更少钱完成更难任务。

接下来做两轮实测验证。

2 四款模型同Agent任务实测

为了验证Qwen3.8-Flash能不能真正提升斩杀线,我选择了一个典型的中小型Agent任务:开发一款单文件Excel数据分析工具。

这个任务不只考验代码生成,还涉及文件读取、数据分析、图表生成和页面交互,比较接近真实工作场景。

完整提示词如下:

开发一个单文件HTML网页,实现Excel数据分析与可视化工具。支持上传.xlsx/.xls文件,读取多个Sheet,展示可搜索、分页的数据表格;自动统计行列数、缺失值、唯一值、最大值、最小值和平均值;生成中文分析报告,并使用ECharts生成柱状图、折线图和饼图。只输出完整可运行的HTML代码,不依赖后端。

我把相同提示词分别发给Qwen3.8-Flash、Claude Opus 4.6、Doubao-Seed-Evolving和DeepSeek V4 Flash。

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

四款模型使用同一份Excel文件,生成结果不做人工修改,重点比较能否一次运行、功能完成度、分析质量、页面交互以及任务成本。

如下整理出来的结果文件:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

先看Qwen3.8-Flash生成的结果,导入Excel文件后,数据预览、统计分析:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

图表结果如下:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

同样的Excel任务发给Claude Opus 4.6:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

图表结果如下:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

下面是Doubao-Seed-Evolving的实测结果:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

自动生成图表结果如下:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

最后是DeepSeek V4 Flash 0731:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

自动生成图表结果如下:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

这一轮不只看谁的页面更好看,而是看谁能用更低的成本一次把完整任务干完,实测成本汇总:

模型

耗时

成本

Qwen3.8-Flash

1分10秒

¥0.026

Claude Opus 4.6

3分09秒

¥3.20

Doubao-Seed-Evolving

2分10秒

¥0.19

DeepSeek V4 Flash

2分48秒

¥0.061

先看Qwen3.8-Flash。整个生成过程只用了1分10秒,API折算成本约0.026元,是四款模型中速度最快、成本最低的。

再看Doubao-Seed-Evolving,用了2分10秒,成本约0.19元,整体完成度不错。

再看Claude Opus 4.6。它生成的功能确实完整,但耗时达到3分09秒,单次约3.2元,成本是Qwen3.8-Flash的120多倍。

综上在这次任务中,Qwen3.8-Flash与其他几个模型,都能出色完成这个任务,但是通过表格看到Qwen3.8-Flash性价比最高,成本最低。

3 继续上强度,对比Opus 4.8

第一轮只能证明Qwen3.8-Flash可以用更低的成本,完成一个中小型Agent任务。

但它的能力上限到底在哪里?

最后一轮,我直接把对手升级到Opus 4.8,并给两款模型提供相同的初始HTML和Excel文件,测试更复杂的连续修改任务。

这次我要求它们增加日期、区域和渠道筛选,制作核心指标看板,实现图表联动,并根据数据自动找出异常变化、生成分析结论。

完整提示词如下:

在现有单文件HTML基础上继续开发:增加日期、区域和渠道筛选;展示访问用户、订单数、成交金额和转化率四项核心指标;实现图表与数据表格联动;自动识别异常数据并生成中文分析结论。保持单文件HTML,不依赖后端,输出完整可运行代码。

这轮重点比较的,不只是最终页面,而是两款模型能不能理解已有代码、准确完成修改,并且不破坏原来的功能。

先看实测结果对比:

模型

总耗时

输入 / 输出

成本

Qwen3.8-Flash

1分34秒

7,612 / 11,384 Token

约 ¥0.047

Claude Opus 4.8

4分17秒

10,990 / 26,029 Token

约 ¥5.08

再看Qwen3.8-Flash,最终页面、数据筛选和异常分析:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

再看Claude Opus 4.8,最终页面、数据筛选和异常分析:

最新Qwen3.8-Flash 实测:接近Opus 4.8,性价比离谱!

实测下来,在这次单文件数据分析Agent任务中,Qwen3.8-Flash最终呈现的核心功能、数据分析和页面交互,已经接近Opus 4.8。

Qwen3.8-Flash没有全面超过Opus 4.8,但它用不到Opus百分之一的成本,已经进入了Opus级别的任务能力区间。

对于大量日常Agent任务,这个性价比夸张。

最后总结一下

两轮实测下来,Qwen3.8-Flash不只是便宜,而是真的能完成复杂Agent任务。

第一轮,它的速度最快、成本最低,实际效果超过Opus 4.6;但是它每百万Tokens 输入0.8元,输出2.7元,不到Opus4.6的1/40。

第二轮面对Opus 4.8,核心功能和数据分析已经非常接近,但速度快约2.7倍。

结论: 实测表现逼近Opus 4.8,同时成本比DeepSeek V4 Flash还低。Qwen3.8-Flash,再次把性价比斩杀线推向了左上方。

对于需要高频运行Agent任务的人来说,这样的性能和价格组合,简直就是福音。

全文2151字,15张图,如果你觉得这篇文章对你有帮助,也欢迎给我一个三连击:点赞、转发和在看;如果可以,再帮我点一个⭐️。谢谢你看到这里,我们下篇再见。

常见问题

最新Qwen3.8-Flash 实测:接近Opus 4.…测了什么?

看 AI消息 的实际效果、使用门槛和结果表现。

最新Qwen3.8-Flash 实测:接近Opus 4.…适合谁看?

适合正在选工具、做本地部署或验证 AI 工作流的人。

最新Qwen3.8-Flash 实测:接近Opus 4.…要注意什么?

重点看配置成本、失败点、数据边界和可替代方案。

微博邮件

相关内容

更多相关文章

返回栏目

Reader Messages

读者留言

有问题、补充资料或实测结果,可以直接留下。这里不需要登录。

最多 800 字

为了防刷,每条留言会做长度、链接数量和提交频率限制。

0/800

留言列表

0
正在加载留言...