网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

千问3.8-Max发布:国产模型激战正酣,阿里如何突围制胜?

2026-08-04来源:天脉网编辑:瑞雪

8月初,阿里正式推出Qwen3.8-Max大模型,参数规模高达2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研及长周期任务处理能力。官方宣称,该模型不仅能回答问题,还可调用工具、修改代码,并端到端完成复杂任务。开发者可通过千问AI平台获取API服务,每百万Token输入12元、输出36元,价格处于国产头部模型中间水平。阿里计划开源Qwen3.8系列的27B小尺寸模型,为本地部署和低成本应用提供更多选择。

在7月19日预览版上线时,千问团队便宣称该模型以“天”为单位持续进化,对标Anthropic旗舰模型Fable 5,并称其“可能是除Fable 5外最强大的模型”。然而,实际测试显示,Qwen3.8-Max在科研编程、Agent和办公任务中进步显著,部分项目甚至超越海外旗舰模型,但在真实软件工程和复杂环境操作中仍存在差距。例如,在SWE-bench Pro测试中,Qwen3.8-Max得分为67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。

第三方榜单Arena的成绩也反映了类似情况。Qwen3.8-Max在视觉和文本榜单上分别排名第二和第五,与榜首相差13分;在前端代码榜单中排名第四,比榜首的Opus 5-Max低37分。尽管官方编程基准成绩较好,但Arena榜单更侧重生成结果的视觉效果、交互完成度和用户偏好,因此Qwen3.8-Max未能登顶并不矛盾。长周期任务是Qwen3.8-Max的亮点之一,例如连续运行约16天从零构建开源项目oh-my-cli,但连续运行16天仍不足以证明长周期能力已完全成熟,还需考察其目标一致性、错误发现和恢复能力。

千问系列模型一直成绩亮眼。5月20日发布的Qwen3.7-Max曾在Code Arena排名第四,Text Arena排名第六。然而,实际使用中开发者反馈不一。开发者艾林认为,Qwen3.7-Max对项目理解清晰,但在处理复杂代码时易出现漏洞。新一代Qwen3.8-Max在任务拆解、Agent调用和需求理解上有所提升,但与Fable系列仍有差距。独立开发者李默测试后表示,Qwen3.8-Max已接近第一梯队门槛,但在生成交互网站时存在核心功能未完整实现、HTML标签直接显示等问题,需将要求拆解得非常具体才能执行到位。

与国内近期发布的新模型相比,Qwen3.8-Max在与Kimi K3的对比中,仅在工作流智能体任务上超过对方,其余项目多数落后,尤其在深度软件工程和前沿工程任务中差距较大。与DeepSeek V4 Flash的对比则更多反映定位差异,Qwen3.8-Max在所有可比项目中均占优势,但轻量模型V4 Flash以更低成本取得“够用”成绩,挑战了中间价位旗舰模型的价值。开发者李默认为,Qwen3.8-Max在长上下文和复杂任务上的提升“实打实”,但代码能力仍弱于GLM 5.2和Kimi K3,尚未稳定排进第一梯队前列。

阿里面临的竞争环境愈发复杂。过去,架构创新、更长的上下文或更低的API价格可能成为模型卖点,但如今这些能力正在快速普及,MoE架构、百万Token上下文、智能体编程、多模态和开放权重几乎成为国产头部模型的共同方向。对手动作也越来越快,Kimi K3在复杂软件工程和长周期任务中表现突出,DeepSeek V4以低价和推理效率吸引开发者,GLM 5.2则凭借编程能力获得海外开发者认可。技术路线趋同下,单个模型难以建立长期壁垒,竞争转向谁能持续推出更强模型并降低推理成本。

API定价策略反映了四家的不同思路。Kimi K3走高价旗舰路线,DeepSeek V4-Pro用低价争夺调用量,Qwen3.8-Max与GLM 5.2处于中间档位,但千问输入、输出价格均高于智谱,不占价格优势。对于编程和Agent任务,Token单价只是成本一部分,任务成功率、重试次数和人工接管成本往往更影响总成本。低价模型若频繁理解错需求,节省的调用费用可能被检查和返工成本抵消;高价模型若能一次完成任务,综合成本反而可能更低。因此,Qwen3.8-Max需证明其完成同一项任务时能带来更低综合成本。

阿里的独特优势在于模型之外的完整生态。在模型层面,阿里已覆盖通用语言、编程、数学、视觉、语音、全模态和视频生成,并延伸至世界模型和具身智能,企业可在同一平台组合不同模型。在产品层面,阿里拥有云计算、模型开发平台、钉钉、淘宝及大量企业客户,模型可直接接入办公、电商、客服、营销和软件开发场景。发布当天,阿里旗下企业级Agent产品“千问办公”同步开启公测,模型能力正被直接装进办公场景。阿里披露,Qwen在国内企业级大模型调用市场排名第一,阿里云也位居国内AI云市场第一。然而,生态不能替代模型能力,企业倾向于在同一系统中调用多个模型,哪个效果更好、价格更低就用哪个。若千问长期落后于第一梯队,云和渠道只能延缓用户流失,无法消除能力差距。阿里的竞争力仍存在,但壁垒已非某一款Qwen模型,模型能力决定入场资格,价格决定开发者尝试意愿,云服务和企业生态则决定客户是否长期留下。

DeepSeek V4 Flash:以性价比重塑大模型竞争格局,Agent时代新标杆
当 V4 Flash 可以部署在「消费级」电脑上V4 Flash 的另一个变化,是让前沿 Agent 模型离本地设备更近了一步。 它没有用一个绝对领先的榜单成绩,证明自己是最聪明的模型;它做的,是把过去只有…

2026-08-04

Qwen3.8-Max发布,国产模型混战下阿里如何突围生态与成本双关?
两款模型的参照意义不同:Kimi K3是同期发布的同级旗舰,用来回答“千问掉队了吗”;DeepSeekV4的Pro版尚未发布,目前只有轻量化的V4 Flash有公开成绩,它要回答的是,Qwen3.8-Max…

2026-08-04

谷歌押注机器人大脑,蚂蚁灵波“一脑多体”已落地药房抢先机
我认为,蚂蚁灵波最前置的一步就在这里:它把跨本体、空间理解和动作反馈放进了同一套机器人大脑中。 在整套具身原生路线中,空间智能只是一块拼图,但它很能说明蚂蚁灵波的思路:从物理世界里最具体的问题入手,把那些不…

2026-08-04

三星Z Fold8深度体验:阔折叠屏是内容消费神器还是新鲜感陷阱?
而在理解 Z Fold8 的软件适配情况之后,我们就可以来看看这块宽屏真正擅长做什么了。 虽然 4:3 如今只有 IMAX等少数规格在坚持使用,但在播放 16:9、18.5:9 为主的流媒体内容时,Z F…

2026-08-04

索尼音频新品来袭:INZONE H9 II联名套装登场,WH-1000XM6解锁橄榄灰新配色
耳机搭载与WH-1000XM6同款的30mm碳纤维驱动单元,兼顾解析力与动态表现,既能精准捕捉游戏中脚步声、枪声、方位音效等细微声响,带来沉浸式对战体验,也可轻松驾驭日常音乐、影音播放,实现一机多用。同时设备…

2026-08-04

搭载十大全球第一顶尖科技,腾势Z9S正式开启预售
8月3日,“科技豪华智能轿车”腾势Z9S正式开启预售!沿着“全球首款高性能电动智能超跑”腾势Z的顶级技术,腾势Z9S的“S”是Super,是超级,代表超美颜值、超长续航、超强驾控和超级智能,为悦己生活而来。它拥有十大全球第一顶尖科技,采用优雅之势设计语言,搭载第二

2026-08-04

京东AI新探索:从“看懂”到“动手”,让机器人走进现实“真干活”
与一些企业聚焦机器人本体或单一模型不同,京东试图回答的是一个系统性问题:如何把数据、模型、终端和真实场景连接起来,让人工智能在现实中持续学习、接受检验。 这也是京东提出建设“全球最大物理世界运营中心”的现实基…

2026-08-04