
分析师/智涵
校对/会磊
策划/Eason
8月3日,阿里千问发布了新一代大模型Qwen3.8-Max。消息一出,阿里港股股价应声上涨超过7%。
真正让圈内人坐不住的,不是股价,是官方放出的一组实测数据:只给模型一句“创建一个自进化的智能体Harness”,它就从空文件夹出发,独立编程约16天,做出了一个真实可用的自进化智能体框架“oh-my-cli”,累计产生265次代码提交、127个合并请求和151个议题。项目已完全开源。
整整16天,在无人干预的情况下,它自己从空白文件夹跑出了一个完整项目。
这件事最吓人的地方,不在“16天”,也不在“265次提交”——而在那四个字:全程无人。这意味着一个模型不再需要你在旁边盯着、哄着、纠偏,而是可以真正“接单”并“交付”的执行主体。
过去两年,国产模型和海外顶级的差距,从来不在于“能不能写代码”。今天任何一个主流模型都能写函数、补代码、改页面。真正的差距只有一个:你敢不敢把一个复杂任务交给它,然后走开,两周后再回来看结果?
Qwen3.8-Max这次真正让人兴奋的,不是参数又大了多少,也不是榜单排名又升了几位——而是国产模型第一次在“端到端交付”这件事上,拿出了能打的东西。
更重要的是,它的API定价输入12元/百万tokens、输出36元/百万tokens,国际价格仅为Claude Opus 5的40%与24%。一个能交付项目、又足够便宜的模型,会让企业开始认真思考:我为什么要花10万块外包这个项目,而不是让AI跑一周?

两年前的AI,像个聪明的实习生。
写个排序算法,五秒交卷。补全个函数,连注释都给你写好。但你没法让它独立负责一个项目——第五轮对话就忘了需求,第二十轮开始自说自话乱改逻辑,你走开半小时,回来发现它把整个代码库重构了一遍,还跑不起来。
所以你只能守着窗口,把任务拆碎,一次次纠正方向,一遍遍给反馈。
这是Coding Agent的代际差。一个需要人类当“保姆”的模型,再聪明也只是一个高级工具,不是一个可以被托付的劳动力。两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手——但仅此而已。
Qwen3.8-Max这次要讲的,正是这个跨越:从“会写代码”到“能交付任务”。

千问团队做了一个近乎“残酷”的实验。
只给模型一句话:“创建一个自进化的智能体Harness。”没有更多指令。没有拆解的子任务。没有人类中途介入。
模型从空文件夹出发,自己判断要做什么、怎么拆、怎么验证、怎么迭代。它自主搭建了循环工程框架,编排智能体自动领取和执行任务。人类在旁边只做一件事:通过钉钉给它提需求、给反馈——仅此而已。

16天后,它交付了一个Hermes Agent级别的、真实可用的自进化智能体框架“oh-my-cli”。截至7月30日,该项目在完全自主运行中累计产生265次代码提交、127个合并请求和151个议题。项目已完全开源,完整过程公开保存在GitHub仓库里。
这不是简单地写一段代码就收工,而是从头到尾交出了一个完整的东西。
类似的案例不止一个。在科研场景中,Qwen3.8连续自主工作约125小时,成功复现了AI推理相关论文并进行了四轮自我进化探索。

它甚至在天池平台举办的WWW2025多模态对话意图识别挑战赛中,于24小时内击败了458支人类参赛队伍。

再看专业办公场景。一支法务助理团队在数百份法律文档中标注千余个相关条款,需要整整一周时间——Qwen3.8一小时内就能完成,精准标出了1284条条款。一个篮球数据分析团队逐帧标注160个小时以上的比赛录像,Qwen3.8数十分钟就精准拆解了8400多个攻防回合,一次性输出球员战术画像和教练报告。

还有更夸张的。在芯片设计沙箱内,Qwen3.8历经约500轮交互,将硬件门数由8298门精简至678门。在365天长周期电商经营模拟中,它以416252元的总资金成绩拿下第一。
很多人会问:凭什么能做到?
首先是规模。 Qwen3.8-Max总参数量达到2.4万亿,采用稀疏MoE(混合专家)架构与混合注意力机制的联合优化。推理时只激活950亿参数——既保证了能力上限,也控制了实际使用成本。它支持1M Tokens的上下文窗口和视觉理解能力,能读懂200页的财报PDF、看懂超100小时的长视频。
其次是评测成绩。 8月3日Arena榜单同期放榜。在文本任务Text Arena中,Qwen3.8-Max以1496分位列实验室榜第二,单模型排名第五,仅次于Anthropic的Claude系列。

在CodeArena编程榜中,它以1668分位居全球第四。

在Vision Arena视觉榜中,它以1305分排名全球第二。

但真正体现“端到端交付”能力的,是另外几项评测。
在科研复现评测PaperBench中,Qwen3.8-Max较上代模型大幅提升28.2分,以93.0分录得评测新高,超过了Anthropic Fable 5的88.8分。在评估智能体电脑操作能力的OSWorld-Verified评测中,Qwen3.8-Max以86.1分位居主流模型首位——超过了GPT-5.6 Sol Max的83.2分和Fable 5的85.0分。

这些数字不是在说“我比别人高几分”。而是在说:单步推理再强,如果第二十轮开始忘目标、第五十轮乱改文件、第一百轮无法解释自己做过什么,它就仍然不能被托付。Qwen3.8的突破在于长程任务的稳定性——它能持续理解目标、更新计划、吸收反馈,在数千轮交互中保持逻辑一致性。
前沿模型的竞争,正在日益转向它们完成整个工作流的能力,而不是回答单个提示词的能力。
Qwen3.8-Max带来的核心变化,可以归结为一个词:可托付性。
过去两年,大模型在公司预算表里的位置,一直卡在“效率工具”这个格子。它能帮程序员写得更快,帮设计师改得更勤,帮运营想更多文案——但它始终是“辅助”,不是“执行”。原因很简单:你不敢放手。
但现在,当模型能从一句话指令出发、独立跑完16天的开发周期、交付一个完整的开源项目时,它的定位就变了。它不再是“帮你省10分钟”的插件,而是“替你完成一个项目”的团队成员。
这中间差的,不是几个百分点的模型分数,而是两个数量级的市场空间。
效率工具的市场是按“席位”算的——每个员工买个会员,几十到几百块一个月。但企业级项目的市场是按“项目”算的——一个外包开发项目几万到几十万,一个法务审查项目按工时计费,一个数据分析项目按复杂度报价。当AI能够独立交付这些项目时,它就从“预算表的边缘”进入了“预算表的中心”。
而Qwen3.8-Max的定价,让这件事变得触手可及。今日起,全球开发者都可通过千问AI平台获得API服务,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元。国际价格仅为Claude Opus 5的40%与24%。
更值得关注的是,Qwen3.8-Max的权重将于下周开源,同时还将开源Qwen3.8-27B。这是Qwen-Max级别模型首次面向社会开放权重。开发者可以在ModelScope、Hugging Face等平台获取模型。这个动作的意义,不亚于模型本身的技术突破——中国大模型第一次在“顶配”层面参与了全球开源社区的规则制定。
回到开头那个问题:国产模型和海外顶级的差距到底在哪?
两年前我们问的是“AI能写代码吗”。一年前问的是“AI写得够好吗”。今天问题变了——我们问的是“你敢放手让它自己干吗”。
Qwen3.8-Max交出的答卷是:我能。

