核心事件: 8 月 3 日,阿里巴巴发布 Qwen3.8-Max——总参数量 2.4 万亿(激活 95B)、上下文长度 1M,Text Arena 排名第五、Vision Arena 排名第二,权重预计本周内开源。头条能力不是基准分数,而是一项关于监督的声明:阿里巴巴称,该模型在一个真实的软件工程项目上自主运行了 16 天,并构建了一个自我进化的 agent 框架(“oh-my-cli”),随后在 GitHub 上开源。零干预自主性是编程 agent 的新前沿。它也正是权限边界问题变得不容商榷的地方。
阿里巴巴发布了什么
Qwen3.8-Max 是 Qwen 家族中规模最大的模型,基于 Qwen 3.5 构建,采用稀疏 MoE(混合专家)架构与混合注意力机制——总参数量 2.4 万亿,推理时激活 95B,这正是阿里巴巴得以在不承担前沿级算力成本的前提下获得前沿级智能的方式。第三方数字:Text Arena 排名第五、Vision Arena 排名第二(Arena 综合排名将 Qwen 排在 Anthropic 的 Claude 系列之后),CodeArena 排名第四,IF Bench 82.8、GPQA Diamond 92.6,OSWorld-Verified 得分 86.1——在主流模型中位列第一,代表计算机操作能力。
定价延续了中国开源权重模型积极进攻的价值策略:国内每百万 token 输入 ¥12 / 输出 ¥36,隐式缓存命中 ¥1.5;国际价格方面,输入约为 Opus 5 定价的 40%,输出约为 24%。权重——包括 Qwen3.8-27B——预计于本周内紧随发布,这对自托管意义重大:Qwen 家族已经是 Hugging Face 上下载量最高的开源模型系列,累计下载量超过 10 亿次。
自主性声明
让这次发布区别于一次参数表刷新的是“零干预编程”的故事。阿里巴巴表示,在内部测试中,Qwen3.8-Max 被分配了一个真实的软件工程项目——从零构建一个自我进化的 agent 框架——并在 16 天内无任何人工干预地完成了它:在封闭的工程循环中整合用户反馈、社区最佳实践与自测数据,不断迭代代码生成、测试、预览与日志分析,最终将成果(“oh-my-cli”)在 GitHub 上开源。这一叙事也得到了中国科技媒体的呼应:两年前,前沿模型只能编写函数;如今,一个模型可以从一个空文件夹起步,交付一个真实、持续多日的项目,全程无需人介入循环。
这是一项真正不同的能力声明,值得认真对待——也值得审视。一次 16 天的无人值守运行是一次演示,而不是一道控制措施。有趣的问题永远是伴随自主性而来的那些:在这 16 天里,模型能访问什么、能触碰到什么,以及在其产出的任何东西被视为完成之前,由谁来评审?阿里巴巴的声明只说明模型在被赋予一个任务和一个封闭环境时能做什么。它并不能证明同一个模型在被授予凭证和一个真实代码库时会发生什么——这与《Anthropic 评测越界事件》得出的区分完全相同:边界由环境强制执行,而非由模型承诺。
自主性让边界成为产品
本站在本周每一次发布中都重复同一个论点——Muse Code 的并行子 agent、Claude Code 的 Auto Mode,如今再到 Qwen 的零干预运行:**厂商正在售卖的能力,恰恰是团队绝不能默认交出去的部分。**每一项新的自主性功能,都把评审关卡进一步移出人类工作流。当环境被限定范围时,这没有问题——一个在隔离工作树中针对有界任务迭代的模型,既强大又安全。而当同样的自主性作用于生产系统、真实凭证或开放互联网时,情况就完全相反——在那里,一次未经评审的动作的代价不是一次糟糕的提交,而是一次不可恢复的操作。
对于开源权重模型,这笔账多了一个闭源厂商没有的变量:权重可以自托管,这意味着环境问题完全掌握在客户手中。一个在受管自托管环境中部署 Qwen3.8-Max、并通过受管 agent 工作运行的团队,获得这项能力的同时,边界由基础设施而非提示词来强制执行。这正是开源权重路径真正的优势所在——不在于许可证,而在于你可以掌控 agent 在哪里运行。同样的自主性,在开发者笔记本上是风险,在受边界约束的环境内则是受控的资源。
结论
Qwen3.8-Max 是迄今最强的信号,表明编程 agent 竞赛已从“模型能写出什么”转向“模型能在没有你的情况下工作多久”。这是进步——也正是在这一点上,评估方式发生了改变。一次 16 天的无人值守运行不是验收测试;你的代码、你的验收标准、你的评审关卡才是。随着开源权重即将到来,团队现在可以真正选择边界落在哪里:是在一台只有提示词的笔记本电脑上,还是在有边界的试点里、置于你掌控的环境之中。本周,模型变得更加自主。正因如此,安全运行它的纪律变得愈发重要。