AI 热点快报:Qwen3.8-Max 发布,首次开源 2.4T 旗舰权重(2026-08-03)
事件与背景
2026 年 8 月 3 日,阿里 Qwen 团队官方发布 Qwen3.8-Max,宣称是 Qwen 家族迄今最强模型,也是首次开源 Qwen-Max 级(旗舰级)模型权重——开源权重将于下周在 Hugging Face 与 ModelScope 发布。模型基于 Qwen 3.5 架构扩展到 2.4 万亿参数(95B 激活,MoE),即日起可通过 QwenCloud API 调用,并支持 OpenAI 与 Anthropic 兼容协议,可直接接入 Claude Code、Codex、OpenClaw 等主流 Agent 框架。
官方博客用三个”无人干预”案例展示其长程自主能力:一是 10+ 天自主开发 oh-my-cli 项目,截至 7 月 30 日累计 265 commits、127 PRs、151 issues;二是仅凭论文与 GPU 在约 5 天内写出约 7600 行代码复现一篇数据选择论文并改进,在 AIME24 上比原方法再 +2.7 分;三是参加 WWW2025 多模态对话意图识别竞赛,24 小时内击败 458/526 支人类队伍(87%)。Benchmark 方面,PaperBench 达 93.0,超过 Claude Opus 4.8(80.3)与 GPT-5.6 Sol(90.5)。
来源:
- Qwen3.8-Max: A New Bar for Coding and Cowork(官方博客)
- HN 讨论(243 分 / 87 评论)
- 自主编码演示仓库 qwen-code-dev-bot/oh-my-cli
- Artificial Analysis:Terminal Bench 2.1 评估
为什么现在重要
-
开源首次触及旗舰级规模。此前 Qwen 开源的是中小模型(Qwen3-235B 等),Max 级一直是闭源 API 专属;这次把 2.4T 参数旗舰权重开放,意味着”开源=落后一代”的行业惯例被打破。影响判断:自托管前沿模型的成本与可行性上限被大幅抬高,企业本地化部署将首次触及旗舰级能力。
-
开源模型进入”长程 Agent”竞争主线。官方不再强调单次问答,而是 10+ 天自主开发、千轮交互自我演进、动态工作流编排——这与 Claude Code、Codex 等闭源 Agent 旗舰正面竞争。影响判断:开源与闭源的差距从”模型质量”转向”工具链与评估体系”,评测话语权开始向长程任务倾斜。
-
协议兼容成为开源模型的护城河策略。Qwen3.8-Max 原生支持 Anthropic 与 OpenAI 协议,用户只需改环境变量即可在现有 Claude Code/Codex 工作流中切换。影响判断:模型层竞争正在”渠道化”,谁兼容主流 Harness,谁就能低成本获得开发者存量。
-
RL 环境规模化成为新训练范式。博客披露其通过联合扩展真实环境(任务×工作区×Harness)与统一奖励系统来横向提升通用工作能力。影响判断:训练竞争从”数据+算力”扩展到”仿真环境基建”,这比单纯堆参数更难复制。
-
对中文开发者是直接利好。QwenCloud 提供北京、新加坡、美东三地接入点,中文生态(Qoder、Qwen Code)同步优化。影响判断:中文场景的旗舰 Agent 成本有望快速下降,国内团队不必再完全依赖境外 API。
工程师/产品人今天能做什么
- 注册 QwenCloud 获取 API Key,用 OpenAI 兼容端点跑通
qwen3.8-max的 chat completions,先在自己的代码补全/审查流程里做一周 A/B。 - 按官方配置把 Claude Code 或 Codex 切到 Qwen3.8-Max(设
ANTHROPIC_BASE_URL或~/.codex/model-catalog.local.json),重点对比长任务下的稳定性与成本,而不是单轮回答质量。 - 试用
reasoning_effort(xhigh/medium/low)三档,为不同业务场景(深度分析 vs 高频低成本调用)测出性价比曲线。 - 关注下周 Hugging Face / ModelScope 的开源权重,评估 95B 激活参数在现有 GPU 集群上的部署方案(量化、张量并行),提前准备评估集。
- 用官方公布的 Benchmark 口径(PaperBench、Terminal Bench 2.1、FrontierSWE)建立自己的模型选型对比表,别只看宣传分数。
待观察
- 开源权重的许可证条款尚未公布——Apache 2.0 还是受限商用,将决定它能多大程度进入企业生产。
- “下周开源”的具体版本是否为完整 2.4T 稠密权重,还是 MoE 稀疏权重 + 蒸馏小模型,部署门槛差异巨大。
- 第三方复测(Artificial Analysis 等)的独立跑分尚未出炉,官方自测与第三方数据是否一致仍需验证。