Qwen3.8-2.4T-A95B 的发布移动了 开放权重 的边界——只是并非标题分数所暗示的方向。阿里巴巴发布了一款拥有 2.4 万亿参数的稀疏专家混合 (MoE) 模型,每个 token 具有 950 亿个激活参数,并采用了自定义许可协议,将商业规模限制在 5000 万美元收入门槛之下。权重于 8 月 12–13 日左右抵达 Hugging Face,市场立即做出反应:在该模型于 8 月初推出 API 后,阿里巴巴股价在 香港上涨 7%,在纽交所上涨 4.5%。
Qwen 3.8 缩小推理差距,但智能体编码仍是美国强势领域
Qwen 3.8 缩小推理差距,但智能体编码仍是美国强势领域 CryptoRank
CryptoRank
Publisher
Aug 22, 2026 at 11:09 PM UTC · 3 分钟阅读

Key Signal
92.6 GPQA Diamond score
Market Impact
SOL-3.38%$113.36
Last Updated
2 个月前
不过,在接受这些数字作为“到达巅峰”的证据之前,值得探究经验证的基准测试究竟确认了什么,以及差距依然存在于何处。
验证数据揭示了什么
在 HuggingFace 的独立评估排行榜上,Qwen 3.8 在 GPQA Diamond 上获得 92.6 分,在 Terminal Bench 2.1 上获得 86.6 分。这些是真正的通用推理分数——足以与 GPT-5.6 Sol(分别为 94.1 和 88.8)和 Opus 4.8(92.0 和 84.6)竞争。该模型在标准化的跨指标评估中,直截了当地缩小了与美国前沿实验室的推理差距。
但要警惕占据报道主导地位的厂商自报数据。阿里巴巴声称在 PaperBench 上获得 93.0 分——高于 GPT-5.6 Sol 的 90.5、Opus 4.8 的 80.3 或 Fable 5 的 88.8。这一数字来自 Qwen 自己的评估工具,其超时和 token 限制配置与美国模型所使用的不同。这在方向上有参考价值。但它与 HuggingFace 排行榜结果并非同一层级的证据。
结构性优势所在
真正的信号存在于 DeepSWE 1.1 中,这是最具抗污染性的编码智能体基准测试。这里的数字是有记录且毫不留情的:Qwen 3.8 为 56.6,Fable 5 为 70.0,GPT-5.6 Sol 为 73.0。在对生产级智能体编码至关重要的任务类型上——如导航现实世界的代码库、跨大型仓库调试、在复杂的多文件结构中无需人工干预地进行迭代——存在 13 到 16 分的差距。
这一差距之所以具有启发性,不在于赤字本身,而在于它所指向的问题。在更广泛的推理方面,Qwen 3.8 已有效达到持平。但在将推理引擎转变为可靠的自主编码智能体的特定能力栈上——工具调用编排、环境反馈集成、长周期仓库导航——美国模型脱颖而出。这不是通用智能问题。这是一个基础设施和训练数据的问题,这表明竞争护城河已从原始模型能力转向了建立在其之上的工作流。
竞争对手应关注的速度
以下是不容忽视的一点:Qwen 3.7-Max 在同样的 DeepSWE 1.1 基准测试中得分为 21.6。单代实现了 35 分的跳跃——从 21.6 到 56.6——这不是渐进式的进步。这是一种代际加速,表明阿里巴巴缩小智能体编码差距的速度比静态画面所暗示的要快。如果这种趋势在下一代中得以维持,美国的堡垒将显著缩小。
Market Context
Article Intelligence
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
