Qwen3.8-Max 来了。2.4万亿参数Qwen 家族迄今最强的模型也是首个 Max 级别的开源权重模型。在 Frontend Code Arena 排行榜上名列第四其得分为 1668 分。仅次于 Claude Opus 5 (Max)的 1705 分和 Kimi K3 (Max)的 1676 分。与 Claude Opus 5 (High)的 1669 分相当。各项基准上对比上一代全面大幅提升而且权重下周将开放。它能连续自主工作数天几乎不需要人插手把一个复杂、开放的目标从头做到尾交付可用的成果。编程、办公、科研、长周期任务、多模态全面提升。网友直呼“电脑将会替我们完成所有工作而我们则可以一起去海滩度假了”连续写码十天对顶尖模型来说写代码早就不是帮我写个函数这么简单了。真正的考验是从一个空文件夹出发独立把一个跨越数天的项目做到交付。Qwen3.8-Max 接受了三个这样的挑战全程自己写代码、跑代码。第一个挑战十天级自动编程。Qwen3.8-Max 从零创建了一个叫 oh-my-cli 的项目任务是构建一套自进化 Harness执行框架。它把用户反馈、社区实践、自测结果统一纳入工程循环需求变成 issueAgent智能体自动领取、执行代码写完跑测试、看日志有问题就修修完再跑。16天自主运行后仓库里留下了265次 commits、127个 PR、151个 issues。第二个挑战复现一篇论文然后超越它。任务是把《Unified Data Selection for LLM Reasoning》用代码复现出来再想办法做得更好。Qwen3.8-Max 手里除了论文什么都没有。数据处理、训练代码、评测程序全得从零写。它连续工作了约5天125小时不间断写下约7600行代码执行超过1100步操作跑了33轮 GPU 训练。前37小时搭起整套流水线完整复现了论文的6项主要结论。它还自己跑起了一个科研循环提假设、写代码、上 GPU 跑、分析、再试。4轮探索18种改进想法每一轮的结果反哺下一轮。最终在竞赛级数学基准 AIME24 上比论文原方法又提升了2.7分。第三个挑战24小时多模态对话意图识别挑战赛。WWW2025多模态对话意图识别挑战赛阿里云天池平台526支人类队伍同场竞争。任务是读懂电商客服对话文字加截图判断顾客到底想要什么。Qwen3.8-Max 独立参赛它先读懂比赛规则再用代码搭起一整套方案。文本方面微调并集成了 BERT、MacBERT、RoBERTa 多个中文模型。图片方面微调了 Qwen2.5-VL-7B 视觉语言模型用 Chinese-CLIP 兜底。这些模型融合成加权投票系统交叉验证校准权重。45次提交准确率从0.60爬到0.853击败458支人类队伍占全场的87%。三个案例一条共同的主线。面对开放目标Qwen3.8-Max 能连续专注数天自己提想法自己验证把成果做出来。真实办公编程之外真实工作里那些琐碎、多步骤、重度依赖工具的任务是前沿模型创造经济价值的主赛道。团队联合扩展了 RL强化学习的环境数量和训练算力随着 RL 训练持续 scale upQwen3.8-Max 在数十个 in-house / public 工作基准上取得稳步、一致的性能提升。在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等主流 Harness 上模型的通用工作能力持续提升而且不同 Harness 上能力相当。环境在任务、工作空间、Harness 三个维度上解耦合以组合方式自然增长。奖励系统把执行校验、文本与视觉评估、agentic 检查统一在一起为所有环境提供一致的信号。在线数据均衡器让每个 batch 在任务、难度、工作区上高度均衡支撑训练算力稳定扩展。为了检验广度团队选取了数百种高经济价值职业的高频场景来测试。企业合规律师UI/UX 设计师结构工程师康复理疗师体育数据分析师等的工作以前需要数小时甚至数周Qwen3.8-Max 只要几分钟或几小时就能完成。还有一个更深的量化策略研发案例。Qwen3.8-Max 仅从一句简短的任务描述出发自主规划动态工作流持续工作数小时交付出完整的 ETF 轮动策略。它自己搭数据系统、构建因子、编排多轮迭代持续分析回测结果并调整方向。发现过拟合信号自动剪枝。发现多条路径收敛到同一组信号增加多种子验证。判断集成策略不够稳健自主切换框架。广度上它把因子研究并行化。6类经典因子每类拆解为50个研究方向调度约330个子 Agent完成约6000次回测。最终入选因子的超额夏普比率介于0.64与1.48之间。原本需要研究员数周乃至数月串行推进的量化研究压缩为一次对话内可交付的自动化闭环。长程攻坚面对极复杂的长周期、多约束任务Qwen3.8-Max 展现出了系统级的自主规划与闭环自适应学习能力。芯片设计是一个典型场景。任务是独立完成一个 GCD/RSA 密码硬件加速器的逻辑重构、多约束优化和后端布局在保证功能正确的前提下最小化综合后的网表门数。输入极简只有任务描述、一个无内部逻辑的 RTL寄存器传输级接口骨架和评估脚本。没有参考设计没有人类干预。Qwen3.8-Max 在集成了 Iverilog 仿真、Yosys 综合和 OpenROAD 物理设计的沙箱中自主执行。约500轮交互71次评估跨越13个关键里程碑。芯片面积整体缩减81%。前端架构级的深度演进无缝转化为了更小、更快、更可布线的实体芯片设计。另一个长程案例E-Commerce Bench一个365天长周期电商经营模拟。基于淘宝天猫真实脱敏交易数据12种店铺类型、60个商品类目、近600家供应商、7000种商品。模型手握10万元启动资金同时运营多家网店面对季节波动、突发事件、现金流压力自主完成选品、议价、库存管理、动态定价、退货处理等全链路决策。供应商不好对付每个都有独立的性格和让步策略需要多轮自然语言议价。Qwen3.8-Max 能对同一供应商逐轮压价还能把博弈经验泛化到类似商品议价效率随时间持续增大。600家供应商里藏着152家欺诈型商家会费陷阱、低价诱导、货不对板模型都得识别和规避。最终Qwen3.8-Max 以416252元总现金胜出4.16倍回报超过第二名 GLM 5.2 达38%比上一代 Qwen3.7-Max 提升152%。在超过2000轮交互中持续迭代进化没有死守早期策略。看得见做得到Qwen3.8-Max 的多模态能力贯穿了任务全流程。面对超过200页的财报和复杂 PDF它能跨页面理解文字、图表和版面结构提炼关键结论生成结构化报告与可交付的网页。面对超过100小时的长视频它能定位片段、回答细节把人物、事件、时间组织成视频 Graph 记忆在长时间跨度中梳理事件演进和人物关系。理解之外它还能做真实的视觉生产。把生活素材剪成 Vlog把一道题变成沉浸式教学动画把界面截图还原为完整前端项目把户型图构建成 Blender 3D 装修效果。更值得关注的一点视觉能力不只在输入端。模型执行过程中会持续观察自己的中间产物检查页面布局、物体方向、空间关系、动画效果。发现电视放反了、界面错位了它能定位偏差、重新规划、自主修正。视觉成了贯穿规划、执行、验证和迭代的原生反馈回路。一边生成一边观察。一边行动一边审查。团队还构建了 RecreationBench一个让编程和 GUI 操作彼此互补的长程应用复刻基准覆盖 Ubuntu、macOS、Windows、Android 和 Web 五大平台。模型把一个真实运行的应用当黑盒观察没有源代码不能联网完全靠交互和反馈去理解然后从零复刻。Qwen3.8-Max 在这个基准上展现出前沿水准的 Hybrid Agent 能力通过迭代编程与交互反馈的反复循环一步步逼近原始应用。配套推出的还有 Qwen-MM-Plugins面向多模态 Agent 的 Harness 扩展库为不同 Agent 框架提供图像与视频处理、多模态记忆、动态分辨率、视觉工具调用以及视频剪辑、Blender、CAD 等专业任务支持让现有 Agent Harness 更自然地升级为多模态原生系统。而且Qwen3.8-27B本地就能跑的小模型也将开源相信能力也会大幅提升开发者值得期待。参考资料https://qwen.ai/blog?idqwen3.8https://x.com/i/trending/2084103544576098577