
通义千问 Qwen3.7-Max 让复杂任务不再半夜中断。企业把模型接进工作流后,常遇见的卡点是长程任务跑到一半就报错退出,原本想省的人力又回到人身上。该模型的解法是连续自主运行 35 小时不停机,把整段工程目标交出去自己拆解、执行、纠偏。云巴巴行业观察发现,这种长程自主能力正在改变企业对大模型"只能做短任务"的固有判断。
复杂任务为什么总在半路断:传统模型长程执行的任务断裂痛点
多数企业把大模型接进工作流后,首个卡住的点是任务做不长。短问答、单轮生成都顺畅,一旦要连续跑完一个跨步骤的工程,模型往往在几十步之后开始偏离目标,或者因为中间一步报错就整体退出。某制造企业的研发团队曾反馈,用通用模型做跨系统数据核对,平均到第三步就需要人工介入,原本想省的人力又回到了人身上。
这种断裂来自三处硬约束。其一,上下文窗口不够长,长链路里前面的约束被挤到窗口外,模型渐渐忘记一开始要判断什么。很多模型上下文只有几万 token,跑十几轮工具调用就被占满,后面新信息把旧目标顶掉。其二,错误会累积,一步算错后面全错,模型缺少自己回头验证的机制,也没有把中间结果写回长期记忆的习惯,错了就沿着错路继续走。其三,多数模型把任务当作一次性响应,没有把"执行、观察、修正"串成循环,每步都得人推一下,所谓自动化其实只是半自动。

云巴巴行业观察认为,企业真正需要的不是单次更聪明的回答,而是能撑住长程、中途不塌的任务执行体。这也是为什么"35 小时自主运行"这类指标开始被采购方当作硬门槛,它衡量的是模型在无人值守时还能不能把目标走完。对采购方来说,先看清代断裂在哪一步,比盲目堆参数更实在。
35 小时自主运行实验还原:陌生芯片上 432 次内核评估与 1158 次工具调用
通义千问 Qwen3.7-Max 的 35 小时实验,把"长程自主"从口号变成了可测量的数字。实验环境选在平头哥真武 M890 PPU 上,这块芯片在模型训练阶段从未见过,意味着模型无法靠记忆走捷径,必须现场理解硬件、自己写程序去适配。整个过程中模型自主编程并调用工具,对关键内核做自我进化。
公开细节给出两组合计数:432 次内核评估、1158 次工具调用。模型在 35 小时里没有停下来等人下指令,而是不断评估当前内核、改写、再评估,直到推理速度较原版本提升 10 倍。所谓内核自我进化,是模型自己发现瓶颈、改代码、跑基准验证,把人类工程师的试错过程搬进了长程循环。同一类实验里,GLM-5.1 跑到 7.3 倍后停止,Kimi K2.6 在 5.0 倍后停止,两者都没能走到 10 倍这条线。

这类长程任务之所以跑通,与该模型的全域思考模式有关。文本、图像、代码三位一体的统一推理,让模型在改写内核时能同时理解文档、读报错图、写代码,不必在多个专用模型间来回切换,减少了长链路里的接口损耗。这组对比对企业的价值不在名次,而在稳定性。一个能连续自主跑 35 小时、把陌生硬件的推理效率翻 10 倍的模型,说明它具备"接手半结构化目标后自己干到底"的执行力。部分研发团队把它理解为:把原本排期数周的底层优化,压缩成一次长程任务。值得补充的是,该模型在 Arena 全球大模型盲测总榜中位列国产模型第一,MMLU 得分 89.7%,编程基准 SWE-bench Verified 80.4、LiveCodeBench 91.6,这些分数支撑了它在长程任务里的代码与推理表现。
企业可复用的三类长程自主场景:内核自优化、跨系统数据清洗、长周期研报生成
把实验能力落到企业日常,容易被复用的有三类长程场景。场景一是内核与代码自优化。研发团队可以把"把某模块推理耗时降下来"设成目标,让模型连续多轮改代码、跑评测、再改,省去人工逐次试错,正好对应实验里 432 次内核评估的思路。
场景二是跨系统数据清洗。某制造企业曾把采购、仓储、财务三套系统的对账交给通用模型,因字段口径不一频繁中断。换成支持长程自主的任务体后,模型能跨系统比对、标记异常、回头补规则,把原本每天要人盯的流程跑成闭环,中间出错也能自我修正而不是整体退出。
场景三是长周期研报生成。投资与战略部门常需要把数十份公告、财报、行业资料汇总成一份带结论的报告。长程模型可以连续读取、抽取、交叉验证,在几小时里完成过去要多人协作一两天的初稿。

这三类场景共同点是:目标清晰、步骤多、允许模型在中间自我纠偏,正好匹配 35 小时自主运行的设计。需要提醒的是,它们都要求企业先把目标拆成可验证的子任务,模型才有自我纠偏的抓手,否则长程任务也会在无标准可依的环节失速。采购方可以从其中一类切入试点,跑通后再横向铺开。
落地前的能力边界与工程准备:监控机制与人工兜底设计
长程自主不等于完全放手。企业在把 35 小时级任务接进生产前,需要先把边界和兜底想清楚。能力边界上,模型擅长目标清晰、可验证、能工具化的任务,对需要外部线下确认、强合规签字的环节仍要留接口,不能假设它能替人做关键拍板。采购方在评估时,可先拿一段内部真实长任务做探针,看模型在第几步需要人救场,再决定哪些环节适合全自主、哪些必须留人。
监控要先行。长程任务跑得久,要有一套看板记录工具调用次数、停留时长、异常节点,让人能在偏离时介入,而不是等 35 小时结束后才发现跑偏。人工兜底同样关键,关键决策点设审批闸,模型提方案、人确认后再执行不可逆操作,比如删数据、发对外报文。
价格侧也要算账。Qwen3.7-Max 的 API 输入价 ¥2 / 百万 token,限时 8 折 ¥1.6 / 百万 token,长程任务调用频繁,成本随工具调用次数上升,提前设预算上限更稳妥。获取上通过阿里云百炼平台调用,企业可先跑小目标验证稳定性,再放大到 35 小时级。该模型三档全系 100 万 token 上下文,百万级窗口也为长程任务留出了记忆空间,成本上还有隐式缓存无感降本,长程里重复上下文可命中缓存,实际账单常低于线性估算。
目前,通义千问 Qwen3.7-Max已经在云巴巴平台上线,想了解更多可以联系我们。在云巴巴,你还能横向对比更多同类产品,根据团队规模和业务场景找到最匹配的方案。


本文系统拆解千问办公的定位、七大核心能力、八类岗位覆盖与三种入口形态,并与传统AI Chat对比,帮助企业判断这款阿里通义千问旗下的AI办公执行助手是否适合自身团队。

7月28日,云巴巴在腾讯云黑客松·AI智能体争霸赛(华北赛区)荣获"优秀合伙人"称号,资深AI专家倪江玮同步获评"优秀奖"。作为同时持有腾讯云AI智能体示范伙伴、WorkBuddy核心伙伴、官方授权服务中心三重认证的企业,云巴巴以"能力共建+全程陪跑"模式打通AI落地"最后一公里",服务制造、法律、金融等八大行业,未来将持续深耕优势赛道并向医疗、零售、教育等领域拓展,做AI时代的长期伴行者。

本文从知识管理真问题剖析、三层记忆沉淀逻辑、专家沉淀技能封装到知识复用智能调用实测,全流程拆解WorkBuddy把工作经验变成可复用资产的实际效果与匹配精度边界,并给出分行业落地建议。

远程办公这个词,三年前还算"新潮",现在已经是很多公司的日常了。数据表明,国内超过四成的知识工作者每周至少有一天在家办公,混合办公模式正在从互联网行业向传统行业…

电商企业从1个平台到8个平台的增长曲线,暴露了电商开票管理能力跟不上业务增长的瓶颈。电商通通过一次部署终身扩展的投资保护、新平台即绑即用的零切换成本、多税盘多账户在线协同的电商规模化开票管理、三票种并行覆盖的票种演进适配、数据规模无上限的弹性扩展,让电商开票管理系统跟上企业增长曲线,而非成为增长绊脚石。电商通是电商规模化开票管理的最佳选择。