Hy4 preview是腾讯混元于2026年8月28日发布并开源的新一代大语言模型,采用MoE架构,总参数7700亿、每次推理激活490亿,上下文长度突破100万tokens。该模型在模型尺寸、上下文长度、数据规模三个方向同步扩展,预训练与后训练的共同改进带来智能水平的又一次提升,在开源模型中处于领先水平。Hy4 preview的定位是「为生产力而生」,路线与追求通用榜单分数的模型有明显差异:团队与腾讯内部软件工程、游戏、金融、安全等领域的专家共建高质量数据,并与WorkBuddy、CodeBuddy等产品做深度协同设计(Co-Design),让模型的优化目标直接对齐真实用户工作流而非基准题目。在腾讯内部组织的盲测中,163名内部专家针对203个真实工程任务打分,Hy4 preview取得2.99/4.00的均分,略优于GLM-5.3的2.92与Kimi K3的2.94。分场景来看,软件工程方向增强了长程开发任务的理解、规划、调试与验证能力,并提升前端开发的视觉审美与交互质量;办公分析方向提升复杂办公环境理解和金融分析能力,打通从信息处理到文档、表格、演示文稿交付的完整链路;游戏开发方向支持一句需求直接生成可玩原型,并能熟练驱动游戏引擎做多轮迭代;科学研究方向在AI研发、分子动力学模拟、凝聚态物理、基础数学等场景均有明显进步。值得关注的是,Hy4 preview在自身研发链路中首次参与训练方法、数据策略、评估体系和底层算子的自动优化——模型提出方案、运行实验、依据结果继续迭代,实验产生的代码、日志与反馈进入下一轮探索,形成了初步的递归自我改进闭环。它还通过自主分析推理系统瓶颈,围绕算子融合与通信优化开展多轮改造,端到端吞吐相较基线提升31.8%,且在不同上下文长度与并发度下均取得稳定收益。模型已在WorkBuddy/CodeBuddy国内版及国际版、元宝、ima等腾讯产品同步首发,开发者可通过腾讯云TokenHub和OpenRouter接入API。定价延续普惠路线:输入每百万tokens 6元、输出18元、缓存命中0.3元。自2026年2月重建基础设施以来,混元大模型保持约每两个月一次大版本迭代的节奏。
📋 技术规格
| 厂商 | 腾讯混元 |
|---|---|
| 模型分类 | 对话与文本生成 |
| 参数规模 | 7700亿总参数(770B),激活参数490亿(49B),MoE架构 |
| 上下文窗口 | 100万tokens |
| 最大输出 | 未公开 |
| 知识截止 | 未公开 |
| API定价 | 输入: 6元/百万tokens(缓存命中0.3元/百万tokens)输出: 18元/百万tokens |
⭐ 核心能力详解
770B总参数、49B激活参数的MoE架构,上下文突破100万tokens
内部盲测均分2.99/4.00,略优于GLM-5.3与Kimi K3
Apache 2.0开源权重,可自由下载、微调与商用
定位「为生产力而生」,与真实工程任务而非榜单题目对齐
首批参与自身训练方法与算子自动优化的混元模型,形成递归自我改进闭环
定价输入6元/输出18元每百万tokens,缓存命中低至0.3元
🎯 典型应用场景
长程软件工程与代码库级开发任务
前端界面开发与交互质量优化
复杂办公文档、表格与演示文稿的自动化交付
金融数据分析与跨文件协作
游戏原型生成与引擎驱动开发
科研问题推理与实验方案设计
💪 技术优势与差异化
- Apache 2.0协议开源,企业可私有化部署无授权顾虑
- 770B规模下仅激活49B,兼顾能力上限与推理成本
- 100万上下文支持整库代码与长文档一次性载入
- 与真实生产力工具协同设计,工程任务落地体验优于纯榜单调优
- 推理吞吐较基线提升31.8%,长上下文与高并发下收益稳定
- 缓存命中价格0.3元/百万tokens,高频重复上下文场景成本优势明显
⚠️ 使用局限与注意事项
- 版本名带preview后缀,属于预览阶段,正式版能力与接口可能调整
- 最大输出长度与知识截止时间官方未公开
- 770B总参数对私有化部署的显存与集群要求较高
- 盲测数据来自腾讯内部专家评审,非第三方独立基准
- 公开第三方综合基准成绩尚不充分,横向对比需自行验证
- 多模态能力未在发布信息中说明,当前定位为大语言模型
💰 价格分析与成本建议
Hy4 preview延续混元的普惠定价路线,输入每百万tokens 6元、输出18元,缓存命中低至0.3元。以典型的代码助手场景估算,若单次请求携带30K系统提示与代码上下文、输出2K tokens,未命中缓存时单次成本约0.216元;在系统提示可复用的场景下缓存命中后输入成本降至约1/20,单次成本可压到0.045元左右,高频调用的差距会被显著放大。相较于按美元计价的海外同级模型,Hy4 preview的输出价格具备明显成本优势。此外模型以Apache 2.0开源,具备自建推理集群能力的企业可进一步用自有算力替代API计费,把边际成本转为固定投入。
👥 适用人群与企业
软件工程团队、企业办公与金融分析人员、游戏开发者、科研机构、私有化部署的企业IT团队、Agent应用开发者
🏭 行业适配度评估
长程开发任务的规划、调试、验证能力与百万上下文契合代码库级工作
⚠ preview阶段接口可能调整,建议保留回退模型
复杂办公环境理解与金融分析能力提升,支持跨文件数据整合与报告交付
⚠ 金融合规场景建议私有化部署并自建审计日志
支持一句需求生成可玩原型,可驱动游戏引擎做多轮迭代
⚠ 复杂玩法逻辑仍需人工把关,生成资产的版权归属需自行确认
在AI研发、分子动力学、凝聚态物理、基础数学等场景推理能力有进步
⚠ 科研结论必须人工复核,模型输出不可直接作为实验依据
Apache 2.0开源支持完全内网部署,满足数据不出域要求
⚠ 770B规模对政务侧算力储备要求较高,需评估硬件投入
可用于工艺文档整理、生产报表分析与内部知识问答
⚠ 行业专有知识需通过微调或检索增强补充
🔧 技术架构解析
| 架构设计 | MoE混合专家架构,总参数770B、单次推理激活49B,上下文长度突破100万tokens |
|---|---|
| 训练策略 | 在模型尺寸、上下文长度、数据规模三个维度同步扩展,预训练与后训练共同推进;与软件工程、游戏、金融、安全领域专家共建高质量数据 |
| 产品协同 | 与WorkBuddy、CodeBuddy等生产力产品做Co-Design,把真实用户工作流反馈引入优化目标 |
| 自我改进 | 首次参与自身训练方法、数据策略、评估体系与底层算子的自动优化,模型提出方案、运行实验并依据结果迭代,形成初步递归自我改进闭环 |
| 推理优化 | 自主分析推理系统瓶颈,围绕算子融合、通信优化开展多轮改造,端到端吞吐较基线提升31.8% |
| 部署渠道 | WorkBuddy/CodeBuddy国内外版本、元宝、ima同步首发,API通过腾讯云TokenHub与OpenRouter接入 |
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(腾讯未明确说明API调用数据是否用于模型训练) |
|---|---|
| 合规认证 | 中国生成式AI服务备案、Apache 2.0开源许可 |
| 数据驻留 | 腾讯云TokenHub中国境内节点,开源权重支持完全本地化部署 |
| 加密方式 | API调用采用HTTPS/TLS传输加密,本地部署下数据不出内网 |
⚔️ 腾讯混元Hy4 preview 与同级开源模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| GLM-5.3 | 编程与网络安全能力突出,开源生态活跃 | 内部工程盲测均分2.92略低于Hy4 preview,且仅处理文本模态 |
| Kimi K3 | 参数规模大,长文本处理经验成熟 | 内部工程盲测均分2.94,生产力工具链协同度较低 |
| DeepSeek V4-Pro | Agent与编程基准表现强,峰谷定价灵活 | 上下文与Hy4 preview同为百万级但缓存价格优势较弱 |
- 内部203个真实工程任务盲测均分2.99/4.00,在同级开源模型中领先
- Apache 2.0协议,商用授权限制少
- 缓存命中0.3元/百万tokens,重复上下文成本低
- 与生产力产品深度协同设计,工程落地体验更贴近真实工作流
🏢 同厂商模型矩阵
腾讯混元模型矩阵中的代表性模型定位
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| 腾讯混元Hy4 preview当前 | 当前开源旗舰 | chat | 770B/49B MoE,100万上下文,Apache 2.0(当前模型) |
| 腾讯混元Hy3 | 前代主力 | chat | 2026年7月发布的上一代大语言模型 |
| 腾讯混元Hyra-1.0 | 科研智能体 | reasoning | Harness框架科研推理,已开源 |
| 腾讯混元Hy ASR 3.0 Preview | 语音识别 | audio | 覆盖10大方言片区,中文WER 3.34% |
| 腾讯混元混元图生视频模型 | 视频生成 | video_gen | 图像驱动的视频生成能力 |
| 腾讯混元混元文生3D | 3D生成 | image_gen | 文本驱动的三维资产生成 |
🧭 选型决策指南
Apache 2.0协议,无MAU或商用限制
100万上下文加长程规划调试能力,内部工程盲测领先同级开源模型
缓存命中输入价格低至0.3元/百万tokens
当前发布信息中定位为大语言模型,未说明多模态输入能力
preview版本仍可能调整能力与接口
770B总参数对部署硬件要求较高
🏆 真实使用案例
📌 某互联网团队用Hy4 preview做前端重构
📌 某金融分析团队用于跨文件报表整合
💬 用户真实评价
百万上下文配合缓存定价,把整个服务模块丢进去做重构评审的成本比想象中低很多。Apache 2.0也让内部私有化部署的审批走得很顺。
生成的界面在视觉细节和交互一致性上比之前用过的开源模型好一截,但preview版本偶尔在超长会话后期规划会有点飘,需要人工拉回来。
跨文件的数据整合和口径对齐能力实用,输出的表格结构基本可直接用。希望官方尽快补齐最大输出长度这类基础参数说明。
✅ 实践建议与使用技巧
💡 Prompt工程建议
把稳定内容前置以命中缓存
系统提示、项目规范、代码规约等不变内容放在提示最前部并保持字符级稳定,才能有效命中缓存降价。
长程任务显式分段
把开发任务拆成规划、实现、调试、验证四段,每段结束前要求模型自检并列出未决问题。
明确交付物格式
办公分析场景直接指定输出形态,模型的文档、表格、演示文稿交付链路才能被正确触发。
为前端任务补充审美约束
前端开发时给出设计语言与交互预期,可进一步发挥模型在视觉质量上的改进。
🔄 替代方案分析
这几款采用小激活参数的MoE设计,单token成本明显更低,适合大规模高并发调用。
这些模型支持图像等多模态输入,可覆盖界面理解与视觉推理场景。
参数规模在30B以内,量化后可在单卡或高配工作站运行。
这些模型在CyberGym等安全基准上有专门优化与公开成绩。








首页 

2026-08-31


5个回答 


