今天,腾讯正式发布 Hy4 preview。
纸面参数很漂亮:770B 总参数、49B 激活参数、1M 上下文,重点强化代码、办公、科学等真实生产力任务。

相比 7 月正式发布的 Hy3,295B 总参数、21B 激活参数、256K 上下文,Hy4 的模型规模和长上下文能力都明显上了一个台阶。如果只看腾讯过去半年的变化,我其实愿意给混元很高的进步分。
但如果问题换成 **Hy4 能不能让混元真正进入国内基础模型第一梯队,并建立持续领先优势?我依然偏谨慎。个人对腾讯 AI 应用层越来越乐观,对混元4能否成为头部心智仍然没有那么乐观,**原因有五个。
一、770B 很大,但今天已经很难靠参数量建立优势
DeepSeek 官方披露 V4-Pro 为 1.6T 总参数、49B 激活参数;Kimi K3 已经做到 2.8T,并原生支持视觉和 1M 上下文;智谱 GLM-5 的基础规模是 744B/40B,GLM-5.3 又继续强化长程 Coding 和 Agent;阿里 Qwen3.8-Max 同样已经把上下文做到 1M。
Hy4 的 770B 和 1M 放在 2026 年 8 月来看,当然很强,但已经很难构成让人眼前一亮的代际优势。甚至参数量本身越来越不适合成为判断模型强弱的主要依据。
GLM-5.3 就是一个非常典型的例子。智谱明确表示,它沿用了 GLM-5.2 的基座,没有重新扩大预训练模型,主要靠继续 Scaling 后训练、强化学习环境和长程任务训练,内部 Code Bench 相比 GLM-5.2 提升了 50%。
当行业走到现在,竞争重点已经从单纯堆参数,逐渐转到:训练数据 × 后训练 × Agent 环境 × Harness × 推理效率 × 产品反馈
参数仍然重要,只是它越来越像发动机排量。真正决定一辆车好不好开的,还有变速箱、底盘、软件和整车调校。Hy4 把发动机做大了,接下来更重要的问题是,整车能不能领先。
二、Hy4 解决了追赶,领先仍然是未知数
腾讯今天把 Hy4 定位在代码、办公、科学这些真实生产力任务上,我很认同这个方向。
因为现在已经很少有人在意一个模型能不能写首诗、回答百科知识。大家真正关心的是,它能不能在WorkBuddy 、Codex这类 Agent 环境里连续工作几个小时,能不能读完整代码库,能不能稳定调用工具,能不能自己发现错误再修回来。而这已经是所有头部模型都在争夺的主战场。
DeepSeek V4-Pro 官方重点强调 Agentic Coding 和 1M 上下文,并针对 Claude Code、Codex等 Agent Harness 做了专门适配;Kimi K3 从发布之初就把长程编程、知识工作、推理列为核心场景,直接做到 2.8T 参数和 1M 上下文。更值得注意的是,Kimi 官方发布页明确承认整体能力仍落后于 GPT-5.6 Sol 和 Claude Fable 5;GLM-5.3 则更激进,已经开始针对数小时甚至数天的工程任务训练,让模型在完整环境中自己排查瓶颈、修改代码、跑实验、验证结果。
所以我更愿意把Hy4 preview定义为:**腾讯终于稳定跟上了这一轮前沿模型竞争。**至于是否已经实现领先,还得继续看外部开发者的真实投票。
三、WorkBuddy 是混元最大的优势,也是挑战
如果让我选腾讯这轮 AI 转型里最值得关注的产品,我现在反而会选 WorkBuddy。
它已经不只是一个聊天框。腾讯官方给它的定位是全场景 AI 办公工作台,可以自主拆解任务、调用工具、读写本地文件、运行云端长期任务、多 Agent 协作,还打通了微信、企业微信、QQ、钉钉、飞书、腾讯文档和知识库。
这套东西对混元非常重要。过去模型公司最大的问题之一,是模型在实验室里训练,产品在另外一个团队里使用。用户到底在哪一步失败、哪个工具调用容易翻车,很难快速返回模型团队。Hy3 在 WorkBuddy 真实任务里被反复打磨,再把失败案例送回模型训练,所以才有了任务成功率从 72% 到 90% 这样的提升。这个闭环非常有价值,但问题也恰恰出现在这里。
WorkBuddy 本身正在变成一个多模型聚合平台
目前已经直接支持 Kimi K3、DeepSeek V4-Flash等国内模型,并开放自定义模型;海外版还能接 OpenAI、Anthropic、Gemini 等模型。从 WorkBuddy 产品经理的角度看,这个设计完全正确。
用户要的是最好用的办公 Agent,至于背后跑 Hy4、DeepSeek 还是 Kimi,其实没那么重要。
可站在混元团队角度,这里面就出现了一个很有意思的问题:**如果 WorkBuddy 最终成功了,究竟证明 WorkBuddy 强,还是证明 Hy4 强?**这两个结果完全可能同时出现,但也完全可能分开。
假设未来 Kimi K3 更适合超长文档,DeepSeek 更适合代码,GPT-5.6 更适合复杂知识工作,WorkBuddy 完全可以自动路由。WorkBuddy 依然会越来越强。混元却未必因此成为用户心里最想主动调用的模型。
这也是我目前对腾讯 AI 最重要的一个判断:腾讯很可能先赢在 Agent 和生态,再慢慢带动基础模型。
它和 DeepSeek、Kimi 这种靠模型建立品牌心智的路径,是两种完全不同的打法。
四、腾讯生态很大,但也会稀释模型品牌
看看腾讯现在的 AI 产品矩阵:WorkBuddy 做办公、CodeBuddy 做编程、元宝做通用 AI、ima 做知识库、微信做小微,腾讯云还有 TokenHub 和 Agent 平台。
从公司战略看,这当然是一手好牌。尤其微信有超十亿级用户规模,一旦小微真正连接小程序、支付、社交关系和内容生态,AI 应用的上限非常高。但从混元这个模型品牌来看,它面临的是另一种挑战。
普通开发者想到低价开源模型,会想到 DeepSeek。想到超长上下文和模型创新,很容易想到 Kimi。想到 Coding 和 Agent,GLM 这半年已经建立了越来越强的开发者心智。而很多普通腾讯用户,即使每天都在用腾讯 AI 产品,也未必知道底层到底跑的是哪一代混元。
这件事对腾讯公司未必是坏事。腾讯真正想赚的钱,本来也未必来自一个模型 API。游戏、广告、微信、企业服务、云和 Agent,才是它最终的商业闭环。但如果讨论的是混元能否成为一个独立的基础模型生态,我依然需要看到更多外部证据。
五、腾讯有足够的钱追,但 AI 竞争现在最缺的是时间
这一点是我对混元最现实的担忧。腾讯当然不缺钱,今年二季度腾讯研发支出达到 272.8 亿元,同比增长 35%;资本开支达到 527.8 亿元,同比增长 176%。腾讯管理层还明确表示,未来几个月资本开支的第一优先级,就是训练更大、更好的混元模型,其次才是给混元和 WorkBuddy 等产品提供推理算力。
资金、算力、用户、应用场景,腾讯都有,真正稀缺的是时间。Hy3 正式版 7 月 6 日发布,Kimi K3 7 月 16 日发布;GLM-5.3 8 月中旬推出,GLM-5.3-Flash 8 月 26 日刚发布;今天 Hy4 preview 又来了。现在国内大模型的代差已经缩短到以月计算。
甚至竞争对手可以不训练新的 Base Model,仅靠一个月强化学习和 Agent 环境扩展,就把模型能力再拉一档,GLM-5.3 已经证明了这一点。腾讯过去那种后发、复制、依靠生态慢慢追赶的节奏,在大模型时代会非常吃力。
Hy4 的发布证明腾讯已经明显提速。但想建立领先,还需要连续两三代都保持这种速度,这点比一次 benchmark 第一更难。
何时我会改变对混元4的判断
其实标准并不复杂,我主要看四件事。
第一,Hy4 在外部真实 Agent 场景里能否持续成为第一选择。
不是只看腾讯内部测试,还要看 OpenRouter、OpenCode、自建 Agent 等第三方环境。
第二,价格、速度和 Token 效率。
Hy4 从 Hy3 的 21B 激活参数提高到 49B,理论计算负担明显增加。当然,实际成本还取决于架构、量化、推理系统和并行优化,不能简单线性换算。截至目前,我只在腾讯云上看到Hy4 API 定价,但吞吐和实际任务 Token 消耗数据没有体现。在这些数据出来之前,谈性价比还太早。
第三,WorkBuddy 用户会不会主动选 Hy4。
Hy3 已经有一个不错的数据,WorkBuddy 自选模型用户里约 60% 选择 Hy3。如果在Kimi K3、DeepSeek V4、GLM-5.3众多模型中,Hy4 还能长期保持明显第一,这比任何自家榜单都更有说服力。
第四,微信能不能真正把混元带入十亿级 AI 使用场景。
WorkBuddy 是生产力入口,微信小微才可能是腾讯最终的大杀器。如果未来小微大量调用 Hy 系列模型,同时小程序、支付、公众号、视频号开始围绕 Agent 形成服务闭环,腾讯会拥有其他模型公司极难复制的数据和场景优势。到了那个阶段,我对混元的判断会完全不同。
写到最后
我承认混元已经追得非常快,但就此判断混元已经重新站到行业最前排,为时尚早。
模型能不能持续完成真实任务,Harness 能不能把能力释放出来,产品有没有用户反馈飞轮,开发者是否主动选择它,以及最终能不能把这些能力变成稳定收入。腾讯恰好在后三件事上拥有非常强的资源。
所以我真正看好的,其实是另一件事:WorkBuddy和微信小微,很可能比混元4更早成为腾讯 AI 的核心竞争力。
只要腾讯能把最合适的模型接进自己的 Agent,再把微信、企业微信、文档、支付、小程序和云连接起来,它就有可能成为 AI 应用时代最难绕开的平台之一。
这也正是我为什么目前仍然不看好混元4,却持续看好腾讯 AI 发展的原因。