云知声发布U2-Flash:266B总参数只激活10B,模型参与自身训练

来源:互联网 时间:2026-09-15

9 月 15 日,云知声对外发布新一代主力模型 U2-Flash。公司的定位很明确:这不是旗舰模型砍出来的轻量版,而是要在同等延迟和成本下完成主力级任务的稠密替代品。公告里给了两件事的具体数字——参数结构和训练方式,后者是这次真正值得看的部分。

U2-Flash 采用稀疏混合专家架构,总参数约 2660 亿,单次推理激活约 100 亿,激活比例不到权重的 4%。编程、智能体、数学推理、指令遵循这几类能力统一在同一套权重里,不用为不同任务切换不同的模型版本。推理方式上,模型具备隐式思考与连续状态推理机制,并把推理强度封装成四档可控接口——需要快速回答时用低档位,需要严谨推导时用高档位,高档位会输出完整可读的推理链条,方便核对。

据公开榜单,U2-Flash 在 DeepSWE v1.1 中取得 64.6 分,超过 GLM-5.3-Flash 和 DeepSeek-V4-Pro;在 TerminalBench3.0 中提升到 24.3 分。工程效率方面,官方给出的数字是智能体任务迭代步数减少 20% 到 30%,Token 消耗同等幅度下降。效率类数字比评测分数更值得关注。对做智能体产品的团队来说,同一任务少跑三分之一的步数,直接对应的是响应时间和调用成本,这比多考几分更能影响能不能上线。

模型参与了自己的训练,公告里最有信息量的一段就在训练侧。U2-Flash 建立了一套模型深度参与自身训练的闭环:模型参与任务生成、轨迹分析和纠错重采,自主构建了近 10 万条高质量的任务集;配合异步强化学习、多教师模型在线策略蒸馏、自适应动态任务生成等手段,训练轨迹数提升约 60%,训练步数减少约 55%,训练系统还能做自主巡检与修复。公司把这件事定义为递归自我改进方向上的第一步实践。同时明确了一条边界:所有自主调整都在人工设定的沙盒环境和验证标准内进行,保留完整、可回滚的记录。

真正要区分的是自动化与自主权。让模型参与数据生成、轨迹分析,这类自动化在训练流程里并不新鲜;值得盯的是自主决策的边界——沙盒范围有多大、验证标准谁定、回滚记录是否真实可用。公告把可回滚写进去,说明这条线厂家自己也很在意。读到评测分数时先看口径。榜单分数受题目分布、推理档位、是否允许工具调用影响很大,跟自己业务场景的匹配才是真问题。国产算力适配算是加分项。公告明确该模型已完成对主流国产算力平台的系统性适配,对在意部署成本的团队,这决定了它能不能落在已有硬件上。顺带说一句,同一天还有另一家国产团队上线了开源的新模型,国内大模型这一轮的发布密度,比大多数人预期的要高。

相关文章

标签:

A5创业网 版权所有