联想天禧的TianxiCode拿下SWE-bench-Live轻量榜第一

来源:互联网 时间:2026-10-10

A5站长网10月10日消息,联想天禧AI自研的代码智能体框架TianxiCode拿到一份成绩单:在软件工程评测SWE-bench-Live的Lite分榜上,它配合DeepSeek-v4.1-Flash以71%的问题解决率排到第一,并通过了官方的Verified审核。按公开榜单,这个成绩对应300道题里解决213道。这类评测用的底子是真实项目里的问题,要求参评系统在可复现环境里生成补丁并把它修好。

SWE-bench-Live和只考语法或单函数生成的老式代码测试不是一回事。每道题的底子是真实开源项目里的一张问题单,参评系统要读代码、定位症结、写出补丁,再在隔离环境里把测试跑通。想拿到Verified标记,团队得提交全链路的智能体运行轨迹,官方会审查评测输入与信息隔离环境,排查有没有把标准答案、测试用例或结果泄露给智能体。多了这一道流程,分数更难注水。

联想把TianxiCode和底座模型的关系拆成了两个角色。DeepSeek-v4.1-Flash是工程师的大脑,负责读代码、理解语义、构思解法;TianxiCode是眼、手、工具箱以及工作流规范。官方强调的能力有三块:跨文件的多步信息检索,配合上下文裁剪与切片,用来在大仓库里追根因;自主规划与多轮工具调用,能制定调试计划、在终端跑测试、读日志、对比变更历史,一条路走不通就换思路;基于测试的闭环自纠,把新代码放进隔离环境运行,反复修正直到补丁过关。

这次登顶有个数字要看清楚。它排的是Lite分榜,不是完整榜单或多语言榜单;与同榜第二名之间的差距只有0.67个百分点,对方是70.33%。这说明第一梯队的水平咬得很紧,一次登顶并不等于拉开代差。联想也没有公布同一套系统换用其他底座模型后的评测结果,所以框架本身带来了多少增益,目前只能从官方描述里判断。

TianxiCode是联想天禧AI生态里聚焦代码生成和工程开发的一项子能力,官方说它后续会被用到联想的AI硬件产品上,不过具体时间表和落地设备还没有公布。把这件事放到更大的盘子里看,值得注意的不是那七十一这个数字本身,而是一套国产智能体框架配上一个Flash级模型,能在贴近真实开发的评测里跑到什么位置。

相关文章

标签:

A5创业网 版权所有