腾讯混元发布WebCraftBench,用真实操作评测AI生成网页

来源:互联网 时间:2026-09-22

A5站长网9月22日消息,腾讯混元联合清华大学、北京大学提出WebCraftBench,把软件测试的思路引入网页生成评测。做法是让智能体真实操作生成的网页,再从美观度、易用性与需求符合度三个维度打分。基准包含369条真实需求与5088条验收标准,评测了17个前沿模型生成的6273个应用。

为什么需要一套新基准?此前的评测多停留在截图比对或主观打分,看的是像不像,而不是能不能用。截图比对能判断风格是否接近,却回答不了按钮点下去有没有反应、表单提交会不会报错,而后者才决定网页能不能进生产。网页生成的价值最终落在可点击、可提交、可完成任务的层面,把测试方法引进来,等于把评价标准从观感拉回到功能。

具体做法上,评测过程自动插桩,成功率99.89%,覆盖率引导把函数覆盖率中位数从91.9%提升到94.3%。也就是说,评价不仅看页面跑没跑通,还要看有多少代码分支真正被执行到。覆盖率越高,说明测试触达的功能越多,评分越有说服力,模型投机取巧的空间也越小。

三个维度各有侧重。美观度关注布局、配色与信息层级;易用性关注交互路径是否顺畅、元素是否可发现;需求符合度则把生成结果与369条真实需求逐条对照。把这三项分开打分,能避免好看但用不了、或者能用但难看的结果被一个总分掩盖过去。

对做网站与前端的人来说,这类基准的意义在于给出改进方向。6273个应用的评测规模意味着结论不是个例。团队把方法与数据公开,开发者可以据此判断模型在自家场景下是否够用,也能看出当前模型在哪些环节仍然薄弱。

网页生成正在从演示型走向交付型。能不能一次生成可用的表单、可下单的页面、可提交的后台,决定了它在真实项目里的位置。基准给出的不只是一份排名,还有一批可复现的失败样本:哪些交互容易被模型漏掉,哪些布局在窄屏下会塌。看懂这些再去选模型或补提示,方向会具体得多,这比再多做几个炫技演示更有价值。

相关文章

标签:

A5创业网 版权所有