Cloudflare开源决策模型Clef,不写句子只输出带概率的选项

来源:互联网 时间:2026-10-02

10月1日,Cloudflare发布了两个决策模型Clef与Clef-flash,权重以Apache2.0许可开放,模型托管在自家的Workers AI上。所谓决策模型,和常见的大语言模型走的不是一条路:它不生成自由文本,而是接收一段状态描述和一组事先定义好的问题,对每个问题的合法答案给出概率。调用方拿到的是一份结构化的判断,代码可以直接按这个判断去路由工单、触发升级或者转人工。

两个模型的底座都是冻结的。Clef基于Qwen3.8-27B,Clef-flash基于Qwen3.5-9B,训练时只更新一个路由头与rank-256的低秩适配器,主干参数不动。推理过程也不是逐token生成:先用底座做一次只算前向的预填充,再对合法选项并行打分,因为少了自回归这一步,速度比同规模的生成式模型快得多。Clef的上下文窗口是64K,另外带了视觉编码器,可以接图像做分类。

官方给出的延迟数据是这组模型最直接的卖点。在43项评测基准上,Clef的中位延迟为209.3毫秒,Clef-flash为38.8毫秒,作为对照的Jev是524.1毫秒。Cloudflare还举了一个内部用例:在威胁情报团队做网站域名分类时,Clef完成抓取、渲染与分类一共用了2.2秒,而公司内部最快的通用模型gpt-oss-120b在同一工作流上用了4.7秒,且只返回两个分类。

质量benchmark上的表现并不一边倒。在BFCL的精确匹配上Clef为98.47、Clef-flash为98.76,对照Jev是95.75;在BANKING77的宏平均F1上Clef拿到94.20,Jev是79.74。但换成When2Call和BRIGHT这两项,Jev反超。Cloudflare还在自家的Typesafe评测套件上做了四类工作流的对比,结果是Clef四场里赢了三场,客服场景那一项输给Clef-flash。

和模型一起放出的是微调路径。Cloudflare把训练链路的各个环节都落在自家产品上:数据由AI Gateway在流量经过时自动沉淀成数据集,rollout由Workers AI对底座模型生成,打分和重放agent动作在Containers里做,权重更新走新推出的Trainer,最后通过BYO Model把微调后的模型重新部署回Workers AI。目前微调需要前置部署工程师陪同,自助平台后续再开。官方明确,除非客户主动使用微调产品,否则不会读取、存储其请求与响应,也不用这些数据训练。

Cloudflare把首批内部用例列了出来:Trust and Safety的提交评估、支持工单分类、机器人产品里判断来访的是好爬虫还是坏爬虫、以及威胁情报的域名归类。这些任务的共同点是答案有边界、要求快且稳定,恰好是生成式模型不擅长的部分。把这一类判断从大模型里拆出来交给专用小模型,再让它以Apache2.0开放权重,是把选择权和成本一起交回给使用方。

相关文章

标签:

A5创业网 版权所有