知道创宇404实验室发布《大模型中转站研究与测评报告(2026)》

来源:互联网 时间:2026-09-21

当开发者只改一个模型名称,就能在同一个接口上调用 GPT、Claude、Gemini 时,很少有人会追问:屏幕另一端真正干活的是谁?9 月,知道创宇积极防御实验室发布《大模型中转站研究与测评报告(2026)》,对 100 个具有代表性的大模型中转站展开为期数月的黑盒测评。结果显示,这条被开发者广泛依赖的“中间链路”,正呈现出明显的质量两极分化:135 个测试组合实际不可用,296 个测试组合存在至少一项模型真实性异常证据,110 个测试组合被发现存在隐藏指令注入。

一个接口聚合百家模型,“中间商”成了新基础设施

随着大语言模型在编码、智能体(Agent)等场景中深入应用,开发者对“多模型、低成本、开箱即用”的模型 API 需求持续增长,大模型中转站逐渐成为连接开发者与模型服务的重要基础设施。这类平台对外提供与主流模型 API 兼容的统一接口,将不同厂商的服务聚合在一起,调用者通常只需修改模型名称即可完成切换。

但便利的背后,是调用链路的悄然改变。报告指出,与直接调用模型厂商官方 API 不同,开发者在使用中转站时,实际上把原本“用户—模型厂商”之间的直接调用,变成了“用户—中转站—模型厂商”的多级链路。中转站不仅承担请求转发,还可能参与模型路由、请求处理、日志记录与响应处理等环节——而这些过程对调用者通常不可见。

“中转站的核心问题,并不仅在于能否正常调用模型,更在于整个调用链路是否可信、完整和可靠。”报告将风险划分为站点侧、请求侧、响应侧和服务侧四个维度:站点侧关注中转站自身的可信性,包括是否存在威胁情报标记、恶意或投毒记录,以及 TLS 加密是否有效;请求侧关注用户请求在转发过程中是否被完整、准确地传递;响应侧关注返回内容及相关元数据是否保持完整、有效;服务侧则关注调用过程中的稳定性与可用性。

849 个组合的“体检”:近三成疑似偷换模型

本次测评选取 100 个具有代表性的大模型中转站作为测试对象,覆盖国内运营与海外运营两类服务市场各占 50%,并同时覆盖企业运营与非企业运营两类主体。测评围绕 26 类主流模型,形成 849 个“模型—中转站”测试组合,通过 19 项黑盒检测器,从基础能力、站点安全性、模型一致性、响应完整性和服务稳定性五个维度进行验证。

测评结果呈现明显的两极分化。最突出的是模型真实性问题:849 个受测组合中共有 296 个组合命中至少一项模型真实性异常证据,涉及 75 个中转站,共获取 467 条可疑证据和 138 条强证据。报告解释了其中的“经济动机”——部分中转站提供的海外高端模型价格甚至低于原生 API 价格数十倍,这种显著价差与模型厂商的服务区域限制,共同构成了模型偷换的驱动力。

记者注意到,模型偷换的手法相当隐蔽。以最典型的一种为例:用户通过 OpenAI 协议指定 model 字段请求某一模型,中转站却可依据内部路由策略,将请求转发至价格更低或能力不同的替代模型,并在返回时把 model 字段改回用户请求的名称。这样一来,用户从 API 请求和响应表面均难以发现异常,实际调用的模型却已经发生变化。

证据来自多个相互独立的检测手段。在显式身份信息方面,26 个站点的 43 个测试组合中,模型自报身份与用户请求模型不一致,其中 8 个站点的 11 个组合在 response model 字段中持续返回与请求模型不一致的模型名称。在行为指纹方面,基于随机偏好分布的序贯检验结果显示,159 个测试组合明确拒绝了其输出分布与官方模型一致的假设,涉及 67 个站点,异常主要集中于 Claude 系列与 GPT 主力型号;Tokenizer 特征检测也在 63 个站点的 124 个组合上判定异常。

更棘手的是“真假模型动态路由”。报告发现,部分中转站会在后端按用户、请求特征、调用时间等条件在真假模型之间动态切换,导致相同输入在不同时间表现出明显不同的能力特征,仅凭单次调用难以确认获得的是稳定一致的模型服务。

“看不见的改写”:请求被注入、上下文被截断

如果说模型偷换是“换了人”,那么请求注入与上下文截断则是“改了话”。

测评共发现 110 个测试组合存在隐藏指令注入现象,其中 62 个组合明确判定异常,额外输入 Token 数量的中位数为 496;186 个组合的输入 Token 规模与官方模型基线存在明显偏离;31 个组合在上下文完整性检测中无法完整找回预先埋入的隐藏标记,其中 28 个组合进一步确认存在上下文压缩或截断问题。

报告披露了若干典型情形:个别组合的额外注入规模达数千 Token,输入 Token 总量中有九成以上为额外注入内容;部分站点的长文本请求在多个测试档位中实际输入较少,远低于官方基线,存在明显的输入内容丢失;个别站点的全部受测 Claude 模型均未找回任何预先埋入的隐藏标记,表明其长文本请求处理存在一致性截断。

“这意味着用户发送给中转站的原始请求,并不一定以完整、原样的形式传递至上游模型。”报告提醒,对于依赖复杂提示词、长上下文或 Agent 工作流的应用,这类请求链路中的隐式修改可能直接影响模型的最终行为,而用户往往将由此导致的能力下降归因于模型本身。

延迟相差两个数量级,有站点成功率不足 25%

服务稳定性问题同样不容忽视。请求延迟检测覆盖全部 849 个测试组合,其中 239 个组合判定为异常,涉及 72 个站点;请求成功率检测覆盖 714 个具备有效统计的组合,其中 23 个组合的成功率低于 50%。

站点层面的 P95 延迟中位数从约 1 秒至超过 100 秒,差距达两个数量级:响应较快的站点与官方直连 API 水平接近,而延迟最高的站点 P95 延迟中位数超过 100 秒;部分异常组合的生成吞吐中位数仅 0.1~0.7 token/s,难以满足交互式应用的基本要求。高延迟问题集中于通过反向代理提供海外模型的场景——239 个延迟异常组合中,Claude 系列占 119 个、GPT 系列占 56 个。

成功率方面,个别站点的整体请求成功率不足 25%,另有多个站点低于 90%。此外,16 个站点反复出现 429 限流或上游额度异常,部分站点的错误信息明确指向共享上游账号的额度限制,甚至有站点在触发限流后对后续请求实施超过 20 小时的持续限制。

报告还指出,部分站点的上游账号及密钥获取途径并非正规渠道,涉及泄露凭证、共享账号、虚拟卡套利、模型逆向等,上游可用性与合法性存在大量不稳定因素,而相关限制在站点的对外服务信息中往往未作说明,用户仅在实际调用中才会发现服务能力与页面展示之间的差距。

规模不等于可信:大型平台多供应商架构的“另一面”

用户通常更容易信任规模较大、模型覆盖广且服务稳定的中转站。但报告提示,从技术架构看,规模并不能直接证明其上游模型来源与请求处理过程透明。

大型平台普遍采用多供应商架构,同一模型名称下可接入多家模型供应商,平台按价格、延迟、吞吐及故障情况进行动态选择与切换。测评中即观察到,部分大型平台的单一模型下接入十余家供应商。这种机制提高了服务可用性,但也意味着用户请求的是同一个模型名称,实际承担推理任务的可能是不同后端供应商,其模型版本、推理环境、量化方式与数据处理策略均可能存在差异。

测评结果颇具反讽意味:大型中转站并未因规模与品牌自然获得与规模相匹配的绝对优势;相反,将多供应商平台的供应商限定为单一后端后,其模型稳定性和一致性均明显提升,测评分数显著高于默认负载均衡策略。

运营属性与质量风险:非企业站点问题更集中

将 100 个站点按运营区域与运营主体交叉分组后,风险差异清晰可见。报告数据显示:海外企业群体的站点综合得分中位数为 80.3,S 级站点 4 个,D 级仅 2 个;国内非企业群体得分中位数仅 68.0,无 S 级站点,D 级多达 10 个;海外非企业群体虽然站点最少,但问题密度最高,13 个站点中有 6 个落入 D 级。

非企业与延迟问题的关联尤其显著:非企业站点的组合级延迟判负率高达 39.2%,企业站点仅为 19.5%;延迟判负的 239 个组合中有 144 个集中于非企业站点,其中国内非企业群体贡献 115 个,接近全部延迟判负组合的一半。

模型偷换与 Tokenizer 替换在不同群体中的分布也呈互补特征:行为指纹偏离主要集中于国内站点,而 Tokenizer 替换主要发生于海外企业站点。报告据此判断,国内以非企业为主的小型站点更倾向于直接替换模型后端,海外企业供应商则更多出现模型版本或供应商层面的近似替代。

榜单揭晓:前十名站点综合评分公布

基于各项测评结果,报告按照统一评分规则对 100 个中转站进行综合评价,并根据最终得分划分站点等级。综合评分在汇总各模型测评结果的基础上,同时考虑站点的测评覆盖规模与实际测评表现,引入基于样本规模的收缩机制,避免受测模型数量较少的站点仅凭少量高分模型获得过高排名,经测试确认不可用的模型同样按测评失败结果计入评分。

注:各维度得分为该维度下已执行检测项在站点全部受测模型上的平均分;完整评分规则请参考完整版报告。本文仅呈现排名前十的站点及各维度得分。

记者观察:透明度,才是中转服务的真正“硬指标”

综合本次测评可以看到,中转站的主要风险来自其作为用户与上游模型之间的黑盒中间层——用户无法直接确认实际调用的模型、请求是否被完整转发,以及请求最终由哪个上游后端处理。风险并非单一模型或单一接口问题,而是贯穿模型供应、请求处理和服务交付等多个环节。

报告同时给出了选型建议:模型列表和模型名称本身并不足以证明中转站实际提供了对应模型;站点规模和供应商数量也不能直接等同于模型服务的可信度;运营区域、企业属性和站点规模只能作为辅助判断因素,不能替代技术测评。开发者应将模型真实性与请求完整性等技术指标纳入评估范围,优先参考模型价格合理、经过多维度、可重复测试验证的站点,必要时可通过短探针、usage 对比、Tokenizer 探针等方式对所使用的中转服务进行自行验证。

值得注意的是,报告也划定了结论的边界:上述检测均在测试端以黑盒方式完成,测评无法直接获取中转站内部路由策略与调用日志,部分结果属于基于外部行为特征的间接判断。对于模型偷换等高风险结论,报告均以多个相互独立的检测结果交叉验证为前提;“未发现异常”仅表示在本次测试范围与条件下未观察到足以支持该风险判断的证据,不代表确认不存在该风险。

背景链接:中转站风险并非首次被曝光

记者梳理发现,中转站的安全隐患此前已多次进入研究视野。2026 年 4 月,来自加州大学圣塔芭芭拉分校(UC Santa Barbara)、加州大学圣地亚哥分校(UC San Diego)等机构的研究人员发表论文《Your Agent Is Mine: Measuring Malicious Intermediary Attacks on the LLM Supply Chain》,对 428 个第三方大模型中转站进行系统性测试,结果显示有 9 个中转站主动向 Agent 的响应中注入恶意代码,共计 26 个中转站存在访问测试环境敏感凭证的行为,该研究同时验证了针对 Agent 工具调用链路的攻击方式。

由于中转站能够接触传输过程中的完整 JSON 数据,其具备修改模型响应和 Tool Call 的能力。2026 年 8 月,国内论坛有用户发帖反映,在使用 Agent 编写代码时发现模型思维链中存在投毒内容:在正常命令后拼接了大量窃取数据的命令,并发送至攻击者控制的服务器。

更早披露的另一类风险是数据售卖与凭证泄露。上述研究作者曾描述,其从一家头部中转站服务商处购买约 6TB 的数据集,其中包含大量用户历史数据以及 SSH 密钥、VPN 配置、云服务访问密钥等敏感凭证。

相关文章

A5创业网 版权所有