A5站长网10月5日消息,一个叫Strata的开源项目上了Hacker News首页,617分、289条评论,代码仓库星标约1.12万。它要做的事一句话能说完:把1250亿参数的Qwen3.8-Flash-Next跑在消费级显卡上,速度冲着每秒100个token去。
先解释这件事为什么看起来不可能、实际却成立。Qwen3.8-Flash-Next用的是混合专家架构,总参数1250亿,里面装了512个专家;但每个token只激活10个路由专家加1个共享专家,实际参与计算的约60亿参数。稀疏激活省的是算力,不是显存——下一次路由可能点到别的专家,所以所有专家都得在场待命。
Strata的办法是把整台电脑当一个存储层级用。显存放共享组件、草稿层、注意力缓存和最常用的专家;内存放完整的专家池;CPU负责计算没被缓存的专家;SSD补上大表和模型数据。专家缓存相当于一个工作集,话题变了,缓存跟着换。这也是为什么在这个负载下,显存够不够比显卡快不快更要紧。
实测数字来自社区。在RTX4090配i9-13900K和64GB DDR5的机器上,IQ2_XS档跑出106.1token/秒、IQ3_XXS档98.1token/秒,统计的是完整请求、含模型的思考过程,短对话峰值能到115和120。门槛比想象中低:12GB显存、32GB内存、约80GB磁盘就能起步。换别的卡,RTX5070是53到94,RX9070XT是44到60。
代价得说清楚。为了塞进消费级硬件,用的是2到3位的量化版本,质量损失真实存在——编程类任务多数用户认为够用,视觉和长尾任务会出现退化。拿2位量化的结果去对齐托管的前沿模型,这个比较本身不成立。另外首次启动会预占35到55GB内存,系统会卡顿一两分钟。
Strata还暴露了一个正在变化的分工。它在本机暴露OpenAI与Anthropic兼容的接口,也就是说Claude Code、Codex这类工具可以把它当本地后端用,聊天、编程、图片理解、智能体流程都留在自己机器上。本地部署的门槛压下来之后,大模型推理越来越像一道软件工程题,而不是单纯的硬件题——同一张卡,换个推理引擎,能跑的模型规模和速度就差出一个量级。
A5创业网 版权所有