九章云极开源Alaya-DSpark 打造专业级推理加速草稿 推理吞吐提升约2.9倍
/传播易/近日,九章云极旗下九章智算云(AlayaNeW Cloud)正式开源Alaya-DSpark——专为GLM-5.2系列大模型定制训练并优化的推测解码加速草稿。该方案基于DeepSeek提出的DSpark方法,通过与GLM-5.2 / GLM-5.2-FP8在SGLang、vLLM等主流推理框架上直接配对,在保持输出分布与原模型完全一致的前提下,将实测推理吞吐从约121 tok/s提升至约352 tok/s,加速比约2.9倍。模型已发布至Hugging Face(AlayaNeW/GLM-5.2-DSpark)。

作为九章云极“AI工厂”战略中Token工厂的关键工程组件,Alaya-DSpark的发布意味着九章智算云在“让专业Token更快、更便宜、更稳定地规模化交付”上再进一步。
大模型推理慢的本质,往往不是“想不出来”,而是“一个字一个字往外吐”——自回归解码每次仅生成一个token,GPU经常处于等待状态。Alaya-DSpark通过“草稿先行、主模型验收”的工程化分工,将解码过程流水线化,直接提升Token工厂的产能与成本曲线,也让千行百业能以更低门槛将大模型能力嵌入核心业务。九章云极副总裁胡宗星表示:“大模型的下一跳,不只是参数更大,也包括同样聪明但更愿意被用起来。Alaya-DSpark 是我们把工程优化做进推理每一个环节的一个缩影。”
从“逐字跟读”到“一次验收一整段”
传统自回归解码像口译员逐字跟读:说一个,想一个,再说下一个。Alaya-DSpark换了一种分工:先用轻量草稿一次向前看一整小段,快速生成候选token;再用很轻的一步将多个候选词收成语义通顺的片段;最后让GLM-5.2一眼扫完整段,留下对的前缀,错的地方动态舍弃。
为了让主模型“收下”尽可能多的token而不增加额外风险,Alaya-DSpark为每位候选配了置信度分数,系统按当前负载动态决定验证长度。核验规则保证输出分布与原模型完全一致——更快,且答案不变。
社区已有面向GLM-5.2的DSpark草稿,但通用方案往往在短文本、英文对话上表现尚可,一旦切换到中文、检索问答或长文档,接受长度便明显下降。Alaya-DSpark将草稿视为GLM-5.2的配套能力专门训练:训练回答全部由GLM-5.2自身重写,让草稿学习“它接下来会怎么说”;语料混合代码、推理、中文对齐和长上下文,覆盖真实生产环境;一份权重同时服务SGLang与vLLM,FP8/BF16的GLM-5.2均可直接配对,做到开箱即用。
实测:任务面更宽、长文本更稳
在覆盖11类真实任务的评测中,Alaya-DSpark的接受长度(大模型每轮核验平均能收下的token数)全面高于社区公开方案。其中,多语任务接受长度达到4.43.检索增强生成(RAG)达到4.87.


更关键的是长上下文稳定性。Alaya-DSpark从1k到32k上下文始终稳定在4.5–4.8区间;而社区公开方案在32k时降至约1.16.几乎退回“几乎没有草稿可用”的水平。逐位置接受率同样显示,Alaya-DSpark在8k、32k长文本下的首位接受率仍保持在83%以上,社区公开方案在32k时降至约8%。
这意味着在长文档问答、长代码生成、多轮会话等企业高频场景中,Alaya-DSpark能够持续提供扎实、可靠的加速效果。
Alaya-DSpark已在Hugging Face上线,开发者使用最新支持DSpark的SGLang或vLLM即可部署,接口仍为标准OpenAI Chat Completions格式,应用无需修改协议。此次开源是九章云极把工程化能力沉淀为可复用基础设施的又一实践。九章云极正以AI工厂双引擎为底座,推动算力、算法与工程的协同优化,让专业Token成为千行百业可量化、可审计、可规模化交付的标准生产力单元。

分享








