最新动态

  • Home
  • 大模型的逐字生成模式,正在拖慢你的Agent,有人跑出了5倍提速

大模型的逐字生成模式,正在拖慢你的Agent,有人跑出了5倍提速

2026-09-02 599

主流大模型仍在沿着自回归路线不断扩展,但另一种技术路径正在加速逼近产业化临界点。 一项联合测试为这种可能性提供了新证据。 9 月 1 日,扩散语言模型团队扩散智能 DiffuSpace 与 亚洲智能体计算平台公司 Acrab 的测试结果显示,在端侧场景中,dLLM 可将 Agent 的运行速度提升约 5 倍 。基于此次测试,双方计划加速推进扩散语言模型在 AI PC、智能汽车、机器人及智能家居等场景的落地。 视频链接:https://mp.weixin.qq.com/s/Xd-V3BbuqsopfIeeWPbwtw 扩散语言模型(Diffusion Language Model,dLLM),凭借「全局生成」的独特性,被视为下一代通用人工智能基础模型的重要方向之一,甚至被预测,“或将在两年内替代 GPT 类自回归模型”。Google、Inception、蚂蚁集团等都在积极抢占这一赛道。 与 GPT 类主流模型 “从左至右,逐个 Token 生成” 的模式不同,dLLM 模型借鉴了图像模型的扩散机制,生成时先形成全局内容框架,再结合上下文并行不断修正结果, 既能形成更具全局一致性的内容,也能实现 5 倍乃至 10 倍的推理加速 这种差异,在端侧 AI 上会被进一步放大。 传统自回归模型的生成范式,每次 “只生成一个 token”,无法高效利用端侧芯片的并行算力;但 扩散语言模型则可以将多个位置同时交给 GPU 处理,将芯片的并行计算能力转化为实际速度 Agent 场景又进一步放大了生成速度的重要性。一次完整的 Agent 任务,往往包括规划、检索、工具调用、执行和校验,模型可能被连续调用多次。每一次生成带来的延迟,都会在整条任务链路中累加。因此, 5 倍提速,可显著缩短 Agent 完成任务的所需时间 以 AI PC 为例,一个本地 Agent 可能需要同时读取邮件、整理日程、检索文件并生成后续计划,扩散模型可以对多个相关步骤进行并行推演,并根据变化实时调整,协同完成多个相互关联的任务。 扩散智能 DiffuSpace 是全球最早投入 dLLM 范式研究的团队之一,由港大 NLP 实验室联合主管孔令鹏教授及其博士生龚珊三、叶佳成联合创立 ,核心团队长期深耕扩散语言模型研究,在该领域处于国际前沿,是在 “条件生成、离散信号建模、Scaling” 的三大 dLLM 核心问题上均有全球领先突破的团队。成员均来自清华、北大、港大、CMU 等顶尖高校及顶尖模型团队。 2022 年,团队推出 DiffuSeq,开创了扩散模型处理序列到序列文本生成的技术路径;2025 年,团队推出的 Dream 7B 模型首次全面超越同参数规模的自回归模型,并在规划能力上比肩 671B 的 DeepSeek V3。机器之心曾报道过该团队研发的 Dream 7B 模型(《7B扩散LLM,居然能跟671B的DeepSeek V3掰手腕,扩散vs自回归,谁才是未来?》) 围绕这条技术路线和产业应用,我们与扩散智能 DiffuSpace 进行了一次交流。 机器之心:为什么端侧可能成为扩散语言模型率先建立优势的场景? DiffuSpace:扩散模型相较自回归模型的推理加速优势,在模型只处理一个用户的任务时最为明显。端侧推理,比如手机、电脑和汽车里的 AI,通常都只服务本地的一个用户;同时,端侧用户对响应速度非常敏感,希望模型能够及时完成任务。因此,端侧是我们非常重视,也认为扩散语言模型很有优势的场景。这次和 Acrab 的测试,也充分验证了这个判断。 机器之心:扩散语言模型的速度优势具体来自哪里? DiffuSpace:自回归模型通常每一步只能向前生成一个 Token。扩散模型则可以同时生成多个 Token,更贴近人在思考时的过程。人思考问题时,不一定会在心里把所有 token、所有单词都一个字一个字写下来。有时候,我们最开始只有一些模糊的想法或模糊的感受,然后这些想法慢慢成形、慢慢浮现,再一步步变得清晰。扩散模型呈现出来的正是类似的过程。 现在使用 GPT 一类模型时,用户可能需要等待一分钟;如果速度提升到十倍,就只需要等待十秒。一旦体验过这种快速响应的感觉,就很难再回到以前那种龟速思考的体验。在一些场景中,速度非常重要。以代码任务为例,两个函数可能是相对独立的模块,括号、定义等结构也具有较高的可预测性,扩散模型每一步通常可以生成 7 到 10 个 Token。这会直接提升生成速度,并进一步提高服务效率、降低单位成本。 机器之心:除了生成更快,dLLM 会怎样改变 Agent 的使用体验?带来怎样的改变? DiffuSpace:以 Coding Agent 为例,如果用户修改了前几轮对话中的内容,自回归模型只能从修改位置重新向后生成,原来已经产生的后续内容很难继续利用

about image

发表评论