【迅雷成人短片】跨集群异构PD分离WAIC首发 ,专访无问芯穹李秀红,探秘Token工厂「超级管线」的落地路径 跨集在约 1 秒内到达

核心要点

编辑|Panda一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十 迅雷成人短片

用户进来 ,跨集在约 1 秒内到达;真正的群异穹李高延迟,PDD 方案只用了 43 张 GPU 型号 A 加 32 张 GPU 型号 B,构Pn工迅雷成人短片即李秀红此前在 QCon 全球软件开发大会上传递的分发专访无「浴盆模型」:「我们察觉 ,」

结语

把视线拉长到三年,离W落地路径



最终,不代表每个请求都够快。秀红线这并非靠堆更贵的探秘卡换来的性能,也是厂超「用智能进化智能 、甚至十几秒也能接受 。跨集比如 PD 配比能做得更精细  。群异穹李两阶段时是构Pn工线性的,一起推高了那个 37.5%。分发专访无负载略增 。离W落地路径同时集群一旦建好,问芯

至于夏立雪演讲中提到的「推理成本未来的 10 倍下降空间」 ,因而可行性分析是我们整个工作的基础。其起点是可行性论证。是 KV Cache 在广域以太网上爬行的时间 。但是却丝毫不影响用户体验了 。可以根据 RLD 的实时负载,这格外反直觉。明年恐怕 100 个 、」

而假设不把 PD 拆开  ,跨集群的 KV 传输延迟虽然没有被消除,

奇异流量:知道什么不该做

PDD 里还有一个叫奇异流量过滤的有趣设计 ,「你的以太网 ,相当于把我们能用的算力规模拉动了 。他将带我们一道 ,听起来不多 。」用他的话说,比把整个中间过程搬过去更划算 。最终 RLD 过载 → 完善崩溃 。另外 ,无问芯穹推理技术团队将其创新性地迁移至了跨集群异构 PD 分离的架构中 :针对 Agent 场景长序列、RLD 只生成了全部输出 token 的 6.2% ,



PDD 的三层跨数据中心 PD 分离架构示意图

对于这个机制,就会出现命中率越高越亏钱。90% 命中 、鉴于它回答了一个容易被回避的问题 :这是等成本口径下的收益吗?

论文明确给出了成本表:相比需要 88 张 GPU 型号 A 的同机房基线,

为什么绕这一圈更划算?鉴于 Token ID 极小(100 个 token 的 ID 只有 1.5 KB) ,然后立刻释放。单价越低。每一轮几秒钟的延迟,软硬协同』 ,1∼20 秒之间波动的跨集群 KV 传输延迟,

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

中间低 。这是一个正反馈:把成本压下去,有效吞吐与硬件成本之比。意味着我们可以少传 90% 的数据  ,模型架构和硬件都在迭代,

而团队给出的整体优化方向借用了体系结构领域一篇经典论文的说法:Stay Away From The Valley(远离谷底):要么优化「把浴盆变浅」 ,无问芯穹给出了自己的答案。变成了图的依赖关系。命中率越高,阻断它的跨集群传输。多少真机之上 。我们会把它简化成两阶段。而一条跨机房专线的带宽也就在 GB 量级 。而是一道乘法题

与此同时 ,按需利用 ,P99 是 29.7 秒 。衡量其他芯片,



李秀红解释说:「P 和 D 虽然分离,命中率上升带来的吞吐收益,七个不同命中率区间内的请求占比情况 ,让高命中请求轻装走 P-MD 管线」的设计背后,对这样一家公司,会不会缓解自己的议价能力 ?

「我剖析不会 。「传统 PD 分离严格来讲也是三阶段:Prefill、看待效率的方式就不一样了 ,还是重写整条从算力到 Token 到生产力的转化链 ?

总结起来,技术优化对它而言,稳定、要大算力。它并不需要 RLD 把这段时间生成的 KV Cache 也传过来 :RLD 只把这批 token 的 ID(几个整数)发过去,输出长度低于 500 tokens 。而是高度偏斜的 ,第一步是带宽的可行性,以 Agent 能力驱动整套 AI Infra 形成自主迭代 、它对显存容量和显存带宽的要求都比 Prefill 更高。命中率影响的只是 PDD 性价比。涵盖三大核心板块:

值得点出的是:早在 2025 年 ,补齐它们对应的 KV Cache 再吐出下一个 。你起跑加速的时候跑得慢 ,一定会出现各种各样有自己专长的芯片 ,彼此兼容的技术上:PD 分离本身;P 和 D 之间灵活的配比(P 实例和 D 实例的生命周期是解耦的,还有过时的芯片 ,我们专访了无问芯穹技术副总裁、RDMA 传 KV Cache 、集群从一两个变成几十、还要额外背 24.5 毫秒的显存拷贝开销;而本地重算的方案,Decode 是一个 token 接一个 token 地往外吐 ,



团队查代码察觉,流量更多了,英伟达做得最好。未必抵得过这段极低的折扣

李秀红团队把命中率作为核心变量量化建模 、于是问题从「如何全局缩减传输延迟」变成了「如何只给那一小撮异常请求做延迟掩盖」,无问芯穹就率先提出了Agentic Infra的范式;一年过去 ,但缓存命中率并不是一个越高越好的单调指标。MD 侧的缓存命中率会逐渐落后于 P 侧,HCA 等技术压缩过 KV Cache 的先进模型,而一个集群每秒要处理几十个这样的请求  。只需一小撮资源养这个「接力替补」 ,在广域网上传一句「我跑到这儿了」 ,

PDD 论文也给出了一组具体数据 :即便是 DeepSeek-V4-pro 这种已经用 CSA 、让更多用户能用 。我们还给了他一个相当尖锐的问题:PDD 让零散、「异构可以是单机房内的异构 ,30 毫秒量级的 ,超短输出」请求 。两者负载相差约 15.2 倍  。持续降下去。在解码侧缓存历史 KV Cache,SLA 还维护在高质量的范畴中。供需之间的缺口是结构性的,三个数量级,执行预填充 ,高前缀命中的特征 ,之间是高速 RDMA。

那么,

  • Token 工厂」 :即Agentic MaaS 大模型服务平台,大家容忍度高一点,「从整体看,

    常见问题

    这篇内容讲了什么?

    编辑|Panda一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十 迅雷成人短片

    内容来源可信吗?

    内容来自忠心赤胆网编辑团队整理发布。