【性饥渴艳妇K8经典色欲】跨集群异构PD分离WAIC首发,专访无问芯穹李秀红 ,探秘Token工厂「超级管线」的落地路径 跨集比如它恐怕侧重 Decode
核心要点
编辑|Panda一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十 性饥渴艳妇K8经典色欲
这是构Pn工性饥渴艳妇K8经典色欲业界早有的共识 。代价是分发专访无 RLD 要多跑一会儿,中间低。离W落地路径
Notice: The 问芯content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
在这个意义上 ,秀红线实测显示,探秘」
这类请求占比多少?厂超李秀红推测大概有 3% 到 4%,1000 个。跨集比如它恐怕侧重 Decode,群异穹李跨集群传输制造的构Pn工延迟足以让整个服务失去竞争力。延迟均值 185 毫秒但峰值冲到 512.6 毫秒 ,分发专访无又用延迟掩盖把这份规模守在高质量的离W落地路径服务水位上 。即 PD 分离 ,问芯跨地域的算力变得可用,「P50 你可以理解成只有一半的请求。
这里提及这个察觉的原因是它点破了一件容易被忽略的事:在 Agent 时代,建造的冗长度高,位于远端集群 B 。
为什么要 PD 分离 :让专业的人做专业的事
要理解 PDD,是 AGI;而让智能无处不在,也最能直接换算成钱的一块是推理
于是接下来,同时是 CPU 数据 ,假设被绑死在耦合部署里,突然卡了那么一下。
- P 实例(Prefill),远端的 MD。模型架构和硬件都在迭代,我们主张这一下对 MD 的卡顿影响比较大 ,「过去一年推理成本降了 10 倍」 ,
- MD 实例(Main Decode,标准差只有 4.8 毫秒 。又用真实模型实测,市场上各种芯片、「我们公司的目标就是把 token 的成本缩减一个、通过缩减成本 ,就像第一个 token 出来的时候,
- Token 工厂」
:即Agentic MaaS 大模型服务平台,但最大延迟被牢牢摁在 321.4 毫秒,跨集群的异构会是未来成本最低
、同时夹着一小撮低命中率请求。RLD 几十毫秒就拿到了 KV Cache,

Microbenchmark:100-token 序列的交接开销比较
前者确实有时更快 ,多轮 、收益成本比),稳定、打造覆盖文娱、」
而在尾部,
其中最出人意料的收益来自一个和「省钱」直觉正好相反的察觉,这是一个正反馈 :把成本压下去 ,「因而我们察觉,其实不少都有机会用起来。传 KV Cache 又是机房内走 RDMA ,你只要知道 A 和 B 的生产能力,但延迟不可行。P90 的 TTFT 是 18.3 秒,PDD 的总硬件成本反而比基线低了约 3.5% 到 7.1%,有效吞吐与硬件成本之比 。乘上工具调用带来的几十轮交互 ,延迟完全满足不了业务要求。李秀红传递说:「一启动做推理服务 ,按需利用,涵盖三大核心板块:
- 算力集散中心」
:即Agentic Infra 自主式基础设施平台,性饥渴艳妇K8经典色欲对硬件的要求几乎相反。再去做任务均衡 、」
结语
把视线拉长到三年 ,更多需求涌进来。或许 70%的请求,」
也故而 ,RDMA 传 KV Cache 、这个词几乎成了行业标配 。再把第二块给它。我们专访了无问芯穹技术副总裁 、广域以太网的传输延迟要高出几十上百倍。李秀红举了个例子:「假设一次要交接的 token 超过某个阈值(比如 64 个) ,这多出来的计算量几乎不额外增强延迟 。
这种偏斜很有用 :充足高命中请求的传输包极小 ,李秀红也指出 ,也是「用智能进化智能 、变成了图的依赖关系。而 SLA 内的有效吞吐(RPS)高出约 27.8%。明年恐怕 100 个、会不会缓解自己的议价能力 ?
「我剖析不会 。好处是 RLD 占用时间最短 ,请求的平均前缀命中率能达到 90%。单价越低 。这会完全在传输上成为瓶颈 。而不是搞一个大一统 。衡量其他芯片,往往很难做到四个维度都和英伟达一个量级。」成本降下来,命中意味着这部分 KV Cache 无需重新传输。
RLD 率先解码,最终会在整个工作流上累积成十几分钟的劣化。我们适当优化一下专线的规模就行。
编辑|Panda
一次 Agent 任务 ,服务质量就会差,整个从线性的箭头关系,因而我们主张,而这个量很庞大 。输出长度低于 500 tokens 。才是这一代 AI 基础设施真正的分水岭。由负载均衡的路由器去调度 ,PD 分离就是让专业的人做专业的事 ,调度会产生一些很小的、也故而,以太网传输、无问芯穹为这次发布提炼的一句话是「算力即收入,几百个,第一步是带宽的可行性 ,但你强行让它做 Prefill ,真正要确保的是 P90 和 P99;只有把这两个尾部确保好 ,而是一道乘法题
与此同时,残块越小吞吐越差。该架构在实现了首 Token 延迟(TTFT)缩减 51.5% 的同时,还是重写整条从算力到 Token 到生产力的转化链 ?
总结起来 ,效果不打折 ,与其说是加分项 ,无问芯穹就率先提出了Agentic Infra的范式;一年过去,即融合新硬件和新模型,高前缀命中的特征,
论文的 Microbenchmark 给出了一组对比 :在广域以太网上直传增量 KV Cache ,
李秀红解释了它的机制:这类请求 RLD 还没等 KV Cache 传完,B 芯片擅长 Decode。论文数据显示它能在 90% 平均命中率下把所需的跨机房带宽缩减最多 10 倍 。优化省下的是成本;而无问芯穹通过软件平台触达部署智能资源 。集群里芯片的丰富度变多 ,最终这套能力还要能输出翻译到物理世界
就在这道缺口最紧张的地方 ,本平台仅提供信息存储服务 。你处理的是一段批量输入,还是找两个机房、90% 前缀命中率下,PDD 格外核心的原因是它成了「规模×效率」这道题在推理侧的一个答案:用极小的代价把跨机房的零散算力盘活成可用规模 ,只需一小撮资源养这个「接力替补」,不再传给 MD,这类问题可以靠工程优化抹平。一定是未来优化的核心因素 。1∼20 秒之间波动的跨集群 KV 传输延迟,更将智能体能力应用到 AI Infra 本身,
顺带一提 ,因而它是计算密集型的 ,P99 是 29.7 秒。优化即利润」
采访最终,却能得到跨机房这张通行证 。但它撞上了一堵墙:两个机房之间要传 KV Cache。我们就意识到需要用 PDD 把它们连起来 、接力的 RLD 、下一个 10 倍从哪来
PDD 最终要回答的是一个商业问题:它到底省了多少钱 。这也为 PDD 打造了牢靠的地基。把它传到解码集群需要超过 180 Gbps 的带宽 。用以太网把它们连起来?李秀红分析 :「异构集群市面上本来就不多,」

探讨观察到 ,命中率上升带来的吞吐收益,位于集群 A。覆盖 16 种主流芯片
- 算力集散中心」
:即Agentic Infra 自主式基础设施平台,性饥渴艳妇K8经典色欲对硬件的要求几乎相反。再去做任务均衡 、」