首页 > 技术

从34.81秒到11.89秒:星流计算NovuWing™ Runtime完成新一轮性能验证

2026-08-31 18:38:24      西盟科技资讯   


随着企业AI从单次模型调用转向长期运行的Agent,推理基础设施的关注点也在变化:除GPU算力外,上下文能否持续保存、跨实例复用,并在Agent暂停和再次唤醒时低成本恢复,正越来越直接地影响实际运行效率。

星流计算(NovuInfra,全称为浙江星流计算科技有限公司)近期完成NovuWing™ Runtime新一轮性能验证。作为NovuWing Agent Native Compute架构的核心运行时组件,NovuWing Runtime将Agent ID、Session ID和生命周期状态纳入运行时管理,并通过SharedKV、Agent-aware KV Scheduling及分层内存协同,减少多轮Agent场景中的重复Prefill。

本轮核心测试采用Traffic Y工作负载。Traffic Y是基于GitHub开源agentic-swarm-bench生成的典型Agent工作负载。在同一硬件、同一模型和同一Traffic Y请求清单下,以vanilla vLLM + native APC为公开基线,跨实例场景平均TTFT由34.81秒降至11.89秒,下降65.8%;TTFT p50由32.83秒降至11.84秒,下降63.9%。这表明,即使保留vLLM本地Prefix Cache,跨实例共享仍能进一步释放上下文复用价值。

在216个多轮Agent请求组成的swarm场景中,平均TTFT由17.53秒降至3.61秒,下降79.4%;Cached Prompt覆盖率由39.2%升至92.4%,增加53.2个百分点。完整回放任务耗时由45.0分钟缩短至20.1分钟,整体下降55.3%。

2b3e157d4e1f474e373ed7702dc30fe1319878492c242192bab79c86256f8849

图1|Traffic Y同环境测试:NovuWing Runtime与vanilla vLLM + native APC的TTFT对比

跨实例复用不仅要快,更要保证状态一致性。测试中的36次外部跨实例查询均完整命中19,600 Token共享前缀,没有出现部分命中、状态回滚或不完整加载。对于Attention与Mamba/SSM混合模型,这一点尤其关键。

在此基础上,NovuWing Runtime进一步引入Sliding Shared-KV Windows(滑动共享KV窗口),将“逻辑共享缓存容量”与“GPU page-lock容量”解耦:不再长期锁定整个共享内存池,而只动态注册当前参与GPU数据交换的窗口,并通过引用计数和TTL/LRU管理生命周期。

2e014f3afa1dd6c1b5dbead4cceac38a085c6448ce43009fbdaf1bcc749a5fae

图2|Sliding Shared-KV Windows:以有限page-lock工作集支撑更大的逻辑共享KV缓存(摘自星流计算内部技术文档)

最终两轮跨实例mean TTFT分别为11.97秒和11.81秒,与整池固定Pin基线12.01秒处于同一性能水平;Cold Prime TTFT约39.0–39.2秒,与整池固定Pin基线41.51秒相比,也未出现性能回退,甚至还略有提升。最为关键的是,系统在基本保持原有性能水平的同时,摆脱了“逻辑缓存越大、需长期Pin住的内存也越大”的约束,为更大规模共享KV缓存提供了更灵活的内存管理方式。

针对缓存路径中的重复数据移动,Runtime同时引入index-aware store-skip:冗余replacement store由2,413次降至0,store register/unregister调用由1,524次降至253次,减少83.4%,进一步降低窗口注册、释放和重复DMA带来的系统开销。

这些结果表明,企业Agent时代的性能优化正在从单纯提升GPU峰值能力,转向对KV Cache、上下文状态和多级内存的系统级协同。NovuWing Runtime希望让已经完成的计算持续复用,并将KV Cache提升为面向Agent生命周期的运行时资源。

测试说明:核心基线对比采用相同硬件、相同模型与相同Traffic Y请求清单。Traffic Y为基于agentic-swarm-bench构造的合成工作负载,用于可重复模拟多轮Agent与共享前缀特征,不等同于所有真实生产流量;不同公开研究系统因软硬件、模型和工作负载不一致,本文不采用跨环境绝对跑分直接比较。

相关阅读

    无相关信息