翼华科技图南AI-DPU技术路线公布,破解大模型记忆成本难题-新华网
新华网 > > 正文
2026 07/20 10:33:14
来源:新华网

翼华科技图南AI-DPU技术路线公布,破解大模型记忆成本难题

字体:

  在今日开幕的2026世界人工智能大会(WAIC)上,国内领先的高性能网络及算力芯片公司—翼华科技,发表了题为《重构缓存边界:AI DPU让每一个Token更便宜》的主题演讲,首次公开了培风图南AI-DPU的产品路线。

  直面行业痛点:推理成本正从“算力”转向“记忆”

  随着大模型进入长上下文、多轮对话和多智能体时代,翼华科技联合创始人贾淑芸指出,推理成本的瓶颈已不再是单纯算力,而正从“算力”转移到“记忆”。上下文越长,KV Cache越大,越装不进GPU,上下文离GPU越远,访问延迟越高,导致大量计算资源耗费在数据的反复重算和延迟上,形成了一堵隐形的“成本墙”。

  核心方案:首创“上下文记忆层”,让“不重算”成为现实

  针对这一行业级难题,翼华科技推出了“培风图南”AI-DPU及其驱动的Context Memory节点。该方案在传统的GPU HBM与通用存储之间,创造性地增加了一层专用的“上下文记忆层”。通过将KV Cache从“每张卡各自为政的临时数据”转变为“全集群统一编排的共享资源”,实现了三大突破:

  1.极致降本: 通过前缀KV跨请求复用和会话持久化技术,大幅减少重算,在典型场景下可显著降低Decode阶段的硬件成本和首Token延迟。

  2.高效卸载: AI-DPU将KV索引、RDMA零拷贝、压缩加密及智能预取等任务从CPU/GPU卸载,在不打扰主计算任务的前提下,实现数据的高速流转。

  3.开放生态: 全面兼容异构GPU、标准以太网及vLLM、SGLang等主流推理框架,支持对现有存量集群进行平滑、渐进式的改造升级。

  此次翼华科技提出的方案核心就是:用“不重算”最大限度的降低每一个token的产出成本,让GPU算力效率充分提高。这家专注于高性能网络芯片与计算芯片的“双芯驱动”高科技企业,不仅在芯片研发上实现了全栈自研,自主可控,还提供算力中心设计、集成、运维的全栈服务,致力于打造高度自主可控的国产算力底座。

  翼华科技仅成立四年,就实现了首款芯片的商业化应用,并荣获“中国芯”优秀技术创新产品奖等多项殊荣,成为三大运营商合作伙伴。

  成立至今,公司顺利完成多轮融资,成功引入包括小米产投、京能集团等产业投资人,及包括建投投资、达晨财智等市场领先财务投资人。

  翼华科技在WAIC 2026上的亮相,标志着其在AI基础设施领域的布局进入了全新阶段。公司创始人贾淑芸表示:“算力决定模型能想多快,记忆决定模型能想多远,而成本决定这一切能否真正普惠。翼华愿做那个把‘记忆’做便宜,让智能真正实现普惠的企业。”

 

【纠错】 【责任编辑:马渭淞】