凯时AG

WAIC系列 | 三款AI推理芯片+超节点异构集群,,,,,云天励飞宣布未来算力蓝图

作者:黄智瑶
宣布时间:2026-07-23 07:24:08
阅读量:76

WAIC系列 | 三款AI推理芯片+超节点异构集群,,,,,云天励飞宣布未来算力蓝图

7月18日,,,,,云天励飞在2026 WAIC宣布未来两年多AI推理芯片蹊径图。。。。公司妄想推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款芯片,,,,,划分针对AI推理中Prefill、Decode和Decode FFN环节的负载特征举行专用优化。。。。

三款芯片将面向万卡异构集群举行协同设计与安排,,,,,通过对差别推理阶段举行解耦,,,,,为差别负载设置越发适配的芯片和算力资源,,,,,进一步提升系统整体效率,,,,,一连降低Token天生本钱。。。。

推理负载一连分化,,,,,算力优化走向细腻化

从负载特征来看,,,,,目今大模子推理应用正在形成差别类型:以对话、知识问答为代表的通用AI助手,,,,,以重大推理、编程为代表的深度推理应用,,,,,以及以Agentic Coding、多Agent协同为代表的实时智能系一切。。。。

随着AI应用一直深入,,,,,单次使命的上下文长度、推理链路重漂后以及实时交互要求一连提高,,,,,对推理系统的吞吐、延迟和本钱提出了更高要求。。。。关于大规模推理安排而言,,,,,峰值算力已难以单独反映系统效率,,,,,盘算、访存、互联和系统调理等因素,,,,,配合影响Token天生效率和本钱。。。。

大模子推理差别阶段的盘算特征也保存显着差别。。。。Prefill需要集中处理输入上下文,,,,,对盘算能力要求较高; ;;Decode接纳逐Token天生方式,,,,,对内存带宽和数据会收效率越发敏感。。。。随着MoE等模子架构生长,,,,,Decode阶段内部的Attention与FFN在盘算、访存等方面也泛起出差别的资源需求。。。。

针对推理负载的转变,,,,,云天励飞妄想在未来推出DeepVerse100P、DeepVerse100D和DeepVerse100L三款云端大算力推理芯片。。。。

DeepVerse100P面向百万级上下文Prefill场景打造。。。。在古板混部架构中,,,,,长上下文Prefil与Decode共享算力与带宽资源,,,,,会造成资源抢占,,,,,对Decode天生吞吐造成影响。。。。

DeepVerse100D面向Decode环节打造专用推理引擎,,,,,拥有数倍于主流芯片的内存带宽,,,,,支持1024卡Scale-up及光互联系统架构。。。。通过按需建设光路直连,,,,,并凭证使命动态重构光路,,,,,镌汰古板多跳电交流和静态组网中的排队、拥塞及中心转发开销,,,,,降低多节点通讯壅闭和尾延迟,,,,,提高逐Token输出的稳固性。。。。

DeepVerse100L面向Decode 阶段盘算麋集型的FFN环节,,,,,接纳3D Memory架构,,,,,相比主流HBM,,,,,大幅提升内存带宽,,,,,并通过低延迟芯片互联和激活数据快速传输,,,,,提高盘算与通讯的并行效率。。。。

三款芯片协同面向万卡异构集群

随着AI推理进入规模 ;;才沤锥,,,,,芯片优化也正由单颗性能提升,,,,,进一步走向多芯协同和集群级效率优化。。。。

在万卡规模的推理集群中,,,,,系统效率并非单卡性能的简朴叠加。。。。差别推理负载对盘算、内存和通讯资源的需求保存显着差别,,,,,当Prefill与Decode、Attention与FFN共享统一套通用算力资源时,,,,,容易爆发资源竞争。。。。与此同时,,,,,随着集群规模扩大,,,,,通讯壅闭、资源期待和尾延迟等问题也会进一步影响整体推理效率。。。。

因此,,,,,提升Token天生效率,,,,,除了优化单颗芯片性能,,,,,还需要围绕芯片在集群中的协同,,,,,对推理历程中的盘算、访存、互联和资源设置举行系统级设计。。。。

基于DeepVerse100P、DeepVerse100D和DeepVerse100L,,,,,云天励飞妄想推动三款芯片在万卡异构集群中的疏散式安排与协同运行。。。。凭证Prefill、Decode 和Decode FFN的差别负载特征,,,,,划分设置响应芯片和资源池,,,,,并通过高速互联形成协同运行的异构算力系统。。。。

这一芯片协同方案围绕Token生玉成历程举行系统优化。。。。通过对差别推理阶段举行疏散,,,,,降低差别负载之间的资源滋扰,,,,,并凭证现实需求设置盘算、访存和通讯资源,,,,,从而提升集群资源使用率和整体推理效率。。。。

从面向特定推理负载举行芯片优化,,,,,赴任别芯片之间的协同,,,,,再到万卡级集群应用,,,,,云天励飞正在将AI推理芯片的优化规模由单颗性能延伸至集群级效率。。。。

面向“百亿Token一分钱”的恒久目的,,,,,云天励飞希望以三款芯片为焦点,,,,,形成一套服务于大规模Token天生的“推理工厂”,,,,,通过芯片、互联、软件和系统的协同优化,,,,,提高算力产出效率,,,,,一连降低单位Token本钱。。。。

IFWA软件栈:降低国产算力应用门槛

硬件异构水平和集群规模一直提升,,,,,也对软件栈提出了更高要求。。。。模子能否快速完成适配、算子性能能否获得充分释放、差别硬件资源能否高效协同,,,,,直接影响DeepVerse芯片在大规模集群中的现实运行效率。。。。

围绕DeepVerse芯片及其集群应用,,,,,云天励飞一连建设IFWA软件栈,,,,,笼罩AI模子开发、编程及系统等差别层级,,,,,为模子适配、算子优化、编译安排和软硬件协同提供软件支持。。。。

在兼容性方面,,,,,IFWA围绕Transformer主流架构,,,,,一连完善PyTorch ATen算子的适配和性能优化,,,,,并增强对vLLM、SGLang等主流推理框架的支持。。。。通过兼容主流软件接口、复用成熟开源组件,,,,,降低模子向DeepVerse平台迁徙和安排的本钱。。。。

在模子适配和开发效率方面,,,,,IFWA构建了笼罩模子量化、压缩、编译和安排的一站式自动化工具链,,,,,并引入AI Agent加入推理芯片适配和性能优化。。。。

此前,,,,,云天励飞已开源Houmao多Agent异构编程框架,,,,,由差别Agent协同完成模子开发、算子开发、性能优化和测试验证等使命,,,,,将部分依赖人工履历的芯片软件开发流程转化为自动执行、自动验证和一连优化,,,,,缩短新模子和新算子的适配周期。。。。

与此同时,,,,,云天励飞还将成熟的Triton算子能力融入FlagOS,,,,,通过代码孝顺、联合验证和社区复用,,,,,推动相关能力在国产AI软件生态中进一步共享,,,,,镌汰差别硬件平台在算子适配上的重复投入。。。。

在云天励飞的妄想中,,,,,IFWA并非一套关闭的软件系统,,,,,而是通过对主流模子、框架和开发工具的兼容,,,,,降低开发者的迁徙和使用本钱,,,,,缩短模子在DeepVerse平台上的安排周期,,,,,让国产算力越发便捷地进入现实应用。。。。

“1001妄想”,,,,,推动Token本钱协同优化

降低Token天生本钱是一项系统工程。。。。

从芯片架构、IP与EDA,,,,,到封装测试、系统互联、软件栈和算力平台,,,,,再到模子及应用,,,,,工业链差别环节的效率都会影响最终的Token天生本钱。。。。实现极致性价比的Token,,,,,需要工业链上下游配合加入。。。。

今年5月,,,,,云天励飞联合30余家等单位,,,,,配合签署“1001妄想”建议。。。。“1001妄想”将围绕Token天生效率和本钱,,,,,推动工业链上下游增强协同。。。。通过越发细密的工业相助,,,,,使模子和应用需求更早反馈至芯片及系统设计环节,,,,,推动成熟软件能力加速复用,,,,,同时加速芯片在集群和现实场景中的验证和应用。。。。

随着AI走向规模 ;;τ,,,,,算力竞争正在进一步转向对系统效率和单位Token本钱的一连优化。。。。芯片、软件、系统和应用之间的协同水平,,,,,也将越来越直接地影响AI算力的现实价值。。。。

以“百亿Token一分钱”为恒久目的,,,,,云天励飞将一连推进芯片、系统、软件和工业生态协同立异,,,,,与更多生态同伴配合提高Token性价比,,,,,推动国产AI算力从“能用”迈向“好用、易用、用得起”,,,,,为人工智能规模 ;;τ锰峁┰椒⒏咝А⑵栈莸乃懔 。。。

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论,,,,,请在这里揭晓您的看法、交流您的看法。。。。

最新文章

热门文章

随机推荐

【网站地图】