项天与王攀和清华汽车研究院一同会见美国底特律(2016年)2017年项天、王攀和公司首创团队成员的合影
目今,,,,人工智能正加速从数字天下迈向物理天下,,,,具身智能与物理AI成为工业界最受关注的新赛道。。。作为AI时代的“算力心脏”,,,,GPU芯片的手艺蹊径选择与生态构建,,,,直接决议着这一轮AI厘革能否真正落地千行百业。。。克日,,,,速显微电子在天津津南区举行新总部启用暨新品宣布仪式,,,,正式宣布“TUCA”雷神统一盘算架构与“天衡”GPGPU芯片,,,,宣布公司进入具身智能GPGPU赛道。。。
速显微电子首创人兼董事长项天、联合首创人兼总司理王攀在接受媒体采访时,,,,就国产GPU的手艺蹊径选择、具身智能时代的芯片立异、生态建设与资源化路径等话题举行了深入解读。。。
新起点:天津总部开启第二个十年
7月25日,,,,天津津南区,,,,速显微电子正式揭牌启用了公司新总部。。。这不但是一次地理意义上的迁址,,,,从2015年在合肥起步,,,,到现在落子天津津南,,,,速显微完成了从细分赛道领跑者到主流赛道竞争者的跨越。。。
回溯创业历程,,,,项天与王攀为中国科学手艺大学2005级本科同班同砚,,,,从大学时代起就对GPU手艺抱有浓重兴趣,,,,读博时也一直在做相关偏向的研究。。。2015年,,,,两人敏锐捕获到物联网终端的人机交互界面新的渲染需求,,,,其中代表性的是汽车仪表正从机械仪表向智能座舱液晶仪表转变,,,,而其时市场上缺乏合适的国产芯片支持这一新产品需求。。。
“其时桌面GPU市场已经被英伟达牢牢占有,,,,游戏显卡赛道竞争强烈且资源并不看重国产芯片赛道,,,,而单片机级别的GPU却是一个市场空缺。。。”项天体现。。;;;谡庖慌卸,,,,两人博士结业后便最先创业,,,,选择从物联网渲染GPU这一细分赛道切入,,,,一干就是十年。。。
十年间,,,,速显微在物联网渲染类GPU赛道做到了行业领先。。。2019年量产GC9003,,,,成为海内第一颗能跑3D图形的车规MCU,,,,随后推出GC9002、GC9005形成完整产品矩阵。。。现在产品普遍应用于汽车智能座舱、智能家电、工业控制、医疗装备等领域。。。
“这十年我们做了两件事:一是把物联网渲染类GPU这个赛道做大做强,,,,二是一连研发从GPU IP到CUDA兼容的开发框架的全栈GPU手艺。。。”项天说。。。现在公司站在第二个十年的起点,,,,明确了新的战略偏向:周全进入具身智能GPGPU赛道。。。
同时,,,,面临国产芯片普遍面临的制程限制难题,,,,速显微在周全兼容CUDA生态的同时,,,,提出“深度优化器件与架构”的生长战略。。。“端侧产品最主要的是让客户愿意用、用得好,,,,”项天强调,,,,“我们坚持CUDA兼容蹊径,,,,就是要降低客户的迁徙本钱;;;并在制程受限的情形下,,,,通过半导体器件和系统结构的底层深度优化来挖掘性能潜力,,,,知足用户对端侧AI芯片好用、自制、易安排的焦点诉求。。。”
而选择落户天津津南区,,,,正是速显微开启新十年的要害一步。。。“天津市2026年政府事情报告明确提出将具身智能列为新的经济增添点;;;津南区坐拥天津大学、南开大学两所顶尖高校,,,,是天津市智力资源最麋集的区域之一。。。公司头一个十年积累了扎实的客户基础、供应链基础和人才储备,,,,新总部落户天津将依托津南区的工业配套和科教资源优势,,,,把前十年储备的手艺能力迅速转化为产品和市场竞争力。。。”项天体现。。。
手艺路:“先渲染后AI”的正向研发逻辑
2026年被工业界称为“端侧AI元年”。。。随着大模子手艺从云端向边/端侧渗透,,,,具身智能、天下模子成为新的工业热门,,,,端侧算力需求迎来爆发式增添,,,,速显微的战略升级正得其时。。。但一个现实问题是:在先进制程工艺暂时受限的情形下,,,,中国端侧算力生长是否只有“堆晶体管、追制程”这一条路????速显微的战略是遵照“先渲染后AI”的正向研发逻辑——这与英伟达的生长路径高度相似。。。
对此,,,,王攀指出:“GPU手艺是有地基的,,,,一楼是渲染,,,,二楼就是AI。。。我们从2015年最先做渲染手艺积累,,,,到2021-2022年渲染IP成熟后自然延伸到通用GPGPU IP的研发,,,,这不是盲目追逐热门,,,,而是手艺积累的水到渠成。。。”正向自研IP的价值在于“知其然更知其以是然”。。。若是是买IP来做芯片,,,,就像买发念头回来造车,,,,很难在底层做深度优化。。。速显微选择从0到1自研GPU IP,,,,可深度掌握更底层的手艺,,,,匹配最新的客户需求,,,,这也为后续的器件级立异打下了基础。。。
国产芯片制程受限使得速显微的正向研发逻辑优势凸显,,,,可以越发从容地将立异重心从系统结构转向半导体器件与架构的深度协同优化,,,,未来甚至可以通过缩短晶体管传输时间、优化数据搬运效率来提升器件的整体性能。。。这与华为提出的韬定律——以“时间缩微”替换“几何缩微”,,,,不谋而合。。。
基于这一思绪,,,,速显微通过多年的深入研发,,,,实现了三个偏向的手艺立异突破:一是正向自研GPU IP。。。从渲染到AI全栈正向研发,,,,掌握从指令集、编译器到驱动的所有焦点手艺,,,,为底层优化提供了可能。。。这使得速显微成为海内少少数实现从IP到工具链全链条自主设计的GPU企业。。。
二是GPU IP内部存算融合架构。。。除了在封装层面做存储与盘算芯片3D堆叠的通用思绪以外,,,,速显微在GPU IP设计阶段就以数字存算的设计方式将GPU IP标准单位内里的存储和盘算融合设计,,,,实现“算中存、存中算”,,,,从泉源上镌汰冯·诺依曼架构下的数据搬运消耗,,,,大幅提升能效比。。。
三是AI ROM手艺。。。这是速显微的一项立异手艺——将大模子参数直接固化在GPU的ROM中,,,,相比古板DDR/HBM方案可以大幅降低存储本钱和功耗,,,,提高Token输出效率。。。
这些立异并非从天而降,,,,而是速显微十年如一日深耕GPU全栈手艺研发的必定效果。。。公司始终遵照“研发一代、成熟一代、推出一代”的产品节奏,,,,不盲目追热门、不急于求成,,,,让手艺立异细密匹配市场需求,,,,经由恒久积累最终水到渠成。。。这些扎根于底层手艺的立异,,,,也组成了速显微区别于其他GPU厂商的差别化竞争优势。。。
硬产品:TUCA架构与“天衡”芯片的算力底座
具身智能时代的到来,,,,对AI算力芯片提出了全新要求。。。与云端算力差别,,,,端侧GPGPU不但要提供足够的AI算力,,,,还要兼顾低功耗、低本钱、富厚外设接口、实时性等多重约束,,,,更要解决软件生态的易用性问题。。。针对这一市场需求,,,,基于上述手艺立异,,,,速显微在本次宣布会上正式推出了面向下一代AI与异构盘算的TUCA统一盘算架构,,,,以及“天衡”系列GPGPU芯片。。。
作为一套全栈异构盘算架构,,,,TUCA雷神统一盘算架构接纳分层式设计,,,,笼罩从开发接口到硬件执行的完整盘算链路:编程接口层为开发者提供统一入口;;;编译优化层认真将上层程序转换为高效硬件代码;;;运行时调理层肩负内存治理、核函数调理、多装备协一律焦点功效;;;加速库层则提供矩阵运算、卷积盘算、Transformer算子等高性能基础能力。。。
“TUCA的焦点价值是闪开发者专注于营业立异,,,,不被底层硬件重大性约束。。。”项天先容。。。为了降低开发者使用门槛,,,,速显微还推出了TUCA Playground在线编译运行平台,,,,开发者无须装置任何工具链、设置驱动情形,,,,通过浏览器就能直接编写、编译和运行TUCA内核代码。。。
基于TUCA架构,,,,速显微宣布了“天衡”系列GPGPU芯片,,,,算力笼罩100T到4000T。。。其中,,,,本次宣布的TH1100是天衡系列的首款产品,,,,100T算力,,,,今年即可实现落地。。。该芯片面向物理AI和具身智能场景,,,,集成了6个SXGPU焦点和8核Cortex-A55 CPU,,,,同时集成ISP图像信号处理器和清静加密引擎。。。在算力方面,,,,TH1100在FP4希罕模式下峰值抵达98.2 TOPS,,,,FP16浓密算力12.3 TFLOPS,,,,周全笼罩从低精怀抱化推理到中高精度盘算的需求;;;内存子系统最高支持128GB容量,,,,峰值带宽85.3 GB/s,,,,单芯片即可承载35B-A3B参数级大语言模子的全量推理。。。
以35B-A3B参数的通义千问大模子为例,,,,TH1100在INT4精度下可以实现约50毫秒每Token的推理延迟,,,,完全知足实时对话和人机交互的需求,,,,不会泛起可感知的卡顿。。。
凭证产品蹊径图,,,,速显微后续还将推出更高算力的产品:TH1800算力抵达800T,,,,对标英伟达Jetson Thor,,,,面向高性能机械人和自动驾驶域控场景,,,,妄想2027年底流片;;;TH24K0算力抵达4000T,,,,对标RTX 4090,,,,面向高端自动驾驶和AI一体机场景,,,,妄想2028年量产。。。“我们先用100T产品跑通供应链、完成客户导入和生态建设,,,,再逐步把器件级立异融入更大算力产品,,,,走得稳才华走得远。。。”项天体现。。。
真落地:“芯片+算法+方案”的端到端交付
具身智能真正落地仍面临诸多挑战。。。大都行业客户缺乏AI开发团队,,,,不知道怎样把大模子与自身营业连系;;;入口芯片不但价钱高,,,,还面临供应链清静风险;;;而大都芯片厂商只提供硬件,,,,缺乏场景化的解决方案能力。。。
速显微团队从创业第一天起就在做toB营业,,,,对古板工业客户的真实需求越发熟悉。。。王攀体现:“许多古板行业好比数控机床、医疗装备、工业自动化,,,,这些领域的客户很是需要AI升级,,,,但他们没有专业的AI团队,,,,也没有成熟的方案可以参考。。。凯时AG战略是提供‘芯片+算法+方案’的端到端交付,,,,帮客户把AI应用直接做好模芯匹配、软硬一体,,,,客户拿来就能用。。。”
这种“自带方案”的能力,,,,来自速显微十年2B营业积累的工程化履历。。。现在,,,,速显微已经在多个场景实现了标杆性落地。。。以医疗场景为例,,,,在牙齿正畸领域,,,,速显微推出了完整的智能口腔一体机方案,,,,可以在40秒内自动完成医疗影像识别建模、病例剖析和方案设计,,,,并直接对接牙套工厂的生产系统,,,,实现从患者建档到牙套生产的全流程AI自动化。。。别的,,,,速显微还与量子丈量装备企业相助,,,,用AI替换人工操作细密丈量装备,,,,不但能为企业每年每台装备节约数十万元的人力本钱,,,,还能阻止人工操作带来的误差。。。
建生态:CUDA兼容降低迁徙门槛
关于AI芯片而言,,,,硬件性能只是基础,,,,软件生态才是决议其能否大规模商业化的要害。。。CUDA生态经由英伟达二十年的谋划,,,,已经群集了全球数百万开发者。。。速显微在生态建设上的焦点战略,,,,就是走CUDA兼容蹊径,,,,最洪流平降低开发者的迁徙本钱。。。在自研指令集和编译器的基础上,,,,实现上层软件工具链与CUDA的完全兼容。。。
开发者在CUDA生态下编写的代码、训练好的模子、熟悉的调试工具,,,,都可以无缝迁徙到速显微的芯片上,,,,不需要重新学习新的编程范式,,,,不需要重写代码,,,,只需要重新编译一次就可以直接运行。。。这种“无感迁徙”的体验,,,,关于开发者和客户来说价值重大,,,,既;;;ち艘延械娜砑投资,,,,又阻止了切换到新平台的手艺风险。。。
除了兼容CUDA,,,,速显微还在起劲构建自己的开源生态。。。TUCA架构的焦点组件接纳MIT开源协议,,,,允许开发者自由使用、修改甚至商用。。。在工业相助层面,,,,速显微已经最先构建多条理的生态相助同伴系统。。。宣布会上,,,,速显微与深度机智、国仪量子等企业签署了战略相助协议:与物理AI企业深度机智配合推进物理AI手艺的工业落地;;;与高端仪器企业国仪量子围绕AI ROM相关营业开展相助。。。
别的,,,,速显微还起劲推进与高校的产学研相助,,,,与南开大学、天津大学等天津外地高校建设相助机制,,,,配合作育GPU和AI人才,,,,从源头上为生态建设储备实力。。。
资源化:上市历程稳步推进
近年来,,,,国产GPU赛道一连受到资源关注,,,,尤其是在AI大模子和具身智能的浪潮推动下,,,,GPU成为半导体领域最热门的投资偏向之一。。。但随着行业进入深水区,,,,资源也越发理性,,,,商业闭环能力和自我造血能力成为权衡企业价值的焦点标准。。。
在这一点上,,,,速显微展现出了与大都创业公司差别的特质,,,,具备越发康健的财务状态和清晰的资源化路径。。。与许多追逐资源热门建设的公司差别,,,,速显微在GPU赛道已有了十年创业履历,,,,原有的渲染GPU营业已经实现了康健的现金流。。。
“除去AI产品的研发投入,,,,公司现在已经是盈利状态了,,,,这让我们在战略上很是从容——一连正向开发,,,,打造第二曲线,,,,直面最终挑战,,,,凭证手艺-产品-市场匹配的节奏踏扎实实地前进。。。”王攀体现。。。
据相识,,,,速显微现在正在推进新一轮融资,,,,后续将陆续宣布相关新闻。。。“融资将主要用于天衡TH系列芯片的研发流片和生态建设。。。我们更看重能带来工业资源和战略协同的投资人。。。”王攀体现。。。
关于市场普遍关注的上市历程,,,,速显微也已提上日程。。。“但我们不会为了上市而上市,,,,越发关注的是能不可把产品做好、把客户服务好、把生态建起来。。。只要商业闭环跑通了,,,,上市是水到渠成的事情。。。”项天指出。。。
王攀进一步剖析:“现在端侧AI芯片赛道能够真正坚持CUDA兼容主赛道的厂商并未几,,,,各人都还在产品化的早期阶段,,,,最终谁能跑出来,,,,要害看谁的商业闭环做得更好。。。凯时AG优势十明确显:第一,,,,公司已经在GPU主赛道上有着长时间的全栈手艺积累;;;第二,,,,有成熟的toB营业做现金流支持,,,,财务康健清静;;;第三,,,,团队履历过几轮从0到1的产品、市场闭环并且依然年轻,,,,充满活力。。。凯时AG目的是希望通过一段时间的起劲,,,,能够真正望英伟达的项背。。。”
具身智能被称为“AI的下一个浪潮”。。。当大模子在数字天下的能力一直迫近天花板,,,,AI走向物理天下、与真真相形交互成为必定趋势。。。而这一浪潮的到来,,,,离不开底层算力芯片的支持。。。速显微站在天津总部新的起点上,,,,希望用第二个十年,,,,通过底层立异,,,,为具身智能时代打造真正好用、用得起的国产算力底座。。。