Ambient发布GPX10芯片:模拟存内计算瞄准边缘AI
边缘AI热潮虽盛,但业界多数时候仍在几十年前为AI出现之前的工作负载设计的计算架构上运行神经网络。硅谷初创公司Ambient Scientific指出,AI运算消耗的能源中,有70%到75%其实浪费在内存与处理器之间的数据搬运上,并非真正用于计算。该公司的创始使命,正是让AI不再依赖云端。
Ambient Scientific给出的答案是DigAn——一项获得专利的模拟存内计算架构。它直接在SRAM内部嵌入模拟乘累加单元,从电路层面消除数据搬运开销。其首款量产芯片GPX10瞄准由电池供电的边缘AI应用,从可实时检测心律失常的智能戒指,到工业预测性维护模块,不一而足。据称,相较传统32位微控制器,GPX10在功耗、性能与面积上可带来100倍提升,并可沿用TensorFlow、PyTorch等标准AI工作流实现完全编程。
eeNews Europe与Ambient Scientific产品负责人Saharsh Singhania详谈了GPX10背后的架构、为何“物理AI”无法在依赖云的基础设施上扩展,以及从单核GPX1一路延伸到支持视觉与自然语言处理的GPX64、再到服务器级处理器的路线图——至少在仿真中是这样。
“AI运算本质上就是矩阵乘法”
Singhania解释,不论什么样的AI运算,拆到最底层都是矩阵乘法或乘累加运算。行业长期使用的x86、ARM、RISC、GPU等架构,已有二三十年历史,只是在AI软件时代来临时恰好可用。传统数字电路面向通用计算设计,并非针对AI这类“数学密集型”负载,因此即便一次乘加也需要大量指令,相当一部分功耗和算力消耗在指令管理上。
与此同时,大矩阵相乘需要反复存取中间结果,而神经网络层数众多,多次迭代会令数据搬运代价急剧放大。“看到统计数据后我们意识到,AI运算约70%到75%的能耗都浪费在数据搬运,而不是实际计算上。”为此,Ambient决定同时解决两个问题:把计算搬进内存,免掉数据搬运的能耗;以及设计专门针对乘累加运算优化的电路。
CubicCore与SenseMesh:模拟电路加动态功耗管理
这类创新从电路与架构层面开始:CubicCore AI核心是乘累加运算的执行场所,利用模拟电路本身的物理特性完成乘法与加法。SoC层面还包括自研ADC、名为SenseMesh的硬件传感器融合层、专有动态电压/频率缩放(DVFS)技术,以及上层软件栈。最终结果据称是PPA(功耗、性能与面积)指标显著改善:相同面积内能实现更高AI性能、功耗至少降低100倍,同时保持100%可编程。
Singhania用人体生物学做了一个类比:“如果把CubicCore比作负责全部算力的‘大脑’,SenseMesh就是‘神经系统’。”SenseMesh本质上是一种DVFS技术,开发者可让AI核心运行在低功耗“潜意识模式”,或按需推入高频率、高电压的“涡轮加速模式”。关键的是,这一切在运行时动态完成,无需复位芯片。具体来说,当传感器数据显示环境没什么变化时,AI核心处于极低功耗状态;一旦发现异常,频率就会及时提升,让更复杂的算法快速识别事件,然后再回落至“潜意识模式”。整个过程连续无中断。
Model Forge:让开发者像用ARM芯片一样编程
Ambient还提供了面向开发者的软件层Model Forge,位于其指令集之上。工程师无需关心底层机制,可以用在ARM或RISC-V芯片组上的习惯方式编写应用和AI算法;Model Forge在后台与SenseMesh、CubicCore无缝集成。使用者只需把TensorFlow或Keras中训练好的模型投入编译器,图分解、内存映射、寄存器设置等均由编译器处理。
DigAn:从GPX10到GPX64再到云级GPX2000
GPX10所采用的DigAn是一种专利模拟存内计算架构,在电路层把存储与计算合二为一,将模拟乘累加单元直接嵌入SRAM。Singhania表示,DigAn也是未来整个处理器路线图的底层技术平台。“基于DigAn技术的AI核心天然可扩展,这就是我们称其为CubicCore的原因——小的立方体可以堆叠成大立方体。”GPX10目前已投入生产,规划中的下一款产品GPX64面向计算机视觉和自然语言处理应用。此外,Ambient已构建出仿真版云服务器级处理器GPX2000,与NVIDIA的大型服务器级芯片H200相比,其PPA有显著改善。
谈到GPX10相对标准32位微控制器100倍提升的意义时,Singhania说,对于一直围绕传统MCU/MPU做设计的工程师而言,GPX10两者兼得:在更小或相同面积内获得高得多的AI性能,同时把功耗大幅降下来。这样不仅能增加AI功能,还能在功耗预算内运行更复杂、延迟更低、精度更高的算法。唯一的小取舍是,Ambient进入行业较晚,其软件工具链仍在成熟过程中,与数十年积累的半导体巨头相比还有差距,但会持续改进。“相同面积内用大幅降低的功耗换取更高AI性能,这个理由已经足够有说服力。”
别只看TOPS,还要看有效TOPS
关于AI加速器性能衡量,Ambient的观点是,架构优劣不由TOPS绝对值决定,而取决于数据在内存中的流动效率。Singhania以“TOPS”和“等效TOPS”两个概念解释。所谓等效TOPS,要考虑到GPU或处理器理论上因并行计算能提供很高AI性能,但计算核心很多时候只是在等待内存派发数据,因此TOPS数字几乎只是理论值。Ambient发布的数据均为有效TOPS,即处理器实际可交付、可以演示的性能。
“物理AI”不能在依赖云端的架构上扩展
Singhania说,“物理AI”指需要实时解读并与现实世界交互的AI应用,如无人机、机器人以及部分工业AI。此类应用对延迟极其敏感,环境变化和决策都在瞬间发生。任何经过网关或互联网的云连接都无法做到绝对可靠,哪怕只是几毫秒或几秒的网络波动,也可能让应用失灵甚至停机。若连接彻底消失,后果更难想象。未来的物理AI必须在数据源头——也就是执行动作的边缘端完成计算,从而实现对环境刺激的近零延迟响应。
功耗论证同样适用于便携的电池或太阳能供电物理AI系统。无人机多出几分钟续航就可能改变整个应用价值;人形机器人若多出几小时运行时间,价值主张也会完全不同。
即便回到云端,数据中心的扩张已带来不可持续的电耗。Singhania指出,AI训练尤其耗电,数据中心的电费往往达到数亿美元;高能耗推高温度,又需要液冷等专门基础设施。如果能让计算在更低能耗水平完成,这些问题有望一并化解。“我们的架构在未来也会很好地延伸到云端。”
首发市场:电池供电的边缘AI设备
GPX10瞄准的是电池供电边缘AI市场,例如必须有本机AI但功耗预算极小的产品:可穿戴设备、智能戒指、需要做实时人脸识别开门的智能门铃摄像头、智能运动器材、电池供电摄像机,以及工业自动化的预测性维护模块。Singhania说,上述领域已能看到最初的“设计赢单”。主要类别包括可穿戴设备、工业、智能家居安防、医疗设备、农业、畜牧业以及新兴的智能运动器材。
以当前热门的智能健身戒指为例,Singhania透露,公司正与全球若干大型OEM厂商合作,目前仍处开发阶段。他们很快发现,很多带安全或医疗性质的算法可以放到设备端。比如心律失常或不规则心跳检测,不像步数那样可以延迟处理,它必须完全实时,因为一旦断了云端连接或手机蓝牙,就可能危及生命。这类近乎医学异常检测的算法放在设备端后,就能彻底摆脱对手机和云端的依赖。Singhania表示,部分功能已经智能戒指中实现。
在医疗健康方面,Ambient看到了一些早期进展。可穿戴听诊器是一个典型例子:它如同一片粘性贴片,贴在患者胸口,内置麦克风阵列捕捉胸腔深处的呼吸活动,再用算法识别呼吸模式异常。医生可通过智能手机查看全部数据,若出现严重异常,警报也会直接推送给医生。Singhania特别强调,要区分“医疗”和“健康”两类应用。Ambient聚焦于健康类而非医疗级应用,因为后者的可靠性与精度标准会完全不同。
在边缘算好,才能让用户安心
以预测性维护为例,Singhania提到,有客户的终端用户来自石化和水泥行业,非常不希望把设备每一秒的数据都传到云端。现在,通过环境科学家的芯片,所有计算可以在一个由电池供电、24/7运行的边缘小模块上完成,模块直接给出磨损迹象、维护告警和故障根因。告警发送给操作员,操作员可选择只把异常推理结果放到云上,而不必传输每一秒的数据流。
支持多种神经网络,是为用户保留软件差异化空间
GPX10支持非常广泛的神经网络架构。Singhania表示,这是为了避免把用户锁死在特定网络集合上。“如果未来有10家公司都用我们的芯片,只要他们各自的软件够独特,用同一颗芯片也没关系。反之,一开始只向开发者开放一两种神经网络,总有一天大家跑的都是同一套算法,差异化也就消失了。”所有神经网络归根结底都在执行MAC运算,GPX10内置了灵活的乘累加/矩阵乘法引擎,因此网络图层面的优化与映射可以交由编译器完成。Ambient会不断根据用户反馈扩充对更多网络的支持。
SDK中的AI编译器是生态关键
Ambient的SDK包含自研AI编译器,可把PyTorch和TensorFlow模型编译到GPX平台。Singhania认为这一软件层对推进采用至关重要:没有它,用户就必须学习每家特定架构的细枝末节;有了它,开发者无需重新学习,可以把熟悉的训练工作流迁移到GPX上。
路线图:先攻小市场,再逐步上升
Ambient的处理器路线图从单核GPX1延伸到集成DSP、面向高速视觉的GPX64。公司采取步步为营的策略,首款产品先进入竞争较小的“空白”市场,以独特价值主张立足。边缘AI是目前门槛较低的入口,之后再向更复杂芯片爬升,因为算力规模、市场策略和所需伙伴数量都会随之变化。从边缘空白领域逐步向上,有助于建立忠实客户群与品牌认知,并逐步完善软件工具链。GPX64瞄准的是计算机视觉和自然语言处理,需要与成熟的CUDA类工具链竞争;该芯片目前已在设计中,预计明年第一季度面市。
Singhania还谈到,随着小型语言模型的兴起,设备端语音交互正成为真实需求。GPX64将能运行足够满足电动车语音控制、可穿戴设备、智能眼镜等场景的小型语言模型,让用户无需依赖手机或互联网即可完成操作。工业与重工业里,语音控制还能让工人与危险机器保持距离。他认为,“GPX64让所有基于语音的交互都成为可能。”
受访者简介
Saharsh Singhania是Ambient Scientific的产品负责人,兼具人工智能、嵌入式系统、云计算和产品战略等交叉领域的丰富经验。他的职业生涯覆盖消费金融科技中的机器学习解决方案、全球云平台的产品战略制定,以及下一代超低功耗边缘AI处理器的商业化。他对芯片架构与大规模AI系统均有深入理解,擅长打通先进技术与客户导向型产品开发之间的链路。目前在Ambient Scientific,他负责产品与营销,重点是通过可编程模拟存内计算架构实现能效出色的常开型AI,应用范围覆盖工业自动化、智能基础设施、医疗健康、可穿戴设备以及其他受功耗约束的嵌入式系统。












