
算力底座,AI走向物理世界的关键一跃
【摘要】AI最热闹的地方在机房,但真正决定产业落地的,往往是机房外的物理世界。
大模型负责让AI变聪明,算力中心负责把智能训练出来,但当AI进入路口、门店、家庭和机器人,问题就变成了:谁来让它在弱网、低功耗、低成本和高可靠的现场里稳定工作。
爱芯元智提供了一个由边缘算力、感知能力、工具链和开发者生态共同构成新底座。物理AI需要更多综合能力强的基础设施建设。
以下为正文:
过去两年,AI最热闹的地方是机房。
一座座智算中心被点亮,GPU集群连成新的基础设施,大模型在里面训练、压缩、推理,最后把回答吐到手机和电脑屏幕上。这个阶段的AI比的是云端,谁的模型更大、上下文更长、Token更便宜,谁就足够耀眼。
但还有一些麻烦的事情,往往不发生在屏幕上,也等不及云端处理。
比如路口摄像头在雨夜里遇到强光,仓储机器人在转弯处突然碰到人,这些场景等不及云端返回,有更多的噪声、时延和成本。
这就是AI走向物理世界时遇到的第一堵墙。
大模型、算力中心、具身智能当然是今天AI产业最重要的三个关键词。它们其实分属不同位置:算力中心像模型工厂,大模型提供认知能力,具身智能代表最终的行动场景。
三者之间还缺一层把云端训练出来的智能,稳定送到具体设备里的基础设施。这个基础设施,就是物理AI的算力底座。
6月底,爱芯元智在深圳举办AXera Edge-Day,主题是"构筑物理AI算力底座,打通边缘AI商业闭环"。从过去几年AI落地的曲折路径看,它其实也是在回答一个现实问题:当AI离开机房以后,谁来负责最后那几十毫秒和那一次必须准确的动作?
01 机房里的火,现场里的冷
AI产业先经历了一场“上云”。
模型要变聪明,需要数据、参数、训练和推理,以及高速网络和海量电力。过去几年,算力中心之所以成为地方政府、云厂商和大模型公司的共同焦点,原因也在这里:智能先要被训练出来。
但AI一旦走到物理世界,问题就变了。
Google DeepMind做RT-2时,想解决的是一个很具体的问题:怎么把视觉、语言和机器人动作连起来;此后Open X-Embodiment把来自22种机器人形态、500多项技能、超过100万段episode的数据聚在一起,背后也是为了让机器人学会迁移;英伟达解释Physical AI时,把它定义为让摄像头、机器人、自动驾驶汽车等自主系统感知、理解、推理并在物理世界执行复杂动作。
这些思路背后的逻辑非常朴素。云端可以训练世界模型,却不能替每一台设备承担所有即时判断。
所以物理AI不是反对云端算力,而是在云端之外重新分工。云端负责把模型训出来,边缘负责把模型用起来,前者追求智能上限,后者关心现场约束。图像链路、NPU架构、编译器、SDK、模型适配,任何一环能力都要同时补齐。
这条路线,是爱芯元智近几年的主战场。
2019年公司成立时,官网给自己的定位是做"AI感知与边缘计算芯片"。那时大模型浪潮还没有真正爆发,边缘侧的主战场也更多是智慧城市、智能交通和机器视觉。
但物理AI后来要解决的第一个问题,恰恰就是感知。
2020年5月,爱芯元智第一代自研芯片AX630A完成流片;同年8月,AX630A上线,并已搭载AXProton AI-ISP技术。到2021年AX630A进入华东市场,2022年AX620A进入华东、华南市场并探索夜视摄像机品类时,AI-ISP已经成为了爱芯元智的优势。
AI-ISP的能力意味着先精准识别现实世界并不那么干净的数据集,再让模型做判断,这本质上是在给物理AI打底。
第二条线是NPU。爱芯元智的AXNeutron并不是到大模型时代才出现的东西。AXNeutron V1在2019年聚焦CNN,2021年的V3开始原生支持BEV和Transformer,2023年的V5进一步面向Transformer、BEV、大模型和智能驾驶做优化;到2024年7月,AXNeutron AI处理器在世界人工智能大会正式发布;2025年的Neutron V7开始面向Physical AI应用,并走向统一推理和自训练架构。
爱芯元智选择了一条更工程化的路,把模型尽可能高效地搬到端侧和边缘。
本次Edge-Day上的Pulsar2 6.0已经适配全系列芯片,并优化Qwen、MiniCPM等主流端侧大模型推理。AX8850和AX8910一个偏感知,一个偏边缘推理和运控,正好对应物理AI从眼睛到小脑的分工。
所以,才有了爱芯元智联合创始人、副总裁刘建伟在这次AXera Edge-Day开场里的预判,"AI算力正从云端向物理世界加速下沉,算力的核心使命正在从生成Token转变为驱动物理世界"。
02 先把世界看清楚
很多人第一次接触边缘AI,会低估"看清楚"这件事。
在城市和工业现场,机器看到的是雨水、逆光、抖动镜头、遮挡的人等。一个视觉算法在实验室里识别率再高,到了夜间路口也可能被车灯打花;巡检模型换到各种各样的真实门店会遇到不同突发事件的问题。
因此,模型只是其中一环,前面还有传感器和ISP,后面还有部署和维护。
从这个角度回看爱芯元智早期的路径,会更感觉到这家公司的底层铺垫之早。
公开资料显示,第一代AX630A在9个月内完成流片,随后进入智慧城市和交通场景;AX620A后来进入华东、华南市场,并探索夜视摄像机等应用;到AX650N、AX630C,再到2025年发布AX8850,路线逐渐从让机器看见走到让机器理解和处理更复杂任务。
这个过程是给物理AI打地基,也更贴近物理世界的入口。
以本次AXera Edge-Day为例,会议场景,广和通把降噪、VAD、声纹识别、ASR和LLM纠错放到AX8850平台上,解决的是会议机在低时延、离线和隐私约束下能不能持续可用。底层逻辑一样,都是把原始信号先处理干净,再让模型在本地完成理解和修正。
家庭场景,Frigate NVR把家庭视觉从目标检测推到语义搜索和本地对话Agent,家庭摄像头不缺录像,缺的是低成本、低隐私风险的本地理解能力。它解决的是家庭场景里"看到找不到、录下读不懂"的老问题。
门店场景,帷幄布局门店里的VLM巡检,本质上是用摄像头理解经营现场。摄像头的角色已经不只是记录客流,而是进入货架、动线、商品和转化这些经营环节。它意味着视觉AI开始进入经营决策。
这些案例里面,没有哪个芯片是万能的,说明物理AI的麻烦非常分散。语音有噪声,家庭视觉有隐私,门店巡检有运维。真正需要被平台化的,是把算法变成产品、走进场景的过程。
芯片只是开头,真正难的是让这些能力以工程方式被重复调用。
03 机器人需要一颗小脑
具身智能很容易让人兴奋,也很容易让人误会。
像不像人、能不能跑、手指灵不灵巧是操作性问题,产业里的人还应该问另外几个问题:能不能稳定干活,能不能换一个场景,坏了谁来修,成本能不能降到客户愿意买。
大模型可以做机器人的“大脑”,算力中心可以做训练和仿真,VLA模型可以把视觉、语言和动作统一到一个框架里。但一台真实机器人身上,还需要更贴身的“小脑”,它要处理双目视觉、运动控制、安全策略,还要在毫秒级闭环里对环境变化做反应。
没有这颗“小脑”,再聪明的大脑也容易悬在空中。
爱芯元智在Edge-Day上把具身智能拆成“大脑-小脑-本体”三层,相当于把机器人产业里最难规模化的部分拆成了更具体的算力问题。
AX8910面向双目纯视觉等低功耗感知,AX8850对应更高算力的边缘推理和运控需求,能够在机器人真正落地时补齐现场所缺的算力。
同样的逻辑,也能解释开发者生态为什么重要。
本次会议上还出现了M5Stack、Frigate NVR和矽速科技,代表的正是三类不同角色。
M5Stack是开发者硬件入口,把AX630C、AX8850做成模块化开发板、M.2算力卡和AI Pyramid套件,让开发者更容易把端侧模型放进具体设备;Frigate NVR代表开源应用生态,基于AX8850把家庭视觉从目标检测推进到语义搜索和本地对话Agent;矽速科技则把MaixCAM、NanoKVM、MaixStation分别做成Agent的"眼睛""手脚"和本地"大脑",对应个人AI基建和物理执行能力。
爱芯元智也在Hugging Face、GitHub上开放模型和工具,其平台模型库突破200个、Pulsar2 6.0适配主流端侧大模型,能够辅助后续降低迁移成本。
物理AI要规模化,最终拼的不是单点能力,在物理世界,开发者需要面对大量真实随机的问题,每一个环节都不能缺。
04 尾声
大模型会继续变强,算力中心会继续扩张,具身智能也会继续吸引资本和想象力。但产业真正往前走,还需要跨过细碎的地方。
在AI从云端走向现场的过程中,产业确实需要一类算力底座,既懂视觉输入,又懂端侧推理,还要把工具链、模型库和开发者生态接起来。
爱芯元智过去几年从AI-ISP到NPU、从视觉芯片到边缘计算、从单点产品到开源生态的路径,正好踩在这条产业迁移线上。
物理AI是让AI接受物理世界的检验。它要求智能不只会回答,还要会感知;不只会生成,还要能行动;不只在机房里成立,还要在弱网、低功耗、低成本和高可靠的现场里成立。
云端训练出来的智能,需要被送到这些不完美但真实的现场。这是AI算力底座真正要解决的问题。
