前不久,杭州一座特殊的“训练场”正式启用。这里没有传统意义上的学生,却设置了30多个应用导向的职业技能训练场景,130多个机器人“学生”在其中反复练习端咖啡、搬货物、做巡检。它的正式名称,是国家人工智能应用中试基地(具身智能)。
2025年8月,国务院《关于深入实施“人工智能+”行动的意见》明确提出布局建设一批国家人工智能应用中试基地。随后,北京、上海、杭州等地一批国家级中试基地相继启动。这些平台集中出现,透露出一个值得关注的变化:AI产业的竞争正在从“谁能做出更强的模型”,延伸到“谁能把模型变成稳定运行的生产系统”。
一个漂亮的Demo,离生产线还有多远
过去几年,我们已经习惯了各种令人惊叹的AI演示。但企业真正关心的问题往往发生在演示结束之后。比如,一家制造企业希望使用大模型辅助设备维修。在实验室里,工程师输入故障现象,模型很快就能给出判断和维修建议,看上去已经相当成熟。真正进入工厂之后,情况却复杂起来:几十种设备来自不同年代和供应商,维修记录格式五花八门,一部分关键经验只存在于老师傅脑子里;企业的ERP、MES、设备管理系统互不相通,一些生产设备甚至与互联网物理隔离。
还有一个更加棘手的问题:如果AI给错建议,导致一条生产线停机两个小时,谁承担损失?这正是AI产业目前面临的一道“死亡谷”。模型在Benchmark上取得高分,至多说明它在特定任务、数据集和评测条件下具备相应能力,还不足以证明它能在真实生产系统中长期、稳定且可追溯地运行。
国家发改委这样解释建设中试基地的原因:当前人工智能应用中,仍然存在“产业需求找不到好的技术、技术成果找不到好的应用场景、优质应用迈不出落地第一步”等问题。中试因此成为连接科技攻关和产业示范、量产推广的中间环节。
“中试”原本是制造业中的老概念。一种新材料在实验室里做出几克,与在生产线上稳定制造几吨,中间隔着工艺、设备、成本和质量控制等重重关卡,因此需要一个介于实验室与大规模生产之间的验证环节。如今,人工智能也开始需要这样的中间地带。AI产业现在缺少的,已经不只是更多令人惊艳的Demo,还包括一种把Demo变成生产力的工程能力。
AI中试,究竟在“试”什么?
传统工业的中试主要解决“放大”问题:实验室里生产一公斤,怎样变成工厂里生产一万吨。AI面对的是另一种放大。当一个模型从实验室进入真实组织,它面对的数据更多、系统更复杂、运行时间更长,犯错的后果也迅速上升。笔者认为,可以把AI中试要跨越的关口概括为“五试”。
第一是试模型。写一封营销邮件时,大模型偶尔会产生幻觉,修改一下即可。如果它开始辅助医生诊断、调节化工设备、判断机器是否停机,人们对错误的容忍度会急剧下降。实验室中的“平均表现不错”,到了工业世界必须进一步变成全天候运行中的稳定表现。极端情况、异常输入、设备变化、模型更新等,都可能让原有准确率突然失效。
第二是试数据。不少企业启动AI项目之后才发现,自己最大的短板并不在模型端。历史数据散落在几十套系统里,字段标准不同,大量记录缺失,一些最重要的工艺知识从未数字化。AI中试看上去是在测试模型,同时也是一次企业的“数据体检”。模型能否进入行业,很大程度上取决于这个行业能否持续提供质量足够高、标准相对统一的数据。
第三是试系统。一家大型制造企业可能已经运行ERP、MES、WMS、SCADA、PLM等几十套甚至上百套软件,AI要真正创造价值,就必须进入这个由软件、数据库、机器和人构成的复杂网络:它有没有权力读取生产数据?能不能修改订单?错误操作如何回滚?模型更新会不会影响旧系统?于是AI落地越来越像系统工程。算法能力只是其中一个零件。
第四是试责任。当AI只负责回答问题时,责任边界相对简单;当智能体开始调用企业系统、生成订单、安排生产甚至自主执行操作,“谁授权”就会成为现实问题。因此,AI中试同时也是一次“责任中试”:企业要在风险可控的环境中决定,究竟愿意把多大的行动权交给机器。
第五是试商业。假设一套AI质检系统开发需要300万元,此后每年还要支付算力、维护和工程师成本,最终只减少了几名质检人员,企业很可能继续采用原来的方案。技术有效与商业成立之间还隔着一张账单。AI应用最终都要回答几个朴素的问题:一次任务到底花多少钱?节省了多少人工?能够多久回本?能不能复制推广?一个AI方案能够在几十家企业稳定部署,才开始成为产品。
从“生产智能”到“验证智能”
理解了这“五试”,才能看清中试基地真正值得关注的地方。
过去几年谈AI基础设施,人们首先想到的是GPU、智算中心和数据中心。它们解决的是一个基础问题:智能在哪里被生产出来。
随着AI进入产业,另一类基础设施开始变得重要:行业数据集、测试场、评测体系、中试基地、系统集成平台。它们处理的问题变成了:生产出来的智能怎样被证明可用。这也解释了为什么中试基地具有一定的公共基础设施属性。
大型科技企业有能力建设算力平台、测试环境、数据体系和工程团队,中小企业很难承担这些固定成本。一家机器人创业公司可能拥有很好的算法,却不可能同时拥有汽车工厂、仓库、商场、医院和电力设施来进行真实环境测试。中试平台所做的事情,是把一部分高昂的试错成本摊薄。
欧盟从2023年起建设四类人工智能“测试与实验设施”(TEFs),覆盖制造、医疗、农业食品以及智慧城市等领域,让企业在真实或接近真实的环境中完成集成、测试和验证。从实验室通往市场之间增加一层“验证基础设施”,正在成为AI产业进入应用阶段之后的共同现象。
我国尤其需要AI中试,与自身的产业结构有关。我国拥有全球规模最大的制造业体系,产业门类齐全,但不同地区、行业和企业之间的数据基础、设备条件与数字化水平差异很大。即便在同一行业,大企业与中小企业的数字化基础也有巨大落差。中国AI产业因而面临特别突出的“长尾应用”难题。如果仅靠每一家企业单独试错,成本过高,也很难形成可复制的标准和解决方案。中试平台的价值,正是把分散的场景需求集中起来,将企业各自承担的试错成本转化为可共享的测试环境、行业标准和解决方案,从而提高AI从头部企业向中小企业扩散的效率。
别让中试基地变成另一个“产业园”
当然,中试基地正在成为政策热点,也意味着另一种风险正在出现。
过去一些地方发展新产业时,很容易形成熟悉的路径:规划一个园区、建设几栋大楼、挂上几块牌子、成立若干联盟,再配上一块展示产业图谱的大屏幕。基础设施迅速铺开,产业能力却未必同步生长。
AI中试尤其要警惕这种倾向。一座真正有价值的中试基地,核心资产未必是楼宇和算力,更可能是那些最难获得的东西:真实生产场景、持续产生的数据、懂行业的工程师、能够验证产品的企业,以及一套允许创新者失败又能控制风险的制度。
因此,判断一个AI中试基地有没有价值,也许只需要追问三个问题:有多少企业愿意把真实业务拿进来测试?有多少项目经过测试之后真正进入了生产系统?又有多少方案离开中试基地之后实现了跨企业复制?这三个数字,比建筑面积和算力规模更值得关注。
AI中试面对的任务十分艰巨:怎样让一种带有不确定性的智能,进入一个高度要求确定性的生产世界。如果智算中心解决的是“AI在哪里算”,高质量数据集回答的是“AI拿什么学”,那么中试基地处理的,就是另一个过去容易被忽视的问题:AI可能在哪里犯错?给AI提供一个可以犯错、能够纠错、代价可控的地方,它才有机会真正进入那些经不起随意犯错的工厂、医院、电网和交通系统。
(作者王翔为复旦大学数字与移动治理实验室研究员)