网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

专访陈涛:具身智能需突破底层架构,两年内或难现“GPT式”飞跃

2026-08-06来源:天脉网编辑:瑞雪

在具身智能领域持续升温的讨论中,技术路线与数据困境成为焦点。然而,一个关键问题仍待解答:当前具身模型能否应对物理世界中的突发状况,并在行动失败后自主纠错、持续学习?复旦大学未来信息创新学院教授陈涛在接受专访时指出,主流视觉—语言—动作模型(VLA)过度依赖成功轨迹数据,导致机器人在执行偏差后难以像人类一样调整策略,将失败转化为经验。

陈涛同时担任具身智能企业眸深智能联合创始人,其学术背景横跨新加坡智能机器人实验室、华为新加坡研究中心等机构。他直言,语言模型架构未必适合解决物理世界问题,行业近半年对数据与VLA优化的投入,尚未触及具身大脑的底层架构瓶颈。"两年内很难实现具身模型的‘GPT时刻’,"他表示,"当前模型迭代速度不足以覆盖物理世界的复杂性。"

针对机器人"原生大脑"概念,陈涛解释称,传统预训练模型在端侧执行成功率难以突破80%,真正的进化需依赖机器人通过失败案例反思行为。他以抓取手机为例:主流VLA模型在伸过头后无法自主回缩调整,而人类能通过试错完成动作。"失败数据及其纠正过程对模型训练至关重要,"陈涛团队采用8:1:1的数据配比,在开源数据基础上融入真实场景素材与本体映射,弱化对海量标注数据的依赖。

在世界人工智能大会展示的具身智能应用中,陈涛观察到技术落地与实际需求的差距。他指出,通信延迟、算力不足及训练语料匮乏导致执行效率低下,而真正进入工厂产线的机器人比例不足10%。"泛化能力、成本控制与节拍精准度是三大卡点,"他强调,"机器人需具备应对突发状况的灵活应变能力,同时大脑成本必须降低,否则将拖累整体生产效率。"

大众对具身智能的预期与现实存在显著落差。陈涛以取药任务为例:机器人需完成识别、定位、轨迹规划与机械操作,每个环节均产生耗时。"自媒体视频过度渲染了技术成熟度,"他提醒,"当前机器人仍以预编程或遥控操作为主,自主决策能力尚未突破。"

作为初创企业,眸深智能选择聚焦机器人"动作大脑"开发。其核心壁垒包括动作自净化能力与端侧部署能力。团队提出的空间扩散模型可编辑动作轨迹,并通过轻量化设计使模型适配国产与海外芯片,在降低参数与功耗的同时维持执行效果。"大厂不愿承接的交付工作正是我们的机会,"陈涛透露,"场景方常因头部企业报价高昂而转向合作,这为小团队提供了技术迭代空间。"

眸深智能将落地场景分为"大商业"与"大制造"两类:前者涵盖户外物业、环卫等低精度需求领域,后者聚焦工厂关键工序替代。陈涛强调,场景不仅是商业交付终点,更是研发起点。"模型在实验室中无法暴露所有问题,"他举例,"传感器故障、电机损耗等硬件缺陷需通过实际部署发现。"

对于通用具身大模型的可行性,陈涛认为未来或出现细分场景垂类模型,但需与具体任务深度结合。他特别指出,被行业热捧的"世界模型"概念存在成本过高问题。"连长程视频生成都尚未突破,何谈解决机器人常识动作?"他建议初创企业围绕特定场景打造定制化模型,"让机器人先理解作业环境,再追求‘上知天文’的能力。"