视频号
    标题 摘要 内容
    详情
    信息来源:澎湃新闻

            当通用大模型开始理解三维环境、拆解操作任务甚至控制机器人,具身智能公司会不会遭遇“降维打击”?GPT-6 Astra近期发布后,社交媒体上陆续出现用它控制机械臂、灵巧手完成操作任务的视频。这无疑对具身模型、世界模型的创业者提出了挑战,未来伴随着大模型能力的不断提升,它是不是直接可以覆盖其它模型的能力?单独打造具身模型乃至世界模型是不是再无必要?这是很多具身智能、世界模型创业者不得不面对的现实问题。

    在9月10日至12日举行的2026 Inclusion·外滩大会期间,多位相关领域创业者对这一问题作出回应。综合来看,大家觉得现在具身模型的优势尚存,但窗口期有限,也可能只有一两年。


    四位具身创业者对于GPT6对于具身的影响态度不一。

    复杂物理交互仍是具身智能公司的最后阵地

    “Astra确实非常惊艳。”GPT-6 Astra开放后,破壳机器人进行了测试。该公司创始人许华哲在外滩大会开幕式的圆桌对话中透露,测试结果显示,GPT-6的语义和空间泛化能力较强,但物理泛化能力相对较弱。

    过去,视觉语言模型只能让机器人移动到目标附近,随后便开始无效动作;但GPT-6能进一步完成抓取。即使面对筷子这类细小、需要机械臂贴近桌面调整姿态才能抓住的物体,它也能完成拿起、旋转和递送。“它认识桌面上的东西,也会往正确的位置走。”许华哲说。但GPT-6暂时还无法完成使用筷子拨动物体、堆叠盒子、折叠衣服等涉及复杂物理接触的任务。许华哲认为,通用模型已经可以解决一部分“看见什么”、“东西在哪里”、“怎样靠近并抓住”的问题,但不等于真正理解物体如何受力和变化,复杂物理交互仍是具身智能公司的“最后阵地”。

    上海科技大学研究员、助理教授,YesAI实验室负责人、瞬适科技创始人石野在世界模型分论坛的圆桌对话中也表示,GPT-6在三维视觉领域的表现给学术界和产业界带来了明显冲击。过去一些需要长期科研积累和专业训练才能完成的三维任务,现在可能借助GPT-6和少量工具完成。

    具身智能涉及数据、本体、预训练和后训练等多个环节。石野认为,GPT或其他智能体工具可以提高这条链路的效率和自动化程度,但从控制机械臂完成简单任务,到真正像人一样理解物理世界,仍有距离。

    “它更多体现的是工具调用,并不是真的像人一样理解并执行这个过程。”石野将GPT-6形容为一名能力很强的“系统架构师”:它能够拆解任务、组织系统和调用工具,却不等于已经掌握了稳定执行物理任务的能力。

    自变量机器人公司创始人兼首席执行官王潜判断,如果未来OpenAI、Anthropic等通用模型公司进入具身智能,它们同样需要采集物理世界数据,建立仿真和评价系统,并处理硬件问题。“如果还是要做这些事情,它其实只是另外一个具身智能公司。”

    通用模型还面临部署限制。机器人需要实时响应,算力、功耗、延迟和成本必须与创造的价值相匹配。规模庞大的云端模型难以直接以合理的速度和成本部署到机器人上,行业仍需要针对具身任务训练更高效的专业模型。

    在王潜看来,GPT-6带来的积极启示是,大规模预训练依然有效。Astra的表现说明,在机器人数据之外加入通用数据,至少可以给具身模型带来能力增益。具身智能公司不应因此放弃预训练,而应继续建设数据、评价和训练基础设施。


    圆桌论坛“世界模型是AI走向物理世界的新大陆吗?

    上层模型与底层技能或进一步分工

    在创业者看来,通用大语言模型和具身模型、世界模型并非对立关系。

    苏度科技联合创始人兼CEO韩铮认为,未来机器人的上层能力与底层技能可能形成更明确的分工:通用模型负责理解环境、进行抽象推理和拆解任务,底层模型负责抓取、移动、插接等具体操作。

    韩铮表示,具身智能公司与上层模型衔接时,必须同时解决泛化性和高成功率问题。“不能只有一些泛化性,但成功率不高”,否则上层模型规划得再好,也会在实际执行中失效。

    他以团队此前的演示为例:上层模型通过语言交互理解周围环境、物体和抽象指令,再将指令拆解成操作步骤;要完成整个任务,底层技能必须在对象和环境发生变化后依然可靠。仅仅扩大可以处理的对象范围,却不能稳定完成动作,仍会导致任务失败。

    忆生科技联合创始人兼CTO杨言超更关注世界模型与GPT-6的协作。他认为,世界模型不仅要具备预测和理解能力,还要形成记忆,并基于记忆持续学习新任务。GPT-6已经能够实现世界模型的一些重要功能;如果世界模型能够调用GPT-6完成其擅长的任务,并在这一过程中形成记忆、持续强化自身,就可能更接近具备预测、理解、记忆和持续学习能力的物理智能体。

    许华哲设想,未来或许可以把具身模型接入类似Codex或其他智能体运行环境,将通用模型与机器人的专业能力串联起来。

    创业公司的窗口期或只有一到两年

    但创业者们的压力明显是增加了。

    极佳视界联合创始人、首席科学家朱政认为,GPT-6以及语言模型公司的进展,给具身智能和世界模型行业带来的“启发和震撼非常直接”。

    过去,大型基础模型团队通常将语言模型和多模态模型分为两条路线,现在两者正出现合流趋势。如果大型模型公司进一步组建具身智能或世界模型团队,部分相关能力可能被纳入通用模型体系。朱政认为,语言模型公司拥有人才和资源优势,进入具身智能或世界模型领域并不存在太大的能力鸿沟。

    他判断,单纯留给纯世界模型公司或者具身智能公司的时间窗口不会很长,必须在短暂的一到两年之内兑现大众对它们的期望。

    上海蚂蚁灵波科技有限公司首席科学家沈宇军的态度则相对乐观。他指出,现在行业内很多声音集中在,具身要么会被现在的数字世界模型“降维打击”,要么只需积累一批物理世界数据、复刻通用模型的训练方式,就能训练出具身模型,“好像攒一波物理世界的数据,按照之前的训练方式,就可以训出一个具身的模型。”在他看来,这类声音并不成立。

    他觉得现在行业低估了具身智能作为复杂系统工程的难度,却可能高估了训练模型技术本身。模型能力只是机器人落地的一环,实际应用还需要综合考虑硬件、系统以及商业逻辑。

    沈宇军判断,具身智能可能沿着与数字模型相似的发展模式前进,但一定不会走相同的技术路线。这种影响也可能是双向的。沈宇军认为,如果机器人进入家庭、工厂和公共空间,它们将持续产生关于物理世界的新数据。这些数据可能成为下一代通用大模型的训练语料,使云端模型不再只是被动回答问题,而能根据现实环境的变化调整与人的交互方式。

    澎湃新闻记者 喻琰