当全球科技巨头还在为“世界模型”的定义争论不休时,IDEA研究院的张磊早已用一套“物体理解”技术,悄悄把谷歌和Meta甩在了身后。在他看来,行业对世界模型的追捧,可能从一开始就走错了方向。
当全球科技巨头还在为“世界模型”的定义争论不休时,IDEA研究院的张磊早已用一套“物体理解”技术,悄悄把谷歌和Meta甩在了身后。在他看来,行业对世界模型的追捧,可能从一开始就走错了方向。

张磊语速不快,但每一个字都像经过精密计算。这位IDEA研究院(粤港澳大湾区数字经济研究院)的计算机视觉与机器人方向负责人,刚刚带领团队在一项名为“物体理解”的基准测试中,力压谷歌、Meta等国际巨头,登顶全球第一。
窗外是深圳湾的璀璨灯火,屋内是屏幕上密密麻麻的技术架构图。张磊指着其中一张图说:“现在很多人谈世界模型,但如果你不以动作作为输入条件,那就不叫世界模型。”
这句话,像
UExJThDJUU0JUI4JTlBJUU1JUFGJUI5JUU0JUI4JTk2JUU3JTk1JThDJUU2JUE4JUExJUU1JTlFJThCJUU3JTlBJTg0JUU4JUJGJUJEJUU2JThEJUE3JTIwYWxpZ258ZW58MXwwfHx8MTc4NjAwNTM0N3ww&ixlib=rb-4.1.0&q=80&w=1080" alt="" style="max-width:100%;border-radius:8px;" loading="lazy">
一把手术刀,精准切开了当前AI领域最热概念的华丽表象。
过去一年,“世界模型”成了AI界最性感的词汇。从英伟达的初创公司到各大实验室,几乎人人都在谈论。但张磊的观察是:绝大多数所谓“世界模型”,本质上仍是“视频生成模型”的变体——输入几帧画面,预测下一帧,仅此而已。
“这不是世界模型。”张磊语气笃定,“世界模型的核心,是理解动作如何改变世界状态。如果模型不知道‘推’这个动作会导致物体位移,不知道‘抓取’需要施加多少力,那它只是在做像素级的概率分布,而不是在理解物理世界。”
在张磊看来,判断一个模型是否配得上“世界模型”之名,标准其实非常简单粗暴:输入是否包含动作(action)。如果输入只有观测(observation),输出只有预测(prediction),那无论视频生成得多流畅,参数规模多庞大,都只是“更高级的插帧工具”。
这种观点,直指当前大模型热潮的软肋。当整个行业沉迷于用海量视频训练模型,试图“涌现”出对世界的理解时,张磊和团队选择了另一条路:从物理本质出发,用结构化的方式教模型理解物体的属性、关系和可交互性。
IDEA研究院在这次夺冠的“物体理解”任务中,做的正是这样一件事。他们不是让模型去看十万小时视频,而是让模型学会回答关于物体的精确问题:这个杯子的材质是什么?如果施加5牛顿的力,它会朝哪个方向移动?这个抽屉的滑动轨迹是怎样的?
“这就像学物理,你不能只靠观察苹果落地就理解万有引力,你需要知道质量、加速度、力之间的关系。”张磊解释道,“物体理解是构建世界模型的原子单位。只有当AI真正理解了一个物体的物理属性、空间位置、可交互方式,它才有可能在更宏观的层面上预测未来。”
这种思路,与业界主流的大规模预训练+微调范式形成鲜明对比。当谷歌的Genie、Meta的V-JEPA还在探索如何从视频中学习时,IDEA已经用更精细的标注+结构化学习,在特定维度上实现了超越。
技术层面,张磊团队采用了结合神经辐射场(NeRF)和隐式物理引擎的方法。他们让模型不仅看到物体的表面,还通过大量仿真交互数据,学习物体的“内力”模型。
# 示意代码:物体物理属性学习框架(简化版)
class ObjectPhysicalModel:
def __init__(self, object_id):
self.object_id = object_id
self.mass = None # 质量
self.friction = None # 摩擦系数
self.elasticity = None # 弹性
self.geometry = None # 几何形状
def predict_interaction(self, action_input):
"""
核心:基于动作输入预测物体状态变化
这是区分"世界模型"与"视频预测"的关键
"""
if self.mass is None:
raise ValueError("未初始化物理属性,无法进行交互预测")
# 使用图神经网络进行动态预测
force_vector = self._encode_action(action_input)
state_change = self._dynamics_model(
self.geometry,
self.mass,
force_vector
)
return state_change
def _encode_action(self, action):
"""将动作编码为物理力向量"""
# 动作 -> 力/力矩 -> 状态变化的映射
return action_to_force(action)
这段代码虽简化,却体现了张磊团队的核心方法论:模型的输入必须包含动作,输出必须是状态变化,而非像素变化。这正是他口中“世界模型”与“视频生成”的本质区别。
在张磊的规划中,物体理解只是第一步。真正的世界模型,需要在机器人、自动驾驶、科学发现等场景中接受检验。
“我们正在将这套物体理解能力迁移到机器人操作任务中。”张磊透露,“想象一下,如果机器人能够准确理解‘拿起这个陶瓷杯’和‘拿起这个塑料杯’在力度上的细微差别,那它的操作精度和安全性将远超现在的方案。”
这意味着,世界模型不应只是“看得懂”世界的旁观者,而应是“能动手”的参与者。张磊的团队正在构建的,是一个从感知到认知再到行动的完整闭环。
“未来的世界模型,一定是在交互中学习的。”他强调,“就像人类婴儿通过不断触摸、抓握、摔打来理解物体一样,AI也需要通过与物理世界的持续互动,建立真正的因果模型。”
这种观点,将世界模型的竞争从“谁的视频生成更流畅”拉回到了“谁的理解更深刻”。当大多数团队还在追求视频生成的视觉效果时,IDEA已经瞄准了物理世界的底层规律。
在张磊的讲述中,我们能感受到一种强烈的战略定力。当中国AI社区被大语言模型的狂热裹挟时,IDEA选择了一条更艰难但可能更扎实的道路。
“我们不能总跟在别人后面做同样的事。”他说,“在物体理解和世界模型这个赛道上,我们有机会定义规则,而不是遵守规则。”
这种自信,源于团队在计算机视觉领域的多年积累,也源于对技术本质的清醒认知。张磊认为,大语言模型的成功经验——大规模数据+大参数模型——并不完全适用于物理世界理解。物理世界的数据不像文本那样可以无限生成,它需要更精细的标注和更深刻的结构化理解。
为此,IDEA构建了大规模仿真环境,让AI在虚拟空间中大量试错学习。这种“虚拟世界先行,现实世界验证”的策略,既解决了数据稀缺问题,又避开了实体机器人昂贵的试错成本。
“我们培养了一个‘物理直觉’极强的模型,”张磊略带自豪,“它可能没看过真实世界的视频,但在仿真环境中,它已经学会了判断物体的稳定性、可抓取性、碰撞行为。当它走进现实时,这种能力可以快速迁移。”
采访接近尾声,张磊对世界模型的未来做了一个大胆预测:真正的世界模型,将在未来五年内出现,但它不会诞生于某个实验室的代码库中,而是诞生于与物理世界的持续对话中。
“当模型能够准确回答‘如果我这样做,世界会怎样变化’时,我们才真正拥有了世界模型。”他说,“而这个答案,不取决于模型的参数规模,而取决于它是否理解了动作与结果之间的因果链条。”
窗外,深圳湾的灯火依旧璀璨。在这座以速度和效率闻名的城市,张磊和他的团队正在进行一场关于“慢思考”的竞赛。他们相信,只有理解了物理世界的底层规律,AI才能从“聪明的鹦鹉”进化为“真正的智能”。
而这一切的起点,正是那句看似简单却振聋发聩的判断:不以动作为输入条件,就不叫世界模型。
雷锋网《对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」》
标签:世界模型, 物体理解, IDEA研究院, 计算机视觉, 具身智能当全球科技巨头还在为“世界模型”的定义争论不休时,IDEA研究院的张磊早已用一套“物体理解”技术,悄悄把谷歌和Meta甩在了身后。在他看来,行业对世界模型的追捧,可能从一开始就走错了方向。
当全球科技巨头还在为“世界模型”的定义争论不休时,IDEA研究院的张磊早已用一套“物体理解”技术,悄悄把谷歌和Meta甩在了身后。在他看来,行业对世界模型的追捧,可能从一开始就走错了方向。

张磊语速不快,但每一个字都像经过精密计算。这位IDEA研究院(粤港澳大湾区数字经济研究院)的计算机视觉与机器人方向负责人,刚刚带领团队在一项名为“物体理解”的基准测试中,力压谷歌、Meta等国际巨头,登顶全球第一。
窗外是深圳湾的璀璨灯火,屋内是屏幕上密密麻麻的技术架构图。张磊指着其中一张图说:“现在很多人谈世界模型,但如果你不以动作作为输入条件,那就不叫世界模型。”
这句话,像
UExJThDJUU0JUI4JTlBJUU1JUFGJUI5JUU0JUI4JTk2JUU3JTk1JThDJUU2JUE4JUExJUU1JTlFJThCJUU3JTlBJTg0JUU4JUJGJUJEJUU2JThEJUE3JTIwYWxpZ258ZW58MXwwfHx8MTc4NjAwNTM0N3ww&ixlib=rb-4.1.0&q=80&w=1080" alt="" style="max-width:100%;border-radius:8px;" loading="lazy">
一把手术刀,精准切开了当前AI领域最热概念的华丽表象。
过去一年,“世界模型”成了AI界最性感的词汇。从英伟达的初创公司到各大实验室,几乎人人都在谈论。但张磊的观察是:绝大多数所谓“世界模型”,本质上仍是“视频生成模型”的变体——输入几帧画面,预测下一帧,仅此而已。
“这不是世界模型。”张磊语气笃定,“世界模型的核心,是理解动作如何改变世界状态。如果模型不知道‘推’这个动作会导致物体位移,不知道‘抓取’需要施加多少力,那它只是在做像素级的概率分布,而不是在理解物理世界。”
在张磊看来,判断一个模型是否配得上“世界模型”之名,标准其实非常简单粗暴:输入是否包含动作(action)。如果输入只有观测(observation),输出只有预测(prediction),那无论视频生成得多流畅,参数规模多庞大,都只是“更高级的插帧工具”。
这种观点,直指当前大模型热潮的软肋。当整个行业沉迷于用海量视频训练模型,试图“涌现”出对世界的理解时,张磊和团队选择了另一条路:从物理本质出发,用结构化的方式教模型理解物体的属性、关系和可交互性。
IDEA研究院在这次夺冠的“物体理解”任务中,做的正是这样一件事。他们不是让模型去看十万小时视频,而是让模型学会回答关于物体的精确问题:这个杯子的材质是什么?如果施加5牛顿的力,它会朝哪个方向移动?这个抽屉的滑动轨迹是怎样的?
“这就像学物理,你不能只靠观察苹果落地就理解万有引力,你需要知道质量、加速度、力之间的关系。”张磊解释道,“物体理解是构建世界模型的原子单位。只有当AI真正理解了一个物体的物理属性、空间位置、可交互方式,它才有可能在更宏观的层面上预测未来。”
这种思路,与业界主流的大规模预训练+微调范式形成鲜明对比。当谷歌的Genie、Meta的V-JEPA还在探索如何从视频中学习时,IDEA已经用更精细的标注+结构化学习,在特定维度上实现了超越。
技术层面,张磊团队采用了结合神经辐射场(NeRF)和隐式物理引擎的方法。他们让模型不仅看到物体的表面,还通过大量仿真交互数据,学习物体的“内力”模型。
# 示意代码:物体物理属性学习框架(简化版)
class ObjectPhysicalModel:
def __init__(self, object_id):
self.object_id = object_id
self.mass = None # 质量
self.friction = None # 摩擦系数
self.elasticity = None # 弹性
self.geometry = None # 几何形状
def predict_interaction(self, action_input):
"""
核心:基于动作输入预测物体状态变化
这是区分"世界模型"与"视频预测"的关键
"""
if self.mass is None:
raise ValueError("未初始化物理属性,无法进行交互预测")
# 使用图神经网络进行动态预测
force_vector = self._encode_action(action_input)
state_change = self._dynamics_model(
self.geometry,
self.mass,
force_vector
)
return state_change
def _encode_action(self, action):
"""将动作编码为物理力向量"""
# 动作 -> 力/力矩 -> 状态变化的映射
return action_to_force(action)
这段代码虽简化,却体现了张磊团队的核心方法论:模型的输入必须包含动作,输出必须是状态变化,而非像素变化。这正是他口中“世界模型”与“视频生成”的本质区别。
在张磊的规划中,物体理解只是第一步。真正的世界模型,需要在机器人、自动驾驶、科学发现等场景中接受检验。
“我们正在将这套物体理解能力迁移到机器人操作任务中。”张磊透露,“想象一下,如果机器人能够准确理解‘拿起这个陶瓷杯’和‘拿起这个塑料杯’在力度上的细微差别,那它的操作精度和安全性将远超现在的方案。”
这意味着,世界模型不应只是“看得懂”世界的旁观者,而应是“能动手”的参与者。张磊的团队正在构建的,是一个从感知到认知再到行动的完整闭环。
“未来的世界模型,一定是在交互中学习的。”他强调,“就像人类婴儿通过不断触摸、抓握、摔打来理解物体一样,AI也需要通过与物理世界的持续互动,建立真正的因果模型。”
这种观点,将世界模型的竞争从“谁的视频生成更流畅”拉回到了“谁的理解更深刻”。当大多数团队还在追求视频生成的视觉效果时,IDEA已经瞄准了物理世界的底层规律。
在张磊的讲述中,我们能感受到一种强烈的战略定力。当中国AI社区被大语言模型的狂热裹挟时,IDEA选择了一条更艰难但可能更扎实的道路。
“我们不能总跟在别人后面做同样的事。”他说,“在物体理解和世界模型这个赛道上,我们有机会定义规则,而不是遵守规则。”
这种自信,源于团队在计算机视觉领域的多年积累,也源于对技术本质的清醒认知。张磊认为,大语言模型的成功经验——大规模数据+大参数模型——并不完全适用于物理世界理解。物理世界的数据不像文本那样可以无限生成,它需要更精细的标注和更深刻的结构化理解。
为此,IDEA构建了大规模仿真环境,让AI在虚拟空间中大量试错学习。这种“虚拟世界先行,现实世界验证”的策略,既解决了数据稀缺问题,又避开了实体机器人昂贵的试错成本。
“我们培养了一个‘物理直觉’极强的模型,”张磊略带自豪,“它可能没看过真实世界的视频,但在仿真环境中,它已经学会了判断物体的稳定性、可抓取性、碰撞行为。当它走进现实时,这种能力可以快速迁移。”
采访接近尾声,张磊对世界模型的未来做了一个大胆预测:真正的世界模型,将在未来五年内出现,但它不会诞生于某个实验室的代码库中,而是诞生于与物理世界的持续对话中。
“当模型能够准确回答‘如果我这样做,世界会怎样变化’时,我们才真正拥有了世界模型。”他说,“而这个答案,不取决于模型的参数规模,而取决于它是否理解了动作与结果之间的因果链条。”
窗外,深圳湾的灯火依旧璀璨。在这座以速度和效率闻名的城市,张磊和他的团队正在进行一场关于“慢思考”的竞赛。他们相信,只有理解了物理世界的底层规律,AI才能从“聪明的鹦鹉”进化为“真正的智能”。
而这一切的起点,正是那句看似简单却振聋发聩的判断:不以动作为输入条件,就不叫世界模型。
这个事件/技术的核心价值在于它推动了一个重要方向的发展。作为从业者/关注者,我们既要看到短期的影响,也要理解其长期意义。
雷锋网《对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」》
原文链接:https://www.leiphone.com/category/academic/wQny8Cer4EJz0RAU.html【开场 Hook(0-5秒)】
当全球科技巨头还在为“世界模型”的定义争论不休时,IDEA研究院的张磊早已用一套“物体理解”技术,悄悄把谷歌和Meta甩在了身后。在他看来,行业对世界模型的追捧,可能从一开始就走错了方向。
【核心内容(5-45秒)】
对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」
(根据文章正文提炼 3-5 个关键点,口语化表达)【结尾引导(45-60秒)】
如果你觉得有用,点赞收藏,评论区告诉我你的看法!
对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」 🔥
当全球科技巨头还在为“世界模型”的定义争论不休时,IDEA研究院的张磊早已用一套“物体理解”技术,悄悄把谷歌和Meta甩在了身后。在他看来,行业对世界模型的追捧,可能从一开始就走错了方向。
💡 关键信息:
#世界模型 #物体理解 #IDEA研究院 #计算机视觉 #具身智能
#科技资讯 #前沿技术
点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。
| 平台 | 状态 | 操作 |
|---|---|---|
| 公众号 | 🔑 待配置密钥 | |
| 知乎 | 📋 手动复制 | |
| 抖音 | 📋 手动复制 | |
| 小红书 | 📋 手动复制 |