(来源:OpenCV与AI深度学习)
过去一年,从VLA、机器人Agent,到世界模型、强化学习与大模型融合,具身智能相关的工作正在快速增加。
相比起已经卷上天的CV、NLP,具身智能目前仍处于快速探索阶段,很多关键问题还没有得到解决,这也意味着,对于论文er来说,这方向依然存在大量创新空间。
本文整理了CVPR26、ICLR26、ICML26、NeurIPS25、AAAI26、ECCV26、ICRA26、IROS26 等12大CCF A/B类顶会中的150篇具身智能最新工作,覆盖了当前最值得关注的研究热点。
可以说,如果你想快速了解最新技术路线,了解今年大家在追什么,哪些思路还没人碰,你的选题gap在哪里,那这份合集将会是一个非常好的切入口!鹅湖

免费获取全部论文+开源代码
部分顶会精选论文简析:
【IROS 2026】Thinker: A vision-language foundation model for embodied intelligence
方法:面向具身智能机器人场景构建四类专属多模态数据集,并设计融合视频与末帧联合输入的两阶段分层训练方案,打造Thinker具身视觉语言基座模型,解决通用大模型混淆第一/第三人称、视频时序推理薄弱的机器人感知规划痛点。

创新点:
构建四类机器人专属大规模多模态数据集,覆盖视觉定位、第一视角时序推理、机械臂操控、工业长时序任务,补齐通用VLM缺少具身机器人视角训练数据的短板。
提出视频+末帧联合输入的时序增强方案,解决现有视觉语言模型混淆第三人称/机器人第一视角、丢失视频末尾关键信息的缺陷,大幅提升时序与空间推理能力。
设计两阶段分层训练框架,先学习通用具身感知与推理基础能力,再针对工业操控任务微调对齐,在Robovqa、Egoplan-bench2两大机器人规划基准上达到SOTA性能。

研究价值:专为机器人具身智能打造的Think视觉语言基座搭配配套工业与第一视角专用数据集,弥补通用多模态模型时空与自中心感知短板,在两大机器人规划基准取得SOTA,为家用、工业机器人长时序任务规划提供高性能多模态基础模型。
【ICLR 2026】Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments
方法:面向动态环境下大模型驱动的具身智能体,提出TMoW测试时混合世界模型框架,通过多粒度原型路由、在线原型微调与少样本蒸馏扩充世界模型三大机制,解决传统MoE路由固化、具身智能难以自适应未知场景的问题。

创新点:
针对具身智能体提出TMoW测试时混合世界模型框架,打破传统MoE训练后路由固定的局限,可在推理阶段动态调配世界模型,无需全局重训即可适配未知动态环境。
设计多粒度原型路由机制,从物体局部到全局场景分层提取环境表征,依据相似度动态加权融合对应世界模型,充分复用跨域共享环境知识。
提出两类适配具身任务的自适应策略:无样本在线原型微调实现零-shot环境适配,少样本蒸馏扩充策略高效生成全新领域世界模型,持续拓展智能体任务能力。

研究价值:TMoW为动态场景下大语言模型驱动的具身智能体提供推理阶段可自适应的模块化世界模型解决方案,大幅提升机器人在未见仿真与真实操控场景下的任务成功率,降低跨域适配的训练成本。



400-886-5570




