Awesome Embodied Robotics and Agent
This is a curated list of "Embodied AI or robot with Large Language Models" research. Watch this repository for the latest updates! 🔥
A Survey on Efficient Vision-Language-Action Models[arXiv 2025.10] [Github] [Project Page] Zhaoshu Yu1, Bo Wang1, Pengpeng Zeng1, Haonan Zhang1, Ji Zhang1, Lianli Gao3,…
A Survey on Vision-Language-Action Models for Embodied AI[arXiv 2024.03] The Chinese University of Hong Kong, Huawei Noah’s Ark Lab
Large Multimodal Agents: A Survey[arXiv 2024.02] [Github] Junlin Xie♣♡ Zhihong Chen♣♡ Ruifei Zhang♣♡ Xiang Wan♣ Guanbin Li♠ ♡The Chinese University of…
A Survey on Self-Evolution of Large Language Models[arXiv 2024.01] Key Lab of HCST (PKU), MOE; School of Computer Science, Peking University, Alibaba Group, Nanyang…
Agent AI: Surveying the Horizons of Multimodal Interaction[arXiv 2024.01] Stanford University, Microsoft Research, Redmond, University of California, Los Angeles, University of…
Igniting Language Intelligence: The Hitchhiker’s Guide From Chain-of-Thought Reasoning to Language Agents[arXiv 2023.11] Shanghai Jiao Tong University, Amazon Web Services, Yale University
The Rise and Potential of Large Language Model Based Agents: A Survey[arXiv 2023.09] Fudan NLP Group, miHoYo Inc
A Survey on LLM-based Autonomous Agents[arXiv 2023,08] Gaoling School of Artificial Intelligence, Renmin University of China
ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning[arXiv 2026] [Github][Project page] AMAP CV Lab, Alibaba Group
D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI[ICLR 2026] [Github][Project page][HuggingFace🤗] Stanford University, Seoul National University, MAUM.AI
Robotic Control via Embodied Chain-of-Thought Reasoning[CoRL 2024] [Github][Project page][HuggingFace🤗] Michał Zawalski∗1,2, William Chen∗1, Karl Pertsch1,3 Oier Mees1,…
π0.5: a VLA with Open-World Generalization[arXiv 2025.04] [Project page] Physical Intelligence
π0: A Vision-Language-Action Flow Model for General Robot Control[arXiv 2024.10] [Project page] Physical Intelligence
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models[arXiv 2025.02] [Project page] Physical Intelligence
OpenVLA: An Open-Source Vision-Language-Action Model[arXiv 2024.01] [Github][Project page][HuggingFace🤗] Stanford University, UC Berkeley, Toyota Research Institute,…
FAST: Efficient Action Tokenization for Vision-Language-Action Models[arXiv 2025.01] [Project page][HuggingFace🤗] Physical Intelligence
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control[arXiv 2024.07] [Project Page] Google Deepmind
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks[arXiv 2025.03] [Github] [Project Page] [HuggingFace🤗] Zhejiang University; Institute of Software, Chinese Academy of…
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models[IROS 2025] [Project page] Kui Wu1, Shuhang Xu2, Hao Chen3, Churan Wang4, Zhoujun Li1, Yizhou Wang4, Fangwei Zhong2…
Hierarchical Instruction-aware Embodied Visual Tracking[arXiv 2025] [Project page] Kui Wu1, Hao Chen2, Churan Wang3, Fakhri Karray4, Zhoujun Li1, Yizhou Wang3, Fangwei…
AdaTracker: Learning Adaptive In-Context Policy for Cross-Embodiment Active Visual Tracking[IEEE RA-L 2026] Kui Wu1, Hao Chen2, Jinzhu Han3, Haijun Liu4, Churan Wang5, Yizhou Wang6, Zhoujun Li1, Si Liu1,…
Meta-Control: Automatic Model-based Control System Synthesis for Heterogeneous Robot Skills[CoRL 2024] [Project page] Tianhao Wei1*, Liqian Ma12*, Rui Chen1, Weiye Zhao1, Changliu Liu1 1Carnegie Mellon…
AGENTGYM: Evolving Large Language Model-based Agents across Diverse Environments[arXiv 2024.06] [Github] [Project page] Fudan NLP Lab & Fudan Vision and Learning Lab
Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models[arXiv 2024.06] [Github] Fangzhi Xu♢♡, Qiushi Sun2, ♡, Kanzhi Cheng1, Jun Liu♢, Yu Qiao♡, Zhiyong Wu♡ ♢Xi’an Jiaotong…
Symbolic Learning Enables Self-Evolving Agents[arXiv 2024.06] [Github] Wangchunshu Zhou, Yixin Ou, Shengwei Ding, Long Li, Jialong Wu, Tiannan Wang, Jiamin Chen,…
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration[arXiv 2024] [Github] Junyang Wang1, Haiyang Xu2, Haitao Jia1, Xi Zhang2, Ming Yan2, Weizhou Shen2, Ji Zhang2, Fei…
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model[CVPR 2024] [Github] Lirui Zhao1,2 Yue Yang2,4 Kaipeng Zhang2 Wenqi Shao2, Yuxin Zhang1, Yu Qiao2, Ping Luo2,3…
MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework[ICLR 2024 (oral)] DeepWisdom, AI Initiative, King Abdullah University of Science and Technology, Xiamen University,…
AppAgent: Multimodal Agents as Smartphone Users[Project page] [Github] Chi Zhang∗ ZhaoYang∗ JiaxuanLiu∗ YuchengHan XinChen Zebiao Huang BinFu GangYu† Tencent
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents[NeurIPS 2025] [Project Page] [Github] Kangrui Wang, Pingyue Zhang, Zihan Wang, Yaning Gao, Linjie Li, Qineng Wang,…
KALM: Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts[NeurIPS 2024] [Project Page] Jing-Cheng Pang, Si-Hang Yang, Kaiyuan Li, Jiaji Zhang, Xiong-Hui Chen, Nan Tang, Yang…
Robust agents learn causal world models[ICLR 2024] Jonathan Richens*, TomEveritt Google DeepMind
Embodied Multi-Modal Agent trained by an LLM from a Parallel TextWorld[CVPR 2024] [Github] Yijun Yang154, Tianyi Zhou2, Kanxue Li3, Dapeng Tao3, Lvsong Li4, Li Shen4, Xiaodong He4, Jing…
Leveraging Pre-trained Large Language Models to Construct and Utilize World Models for Model-based Task Planning[NeurIPS 2023] [Project Page][Github] Lin_Guan1, Karthik Valmeekam1, Sarath Sreedharan2, Subbarao Kambhampati1 1School…
Eureka: Human-Level Reward Design via Coding Large Language Models[NeurIPS 2023 Workshop ALOE Spotlight] [Project page] [Github] Jason Ma1,2, William Liang2, Guanzhi Wang1,3, De-An…
RLAdapter: Bridging Large Language Models to Reinforcement Learning in Open Worlds[arXiv 2023]
Can Language Agents Be Alternatives to PPO? A Preliminary Empirical Study on OpenAI Gym[arXiv 2023]
RoboGPT: An intelligent agent of making embodied long-term decisions for daily instruction tasks[arXiv 2023]
Aligning Agents like Large Language Models[arXiv 2023]
AMAGO: Scalable In-Context Reinforcement Learning for Adaptive Agents[ICLR 2024 spotlight]
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models[arXiv 2023]
Text2Reward: Dense Reward Generation with Language Models for Reinforcement Learning[ICLR 2024 spotlight]
Leveraging Large Language Models for Optimised Coordination in Textual Multi-Agent Reinforcement Learning[arXiv 2023]
Online Continual Learning for Interactive Instruction Following Agents[ICLR 2024]
ADAPTER-RL: Adaptation of Any Agent using Reinforcement Learning[arXiv 2023]
Language Reward Modulation for Pretraining Reinforcement Learning[arXiv 2023]
Informing Reinforcement Learning Agents by Grounding Natural Language to Markov Decision Processes[arXiv 2023]
Learning to Model the World with Language[arXiv 2023]
MAMBA: an Effective World Model Approach for Meta-Reinforcement Learning[ICLR 2024]
Language Reward Modulation for Pretraining Reinforcement Learning[arXiv 2023] [Github] Ademi Adeniji, Amber Xie, Carmelo Sferrazza, Younggyo Seo, Stephen James, Pieter Abbeel 1UC…
Guiding Pretraining in Reinforcement Learning with Large Language Models[ICML 2023] Yuqing Du1*, Olivia Watkins1*, Zihan Wang2, Cedric Colas ´3,4, Trevor Darrell1, Pieter Abbeel1, Abhishek…
Planning with the Views via Scene Self-Exploration[arXiv 2026.05] [Project Page] [Github] Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei,…
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks[arXiv 2026.03] [Project Page] [Github] Ruiying Li*, Yunlang Zhou*, YuYao Zhu, Kylin Chen, Jingyuan Wang, Sukai Wang,…
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics[Arxiv 2025] [Project Page] [Code] Enshen Zhou1,2,, Jingkun An1,, Cheng Chi2,* 1Beihang University, 2Beijing Academy…
RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics[CVPR 2025 (Oral)] [Project Page] [Code] Chan Hee Song1, Valts Blukis2, Jonathan Tremblay2, Stephen Tyree2, Yu Su1,…
Multi-Modal Grounded Planning and Efficient Replanning For Learning Embodied Agents with A Few Examples[AAAI 2025] [Project page] Taewoong Kim, Byeonghwi Kim, Jonghyun Choi† Seoul National University
Pre-emptive Action Revision by Environmental Feedback for Embodied Instruction Following Agents[CoRL 2024] [Project page] Jinyeon Kim1,2,, Cheolhong Min1,, Byeonghwi Kim1, Jonghyun Choi1 1Seoul National University…
Voyager: An Open-Ended Embodied Agent with Large Language Models[NeurIPS 2023 Workshop ALOE Spotlight] [Project page] [Github] Guanzhi Wang1,2, Yuqi Xie3, Yunfan Jiang4, Ajay…
Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization[ACL 2024][Github] Wenqi Zhang, Ke Tang, Hai Wu, Mengna Wang, Yongliang Shen, Guiyang Hou, Zeqi Tan, Peng Li, Yueting…
Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives[ACL 2024] Wenqi Zhang, Yongliang Shen, Linjuan Wu, Qiuying Peng, Jun Wang, Yueting Zhuang, Weiming Lu
MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control[arXiv 2024] [Project Page] Enshen Zhou1,2 Yiran Qin1,3 Zhenfei Yin1,4 Yuzhou Huang3 Ruimao Zhang3 Lu Sheng2 Yu Qiao1…
MP5: A Multi-modal Open-ended Embodied System in Minecraft via Active Perception[CVPR 2024] [Project Page] Yiran Qin1,2 Enshen Zhou1,3 Qichang Liu1,4 Zhenfei Yin1,5 Lu Sheng3 Ruimao Zhang2 Yu Qiao1…
Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection[CVPR 2025] [Project Page] Enshen Zhou1* Qi Su2* Cheng Chi3*; Zhizheng Zhang4 Zhongyuan Wang3 Tiejun Huang2,3 Lu…
RILA: Reflective and Imaginative Language Agent for Zero-Shot Semantic Audio-Visual Navigation[CVPR 2024] Zeyuan Yang1, LIU JIAGENG, Peihao Chen2, Anoop Cherian3, Tim Marks, Jonathan Le Roux4, Chuang Gan5…
Towards General Computer Control: A Multimodal Agent for Red Dead Redemption II as a Case Study[arXiv 2024] [Project Page] [Code] Weihao Tan2, Ziluo Ding1, Wentao Zhang2, Boyu Li1, Bohan Zhou3, Junpeng Yue3,…
See and Think: Embodied Agent in Virtual Environment[arXiv 2023] Zhonghan Zhao1*, Wenhao Chai2*, Xuan Wang1*, Li Boyi1, Shengyu Hao1, Shidong Cao1, Tian Ye3, Jenq-Neng…
Agent Instructs Large Language Models to be General Zero-Shot Reasoners[arXiv 2023] Nicholas Crispino1, Kyle Montgomery1, Fankun Zeng1, Dawn Song2, Chenguang Wang1 1Washington University in…
JARVIS-1: Open-world Multi-task Agents with Memory-Augmented Multimodal Language Models[NeurIPS 2023] [Project Page] Zihao Wang1,2 Shaofei Cai1,2 Anji Liu3 Yonggang Jin4 Jinbing Hou4 Bowei Zhang5 Haowei…
Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents[NeurIPS 2023] Zihao Wang1,2 Shaofei Cai1,2 Guanzhou Chen3 Anji Liu4 Xiaojian Ma4 Yitao Liang1,5† 1Institute for…
CAMEL: Communicative Agents for “Mind” Exploration of Large Scale Language Model Society[NeurIPS 2023] [Github] [Project page] Guohao Li, Hasan Abed Al Kader Hammoud, Hani Itani, Dmitrii Khizbullin, Bernard…
Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents[arXiv 2022] [Github] [Project page] Wenlong Huang1, Pieter Abbeel1, Deepak Pathak2, Igor Mordatch3 1UC Berkeley,…
FILM: Following Instructions in Language with Modular Methods[ICLR 2022] [Github] [Project page] So Yeon Min1, Devendra Singh Chaplot2, Pradeep Ravikumar1, Yonatan Bisk1, Ruslan…
Embodied Task Planning with Large Language Models[arXiv 2023] [Github] [Project page] [Demo] [Huggingface Model] Zhenyu Wu1, Ziwei Wang2,3, Xiuwei Xu2,3, Jiwen Lu2,3,…
SPRING: GPT-4 Out-performs RL Algorithms by Studying Papers and Reasoning[arXiv 2023] Yue Wu1,4* , Shrimai Prabhumoye2 , So Yeon Min1 , Yonatan Bisk1 , Ruslan Salakhutdinov1 ,Amos Azaria3 ,…
PONI: Potential Functions for ObjectGoal Navigation with Interaction-free Learning[CVPR 2022 (Oral)] [Project page] [Github] Santhosh Kumar Ramakrishnan1,2, Devendra Singh Chaplot1, Ziad Al-Halah2…
Moving Forward by Moving Backward: Embedding Action Impact over Action Semantics[ICLR 2023] [Project page] [Github] Kuo-Hao Zeng1, Luca Weihs2, Roozbeh Mottaghi1, Ali Farhadi1 1Paul G. Allen School…
Modeling Dynamic Environments with Scene Graph Memory[ICML 2023] Andrey Kurenkov1, Michael Lingelbach1, Tanmay Agarwal1, Emily Jin1, Chengshu Li1, Ruohan Zhang1, Li…
Reasoning with Language Model is Planning with World Model[arXiv 2023] Shibo Hao∗♣, Yi Gu∗♣, Haodi Ma♢, Joshua Jiahua Hong♣, Zhen Wang♣ ♠, Daisy Zhe Wang♢, Zhiting Hu♣ ♣UC San…
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances[arXiv 2022] Robotics at Google, Everyday Robots
Do Embodied Agents Dream of Pixelated Sheep?: Embodied Decision Making using Language Guided World Modelling[ICML 2023] Kolby Nottingham1 Prithviraj Ammanabrolu2 Alane Suhr2 Yejin Choi3,2 Hannaneh Hajishirzi3,2 Sameer Singh1,2…
Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents[ICCV 2023] [Project page] Byeonghwi Kim Jinyeon Kim Yuyeong Kim1,* Cheolhong Min Jonghyun Choi† Yonsei University…
Inner Monologue: Embodied Reasoning through Planning with Language Models[CoRL 2022] [Project page] Robotics at Google
Language Models Meet World Models: Embodied Experiences Enhance Language Models[arXiv 2023] [Twitter] Jiannan Xiang∗♠, Tianhua Tao∗♠, Yi Gu♠, Tianmin Shu♢, Zirui Wang♠, Zichao Yang♡, Zhiting Hu♠…
AlphaBlock: Embodied Finetuning for Vision-Language Reasoning in Robot Manipulation[arXiv 2023] [Video] Chuhao Jin1* , Wenhui Tan1* , Jiange Yang2* , Bei Liu3† , Ruihua Song1 , Limin Wang2 , Jianlong…
A Persistent Spatial Semantic Representation for High-level Natural Language Instruction Execution[CoRL 2021] [Project page] [Poster] Valts Blukis1,2, Chris Paxton1, Dieter Fox1,3, Animesh Garg1,4, Yoav Artzi2…
LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models[ICCV 2023] [Project page] [Github] Chan Hee Song1, Jiaman Wu1, Clayton Washington1, Brian M. Sadler2, Wei-Lun Chao1,…
Code as Policies: Language Model Programs for Embodied Control[arXiv 2023] [Project page] [Github] [Blog] [Colab] Jacky Liang, Wenlong Huang, Fei Xia, Peng Xu, Karol Hausman, Brian…
3D-LLM: Injecting the 3D World into Large Language Models[arXiv 2023] 1Yining Hong, 2Haoyu Zhen, 3Peihao Chen, 4Shuhong Zheng, 5Yilun Du, 6Zhenfang Chen, 6,7Chuang Gan 1UCLA 2…
VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models[arXiv 2023] [Project page] [Online Demo] Wenlong Huang1, Chen Wang1, Ruohan Zhang1, Yunzhu Li1,2, Jiajun Wu1, Li…
Palm-e: An embodied multimodal language mode[ICML 2023] [Project page] 1Robotics at Google 2TU Berlin 3Google Research
Large Language Models as Commonsense Knowledge for Large-Scale Task Planning[arXiv 2023] Zirui Zhao Wee Sun Lee David Hsu School of Computing National University of Singapore
An Embodied Generalist Agent in 3D World[ICML 2024] Jiangyong Huang, Silong Yong, Xiaojian Ma, Xiongkun Linghu, Puhao Li, Yan Wang, Qing Li, Song-Chun Zhu,…
Communication-Efficient Desire Alignment for Embodied Agent-Human Adaptation[ACL 2026 (Oral)] Yuanfei Wang1, Xinju Huang2, Fangwei Zhong2, Yaodong Yang1, Yizhou Wang1, Yuanpei Chen1, Hao Dong1…
Building Cooperative Embodied Agents Modularly with Large Language Models[ICLR 2024] [Project page] [Github] Hongxin Zhang1*, Weihua Du2*, Jiaming Shan3, Qinhong Zhou1, Yilun Du4, Joshua B.…
War and Peace (WarAgent): Large Language Model-based Multi-Agent Simulation of World Wars[arXiv 2023] Wenyue Hua1*, Lizhou Fan2*, Lingyao Li2, Kai Mei1, Jianchao Ji1, Yingqiang Ge1, Libby Hemphill2, Yongfeng…
MindAgent: Emergent Gaming Interaction[arXiv 2023] Ran Gong*1† Qiuyuan Huang*2‡ Xiaojian Ma*1 Hoi Vo3 Zane Durante†4 Yusuke Noda3 Zilong Zheng5 Song-Chun…
Demonstration-free Autonomous Reinforcement Learning via Implicit and Bidirectional Curriculum[ICML 2023] Jigang Kim*1,2 Daesol Cho*1,2 H. Jin Kim1,3 1Seoul National University, 2Artificial Intelligence Institute…
Adaptive Coordination in Social Embodied Rearrangement[ICML 2023] Andrew Szot1,2 Unnat Jain1 Dhruv Batra1,2 Zsolt Kira2 Ruta Desai1 Akshara Rai1 1Meta AI 2Georgia Institute…
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction[ICRA 2025] Suhwan Choi1 Yongjun Cho1 Minchan Kim1 Jaeyoon Jung1 Myunchul Joe1 Yubeen Park1 Minseo Kim2 Sungwoong Kim2…
IndoorSim-to-OutdoorReal: Learning to Navigate Outdoors without any Outdoor Experience[arXiv 2023] Joanne Truong1,2, April Zitkovich1, Sonia Chernova2, Dhruv Batra2,3, Tingnan Zhang1, Jie Tan1, Wenhao Yu1…
DivScene: Benchmarking LVLMs for Object Navigation with Diverse Scenes and Objects[arXiv 2024] [Project page] Zhaowei Wang1, Hongming Zhang2, Tianqing Fang1,2, Ye Tian3, Yue Yang4, Kaixin Ma2, Xiaoman…
ESC: Exploration with Soft Commonsense Constraints for Zero-shot Object Navigation[ICML 2023] Kaiwen Zhou1, Kaizhi Zheng1, Connor Pryor1, Yilin Shen2, Hongxia Jin2, Lise Getoor1, Xin Eric Wang1…
NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models[arXiv 2023] Gengze Zhou1 Yicong Hong2 Qi Wu1 1The University of Adelaide 2The Australian National University
Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model[arXiv 2023] [Github] Siyuan Huang1,2 Zhengkai Jiang4 Hao Dong3 Yu Qiao2 Peng Gao2 Hongsheng Li5 1Shanghai Jiao Tong…
DetGPT: Detect What You Need via Reasoning[arXiv 2023] Renjie Pi1∗ Jiahui Gao2* Shizhe Diao1∗ Rui Pan1 Hanze Dong1 Jipeng Zhang1 Lewei Yao1 Jianhua Han3 Hang…
LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent[arXiv 2023] Jianing Yang1,, Xuweiyi Chen1,, Shengyi Qian1, Nikhil Madaan, Madhavan Iyengar1, David F. Fouhey1,2,…
3D-VisTA: Pre-trained Transformer for 3D Vision and Text Alignment[ICCV 2023] Ziyu Zhu, Xiaojian Ma, Yixin Chen, Zhidong Deng, Siyuan Huang, Qing Li Beijing Institute for General…
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games[ICCV 2025] [Project page] Peng Chen*, Pi Bu*, Yingyao Wang, Xinyi Wang, Ziming Wang, Jie Guo, Yingxiu Zhao, Qi Zhu,…
Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning[ICML 2023] Thomas Carta1*, Clement Romac ´1,2, Thomas Wolf2, Sylvain Lamprier3, Olivier Sigaud4, Pierre-Yves Oudeyer1…
Learning Affordance Landscapes for Interaction Exploration in 3D Environments[NeurIPS 2020] [Project page] Tushar Nagarajan, Kristen Grauman UT Austin and Facebook AI Research, UT Austin and…
Embodied Question Answering in Photorealistic Environments with Point Cloud Perception[CVPR 2019 (oral)] [Slides] Erik Wijmans1†, Samyak Datta1, Oleksandr Maksymets2†, Abhishek Das1, Georgia Gkioxari2,…
Multi-Target Embodied Question Answering[CVPR 2019] Licheng Yu1, Xinlei Chen3, Georgia Gkioxari3, Mohit Bansal1, Tamara L. Berg1,3, Dhruv Batra2,3 1University…
Neural Modular Control for Embodied Question Answering[CoRL 2018 (Spotlight)] [Project page] [Github] Abhishek Das1,Georgia Gkioxari2, Stefan Lee1, Devi Parikh1,2, Dhruv…
Embodied Question Answering[CVPR 2018 (oral)] [Project page] [Github] Abhishek Das1, Samyak Datta1, Georgia Gkioxari22, Stefan Lee1, Devi…
A Simple Approach for Visual Room Rearrangement: 3D Mapping and Semantic Search[ICLR 2023] 1Brandon Trabucco, 2Gunnar A Sigurdsson, 2Robinson Piramuthu, 2,3Gaurav S. Sukhatme, 1Ruslan Salakhutdinov…
NavSpace: How Intelligent Agents Follow Spatial Intelligence Instructions[ICRA 2026] [Github] Haolin Yang1,2,, Yuxing Long1,2,, Zhuoyuan Yu1,2, Zihan Yang1, Minghan Wang1, Jiapeng Xu1, Yihan…
ReALFRED: An Embodied Instruction Following Benchmark in Photo-Realistic Environments[ECCV 2024] [Project page] Taewoong Kim1*, Cheolhong Min1*, Byeonghwi Kim1, Jinyeon Kim12, Wonje Jeung1, Jonghyun…
SmartPlay: A Benchmark for LLMs as Intelligent Agents[ICLR 2024] [Github] Yue Wu1,2, Xuan Tang1, Tom Mitchell1, Yuanzhi Li1,2 1Carnegie Mellon University, 2Microsoft…
RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation[arXiv 2023] [Project page] [Github] Yufei Wang1, Zhou Xian1, Feng Chen2, Tsun-Hsuan Wang3, Yian Wang4, Katerina…
ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks[CVPR 2020] [Project page] [Github] Mohit Shridhar1 Jesse Thomason1 Daniel Gordon1 Yonatan Bisk1,2,3 Winson Han3…
VIMA: Robot Manipulation with Multimodal Prompts[ICML 2023] [Project page] [Github] [VIMA-Bench] Yunfan Jiang1 Agrim Gupta1† Zichen Zhang2† Guanzhi Wang3,4† Yongqiang…
SQA3D: Situated Question Answering in 3D Scenes[ICLR 2023] [Project page] [Slides] [Github] Xiaojian Ma2 Silong Yong1,3* Zilong Zheng1 Qing Li1 Yitao Liang1,4…
IQA: Visual Question Answering in Interactive Environments[CVPR 2018] [Github] [Demo video (YouTube)] Danie1 Gordon1 Aniruddha Kembhavi2 Mohammad Rastegari2,4 Joseph Redmon1…
Env-QA: A Video Question Answering Benchmark for Comprehensive Understanding of Dynamic Environments[ICCV 2021] [Project page] [Github] Difei Gao1,2, Ruiping Wang1,2,3, Ziyi Bai1,2, Xilin Chen1, 1Key Laboratory of…
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI[ICCV 2025 (Highlight)] [Project page] [Github] Fangwei Zhong1,6, Kui Wu2, Churan Wang3, Hao Chen4, Hai Ci5, Zhoujun…
LEGENT: Open Platform for Embodied Agents[ACL 2024] [Project page] [Github] Tsinghua University
AI2-THOR: An Interactive 3D Environment for Visual AI[arXiv 2022] [Project page] [Github] Allen Institute for AI, University of Washington, Stanford University, Carnegie…
iGibson, a Simulation Environment for Interactive Tasks in Large Realistic Scenes[IROS 2021] [Project page] [Github] Bokui Shen*, Fei Xia* et al.
Habitat: A Platform for Embodied AI Research[ICCV 2019] [Project page] [Habitat-Sim] [Habitat-Lab] [Habitat Challenge] Facebook AI Research, Facebook Reality…
Habitat 2.0: Training Home Assistants to Rearrange their Habitat[NeurIPS 2021] [Project page] Facebook AI Research, Georgia Tech, Intel Research, Simon Fraser University, UC Berkeley
Least-to-Most Prompting Enables Complex Reasoning in Large Language Models[ICLR 2023] Google Research, Brain Team
React: Synergizing reasoning and acting in language models[ICLR 2023] Shunyu Yao1∗, Jeffrey Zhao2, Dian Yu2, Nan Du2, Izhak Shafran2, Karthik Narasimhan1, Yuan Cao2 1Department…
Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models[arXiv 2023] Virginia Tech, Microsoft
Graph of Thoughts: Solving Elaborate Problems with Large Language Models[arXiv 2023] ETH Zurich, Cledar, Warsaw University of Technology
Tree of Thoughts: Deliberate Problem Solving with Large Language Models[arXiv 2023] Shunyu Yao1, Dian Yu2, Jeffrey Zhao2, Izhak Shafran2, Thomas L. Griffiths1, Yuan Cao2, Karthik…
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models[NeurIPS 2022] Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H. Chi, Quoc V. Le,…
MINEDOJO: Building Open-Ended Embodied Agents with Internet-Scale Knowledge[NeurIPS 2022] [Github] [Project page] [Knowledge Base] Linxi Fan1 , Guanzhi Wang2∗ , Yunfan Jiang3* , Ajay Mandlekar1…
Distilling Internet-Scale Vision-Language Models into Embodied Agents[ICML 2023] Theodore Sumers1∗ Kenneth Marino2 Arun Ahuja2 Rob Fergus2 Ishita Dasgupta2
LISA: Reasoning Segmentation via Large Language Model[arXiv 2023] [Github] [Huggingface Models] [Dataset] [Online Demo] TXin Lai1 Zhuotao Tian2 Yukang Chen1 Yanwei Li1…