IROS 2026 Vision-Language Navigation Research Landscape

IROS 2026의 1,933편 전체 프로그램을 검토하면, VLN 관련 논문은 범위를 어떻게 정의하느냐에 따라 다음과 같이 나뉜다.

따라서 넓은 의미에서는 총 65편이 VLN 연구 생태계와 관련된다. 다만 마지막 9편은 엄밀한 의미의 VLN이 아니라 comparison method나 supporting component에 해당한다.

논문 제목과 프로그램 메타데이터는 IROS 2026 공식 Paper & Author Index와 IROS 2026 Paper Explorer를 기준으로 정리하였다.

1. 좁은 의미의 직접 VLN: 20편

자연어 명령, vision-language reasoning, 언어 조건부 waypoint 생성 또는 언어 조건부 navigation action이 명시된 핵심 논문들이다.

# 논문 핵심 축
3990 VL-Nav: A Neuro-Symbolic Approach for Reasoning-Based Vision-Language Navigation Scene graph와 image memory를 이용한 task decomposition, replanning, exploration을 다룬다. 논문
3835 ViTL: Temporal Logic-Guided Zero-Shot Natural Language Navigation Via Vision-Language Models 자연어 명령을 temporal logic으로 grounding한다.
219 View Invariant Learning for Vision-Language Navigation in Continuous Environments 연속 환경에서 viewpoint 변화에 강한 VLN을 다룬다.
1230 JOP-VLN: Joint On-and-Off Policy Learning for Vision-and-Language Navigation On-policy와 offline learning을 결합한다.
3526 Revisiting Topological Graphs for Macro Action Based Closed-Loop Reinforcement Learning of Vision Language Navigation in Continuous Environment Topological macro-action 기반 폐루프 VLN을 제안한다.
2369 HaltNav: Reactive Visual Halting Over Lightweight Topological Priors for Robust Vision-Language Navigation 언제 멈출지를 판단하는 reactive halting을 다룬다.
1976 Talk2Escape: Conversational Grounding for Vision-And-Language Navigation 대화를 통한 명령 grounding과 협업형 VLN을 다룬다.
3151 History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation Navigation history를 이용하여 visual token을 효율적으로 pruning한다.
4043 ImagiNav: Scalable Embodied Navigation Via Generative Visual Prediction and Inverse Dynamics 자연어 navigation을 visual future prediction과 inverse dynamics로 해결한다.
1909 OnFly: Onboard Zero-Shot Aerial Vision-Language Navigation Toward Safety and Efficiency UAV onboard 환경에서 zero-shot VLN을 수행한다.
1246 ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Framework for Aerial Vision-Language Navigation Visual prompting 기반 aerial spatial reasoning을 제안한다. 논문
4260 VLM-MPPI: Grounding Natural Language in Behaviorally Diverse Trajectories for Aerial Navigation 자연어를 MPPI trajectory distribution에 grounding한다.
1132 Fly As I Say: A Language-Guided Gradient-Based Local Planner for Quadrotors with Vision Language Models 자연어와 VLM을 이용한 quadrotor local planning을 다룬다.
1897 DTNav: Dual-Target Vision–Language Navigation with Decoupled Topological Memory for Indoor UAVs Dual target와 topological memory를 이용한 indoor UAV VLN을 제안한다.
679 LibrayNav: Vision-Language Navigation for Quadruped Robots in Library Environments Quadruped robot을 이용한 실환경 VLN을 다룬다.
2055 VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking 자율주차 환경에서 장·단기 memory를 결합한다.
4276 WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control 언어 조건부 waypoint 생성과 저수준 제어를 연결한다.
358 HA-VLN 2.0: An Open Benchmark and Leaderboard for Human-Aware Navigation in Discrete and Continuous Environments with Dynamic Multi-Human Interactions 동적 사람을 포함한 human-aware VLN benchmark를 제공한다.
3431 NavTrust: Benchmarking Trustworthiness for Embodied Navigation VLN과 OGN의 RGB, depth, instruction corruption에 대한 신뢰성을 평가한다. 논문
1880 SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation VLM에 3D scene token을 주입하여 embodied navigation을 수행한다.

우선적으로 살펴볼 논문

  1. VL-Nav
  2. ViTL
  3. Talk2Escape
  4. HaltNav
  5. SoftNav
  6. NavTrust
  7. ImagiNav
  8. OnFly
  9. ViSA-Enhanced Aerial VLN
  10. View Invariant Learning for VLN

2. Object-Goal·Open-Vocabulary·Semantic Navigation: 16편

전통적인 VLN처럼 상세한 route instruction을 따르지는 않지만, 언어적 목표나 semantic concept를 이용해 탐색하고 이동하는 논문들이다. 최근에는 VLN과 object-goal navigation의 경계가 흐려지고 있으므로 이 연구군도 함께 살펴볼 필요가 있다.

# 논문
2754MSM-Nav: Integrating Multi-Modal Spatial Map for Zero-Shot Open-Vocabulary Object-Goal Navigation Via LLM-Driven Trap Avoidance
2842SGC-Nav: Scene Graph Conditioned Multi-LLM Consensus for Mapless Zero-Shot Object Navigation
1185SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation
3840AFSM-Nav: Training-Free Object Navigation Via Self-Repairing LLM-Synthesized Finite State Machines
23Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework Via LLM-Driven Coarse-To-Fine Exploration
220Object Search in Partially-Known Environments Via LLM-Informed Model-Based Planning and Prompt Selection
3266BEACON: Language-Conditioned Navigation Affordance Prediction under Occlusion
1835Frontier-as-Token: Structured Spatial Reasoning for Zero-Shot Object Navigation
2553SparseNav: Efficient Zero-Shot Object-Goal Navigation with Multi-Layer Sparse Semantic Mapping
4257Room-Mediated Co-Occurrence for Zero-Shot Object-Centric Semantic Navigation Via Frontier Scoring
86Where Did I Leave My Glasses? Open-Vocabulary Semantic Exploration in Real-World Semi-Static Environments
1492Uncertainty-Aware Zero-Shot Object Navigation Via Semantic Bayesian Belief
1690LoRANav: Structurally-Constrained Low-Rank Adaptation for Open-Vocabulary Object Goal Navigation
1881REST: Receding Horizon Explorative Steiner Tree for Zero-Shot Object-Goal Navigation
2009EPANav: An Exploration-Progress-Aware Object Navigation Framework
2793IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation

이 연구군에서 특히 주목할 흐름은 다음과 같다.

3. VLM/VLA 기반 특수 플랫폼 Navigation: 10편

언어 명령 추종형 VLN과는 조금 다르지만, VLM 또는 VLA가 실제 이동 정책이나 planning에 직접 관여한다는 점에서 관련성이 높다.

# 논문 플랫폼
58NAMO-LLM: Efficient Navigation among Movable Obstacles with Large Language Model GuidanceMovable-obstacle navigation
4894GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable DynamicsDrone
1031MicroVLA: A Vision-Language-Action Framework for Microrobotic Navigation Considering Inter-Particle Micro-Force FieldsMicrorobot
4480BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic NavigationSurgical endoscope
2299Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical SituationsAutonomous vehicle
14Sim2Real Diffusion: Leveraging Foundation Vision Language Models for Adaptive Automated DrivingAutonomous driving
4040ATLAS: Asynchronous Temporal Learning with Adaptive LLM-Guided Shaping for Autonomous Driving Decision-MakingAutonomous driving
1649APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action ModelAutonomous driving
952ViLaD: A Large Vision Language Diffusion Framework for End-To-End Autonomous DrivingAutonomous driving
1413CognitiveDrone: A VLA Model and Evaluation Benchmark for Real-Time Cognitive Task Solving and Reasoning in UAVsUAV

NAMO-LLM은 언어가 단순한 목표 표현에 머무르지 않고 movable obstacle을 어떻게 처리할지 결정하는 high-level planner에 들어간다는 점에서 중요한 확장형 VLN에 해당한다.

4. Memory·Context·Interaction·Personalization: 10편

VLN 자체를 중심 주제로 삼지는 않지만, 장기 navigation agent를 구성하는 데 필요한 memory, human routine, cognitive map, interaction을 다루는 논문들이다.

# 논문 VLN 연결점
4391DyMemNav: Dynamic and Memory-Augmented Mixture-of-Experts for Cross-Scene Visual NavigationCross-scene memory와 expert routing
862HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across ScenesContinual navigation과 memory replay
3435Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied AgentsOnline scene-graph memory
2169HIMM: Human-Inspired Long-Term Memory Modeling for Embodied Exploration and Question AnsweringLong-term embodied memory
4944A Robot System for Indoor Environment Question Answering with Cognitive Map Leveraging Vision-Language ModelsCognitive map 기반 질의와 navigation grounding
287Language-Guided Generation for Personalized Inspection Planning사용자 언어 기반 inspection route planning
874HUMEMBR: Learning Human Routines for Predictive Embodied Navigation인간 routine 예측 기반 navigation
1898MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language ModelPointing, speech, LLM을 통한 navigation 명령
1714GROVE: Grounded Pedestrian Simulation Via Natural Language for Interactive Social Robot Navigation자연어를 이용한 social navigation 상황 생성
1444When to Personalize Household Object Search: A Rigidity-Gated Hybrid Policy사용자별 search policy를 적용할 시점의 판단
Long-term scene memory → language-grounded task → navigation policy → failure or ambiguity → ask, replan, or retrieve → memory update의 순환 구조가 장기 VLN agent의 핵심 구조로 부상하고 있다.

HIMM, SG-Memo, DyMemNav, HyperDCM, cognitive-map question answering은 서로 다른 형태의 장기 memory를 다룬다. 다만 episodic memory, semantic memory, topological memory와 working memory를 하나의 계층적 구조로 통합하는 연구는 아직 제한적이다.

5. VLN과 밀접하지만 엄밀히는 비언어 Navigation인 논문: 9편

다음 논문들은 language instruction을 사용한다고 프로그램상 명확하게 확인되지 않는다. 따라서 직접적인 VLN 논문 수에는 포함시키지 않고 comparison method 또는 supporting component로 분류하는 것이 정확하다.

# 논문 정확한 분류
1136DINO-Nav: Unified Explicit Localization and Diffusion Planning for Robust Image-Goal NavigationImage-goal navigation
1931SpatialAnt: Autonomous Zero-Shot Robot Navigation Via Active Scene Reconstruction and Visual AnticipationVisual anticipation
2013AION: Aerial Indoor Object-Goal Navigation Using Dual-Policy Reinforcement LearningAerial object-goal navigation
107SenseExpo: Spatial Exploration and Navigation Via Scene Estimation from Expeditious Predictive OperatorsEmbodied exploration
4280ViDi-Nav: Fast and Robust Obstacle-Aware Vision-Based Navigation on Uneven Terrain Via Differentiable PhysicsVisual navigation
967FastMap: Real-Time Semantic Map Completion Via Bitwise Masked ModelingSemantic map completion
4091Interleaved POMDP Planning for Multi-Object Search in Unknown Multi-Room Household EnvironmentsObject search
4344DM³-Nav: Decentralized Multi-Agent Multimodal Multi-Object Semantic NavigationMulti-agent semantic navigation
1198Learning Adaptive Safety Margins for Visual NavigationNavigation safety

6. IROS 2026 VLN 연구의 주요 흐름

6.1 End-to-End Instruction Following에서 Structured Reasoning으로 이동한다

VL-Nav, ViTL, SGC-Nav, SAGE-Nav를 중심으로 다음과 같은 구조적 표현의 사용이 증가하고 있다.

이는 VLM에 이미지와 명령을 입력하고 next action을 직접 질의하는 방식만으로는 장기적이고 복합적인 navigation을 해결하기 어렵다는 인식이 확산되고 있음을 보여준다.

6.2 Navigation Memory가 기능별로 세분화된다

현재 연구들은 특정 memory 기능을 각각 강화하는 방향으로 발전하고 있다. 그러나 서로 다른 시간척도와 공간척도의 memory를 통합하고, retrieval, update, consolidation, forgetting을 함께 다루는 연구는 아직 충분하지 않다.

6.3 Object-Goal Navigation과 VLN의 경계가 흐려진다

과거에는 VLN과 object-goal navigation이 비교적 명확하게 구분되었다.

그러나 IROS 2026의 object-goal navigation 연구에서는 LLM이 목표를 해석하고, scene graph와 semantic prior를 사용하여 subgoal과 탐색 전략을 생성한다. 이에 따라 object-goal navigation이 간접적인 language-conditioned navigation으로 변화하고 있다.

6.4 Aerial VLN이 독립적인 연구축으로 성장한다

OnFly, ViSA, VLM-MPPI, Fly As I Say, DTNav, GRaD-Nav++ 등 최소 6편의 강한 aerial VLN 및 VLM navigation 연구가 확인된다. Aerial VLN에서는 다음 문제가 집중적으로 다뤄진다.

6.5 평균 성공률만으로는 충분하지 않다

NavTrust, HaltNav, HA-VLN 2.0, token-pruning 연구가 보여주듯이 VLN의 평가축이 다음과 같이 확장되고 있다.

7. 연구 공백과 Future-Work 방향

IROS 2026에는 memory를 사용하는 VLN 연구가 많지만, 장기 운용 중 축적되는 장면을 시간척도, 공간척도, semantic abstraction에 따라 계층적으로 조직하고 retrieval, forgetting, clarification, replanning까지 하나의 lifelong loop로 묶는 연구는 아직 뚜렷하지 않다.

7.1 Hierarchical Lifelong Memory

단일 memory buffer가 아니라 working, episodic, semantic, topological memory의 역할을 분리하고 상호 변환하는 구조가 필요하다. 새로운 관측을 무조건 저장하는 것이 아니라 novelty, uncertainty, task relevance를 기준으로 기억의 승격과 삭제를 결정해야 한다.

7.2 Event-Triggered Reasoning

VLM이나 LLM을 매 step 호출하는 방식은 계산량과 latency 측면에서 지속 가능하지 않다. 모호한 명령, semantic conflict, localization uncertainty, progress stagnation, 예상치 못한 장애물처럼 reasoning이 필요한 사건을 감지하고 필요한 순간에만 고비용 추론을 수행해야 한다.

7.3 Clarification, Recovery, and Replanning

향후 VLN agent는 단순히 명령을 수행하는 executor가 아니라, 모호함을 감지해 질문하고 실패 원인을 추론하며 memory와 계획을 수정하는 collaborator로 발전할 필요가 있다. Talk2Escape, HaltNav, AFSM-Nav가 각각 대화, stopping, self-repair의 일부를 다루지만 이를 통합한 시스템은 아직 부족하다.

7.4 Evaluation Beyond SR and SPL

Success Rate와 SPL만으로는 장기 VLN agent의 품질을 충분히 설명할 수 없다. 다음 평가항목이 함께 필요하다.

8. 결론

IROS 2026의 VLN 연구는 단순한 instruction following을 넘어 structured reasoning, explicit memory, object-goal search, aerial navigation, human-aware interaction, robustness evaluation으로 빠르게 확장되고 있다.

가장 강한 공통 흐름은 다음과 같이 요약할 수 있다.

Vision-language navigation은 하나의 end-to-end policy 문제가 아니라, perception, memory, semantic reasoning, planning, interaction, recovery를 결합하는 장기 embodied autonomy 문제로 재정의되고 있다.

향후 경쟁력 있는 연구는 특정 benchmark의 성공률만 높이는 방법보다, 장기 운용에서 무엇을 기억하고 언제 reasoning하며 어떻게 질문하고 실패에서 복구하는지를 함께 설명할 수 있어야 한다.