IROS 2026 VLM/VLA 연구 지형 평론

이 평론의 논문 수, 세션 분포, 제목 기반 분류와 연구 흐름 분석은 IROS 2026 Explorer의 VLM 검색 결과를 분석 재료로 삼아 작성했습니다.

한 줄 총평

IROS 2026은 VLM의 가능성을 보여주는 단계에서, 불완전하고 느린 foundation model을 실제 로봇 시스템의 일부로 길들이는 단계로 넘어간 학회로 보인다.

핵심 질문이 바뀌었다.

따라서 2026년의 중요한 변화는 모델 성능 자체보다 embodied systems engineering의 부상이다.

1. 먼저 숫자를 정확히 해석해야 한다

VLM 검색 결과는 143편으로, 전체 1,933편의 약 7.4%다. 하지만 이것을 그대로 “VLM 논문 143편”이라고 부르기는 어렵다.

제목을 기준으로 보면 다음과 같다.

따라서 안전한 해석은 다음과 같다.

IROS 2026 전체 논문의 약 5%가 명시적으로 vision-language 계열이고, 그 안에서는 VLA가 최대 하위 분야다.

143편 중 발표 형식은 다음과 같다.

논문 수는 이미 충분히 크지만, 약 74%가 lightning이라는 점은 이 분야가 빠르게 팽창하는 동시에 아직 논문의 질과 기여 수준이 크게 분산된 상태라는 것도 보여준다.

2. VLM은 이제 하나의 모델이 아니라 시스템 구성요소다

초기 VLM 로보틱스 논문은 대체로 다음과 같은 구조였다.

image + prompt → semantic answer → robot command

IROS 2026에서는 VLM이 훨씬 다양한 위치에 들어간다.

즉, VLM은 더 이상 독립된 perception module이 아니라 로봇 시스템 전체에 삽입되는 범용 reasoning substrate가 되었다.

하지만 이것은 동시에 새로운 문제를 만든다. 같은 foundation model을 사용하더라도 시스템 안에서 어떤 역할을 맡겼는지에 따라 논문의 본질이 완전히 달라지기 때문이다.

앞으로는 “VLM을 사용했다”가 방법론적 설명이 될 수 없다. 다음을 명확히 해야 한다.

  1. VLM이 어떤 정보를 입력받는가?
  2. 무엇을 추론하는가?
  3. 어떤 형식으로 결과를 출력하는가?
  4. 그 결과가 실제 제어에 어떤 영향을 주는가?
  5. 잘못된 추론을 누가 감지하고 수정하는가?

3. 가장 큰 흐름은 VLM이 아니라 VLA다

VLM 관련 제목 중 약 50편이 VLA를 직접 다룬다는 것은 상당히 강한 신호다. VLA 연구는 이미 다음처럼 세분화되었다.

이 정도면 VLA는 더 이상 단일 연구 주제가 아니라 하나의 연구 생태계다.

다만 논문 제목에서 우려되는 패턴도 보인다.

기존 VLA + 새로운 modality 또는 module + 특정 robot platform

이 조합은 빠르게 포화될 가능성이 크다. 새로운 sensor, masking module, diffusion variant 또는 robot platform을 붙이는 것만으로는 점점 강한 novelty를 주장하기 어려워질 것이다.

미래 연구에 대한 함의

앞으로 강한 VLA 연구는 다음 중 하나를 가져야 한다.

4. Foundation model이 geometry를 대체한 것이 아니라 geometry를 다시 불러왔다

가장 흥미로운 흐름은 3D와 spatial structure의 귀환이다.

대표적인 방향은 다음과 같다.

특히 VLM 관련 Cognitive Robotics Award Candidate가 다음 세 방향으로 구성된다는 점이 상징적이다.

이 흐름이 말해주는 것은 명확하다.

대규모 사전학습은 의미론적 지식을 제공하지만, 로봇이 행동하기 위해 필요한 metric geometry, topology, dynamics, constraints까지 자동으로 해결해주지는 않는다.

따라서 미래의 강한 시스템은 순수 end-to-end 모델보다는 다음과 같은 hybrid 구조가 될 가능성이 크다.

Foundation Model + Structured World State + Predictive Control + Verification

Foundation model은 semantics와 priors를 제공하고, 로보틱스 구조는 consistency와 controllability를 제공하는 식이다.

5. 연구의 중심이 평균 성능에서 계산량과 신뢰성으로 이동하고 있다

IROS 2026에는 efficiency 관련 논문이 눈에 띄게 많다.

이것은 단순한 경량화 유행이 아니다. VLM/VLA가 실제 control loop에 들어가기 시작했기 때문에 나타나는 구조적 변화다.

현재 대형 모델은 일반적으로 다음과 같은 특성을 가진다.

따라서 자연스럽게 다음의 이중 구조가 형성되고 있다.

앞으로 중요한 문제는 단순한 가속이 아니라 다음의 의사결정이다.

언제 깊게 생각하고, 언제 기존 결과를 재사용하며, 언제 즉시 행동해야 하는가?

이를 정식화하면 다음과 같은 constrained optimization 문제가 된다.

maxπ E[Task Utility] − λc Compute − λl Latency − λr Risk

즉, accuracy만 최대화하는 것이 아니라 task success–latency–energy–risk의 Pareto frontier를 다뤄야 한다.

6. Safety 연구는 부가 기능에서 독립 연구 분야로 성장하고 있다

목록에는 다음과 같은 문제가 반복해서 등장한다.

이것은 분야가 성숙하고 있다는 증거다. 초기에는 성공 사례를 보여주는 것으로 충분했지만, 이제는 다음 질문을 피할 수 없다.

특히 중요한 변화는 안전을 단순한 출력 필터링으로 보지 않는다는 점이다.

앞으로의 safety stack은 적어도 세 층으로 나뉠 가능성이 크다.

  1. Before action: feasibility·risk verification
  2. During action: anomaly·deviation monitoring
  3. After failure: rollback·replanning·recovery

Future work에서는 “unsafe command를 차단했다”보다 closed-loop failure lifecycle 전체를 평가해야 강해질 것이다.

7. Memory는 중요하지만 아직 개념적으로 정리되지 않았다

현재 논문들이 memory라고 부르는 것은 서로 상당히 다르다.

이들을 모두 memory라는 하나의 단어로 묶으면 기여가 불명확해진다.

앞으로는 memory를 적어도 다음 축으로 분류해야 한다.

축구분
시간 범위short-term / episodic / persistent
내용observation / action / outcome / semantic knowledge
표현token / latent / metric map / graph / symbolic fact
갱신append / merge / consolidate / forget
검색similarity / spatial / temporal / causal
목적recognition / planning / adaptation / recovery

특히 현재 연구는 짧은 episode 내부의 history나 task-specific memory에 집중되어 있다. 상대적으로 덜 다뤄진 문제는 다음과 같다.

따라서 memory 연구에서는 단순히 memory module을 추가하는 것보다 memory lifecycle 전체를 정의하는 것이 중요한 future direction이다.

8. 플랫폼과 modality 확장은 활발하지만, 그 자체로는 약한 기여가 된다

IROS 2026에서는 VLM/VLA가 다음으로 빠르게 확산되고 있다.

센서도 RGB에서 다음으로 확장되고 있다.

이는 VLA가 범용 interface로 자리 잡고 있다는 긍정적인 신호다. 그러나 “처음으로 VLA를 특정 플랫폼에 적용했다”는 기여는 빠르게 약해질 것이다.

강한 연구가 되려면 특정 플랫폼이 단순 application domain이 아니라 새로운 과학적 문제를 발생시키는 이유가 있어야 한다.

예를 들면 다음과 같다.

즉, 플랫폼 논문은 다음을 보여줘야 한다.

이 embodiment가 기존 VLM/VLA 가정을 어떻게 깨뜨리는가?

9. 현재 많이 보이지만 약해질 가능성이 큰 연구 패턴

앞으로는 다음 형태만으로 강한 논문을 만들기 어려워질 것이다.

① Prompt engineering 중심 연구

“Structured prompting을 적용했더니 성공률이 올랐다”는 결과는 재현성과 일반화 측면에서 약하다.

② Acronym-first architecture

새로운 VLA 이름을 만든 뒤 기존 module 여러 개를 조합하는 방식은 연구 질문이 흐려지기 쉽다.

③ Open-loop semantic evaluation

질문 응답 정확도나 planning text quality만 측정하고 실제 closed-loop 행동을 평가하지 않으면 로보틱스 기여가 약하다.

④ 새로운 modality만 추가

Depth, thermal, tactile을 추가했다는 사실보다 그 정보가 어떤 failure를 해결했는지가 중요하다.

⑤ 평균 success rate만 보고

실패 유형, latency, compute, calibration, recovery를 보고하지 않으면 실제 시스템의 가치를 판단하기 어렵다.

⑥ 쉬운 benchmark에서의 소폭 향상

기존 benchmark가 포착하지 못하는 failure mode를 제시하지 못하면 숫자 개선만으로는 설득력이 떨어진다.

10. 강한 Future Work를 위한 연구 가이드

A. 모델보다 문제를 먼저 정의해야 한다

약한 질문은 다음과 같다.

VLM을 로봇 navigation에 적용할 수 있는가?

강한 질문은 다음과 같다.

부분 관측과 환경 변화가 존재할 때, 로봇은 어떤 관찰을 신뢰하고 언제 추가 정보를 획득해야 하는가?

방법 이름을 제거해도 의미가 남는 연구 질문이어야 한다.

B. VLM과 물리 세계 사이에 구조화된 interface가 필요하다

자유형 텍스트를 바로 action으로 바꾸기보다 다음과 같은 중간 표현이 중요해질 것이다.

좋은 interface는 다음 조건을 만족해야 한다.

C. Adaptive computation을 task-level decision으로 다뤄야 한다

단순 token pruning보다 중요한 것은 다음과 같다.

평가 항목도 함께 바뀌어야 한다.

D. Uncertainty를 행동과 연결해야 한다

VLM의 verbal confidence만으로는 부족하다.

필요한 것은 다음과 같다.

가장 중요한 것은 uncertainty를 계산하는 것보다 그 uncertainty 때문에 로봇이 무엇을 다르게 하는지다.

E. Closed-loop recovery를 기본 평가로 포함해야 한다

실제 로봇은 실패하지 않는 시스템이 아니라 실패를 관리하는 시스템이다.

Future work는 최소한 다음 loop를 다뤄야 한다.

Act → Monitor → Detect → Diagnose → Recover → Resume

단일 시도 success rate보다 다음이 더 중요한 지표가 될 수 있다.

F. 평가를 long-horizon·distribution shift 중심으로 바꿔야 한다

앞으로 필요한 benchmark는 다음 특성을 가져야 한다.

짧고 독립적인 manipulation episode만으로는 memory, reasoning, safety의 진짜 가치를 측정하기 어렵다.

향후 2–3년 전망

IROS 2026의 프로그램을 기반으로 보면 다음과 같은 이동이 예상된다.

감소할 가능성이 큰 것

증가할 가능성이 큰 것

최종 결론

IROS 2026은 “VLM이 로봇에 유용한가?”라는 질문에는 사실상 그렇다고 답한 프로그램이다. 이제 더 중요한 질문은 다음과 같다.

불완전하고 느리며 확률적인 foundation model을, 구조화되고 검증 가능하며 실시간으로 동작하는 로봇 시스템으로 어떻게 변환할 것인가?

차세대 연구의 승부처는 더 큰 VLM을 만드는 데만 있지 않다. 오히려 다음 네 요소를 얼마나 설득력 있게 결합하느냐에 달려 있다.

Structured World State + Selective Reasoning + Closed-Loop Action + Runtime Assurance

결국 VLM/VLA 연구는 모델 중심 경쟁에서 시스템 원리 중심 경쟁으로 이동하고 있다고 평가할 수 있다.