Spatial Intelligence for Embodied Navigation: 문제, 기회, 그리고 Why Now

이 워크숍의 핵심 주장은 다음과 같다.

현재 embodied navigation 모델은 공간에 관해 말하고 행동할 수는 있지만, 공간을 명시적으로 구성하고 조작하며 추론하는 능력은 여전히 취약하다.

즉, 대규모 pretraining과 VLM 덕분에 navigation 성능은 좋아졌지만, 이것이 모델이 실제로 spatial intelligence를 획득했다는 뜻은 아니라는 문제의식이다.

모델이 benchmark에서 정답을 맞혀도 실제로는 공간 구조를 이해한 것이 아니라, 학습 데이터에서 얻은 언어·시각적 상관관계나 환경별 shortcut을 이용했을 수 있다는 것이다.

1. 구체적으로 무엇이 문제인가

현재 embodied navigation 시스템은 짧고 익숙한 명령에는 잘 작동하지만, 구조적인 공간 추론이 필요한 순간에 쉽게 무너진다.

예를 들면 다음과 같다.

현재 모델은 이런 문제를 하나의 거대한 image-language-to-action mapping으로 처리하려는 경향이 있다. 하지만 입력과 행동 사이에 재사용 가능한 공간 구조가 없다면 환경이 조금만 달라져도 성능이 급격히 떨어질 수 있다.

이 워크숍은 그 원인을 다음과 같이 본다.

현재 시스템은 perception 결과를 action으로 변환할 수는 있지만, 공간을 구성하고 관계를 조작할 수 있는 robust internal representation이 부족하다.

2. 이들이 말하는 spatial intelligence란 무엇인가

여기서 spatial intelligence는 단순히 물체와 장소를 인식하는 능력이 아니다.

다음과 같은 전체 능력을 의미한다.

  1. 환경의 공간 구조를 내부적으로 표현한다.
  2. 물체·장소·경로 사이의 관계를 구성한다.
  3. 관측되지 않은 영역과 숨겨진 상태를 추론한다.
  4. 언어 지시를 공간적 관계와 sub-goal로 변환한다.
  5. 만들어진 표현을 planning과 locomotion에 사용한다.
  6. 새로운 환경과 sensor에도 공간적 규칙을 전이한다.
  7. 불확실성과 실패에 따라 표현과 계획을 수정한다.

따라서 핵심은 단순 localization이나 object detection이 아니다.

공간 정보를 행동에 유용한 구조로 만들고, 그 구조 위에서 새로운 관계와 경로를 추론하는 능력이다.

3. Structured reasoning은 무엇을 의미하는가

이 워크숍이 말하는 structured reasoning은 VLM에 자연어로 chain-of-thought를 생성하게 하는 것만을 의미하지 않는다.

구조는 다양한 형태가 될 수 있다.

중요한 것은 표현이 명시적인 symbolic graph인지 neural latent인지가 아니다. 다음 조건을 만족하는지가 중요하다.

즉 structured representation은 보기 좋은 중간 결과가 아니라 compositionality, generalization, diagnosability를 가능하게 하는 계산 구조여야 한다.

4. 여섯 가지 핵심 문제의 의미

C1. Spatial representation learning

첫 번째 질문은 어떤 표현을 학습해야 공간 추론이 가능해지는가다.

현재 representation은 perception benchmark에 유리하도록 학습되는 경우가 많다. 물체 분류나 image-text alignment에는 뛰어나더라도, 다음 질문에는 답하지 못할 수 있다.

따라서 단순 feature quality가 아니라 downstream spatial reasoning을 가능하게 하는 representation quality를 연구해야 한다는 주장이다.

연구 기회는 다음과 같다.

C2. Compositional and long-horizon spatial reasoning

복잡한 instruction은 하나의 action으로 직접 변환하기 어렵다.

예를 들어 다음 지시는 여러 공간적 조건으로 분해되어야 한다.

“의자를 지나고, 복도에서 왼쪽으로 돈 다음, 파란 문 앞에 멈춰라.”

이를 구조화하면 다음과 같다.

  1. 의자를 식별한다.
  2. 의자를 통과해야 하는 landmark로 설정한다.
  3. 복도 진입을 확인한다.
  4. 적절한 교차점에서 왼쪽으로 회전한다.
  5. 파란 문을 검색한다.
  6. 문의 앞이라는 spatial relation을 만족하며 정지한다.

문제는 중간 단계가 실패했을 때다. 의자를 잘못 인식하거나 복도 진입을 놓쳤다면 이후 sub-goal도 수정되어야 한다.

따라서 중요한 것은 task decomposition 자체보다 sub-goal의 성공·실패를 추적하고 그 영향을 이후 계획에 전파하는 것이다.

C3. Generalizable cognitive maps

지도는 정확하기만 하면 되는 것이 아니라 다른 환경에서도 사용할 수 있어야 한다.

그러나 map abstraction에는 본질적인 trade-off가 있다.

표현 장점 약점
Metric map 정밀한 위치와 경로 계산 geometry와 sensor 변화에 민감함
Topological map 구조 변화에 비교적 강하고 확장성이 좋음 정밀 제어에 부족함
Semantic map 언어 지시 및 task reasoning에 유리함 geometry와 connectivity를 잃을 수 있음
Latent map end-to-end 학습에 유리함 해석과 수정이 어려움
Hybrid map 여러 수준의 추론 가능 설계와 학습이 복잡함

그래서 진짜 질문은 “어떤 map이 최고인가?”가 아니다.

어떤 문제에 어느 abstraction level이 필요하며, 로봇이 상황에 따라 그 수준을 전환하거나 결합할 수 있는가?

이것이 generalizable cognitive map의 핵심 연구 기회다.

C4. Grounding language to spatial reasoning

VLM이나 LLM은 언어적 공간 지식이 풍부하지만, 실제 geometry와 결합할 때 취약해질 수 있다.

예를 들어 “복도 끝”, “문 앞”, “의자 너머”, “두 번째 왼쪽” 같은 표현은 단순 object grounding만으로 해결되지 않는다. 관찰자의 시점, 진행 방향, topology, 이동 이력을 함께 고려해야 한다.

언어 모델과 spatial representation의 결합 방식에는 두 극단이 있다.

Tight coupling은 유연하지만 hallucination과 representation entanglement가 생길 수 있다. Loose coupling은 검증과 수정이 쉽지만 interface error와 정보 손실이 생길 수 있다.

따라서 중요한 연구 질문은 다음과 같다.

언어 모델에 공간 추론을 모두 맡길 것인가, 아니면 언어 모델이 구조화된 공간 추론기를 호출하게 할 것인가?

C5. Uncertainty-aware navigation

공간 추론은 항상 불확실성을 포함한다.

현재 navigation model은 단일한 action이나 경로를 자신 있게 출력하지만, 그 결과가 실제로는 불확실할 수 있다.

구조화된 spatial reasoning은 불확실성을 다음과 같이 분해할 수 있다.

이렇게 uncertainty의 원인을 분리하면 로봇이 다음 행동 중 하나를 선택할 수 있다.

즉 uncertainty는 단순 confidence score가 아니라 다음 reasoning과 action을 결정하는 state가 되어야 한다.

C6. Evaluation methodology

이 워크숍에서 가장 중요한 문제 중 하나다.

현재 benchmark의 높은 성공률이 genuine spatial understanding을 의미하지 않을 수 있다.

모델은 다음 shortcut을 사용할 수 있다.

따라서 평가는 최종 Success Rate나 SPL만 측정해서는 부족하다.

진짜 spatial reasoning benchmark는 다음을 검사해야 한다.

결국 가장 어려운 질문은 다음과 같다.

모델이 정말 공간을 추론한 것인지, 데이터셋의 규칙성을 이용해 정답만 맞힌 것인지 어떻게 구별할 것인가?

5. 무엇이 가장 큰 연구 기회인가

① Geometry와 foundation model의 재결합

최근 embodied AI는 language와 large-scale pretraining에 집중하면서 전통적인 geometry가 상대적으로 뒤로 밀렸다. 그러나 navigation에서는 metric consistency, visibility, connectivity, collision constraint를 피할 수 없다.

따라서 강한 연구 방향은 language model이 geometry를 대체하는 것이 아니라 다음을 결합하는 것이다.

즉 foundation model과 classical spatial machinery의 결합이 중요한 기회다.

② Multi-level spatial abstraction

하나의 표현으로 모든 navigation 문제를 해결하기는 어렵다.

따라서 환경과 reasoning horizon에 따라 서로 다른 공간 표현을 동적으로 선택하고 연결하는 architecture가 유망하다.

③ Reasoning을 행동과 결합하는 closed loop

공간 reasoning이 그럴듯한 설명을 생성하는 데서 끝나면 안 된다.

좋은 시스템은 다음 loop를 가져야 한다.

  1. 공간 상태를 추론한다.
  2. sub-goal과 행동을 결정한다.
  3. 행동 결과를 관측한다.
  4. 기존 reasoning이 맞았는지 검증한다.
  5. map, belief, sub-goal을 수정한다.

즉 open-loop chain-of-thought보다 action-conditioned, feedback-driven spatial reasoning이 중요하다.

④ Structure의 유효성을 검증하는 benchmark

새로운 scene graph나 map architecture를 제시하는 것보다, 그 구조가 실제로 필요하다는 것을 입증하는 것이 더 어려우면서도 가치가 크다.

예를 들어 다음과 같은 평가가 필요하다.

이는 “구조를 넣었더니 성능이 올랐다”를 넘어 어떤 구조가 어떤 종류의 일반화를 가능하게 했는가를 밝히는 연구다.

6. 왜 지금 필요한가

VLM이 공간을 잘 이해한다는 착시가 생겼기 때문이다

최신 VLM은 이미지에 있는 물체와 관계를 언어로 매우 자연스럽게 설명한다. 그러나 자연스러운 설명과 안정적인 공간 추론은 다르다.

VLM의 표면적 유창성이 높아질수록 실제 spatial competence를 엄밀하게 측정할 필요가 커진다.

point-goal navigation이나 짧은 object navigation에서 벗어나 다음과 같은 문제가 중요해지고 있다.

이런 task에서는 공간 구조와 sub-goal state를 명시적으로 관리하지 않으면 오류가 누적된다.

Pretraining의 다음 병목이 structure이기 때문이다

대규모 pretraining은 perception과 semantic knowledge를 크게 개선했다. 그러나 데이터와 모델 규모를 늘리는 것만으로 compositional spatial reasoning이 자동으로 나타난다는 보장은 없다.

따라서 다음 단계는 다음 질문으로 이동한다.

더 큰 모델을 만들 것인가가 아니라, 모델이 공간을 어떤 구조로 표현하고 그 위에서 어떻게 계산하게 할 것인가?

실제 배치에서는 generalization과 recovery가 중요하기 때문이다

실제 로봇은 benchmark처럼 정해진 환경과 완벽한 instruction에서만 움직이지 않는다.

이때 필요한 것은 평균적인 성공률만 높은 policy가 아니라, 자신이 무엇을 알고 모르는지 표현하고, 실패 원인을 구조적으로 찾아 계획을 수정할 수 있는 시스템이다.

7. 이 워크숍의 숨은 핵심 주장

표면적인 질문은 “navigation에 어떤 spatial representation을 사용할 것인가?”다.

하지만 더 깊은 질문은 다음과 같다.

Embodied foundation model 내부에 world structure가 실제로 존재하는가? 존재한다면 그것을 어떻게 검증하고, 조작하고, 행동에 사용할 것인가?

즉 이 워크숍은 navigation architecture 하나를 제안하는 자리가 아니라, 현재의 end-to-end embodied learning이 놓치고 있는 representation과 reasoning의 중간층을 다시 연구 대상으로 복원하려는 움직임이다.

8. Memory 및 adaptation과의 관계

앞서 본 두 워크숍과 결합하면 세 주제의 역할이 명확해진다.

주제 핵심 질문 시스템에서의 역할
Spatial intelligence 세계를 어떤 구조로 표현하고 추론할 것인가 공간적 world state와 reasoning substrate
Memory 과거의 어떤 경험을 저장하고 다시 사용할 것인가 시간에 걸친 state와 experience persistence
Adaptation 축적된 경험으로 모델을 어떻게 변화시킬 것인가 deployment experience의 능력 전환

세 가지를 연결하면 다음과 같은 시스템이 된다.

  1. Spatial intelligence가 현재 세계를 구조화한다.
  2. Memory가 그 구조와 경험을 시간에 걸쳐 보존한다.
  3. Adaptation이 반복되는 경험을 policy와 representation의 개선으로 바꾼다.

따라서 가장 강한 통합 연구 질문은 다음과 같다.

로봇은 변화하는 세계의 공간 구조를 어떻게 지속적으로 기억하고, 불확실한 상황에서 그 구조를 추론하며, 축적된 경험으로 표현과 행동을 개선할 것인가?

한 줄 평

이 워크숍은 “navigation에 scene graph나 semantic map을 붙이자”는 단순한 제안이 아니다.

현재의 pattern-matching navigation policy를, 공간 관계를 구성하고 조작하며 실패 시 수정할 수 있는 structured spatial reasoner로 전환하자는 연구 의제다.

그리고 가장 중요한 승부처는 새로운 map representation을 하나 더 제안하는 것이 아니라, 그 표현이 shortcut을 넘어 실제 compositional reasoning과 cross-environment generalization을 가능하게 했음을 증명하는 평가 설계에 있을 가능성이 크다.