Spatial Intelligence for Embodied Navigation: 문제, 기회, 그리고 Why Now
이 워크숍의 핵심 주장은 다음과 같다.
현재 embodied navigation 모델은 공간에 관해 말하고 행동할 수는 있지만, 공간을 명시적으로 구성하고 조작하며 추론하는 능력은 여전히 취약하다.
즉, 대규모 pretraining과 VLM 덕분에 navigation 성능은 좋아졌지만, 이것이 모델이 실제로 spatial intelligence를 획득했다는 뜻은 아니라는 문제의식이다.
모델이 benchmark에서 정답을 맞혀도 실제로는 공간 구조를 이해한 것이 아니라, 학습 데이터에서 얻은 언어·시각적 상관관계나 환경별 shortcut을 이용했을 수 있다는 것이다.
1. 구체적으로 무엇이 문제인가
현재 embodied navigation 시스템은 짧고 익숙한 명령에는 잘 작동하지만, 구조적인 공간 추론이 필요한 순간에 쉽게 무너진다.
예를 들면 다음과 같다.
- “의자를 지나 복도에서 왼쪽으로 돌고 파란 문 앞에 멈춰라”와 같은 복합 명령
- 아직 관측되지 않았거나 가려진 공간에 대한 추론
- 이전에 본 장소와 현재 위치의 관계 추론
- 서로 다른 건물에서도 적용할 수 있는 공간적 규칙
- metric, topological, semantic relation을 함께 사용하는 계획
- 중간 sub-goal이 실패했을 때 이후 계획을 수정하는 능력
- 불확실한 위치와 관측을 고려한 행동 결정
현재 모델은 이런 문제를 하나의 거대한 image-language-to-action mapping으로 처리하려는 경향이 있다. 하지만 입력과 행동 사이에 재사용 가능한 공간 구조가 없다면 환경이 조금만 달라져도 성능이 급격히 떨어질 수 있다.
이 워크숍은 그 원인을 다음과 같이 본다.
현재 시스템은 perception 결과를 action으로 변환할 수는 있지만, 공간을 구성하고 관계를 조작할 수 있는 robust internal representation이 부족하다.
2. 이들이 말하는 spatial intelligence란 무엇인가
여기서 spatial intelligence는 단순히 물체와 장소를 인식하는 능력이 아니다.
다음과 같은 전체 능력을 의미한다.
- 환경의 공간 구조를 내부적으로 표현한다.
- 물체·장소·경로 사이의 관계를 구성한다.
- 관측되지 않은 영역과 숨겨진 상태를 추론한다.
- 언어 지시를 공간적 관계와 sub-goal로 변환한다.
- 만들어진 표현을 planning과 locomotion에 사용한다.
- 새로운 환경과 sensor에도 공간적 규칙을 전이한다.
- 불확실성과 실패에 따라 표현과 계획을 수정한다.
따라서 핵심은 단순 localization이나 object detection이 아니다.
공간 정보를 행동에 유용한 구조로 만들고, 그 구조 위에서 새로운 관계와 경로를 추론하는 능력이다.
3. Structured reasoning은 무엇을 의미하는가
이 워크숍이 말하는 structured reasoning은 VLM에 자연어로 chain-of-thought를 생성하게 하는 것만을 의미하지 않는다.
구조는 다양한 형태가 될 수 있다.
- metric map
- topological graph
- semantic map
- scene graph
- object-centric representation
- affordance graph
- hierarchical task graph
- language-grounded spatial relation
- belief map과 uncertainty representation
- learned latent structure
중요한 것은 표현이 명시적인 symbolic graph인지 neural latent인지가 아니다. 다음 조건을 만족하는지가 중요하다.
- 공간 관계를 조합할 수 있는가
- 여러 단계의 계획에 재사용할 수 있는가
- 관측이 바뀌어도 일관성을 유지하는가
- 실패한 sub-goal을 국소적으로 수정할 수 있는가
- 새로운 환경에서도 관계의 의미가 유지되는가
- 모델의 실제 행동 결정에 기여하는가
즉 structured representation은 보기 좋은 중간 결과가 아니라 compositionality, generalization, diagnosability를 가능하게 하는 계산 구조여야 한다.
4. 여섯 가지 핵심 문제의 의미
C1. Spatial representation learning
첫 번째 질문은 어떤 표현을 학습해야 공간 추론이 가능해지는가다.
현재 representation은 perception benchmark에 유리하도록 학습되는 경우가 많다. 물체 분류나 image-text alignment에는 뛰어나더라도, 다음 질문에는 답하지 못할 수 있다.
- 두 장소가 어떻게 연결되어 있는가
- 특정 물체 뒤에 무엇이 있을 가능성이 높은가
- 현재 관측이 과거 지도와 어떻게 대응되는가
- 목표에 도달하려면 어떤 공간 관계를 순차적으로 만족해야 하는가
따라서 단순 feature quality가 아니라 downstream spatial reasoning을 가능하게 하는 representation quality를 연구해야 한다는 주장이다.
연구 기회는 다음과 같다.
- geometry-aware pretraining
- object- and relation-centric representation
- equivariant spatial representation
- metric·topological·semantic hybrid map
- action-conditioned spatial representation
- 공간 관계를 보존하는 training objective
C2. Compositional and long-horizon spatial reasoning
복잡한 instruction은 하나의 action으로 직접 변환하기 어렵다.
예를 들어 다음 지시는 여러 공간적 조건으로 분해되어야 한다.
“의자를 지나고, 복도에서 왼쪽으로 돈 다음, 파란 문 앞에 멈춰라.”
이를 구조화하면 다음과 같다.
- 의자를 식별한다.
- 의자를 통과해야 하는 landmark로 설정한다.
- 복도 진입을 확인한다.
- 적절한 교차점에서 왼쪽으로 회전한다.
- 파란 문을 검색한다.
- 문의 앞이라는 spatial relation을 만족하며 정지한다.
문제는 중간 단계가 실패했을 때다. 의자를 잘못 인식하거나 복도 진입을 놓쳤다면 이후 sub-goal도 수정되어야 한다.
따라서 중요한 것은 task decomposition 자체보다 sub-goal의 성공·실패를 추적하고 그 영향을 이후 계획에 전파하는 것이다.
C3. Generalizable cognitive maps
지도는 정확하기만 하면 되는 것이 아니라 다른 환경에서도 사용할 수 있어야 한다.
그러나 map abstraction에는 본질적인 trade-off가 있다.
| 표현 | 장점 | 약점 |
|---|---|---|
| Metric map | 정밀한 위치와 경로 계산 | geometry와 sensor 변화에 민감함 |
| Topological map | 구조 변화에 비교적 강하고 확장성이 좋음 | 정밀 제어에 부족함 |
| Semantic map | 언어 지시 및 task reasoning에 유리함 | geometry와 connectivity를 잃을 수 있음 |
| Latent map | end-to-end 학습에 유리함 | 해석과 수정이 어려움 |
| Hybrid map | 여러 수준의 추론 가능 | 설계와 학습이 복잡함 |
그래서 진짜 질문은 “어떤 map이 최고인가?”가 아니다.
어떤 문제에 어느 abstraction level이 필요하며, 로봇이 상황에 따라 그 수준을 전환하거나 결합할 수 있는가?
이것이 generalizable cognitive map의 핵심 연구 기회다.
C4. Grounding language to spatial reasoning
VLM이나 LLM은 언어적 공간 지식이 풍부하지만, 실제 geometry와 결합할 때 취약해질 수 있다.
예를 들어 “복도 끝”, “문 앞”, “의자 너머”, “두 번째 왼쪽” 같은 표현은 단순 object grounding만으로 해결되지 않는다. 관찰자의 시점, 진행 방향, topology, 이동 이력을 함께 고려해야 한다.
언어 모델과 spatial representation의 결합 방식에는 두 극단이 있다.
- Tight coupling: 언어와 공간 표현을 하나의 모델에서 공동 학습
- Loose coupling: VLM은 해석을 담당하고, map·planner는 별도로 유지
Tight coupling은 유연하지만 hallucination과 representation entanglement가 생길 수 있다. Loose coupling은 검증과 수정이 쉽지만 interface error와 정보 손실이 생길 수 있다.
따라서 중요한 연구 질문은 다음과 같다.
언어 모델에 공간 추론을 모두 맡길 것인가, 아니면 언어 모델이 구조화된 공간 추론기를 호출하게 할 것인가?
C5. Uncertainty-aware navigation
공간 추론은 항상 불확실성을 포함한다.
- 현재 위치가 확실하지 않다.
- 물체가 가려져 있다.
- landmark description이 모호하다.
- map이 오래되었다.
- 여러 경로가 가능한 상태다.
- instruction이 환경과 일치하지 않는다.
현재 navigation model은 단일한 action이나 경로를 자신 있게 출력하지만, 그 결과가 실제로는 불확실할 수 있다.
구조화된 spatial reasoning은 불확실성을 다음과 같이 분해할 수 있다.
- localization uncertainty
- object existence uncertainty
- relation uncertainty
- instruction grounding uncertainty
- route uncertainty
- sub-goal completion uncertainty
이렇게 uncertainty의 원인을 분리하면 로봇이 다음 행동 중 하나를 선택할 수 있다.
- 추가 관측을 얻는다.
- 재탐색한다.
- 대체 경로를 선택한다.
- 사용자에게 질문한다.
- 보수적인 행동으로 전환한다.
즉 uncertainty는 단순 confidence score가 아니라 다음 reasoning과 action을 결정하는 state가 되어야 한다.
C6. Evaluation methodology
이 워크숍에서 가장 중요한 문제 중 하나다.
현재 benchmark의 높은 성공률이 genuine spatial understanding을 의미하지 않을 수 있다.
모델은 다음 shortcut을 사용할 수 있다.
- 익숙한 visual landmark를 암기한다.
- instruction에서 자주 등장하는 행동 패턴을 따른다.
- 특정 dataset의 map layout prior를 이용한다.
- 목표를 실제로 이해하지 않고 object co-occurrence를 사용한다.
- training과 유사한 trajectory를 재생한다.
따라서 평가는 최종 Success Rate나 SPL만 측정해서는 부족하다.
진짜 spatial reasoning benchmark는 다음을 검사해야 한다.
- 공간 관계를 바꾸면 행동도 적절히 바뀌는가
- 같은 언어를 다른 geometry에서 실행할 수 있는가
- 같은 geometry를 다른 언어 표현으로 이해하는가
- landmark의 appearance가 바뀌어도 관계를 유지하는가
- 중간 sub-goal 실패 후 계획을 복구하는가
- 보지 못한 공간을 추론하되 확신을 과장하지 않는가
- map이나 reasoning module을 제거하면 성능이 실제로 하락하는가
- counterfactual perturbation에 논리적으로 반응하는가
결국 가장 어려운 질문은 다음과 같다.
모델이 정말 공간을 추론한 것인지, 데이터셋의 규칙성을 이용해 정답만 맞힌 것인지 어떻게 구별할 것인가?
5. 무엇이 가장 큰 연구 기회인가
① Geometry와 foundation model의 재결합
최근 embodied AI는 language와 large-scale pretraining에 집중하면서 전통적인 geometry가 상대적으로 뒤로 밀렸다. 그러나 navigation에서는 metric consistency, visibility, connectivity, collision constraint를 피할 수 없다.
따라서 강한 연구 방향은 language model이 geometry를 대체하는 것이 아니라 다음을 결합하는 것이다.
- VLM의 semantic prior
- SLAM과 mapping의 geometric consistency
- graph reasoning의 compositionality
- planner의 feasibility constraint
- policy learning의 adaptability
즉 foundation model과 classical spatial machinery의 결합이 중요한 기회다.
② Multi-level spatial abstraction
하나의 표현으로 모든 navigation 문제를 해결하기는 어렵다.
- 장거리 계획에는 topology가 적합하다.
- landmark grounding에는 semantic structure가 필요하다.
- obstacle avoidance에는 metric geometry가 필요하다.
- instruction execution에는 task hierarchy가 필요하다.
따라서 환경과 reasoning horizon에 따라 서로 다른 공간 표현을 동적으로 선택하고 연결하는 architecture가 유망하다.
③ Reasoning을 행동과 결합하는 closed loop
공간 reasoning이 그럴듯한 설명을 생성하는 데서 끝나면 안 된다.
좋은 시스템은 다음 loop를 가져야 한다.
- 공간 상태를 추론한다.
- sub-goal과 행동을 결정한다.
- 행동 결과를 관측한다.
- 기존 reasoning이 맞았는지 검증한다.
- map, belief, sub-goal을 수정한다.
즉 open-loop chain-of-thought보다 action-conditioned, feedback-driven spatial reasoning이 중요하다.
④ Structure의 유효성을 검증하는 benchmark
새로운 scene graph나 map architecture를 제시하는 것보다, 그 구조가 실제로 필요하다는 것을 입증하는 것이 더 어려우면서도 가치가 크다.
예를 들어 다음과 같은 평가가 필요하다.
- representation intervention
- relation-level counterfactual
- map corruption과 recovery
- language paraphrase와 geometry permutation
- unseen topology transfer
- partial observability와 occlusion stress test
- sub-goal failure propagation
- matched perception performance 아래에서의 reasoning 비교
이는 “구조를 넣었더니 성능이 올랐다”를 넘어 어떤 구조가 어떤 종류의 일반화를 가능하게 했는가를 밝히는 연구다.
6. 왜 지금 필요한가
VLM이 공간을 잘 이해한다는 착시가 생겼기 때문이다
최신 VLM은 이미지에 있는 물체와 관계를 언어로 매우 자연스럽게 설명한다. 그러나 자연스러운 설명과 안정적인 공간 추론은 다르다.
- left/right가 viewpoint에 따라 흔들린다.
- metric distance에 취약하다.
- occluded region을 근거 없이 추측한다.
- 여러 단계의 relation composition에서 오류가 누적된다.
- 언어적으로 그럴듯하지만 물리적으로 불가능한 경로를 만든다.
VLM의 표면적 유창성이 높아질수록 실제 spatial competence를 엄밀하게 측정할 필요가 커진다.
Navigation task가 길고 복잡해지고 있기 때문이다
point-goal navigation이나 짧은 object navigation에서 벗어나 다음과 같은 문제가 중요해지고 있다.
- long instruction following
- mobile manipulation
- multi-room task
- lifelong navigation
- interactive instruction
- navigation with search and recovery
- multi-agent embodied reasoning
이런 task에서는 공간 구조와 sub-goal state를 명시적으로 관리하지 않으면 오류가 누적된다.
Pretraining의 다음 병목이 structure이기 때문이다
대규모 pretraining은 perception과 semantic knowledge를 크게 개선했다. 그러나 데이터와 모델 규모를 늘리는 것만으로 compositional spatial reasoning이 자동으로 나타난다는 보장은 없다.
따라서 다음 단계는 다음 질문으로 이동한다.
더 큰 모델을 만들 것인가가 아니라, 모델이 공간을 어떤 구조로 표현하고 그 위에서 어떻게 계산하게 할 것인가?
실제 배치에서는 generalization과 recovery가 중요하기 때문이다
실제 로봇은 benchmark처럼 정해진 환경과 완벽한 instruction에서만 움직이지 않는다.
- 처음 보는 건물
- 변경된 가구 배치
- 모호한 지시
- 가려진 landmark
- 잘못된 map
- localization failure
- 중간 행동 실패
이때 필요한 것은 평균적인 성공률만 높은 policy가 아니라, 자신이 무엇을 알고 모르는지 표현하고, 실패 원인을 구조적으로 찾아 계획을 수정할 수 있는 시스템이다.
7. 이 워크숍의 숨은 핵심 주장
표면적인 질문은 “navigation에 어떤 spatial representation을 사용할 것인가?”다.
하지만 더 깊은 질문은 다음과 같다.
Embodied foundation model 내부에 world structure가 실제로 존재하는가? 존재한다면 그것을 어떻게 검증하고, 조작하고, 행동에 사용할 것인가?
즉 이 워크숍은 navigation architecture 하나를 제안하는 자리가 아니라, 현재의 end-to-end embodied learning이 놓치고 있는 representation과 reasoning의 중간층을 다시 연구 대상으로 복원하려는 움직임이다.
8. Memory 및 adaptation과의 관계
앞서 본 두 워크숍과 결합하면 세 주제의 역할이 명확해진다.
| 주제 | 핵심 질문 | 시스템에서의 역할 |
|---|---|---|
| Spatial intelligence | 세계를 어떤 구조로 표현하고 추론할 것인가 | 공간적 world state와 reasoning substrate |
| Memory | 과거의 어떤 경험을 저장하고 다시 사용할 것인가 | 시간에 걸친 state와 experience persistence |
| Adaptation | 축적된 경험으로 모델을 어떻게 변화시킬 것인가 | deployment experience의 능력 전환 |
세 가지를 연결하면 다음과 같은 시스템이 된다.
- Spatial intelligence가 현재 세계를 구조화한다.
- Memory가 그 구조와 경험을 시간에 걸쳐 보존한다.
- Adaptation이 반복되는 경험을 policy와 representation의 개선으로 바꾼다.
따라서 가장 강한 통합 연구 질문은 다음과 같다.
로봇은 변화하는 세계의 공간 구조를 어떻게 지속적으로 기억하고, 불확실한 상황에서 그 구조를 추론하며, 축적된 경험으로 표현과 행동을 개선할 것인가?
한 줄 평
이 워크숍은 “navigation에 scene graph나 semantic map을 붙이자”는 단순한 제안이 아니다.
현재의 pattern-matching navigation policy를, 공간 관계를 구성하고 조작하며 실패 시 수정할 수 있는 structured spatial reasoner로 전환하자는 연구 의제다.
그리고 가장 중요한 승부처는 새로운 map representation을 하나 더 제안하는 것이 아니라, 그 표현이 shortcut을 넘어 실제 compositional reasoning과 cross-environment generalization을 가능하게 했음을 증명하는 평가 설계에 있을 가능성이 크다.