Memory for Robot Foundation Models: 문제, 기회, 그리고 Why Now
이 워크숍의 핵심 주장은 다음과 같다.
현재 robot foundation model은 순간적으로는 유능하지만, 과거 경험을 선택적으로 기억하고 수정하며 행동을 개선하는 능력은 매우 약하다.
즉, 지금의 VLA나 generalist policy가 사실은 매 timestep을 거의 새 문제처럼 풀고 있으며, 긴 context window나 과거 영상 retrieval을 붙였다고 해서 그것이 곧 진정한 robot memory는 아니라는 문제의식이다.
1. 구체적으로 무엇이 문제인가
현실의 로봇은 현재 관측만 보고는 올바르게 행동할 수 없는 경우가 많다.
예를 들면 다음과 같다.
- 머그컵이 지금 보이지 않지만 조금 전에 찬장에 넣었다.
- 서랍 안을 이미 확인했기 때문에 다시 열 필요가 없다.
- 이전 grasp가 미끄러짐 때문에 실패했으므로 접근 각도를 바꿔야 한다.
- 어떤 사용자가 특정 물체를 항상 특정 위치에 두기를 선호한다.
- 지난주에는 있던 장애물이 오늘은 사라졌다.
- 긴 작업 중 어디까지 완료했는지 추적해야 한다.
이런 문제는 현재 이미지나 짧은 observation window만으로 해결할 수 없다. 과거의 관련 정보를 저장하고, 필요한 순간에 다시 불러오며, 그 기억을 현재 상황에 맞게 해석해야 한다.
그런데 현재 robot foundation model에서 memory라고 부르는 것은 대체로 다음 수준에 머물러 있다는 비판이다.
- 최근 몇 프레임을 context에 넣기
- 긴 video sequence를 transformer에 넣기
- replay buffer에 과거 데이터를 저장하기
- 유사한 이미지를 retrieval하기
- 과거 관측을 단순 누적한 map 사용하기
이것들은 정보를 보존할 수는 있지만, 무엇을 기억하고 언제 꺼내며 어떻게 행동을 바꿀 것인지까지 해결하지는 못한다.
2. 이들이 말하는 진짜 memory란 무엇인가
이 워크숍에서 memory는 단순 저장소가 아니라 다음의 전체 과정이다.
- 경험한다.
- 무엇이 중요한지 선택한다.
- 선택한 경험을 저장하고 구조화한다.
- 필요한 순간에 관련 기억을 검색한다.
- 검색한 기억으로 행동을 변화시킨다.
- 기억을 업데이트하고 통합하거나 잊는다.
따라서 memory system은 최소한 다음 질문에 답해야 한다.
- 무엇을 저장할 것인가?
- 어떤 형태로 저장할 것인가?
- 언제 어떤 기억을 검색할 것인가?
- 검색된 기억이 policy나 planner를 어떻게 바꿀 것인가?
- 오래되거나 틀린 기억을 어떻게 수정·삭제할 것인가?
- 기억을 사용해 다음 행동이 실제로 개선되었는가?
핵심은 retrieval 자체가 아니라 behavioral consequence다. 기억을 꺼냈더라도 행동이나 성공률이 개선되지 않으면 유용한 robot memory라고 보기 어렵다.
3. 무엇이 가장 어려운가
무엇을 기억해야 하는가
로봇이 경험하는 모든 영상과 sensor stream을 그대로 저장하는 것은 비효율적이다. 저장량도 커지고 retrieval 후보도 지나치게 많아진다.
반대로 지나치게 압축하면 중요한 사건을 잃을 수 있다.
예를 들어 반복적인 정상 grasp 1,000회보다 이상하게 미끄러진 실패 1회가 미래 행동에 더 중요할 수 있다. 따라서 단순 빈도가 아니라 미래 의사결정에 대한 가치를 기준으로 저장해야 한다.
어떤 추상화 수준으로 기억해야 하는가
같은 사건도 여러 형태로 저장할 수 있다.
- raw image/video
- 3D geometry
- object state
- trajectory
- language summary
- symbolic event
- latent vector
- 성공·실패의 원인
“컵이 픽셀 좌표 어디에 있었다”보다 “컵을 오른쪽 찬장에 넣었다”가 장기간 사용할 기억으로는 더 적절할 수 있다. 반면 정밀 manipulation에는 언어 요약만으로 부족하다.
따라서 중요한 연구 질문은 어떤 기억을 어느 abstraction level로 저장할 것인가다.
올바른 기억을 찾아야 한다
현재 상황과 시각적으로 유사한 기억이 반드시 행동에 관련된 기억은 아니다.
예를 들어 현재 grasp 실패의 원인을 찾을 때 비슷하게 생긴 물체보다 동일한 재질, gripper 상태 또는 실패 유형을 가진 과거 사례가 더 중요할 수 있다. 즉 retrieval similarity와 decision relevance가 다르다는 문제가 있다.
기억은 틀리거나 오래될 수 있다
현실 세계는 변한다.
- 물체가 이동한다.
- 가구 배치가 바뀐다.
- 사용자의 선호가 변한다.
- 과거에 성공했던 행동이 장비 마모로 실패할 수 있다.
따라서 persistent memory는 단순 누적이어서는 안 된다. 기억마다 validity, recency, confidence, provenance를 관리하고, 충돌하는 정보가 생기면 수정하거나 폐기해야 한다.
기억과 policy를 연결해야 한다
외부 DB에서 올바른 기억을 찾는 것만으로는 부족하다. 그것을 실제 control과 planning에 반영해야 한다.
- policy input에 memory token으로 넣을 것인가
- planner의 state나 constraint로 사용할 것인가
- world model prediction을 보정할 것인가
- skill을 선택하는 데 사용할 것인가
- online learning signal로 사용할 것인가
이 연결이 약하면 memory는 행동을 개선하지 못하고 그저 설명용 로그가 된다.
4. 가장 큰 연구 기회는 무엇인가
① Memory taxonomy와 공통 언어
현재 “memory”라는 단어가 너무 넓게 사용된다.
| Memory type | 기억하는 것 | 대표 용도 |
|---|---|---|
| Working memory | 최근 관측과 진행 상태 | 단기 행동 연결 |
| Spatial memory | 장소·물체·구조 | 탐색, 재방문, object permanence |
| Episodic memory | 특정 사건과 경험 | 실패 회피, 사례 기반 행동 |
| Semantic memory | 축적된 일반 지식 | 물체·환경에 대한 일반화 |
| Procedural memory | 행동 방법과 skill | 숙련된 작업 재사용 |
| Social/user memory | 선호·지시·교정 | 개인화와 장기 상호작용 |
이 유형을 구분하지 않으면 서로 다른 시스템을 같은 “memory model”로 부르면서 비교하게 된다. 워크숍은 먼저 이 공통 vocabulary를 만들려는 목적이 있다.
② 기억할 가치의 학습
미래 행동에 유용한 사건만 선택적으로 저장하는 방법이 필요하다.
가능한 기준은 다음과 같다.
- surprise 또는 prediction error
- task relevance
- 실패나 교정 여부
- novelty
- future utility
- uncertainty reduction
- 다른 경험으로 대체할 수 없는 희소성
이것은 결국 memory write policy를 학습하는 문제다.
③ Retrieval을 행동 목적에 맞게 학습
일반적인 visual similarity retrieval이 아니라 현재의 task, belief state, uncertainty, failure mode에 맞는 검색이 필요하다.
Retrieve what helps the next decision, not merely what looks similar.
검색 정확도를 Recall@K로만 평가할 것이 아니라, 검색한 기억을 사용했을 때 task success가 얼마나 개선되는지 봐야 한다는 뜻이다.
④ Consolidation과 abstraction
매번의 개별 경험을 영원히 저장하기보다 반복되는 경험을 일반적인 규칙이나 skill로 통합해야 한다.
예를 들면 다음과 같다.
- “이 컵을 이렇게 잡았더니 미끄러졌다”라는 여러 episode
- → “표면이 매끄러운 원통형 물체에는 더 강한 grip force가 필요하다”는 semantic knowledge
- → 이후 policy나 skill parameter를 수정
이 과정이 인간의 episodic-to-semantic consolidation과 비슷한 연구 기회다.
⑤ Forgetting과 memory revision
망각은 결함이 아니라 필수 기능이라는 관점도 중요하다.
좋은 memory는 모든 것을 영구 보존하는 시스템이 아니라 다음과 같은 선택적인 시스템이어야 한다.
- 오래된 정보를 약화한다.
- 틀린 정보를 수정한다.
- 중복 경험을 압축한다.
- 프라이버시상 삭제해야 할 정보를 제거한다.
- 중요한 희귀 사건은 오래 보존한다.
⑥ 장기·부분관측 benchmark
현재 benchmark는 episode가 짧거나, reset 후 시작하거나, 현재 관측만으로도 풀 수 있는 경우가 많다. 그래서 memory module을 제거해도 성능이 비슷한 일이 생긴다.
진짜 memory benchmark는 다음 조건을 가져야 한다.
- 정답에 필요한 정보가 과거에만 등장한다.
- 충분히 긴 시간적 간격이 존재한다.
- environment state가 관측되지 않거나 가려진다.
- 여러 session을 거쳐야 한다.
- 잘못되거나 오래된 기억이 섞여 있다.
- 단순 context 확장으로 풀 수 없게 통제한다.
- memory를 제거하면 성능이 명확히 하락한다.
이 분야에서 가장 중요한 기회 중 하나는 모델보다 오히려 memory가 정말 필요한 benchmark를 만드는 것일 가능성이 크다.
5. 왜 지금 필요한가
로봇 모델의 horizon이 길어지고 있기 때문이다
초기 robot learning은 수초짜리 pick-and-place를 주로 다뤘다. 지금은 수십 단계의 mobile manipulation, 장기 navigation, 가정 작업, multi-session interaction을 목표로 한다.
task horizon이 길어질수록 현재 관측에 포함되지 않는 과거 정보가 늘어나고, memory가 선택 사항이 아니라 필수 요소가 된다.
VLA의 context window만으로는 부족하기 때문이다
큰 transformer는 더 긴 history를 입력할 수 있지만, 긴 context와 memory는 같지 않다.
긴 context는 다음 문제를 가진다.
- 계산량과 latency 증가
- 오래된 정보에 대한 attention 약화
- 무관한 history로 인한 interference
- persistent multi-session knowledge 유지의 어려움
- 정보 수정과 삭제의 어려움
- 어떤 과거 정보가 실제로 사용되었는지 해석하기 어려움
결국 foundation model이 커질수록 모든 history를 그대로 넣는 방식보다 선택적 저장·검색·압축이 더 중요해진다.
배치된 로봇은 경험을 축적하기 때문이다
실험실 benchmark에서는 매 episode가 reset되지만, 현실의 로봇은 동일한 건물·사용자·장비를 수개월간 경험한다. 그런데 오늘의 경험이 내일의 성능을 전혀 개선하지 않는다면 장기 배치의 가치가 크게 줄어든다.
현실적으로 기대하는 로봇은 다음과 같다.
사용할수록 사용자와 환경을 더 잘 이해하고, 같은 실수를 덜 반복하는 로봇
따라서 lifelong improvement와 memory가 직접 연결된다.
World model과 VLA가 충분히 강해졌기 때문이다
예전에는 perception과 short-horizon control 자체가 병목이어서 memory를 제대로 연구하기 어려웠다. 이제는 foundation model이 순간적인 인식·언어 이해·행동 생성에서 상당한 성능을 보이면서, 다음 병목이 시간에 걸친 일관성, 축적, 적응으로 이동한 것이다.
6. 이 워크숍의 숨은 핵심 주장
표면적인 질문은 “로봇이 무엇을 기억해야 하는가?”지만, 더 깊은 질문은 다음과 같다.
경험이 쌓일수록 실제로 더 나은 로봇이 되게 하려면 어떤 시스템이 필요한가?
현재 robot foundation model은 많은 사전학습 경험을 갖고 배치되지만, 배치 이후 얻는 경험은 대체로 일회성 context로 소비된다. 이 워크숍은 모델을 고정된 policy가 아니라 경험을 축적하고, 재구성하고, 수정하며, 행동을 계속 개선하는 시스템으로 바꾸려는 흐름이다.
7. 앞의 adaptation 워크숍과의 관계
두 워크숍은 매우 가까운 문제를 서로 다른 시간축에서 다룬다.
| 관점 | Adaptation 워크숍 | Memory 워크숍 |
|---|---|---|
| 핵심 질문 | 얼마나 쉽게 새 환경에 맞출 수 있는가 | 과거 경험을 어떻게 유지하고 활용하는가 |
| 주된 시점 | deployment 전후의 모델 변화 | deployment 중 지속되는 경험 |
| 주요 수단 | fine-tuning, RL, ICL, steering | storage, retrieval, consolidation, forgetting |
| 목표 | 빠르고 저렴한 현장 적응 | 반복 사용을 통한 지속적 개선 |
| 공통 병목 | deployment experience를 성능 향상으로 전환하는 것 | |
둘을 연결하면 가장 강한 연구 질문이 나온다.
로봇은 어떤 경험을 기억해야 하며, 그 기억을 어떻게 파라미터·skill·world model의 지속적인 adaptation으로 바꿔야 하는가?
즉 memory는 adaptation을 위한 데이터와 상태를 제공하고, adaptation은 기억된 경험을 실제 능력 변화로 바꾸는 과정이라고 볼 수 있다.
한 줄 평
이 워크숍은 “VLA에 memory module 하나 붙이자”는 이야기가 아니다.
현재의 stateless foundation policy를, 시간에 걸쳐 경험을 축적하고 같은 실수를 줄이며 환경과 사용자에 맞춰 성장하는 persistent robot system으로 전환하자는 연구 의제다.
그리고 기술적으로 가장 중요한 승부처는 memory architecture 자체보다도 진짜 기억 사용과 단순한 긴 context·환경 암기·shortcut을 구별하는 평가 방법에 있을 가능성이 크다.