Release Notes · Google DeepMind

Gemini Robotics 2,
몸을 가진 AI로 가는 대화

39분 대담을 “누가 무엇을 왜 말했는가” 중심으로 재구성한 읽기 지도입니다. 모델 발표, 데이터 병목, 정교 조작, 배포·안전, Physical AGI까지 논지가 이어집니다.

영상: Introducing Gemini Robotics 239:06화자별 탐색 가능한국어 편집 요약
Original video

Introducing Gemini Robotics 2

영상을 이 페이지에서 바로 재생하면서 아래의 화자별 요약, 영문 대화, 한국어 번역을 함께 읽으실 수 있습니다.

이 대담의 한 문장

“언어와 시각을 이해하는 Gemini에 행동을 더했지만, 사람 수준의 물리 지능은 여전히 데이터·손·감각·안전이라는 현실의 벽을 넘어야 한다.”

논의의 3개 축

① 능력전신 제어·정교 조작·다중 로봇 협업
② 학습물리 상호작용 데이터와 embodiment gap
③ 현실화배포, 안전, 인간 중심 환경
Logan Kilpatrick진행 · 문제를 구조화하고 실용성 질문
Carolina Parada총괄 비전 · 일반목적 로보틱스와 배포
Stuart Bowers학습·데이터·시뮬레이션 관점
Kanishka Rao모델 전이·embodied reasoning 관점
Jie Tan전신 제어·정교 조작·Physical AGI 관점
화자명은 첨부 대본의 소개·직접 호명(예: “as Jie mentioned”)과 발언 문맥을 기준으로 정리했습니다. 원 대본에 화자 레이블이 없는 일부 구간은 문맥 기반 배정이므로, 발언의 의미를 우선해 읽어 주세요.

화자를 누르면 해당 발언만 남습니다. 시간 배지는 영상의 원 대본 기준입니다.

00:38Logan대화의 문을 엽니다

“로봇은 정말 어렵다”에서 출발합니다

새 Gemini Robotics 2 제품군을 소개하며, 오늘의 결론보다 먼저 이 지점에 오기까지의 연구 궤적을 여쭙니다.

프레이밍제품군
01:14–02:00Carolina일반목적 로보틱스의 목표

로봇에 ‘인간 수준의 이해–추론–행동’을 더하고자 합니다

목표는 특정 데모를 잘하는 로봇이 아니라, 환경을 이해하고 과업을 추론한 뒤 사람처럼 손재주 있게 실행하는 범용 지능 계층입니다.

general-purposeintelligence layer
02:19–04:48CarolinaGemini Robotics 2의 3가지 변화

전신 지능 · 정교 조작 · 다중 로봇 협업입니다

차고 정리처럼 몸 전체를 써야 하는 과업, 지퍼·문·물건처럼 접촉이 중요한 손동작, 그리고 각기 다른 로봇이 병렬로 일하는 협업을 한 묶음으로 제시합니다.

whole-body intelligencedexteritymulti-robot
04:50–05:17Logan사용자 관점의 상상

집안 로봇들도 서로 일을 나눌 수 있을까요?

로봇 청소기와 다른 가정용 로봇이 단순히 공존하는 대신, 서로 요청하고 작업을 분담하는 장면을 상상하며 협업의 실용성을 짚어 봅니다.

05:39–08:19Carolina연구의 계보

RL → Transformers → VLA → Gemini에 행동을 더했습니다

시뮬레이션 기반 강화학습, 언어·시각을 통한 계획, 데이터 중심 로보틱스, Vision-Language-Action 모델로 이어진 흐름을 설명합니다. Gemini Robotics는 Gemini의 세계 이해에 행동을 하나의 모달리티로 더한 결과입니다.

reinforcement learningVLAmultimodal
09:37–10:45Jie남아 있는 가장 어려운 문제

걷기는 높이 올라왔지만, 손은 아직 미해결입니다

전신 이동은 크게 진전됐지만 일상 물체를 손·그리퍼로 다루는 정교 조작은 접촉점과 20개가 넘는 자유도를 동시에 제어해야 합니다. 그래서 훨씬 어렵습니다.

contact-richmanipulation
11:03–11:39Stuart데이터 병목

인터넷에는 ‘물리 상호작용의 흔적’이 부족합니다

컵을 여는 동안 내 움직임과 환경의 반응이 이어지는 궤적은 텍스트·이미지 인터넷처럼 풍부하게 축적돼 있지 않습니다. Physical AGI의 핵심 레버가 데이터 수집·품질인 이유입니다.

physical datadata quality
12:18–13:50Jie데이터 피라미드

정확할수록 비싸고, 넓을수록 행동 정보가 빠집니다

텔레오퍼레이션은 로봇 행동 신호가 정확하지만 비쌉니다. 착용형 데이터는 더 확장 가능하지만 사람과 로봇의 몸이 다른 gap이 있고, 1인칭 사람 영상은 가장 넓지만 힘·행동 라벨이 부족합니다.

teleoperationembodiment gapegocentric video
14:35–15:35Kanishka기존 Gemini를 그대로 쓰기 어려운 이유

디지털 토큰과 물리 데이터의 규모가 다릅니다

물리 데이터셋은 언어·시각 사전학습 데이터에 비해 아주 작고, 섞는다고 자동으로 잘 작동하지 않습니다. 그래서 로보틱스에 맞춘 모델 연결 방식 자체가 여전히 연구 문제입니다.

16:10–17:08Carolina능력과 배포를 분리해서 봅니다

학습은 넓게, 초기 배포는 반구조화된 곳에서 시작할 수 있습니다

능력 면에서는 좁은 환경에 맞춘 정책이 쉽게 깨지므로 다양성을 지향합니다. 반면 실제 배포는 안전을 통제하고 경험을 모으기 쉬운 산업 환경에서 먼저 시작할 가능성이 높다고 봅니다.

generalizationindustrial deployment
17:21–17:51Stuart다양성이 만드는 일반성

가정은 어렵지만, 바로 그 다양성이 학습에 필요합니다

가정 환경은 가장 많은 변이를 요구합니다. 좁은 과업만 학습하면 오히려 성능이 취약해지므로, 폭넓은 사례가 일반 지능을 키운다는 역설을 짚어 봅니다.

18:01–19:18Logan‘90% 성공’의 현실성 질문

10%의 실패가 와인잔을 깨면, 사용자는 받아들일까요?

대규모 실제 배포가 데이터 플라이휠을 만들지 못하는 이유를 여쭙니다. 로봇의 실패 비용과 신뢰 수준을 직관적으로 드러내는 질문입니다.

reliabilityuser trust
19:19–20:40Stuart배포를 막는 부트스트랩 문제

멋진 데모와 하루 종일 돌아가는 시스템 사이에는 간극이 있습니다

정책이 일반화되는 듯 보여도 하루 동안 계속 변하는 작은 조건들을 안정적으로 처리하기 어렵습니다. 로봇이 막혔을 때 사람이 개입하고, 그 순간에서 빠르게 학습하는 고리가 아직 핵심 과제입니다.

baseline performancehuman intervention
20:42–21:25Carolina파트너십 전략

모델 회사가 로봇 하드웨어 파트너와 깊게 연결되는 이유입니다

DeepMind가 직접 모든 로봇을 만들기보다 다양한 파트너 하드웨어와 연결해, AI 능력과 하드웨어의 부족분을 함께 발견하고 안전한 실제 배포로 검증하려 합니다.

22:39–23:34Carolina그 다음 병목

손을 풀어도 ‘사람과 함께 사는 능력’이 남습니다

정교 조작을 일반적으로 해결하면 기회는 폭발하지만, 일상 공간에는 안전·보안·프라이버시와 인간의 의도를 이해하는 별도의 문제가 남습니다.

human-centricsafetyprivacy
24:10–25:45JiePhysical AGI의 시간축

“쉬운 일은 로봇에 어렵다”는 Moravec의 역설입니다

일반목적 로봇의 일상 진입은 현재 5~10년 범위로 보지만, 신체를 가진 지능은 디지털 에이전트와 다르게 더 많은 시간이 걸릴 수 있다고 말합니다. 사람에게 쉬운 요리·버거 뒤집기가 대표적입니다.

physical AGIMoravec's paradox
25:55–26:51Carolina감각과 하드웨어

시각만으로는 손의 ‘피부’를 대체할 수 없습니다

현재 로봇은 주로 시각과 손 위치에 의존합니다. 사람은 손 전체의 촉각으로 물체를 느끼므로, 인간 수준의 조작에는 센싱 능력과 하드웨어도 함께 따라와야 합니다.

tactile sensinghardware
26:59–27:41Stuart상위 모델이 만드는 연구 루프

모델이 로봇을 보고 “다른 데이터를 모아라”고 조언할 수 있습니다

Embodied reasoning 모델이 수행을 관찰하고, 상위 모델이 하위 제어 모델에 지시하는 피드백 루프가 생기기 시작했다고 설명합니다. AGI 능력이 연구·데이터 수집 자체를 가속하는 경로입니다.

27:52–30:20Kanishka데모: 손재주의 난도

포도 지퍼백, 전구 돌리기, 쓰레기봉투 매듭을 시연합니다

Gemini Robotics 2가 손과 전신을 같은 학습 방식으로 제어하는 사례를 보여 줍니다. 정밀 접촉과 3차원 공간 이해가 필요한 과업들입니다.

Apollohigh-DoF handsdemo
30:48–31:41Kanishka로봇 몸체 간 전이

한 로봇에서 배운 개념을 다른 손·그리퍼로 옮깁니다

GR 2는 로봇마다 별도 모델을 훈련하는 방식이 아니라 다양한 로봇 데이터에서 학습합니다. 그리퍼 과업과 다관절 손 과업 사이에 전이의 초기 신호가 보인다고 말합니다.

cross-embodiment transferGR 2
31:42–32:37Carolina전이가 가능한 이유

정리 과업의 90%는 ‘손을 어떻게 움직이나’보다 ‘무엇을 어디에 둘까’입니다

하드웨어의 한계는 다르지만, 물체·목적·배치에 대한 의미 이해는 공유됩니다. 로봇 형태가 계속 바뀌는 현실에서 이 공통 의미가 중요합니다.

33:15–33:58Stuart코드와 시뮬레이션

현실에서는 규칙 코드보다, 시뮬레이터에서 코드가 더 유용합니다

현실 픽셀로부터 정확한 관절 각을 규칙적으로 계산하는 일은 매우 어렵습니다. 반면 시뮬레이션에서는 거리 등 숨은 정답 상태를 알 수 있어, 데이터 생성·정책 평가·정밀한 가이드에 코드가 도움 됩니다.

simulationprivileged information
34:17–34:47Jie패러다임 전환

규칙 기반 제어에서 데이터 기반 최적화로 옮겨가고 있습니다

수십 년간 작성해 온 규칙 코드는 환경 변화에 일반화하기 어렵습니다. 신경망·학습은 결국 코드 위에서 이뤄지지만, 핵심은 자동화된 연구와 데이터 기반 최적화입니다.

35:19–36:11Carolina접근성

Embodied Reasoning은 API로, Action 모델은 파트너·테스터에게 제공합니다

Embodied Reasoning 2는 AI Studio 및 API를 통해 넓게 제공할 계획입니다. 더 강한 action 모델은 하드웨어 파트너 중심이며, 온디바이스 버전은 신뢰 테스터가 작업·로봇별로 미세조정할 수 있습니다.

APIon-devicetrusted testers
36:39–38:41CarolinaER 2의 확장성과 안전

영상 진행 이해 · 모호성 확인 · 사람 근접 감지를 강화합니다

ER 모델은 2D/3D 공간 이해를 넘어 영상에서 과업이 얼마나 진행됐는지 파악합니다. 애매한 지시에는 먼저 확인하고, 사람과 로봇이 가까운 환경을 더 안전하게 다루도록 설계했습니다. 공개 Asimov Agentic 벤치마크도 소개합니다.

video understandingproactive clarificationAsimov Agentic
38:43–39:06Logan마무리

출시는 출발점이며, 모델을 실제 세계에 붙이는 다음 단계가 남아 있습니다

대화는 Gemini Robotics 2의 발표를 축하하면서 끝나지만, 앞선 논의가 남긴 메시지는 명확합니다. 손재주를 넘어 데이터·감각·안전·배포까지 함께 풀어야 로봇이 일상으로 들어올 수 있습니다.