구글, Gemini Robotics 2 발표…로봇 제어 모델은 파트너 한정

작업대 앞에서 협업하는 양팔 로봇과 Apptronik Apollo 2 휴머노이드
Gemini Robotics ER 2가 여러 로봇을 조율하는 공식 영상의 한 장면. 왼쪽은 양팔 로봇, 오른쪽은 Apptronik Apollo 2 휴머노이드다. 출처: Google DeepMind

구글 딥마인드는 7월 31일 차세대 로봇 AI 제품군 Gemini Robotics 2를 발표했다. 구글 딥마인드는 발표에서 휴머노이드의 전신 동작, 손과 그리퍼의 정밀 조작, 여러 로봇의 협업을 전면에 내세웠다. 세 모델 가운데 일반 개발자가 바로 시험할 수 있는 것은 고수준 추론 모델 Gemini Robotics ER 2의 API 프리뷰다. 구글은 전신 제어 모델 Gemini Robotics 2와 로컬 실행 모델 On-Device 2를 파트너 프로그램을 통해 제한적으로 제공한다.

서로 다른 3개의 제품이 발표됐다

구글이 발표한 세 제품은 전신 제어용 Gemini Robotics 2, 고수준 추론용 Gemini Robotics ER 2, 로컬 실행용 Gemini Robotics On-Device 2다. 이름은 비슷하지만 역할과 제공 범위가 다르다. ER 2는 상황을 이해하고 작업 순서를 정하며, 두 VLA는 로봇 관절을 움직이는 제어 값을 만든다.

Gemini Robotics 2 제품군을 이루는 세 모델의 역할과 제공 범위
모델역할출력제공 범위
Gemini Robotics 2휴머노이드와 양팔 로봇을 제어하는 VLA모터 제어 명령초기 파트너, 대기 목록
Gemini Robotics ER 2영상 이해, 계획, 도구 호출, 여러 로봇 조율텍스트AI Studio와 Gemini API 공개 프리뷰
Gemini Robotics On-Device 2로봇 장치에서 로컬 실행하는 경량 VLA로봇 제어 값Trusted Tester 한정
세 모델의 역할과 제공 범위. 일반 개발자는 ER 2 프리뷰를 이용할 수 있다.
출처: Google DeepMind 모델 페이지와 모델 카드

Gemini Robotics 2 VLA는 시각과 언어 입력을 모터 제어 명령으로 바꾼다. 미국 로봇 기업 Apptronik의 휴머노이드 Apollo 2를 걷게 하고 물체를 집게 했으며, SharpaWave 로봇 손으로 전구를 돌리고 Franka F3 Duo로 정밀한 삽입 작업을 수행했다. 구글 평가에서 Apollo 2의 바닥 물체 집기 성공률은 45.7%, 선반 물체 집기는 76.3%로 작업에 따라 차이가 컸다.

Gemini Robotics On-Device 2는 로봇에서 직접 실행되므로 인터넷 연결이 필요 없고 클라우드 왕복 지연도 없다. 구글은 200개 미만의 예시와 몇 시간 분량의 데이터만으로 이 모델을 형태, 센서 구성, 자유도가 다른 새로운 양팔 로봇에 맞게 조정할 수 있다고 설명한다. 모델 카드는 평가가 서서 작업하는 양팔 로봇의 조작 과제를 중심으로 이뤄졌다고 밝힌다.

구글은 ER 2가 영상 속 작업 진행을 추적하고 Apollo 2와 Franka F3 Duo가 협업하는 장면도 시연했으며, 관련 수치는 구글 내부 평가에서 나왔다.

일반 개발자가 쓸 수 있는 모델은 ER 2다

Gemini Robotics ER 2는 Google AI Studio에서 선택하거나 Gemini API로 호출할 수 있다. 기업용 Gemini Enterprise Agent Platform에서는 비공개 프리뷰로 제공된다. 전신 제어 모델 Gemini Robotics 2와 로컬 실행 모델 On-Device 2는 초기 파트너와 Trusted Tester에게 제공된다.

세 모델의 가중치와 학습 코드는 공개되지 않았다. robotics-samples 저장소에는 미국 로봇 기업 Boston Dynamics의 사족보행 로봇 Spot과 소형 로봇 Tinybot, 사람이 보내는 원격 조작 입력을 ER 2와 연동하는 예제가 들어 있다. 저장소는 Apache 2.0 라이선스로 제공된다.

ER 2는 영상을 이해하고 로봇 API에 작업을 전달한다

ER 2는 Gemini 3.5 Flash를 바탕으로 만든 VLM이다. 텍스트, 이미지, 영상과 오디오를 받아 물체 위치와 작업 진행을 파악하고, 해야 할 일을 단계로 나눈다. ER 2는 작업 계획을 텍스트로 내놓거나 함수 호출을 통해 개발자가 연결한 로봇 제어 API나 별도 VLA에 전달한다. 모터 전류나 관절 각도를 직접 출력하는 모델은 아니다.

Gemini Robotics ER 2 API 엔드포인트 비교
모델 코드용도주요 인터페이스
gemini-robotics-er-2-preview공간 추론, 영상 속 작업 진행 추적, 도구 조율Interactions API, Batch API
gemini-robotics-er-2-streaming-preview연속 영상과 오디오를 처리하는 실시간 에이전트Gemini Live API
표준 모델과 스트리밍 모델은 모두 프리뷰로 제공된다.
출처: Gemini API 문서

표준 모델은 정적 이미지에서 물체 위치와 이름을 구조화된 텍스트로 반환하고, 스트리밍 모델은 Gemini Live API에서 영상과 오디오를 계속 받아 함수 호출을 수행한다. Spot 시연에서는 ER 2가 이동과 매니퓰레이터 API를 조율해 사용자의 말에 따라 간식을 가져왔다.

표준 ER 2와 스트리밍 ER 2의 유료 단가는 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러로 같다. 무료 등급에서는 입력과 출력 요금이 부과되지 않는다.

실제 로봇에 적용하려면 ER 2 외에도 충돌 회피, 힘 제어, 균형 제어 시스템과 하드웨어 비상 정지 장치를 마련해야 한다. 구글은 의료와 운송처럼 안전이 중요한 분야에는 사용하지 말라고 안내한다.

일반 개발자는 ER 2로 영상 이해와 작업 계획을 시험하고 이를 자체 로봇 API에 연결할 수 있다. 전신 제어 모델과 로컬 실행 모델은 파트너 프로그램을 통해 제공되며, 공식 영상의 전신 동작에는 이들 모델과 로봇 제어 시스템이 함께 쓰인다.

원문 출처