본문 바로가기
AI & Tech

[로봇에게도 ChatGPT 같은 두뇌가 생긴다] – ‘로봇 파운데이션 모델’의 정체

by TrendIssueGuide 2026. 8. 14.
728x90
반응형
SMALL

반응형
728x90
SMALL

 

“명령 하나하나를 프로그래밍하던 로봇에서, 보고 이해하고 행동하는 로봇으로”

“빨간 컵을 집어서 테이블 위에 올려줘.”

과거의 로봇이라면 컵을 찾고 → 위치를 계산하고 → 팔을 움직이고 → 물체를 잡는 과정을 개발자가 세세하게 설계해야 했습니다.

하지만 최근 로봇 AI가 향하는 방향은 조금 다릅니다.

 

사람의 말을 이해하고, 카메라로 주변을 살펴본 뒤, 어떤 행동을 해야 하는지 AI가 판단해 실제 움직임으로 연결하는 기술이 빠르게 발전하고 있기 때문이죠.

그 중심에 있는 개념이 바로 ‘로봇 파운데이션 모델(Robot Foundation Model)’​입니다.

 

오늘은 TIG(TrendIssueGuide)​가
로봇 파운데이션 모델이 무엇인지, 기존 로봇과 무엇이 다른지,
그리고 Google DeepMind·NVIDIA 등 실제 기업들이 어떤 기술을 개발하고 있는지 정리해드립니다.


🤖 로봇 파운데이션 모델이란?

파운데이션 모델(Foundation Model)​은 대규모 데이터를 학습한 뒤 하나의 특정 작업에만 머무르지 않고 여러 작업으로 확장·적응할 수 있도록 만들어진 AI 모델을 의미합니다.

ChatGPT와 같은 대규모 언어 모델이 방대한 텍스트를 학습해 다양한 질문과 작업을 처리하는 것처럼, 로봇 분야에서도 다양한 환경과 행동 데이터를 학습해 여러 로봇 작업에 활용할 수 있는 범용 AI 모델을 만들려는 시도가 이어지고 있습니다.

쉽게 표현하면,

ChatGPT가 ‘언어를 다루는 범용 두뇌’라면
로봇 파운데이션 모델은 ‘현실 세계에서 행동하기 위한 범용 두뇌’를 목표로 하는 기술
이라고 볼 수 있습니다.

다만 현재의 로봇 파운데이션 모델이 사람처럼 모든 상황을 완벽하게 이해하고 행동한다는 뜻은 아닙니다.

아직은 연구·개발과 제한적인 실제 적용이 함께 진행되고 있는 단계입니다.


🧠 기존 로봇과 무엇이 다를까?

기존 산업용 로봇은 대부분 미리 정해진 작업을 정확하고 반복적으로 수행하는 것에 강했습니다.

예를 들어 공장에서

  • 부품을 특정 위치로 이동
  • 정해진 지점을 용접
  • 제품을 일정한 순서로 조립

하는 식입니다.

환경이나 작업이 크게 바뀌면 새로운 프로그램이나 학습 과정이 필요한 경우가 많았죠.

반면 로봇 파운데이션 모델이 지향하는 방향은 하나의 모델이 여러 환경과 작업에 적응하는 것입니다.

즉,

기존 로봇

정해진 명령 → 정해진 행동

에서

파운데이션 모델 기반 로봇

주변 환경 인식 → 사람의 지시 이해 → 행동 계획 → 실제 동작

으로 발전하는 것입니다.


👀 핵심 기술 ‘VLA’

최근 로봇 파운데이션 모델을 이해할 때 자주 등장하는 단어가 있습니다.

바로 VLA(Vision-Language-Action)​입니다.

이름 그대로 세 가지 요소를 연결합니다.

Vision 👀

카메라 등을 통해 로봇이 주변 환경과 물체를 인식합니다.

Language 💬

“서랍을 열고 안에 있는 물건을 꺼내줘” 같은 사람의 자연어 지시를 이해합니다.

Action 🦾

이해한 내용을 실제 로봇 팔이나 몸의 움직임으로 연결합니다.

Google DeepMind의 Gemini Robotics 1.5 역시 시각 정보와 명령을 받아 로봇의 행동 명령으로 연결하는 VLA 모델입니다. Google DeepMind는 이를 통해 로봇이 복잡한 다단계 작업에서 인식하고 계획하며 도구를 사용하고 행동하는 능력을 발전시키고 있다고 설명합니다.

결국 VLA가 지향하는 것은

“보고 → 이해하고 → 실제로 행동하는 AI”

입니다.


🌍 실제 기업들은 어디까지 왔을까?

1. 🤖 Google DeepMind – Gemini Robotics

Google DeepMind는 2025년 Gemini Robotics를 공개하며 Gemini의 멀티모달 AI 능력을 현실 세계의 로봇으로 확장했습니다.

Gemini Robotics는 시각과 언어 정보를 이용해 현실 세계를 이해하고 행동하는 VLA 모델입니다.

이후 공개된 Gemini Robotics On-Device는 모델을 로봇 기기에서 직접 실행할 수 있도록 최적화했습니다.

네트워크 연결에 의존하지 않고 로봇에서 직접 추론할 수 있기 때문에 지연 시간이 중요한 작업이나 인터넷 연결이 불안정한 환경에서도 활용할 수 있다는 장점이 있습니다. Google DeepMind는 옷 접기, 가방 지퍼 열기 같은 정교한 작업 사례도 공개했습니다.

그리고 2025년 9월에는 Gemini Robotics 1.5를 발표하며 복잡한 다단계 작업을 위한 추론과 행동 능력을 더욱 확장했습니다.


2. 🦾 NVIDIA – Isaac GR00T

NVIDIA 역시 휴머노이드 로봇용 파운데이션 모델 개발에 적극적입니다.

대표적인 모델이 Isaac GR00T 시리즈입니다.

2025년 공개된 GR00T N1은 언어와 이미지 등의 정보를 받아 휴머노이드 로봇이 물체를 잡고 옮기는 등의 작업을 수행하도록 설계된 오픈 파운데이션 모델입니다.

특히 GR00T N1은 크게 두 부분으로 나뉩니다.

System 2 🧠

주변 상황과 사람의 지시를 이해하고 무엇을 해야 할지 판단하고 계획

System 1 🦾

계획을 바탕으로 실제 로봇의 연속적인 움직임을 생성

하는 방식입니다.

이후 NVIDIA는 N1.5, N1.6 등 후속 버전을 공개하며 언어 지시 이해와 일반화, 물리적 추론 능력을 계속 확장해왔습니다.


📚 로봇은 무엇을 보고 공부할까?

여기서 흥미로운 문제가 하나 있습니다.

ChatGPT 같은 언어 모델은 인터넷 등에 존재하는 방대한 텍스트 데이터를 활용할 수 있지만, 로봇의 실제 행동 데이터는 상대적으로 얻기 어렵습니다.

로봇이 물건을 잡고 옮기는 행동을 수없이 반복해 데이터를 만드는 데에는 시간과 비용이 필요하기 때문입니다.

그래서 최근에는

실제 로봇 데이터 + 사람의 행동 영상 + 시뮬레이션 데이터 + 합성 데이터

등을 함께 활용하려는 연구가 활발합니다.

NVIDIA의 GR00T N1 역시 실제 로봇 궤적뿐 아니라 사람의 1인칭 영상과 시뮬레이션·합성 데이터를 포함한 다양한 데이터로 학습됐습니다.

특히 NVIDIA는 Omniverse 기반 합성 데이터를 실제 데이터와 함께 사용했을 때 GR00T N1의 특정 평가 성능이 실제 데이터만 사용한 경우보다 40% 향상됐다고 발표했습니다.

로봇을 현실에서만 수백만 번 훈련시키는 대신 가상 세계에서 먼저 연습시키는 방식이 중요한 이유입니다.


🏠 로봇 파운데이션 모델이 중요한 이유

로봇 파운데이션 모델이 주목받는 가장 큰 이유는 범용 로봇으로 가기 위한 가능성 때문입니다.

지금까지 로봇 산업은

“하나의 로봇 → 하나의 특정 작업”

에 가까웠다면,

앞으로는

“하나의 범용 모델 → 여러 로봇과 여러 작업”

으로 확장하려는 움직임이 커지고 있습니다.

이 방향이 실제 제품 수준에서 충분히 안정화된다면 로봇의 활용 범위 역시 훨씬 넓어질 수 있습니다.

공장에서는 물건을 분류하고 포장하고,

물류센터에서는 다양한 형태의 물체를 처리하며,

가정에서는 사람의 말을 이해해 여러 집안일을 수행하는 식입니다.

다만 현실 세계에서는 작은 판단 오류도 물건 파손이나 안전 문제로 이어질 수 있기 때문에 정확성·안전성·실시간성·데이터 확보와 일반화는 여전히 중요한 과제입니다.


💡 결국 목표는 ‘로봇계의 ChatGPT’

ChatGPT의 등장 이후 우리는 하나의 AI에게 번역부터 글쓰기, 요약, 코딩까지 다양한 일을 요청하는 경험에 익숙해졌습니다.

로봇 업계에서도 비슷한 변화가 시작되고 있습니다.

작업마다 별도의 프로그램을 만드는 로봇에서 벗어나,

사람의 말을 이해하고, 주변 환경을 보고, 상황을 판단하고, 실제 행동까지 수행하는 범용 로봇 AI​를 만들려는 것입니다.

Google DeepMind의 Gemini Robotics와 NVIDIA의 GR00T 같은 모델들이 바로 이 방향을 보여주는 대표적인 사례입니다.


⭐ 결론: 로봇 경쟁의 핵심은 ‘몸’에서 ‘두뇌’까지

그동안 로봇을 볼 때 우리는

“얼마나 빠르게 움직이는가?”

“얼마나 무거운 것을 들 수 있는가?”

같은 하드웨어 성능에 주목했습니다.

하지만 앞으로는 질문이 달라질 가능성이 큽니다.

 

“이 로봇은 얼마나 잘 이해하고 판단하며 새로운 상황에 적응할 수 있는가?”

로봇의 몸을 움직이는 모터와 관절만큼이나 그 몸을 어떻게 움직일지 결정하는 AI 모델이 중요해지고 있기 때문입니다.

ChatGPT가 컴퓨터 속 AI의 사용 방식을 바꿨다면,
로봇 파운데이션 모델은 AI가 현실 세계에서 행동하는 방식을 바꿀 수 있습니다.

그리고 그 변화는 이미 연구실을 넘어 실제 로봇을 향해 진행되고 있습니다. 🤖🦾

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

728x90
반응형
LIST