피지컬 인텔리전스, 미처 보지 못한 작업도 학습할 수 있는 로봇 뇌 공개
샌프란시스코에 본사를 둔 2년 차 로봇 스타트업 ‘피지컬 인텔리전스(Physical Intelligence)’가 목요일 새로운 연구 결과를 발표했다. 이 회사는 베이 에어리어에서 가장 주목받는 AI 기업 중 하나로 부상했다. 연구 결과에 따르면, 이 회사의 최신 모델은 로봇이 이전에 구체적으로 훈련받지 않은 작업을 수행하도록 안내할 수 있는데, 이는 회사 연구진조차도 예상치 못했던 능력이라고 인정했다.
'π0.7'로 명명된 이 새로운 모델은 회사가 오랫동안 추구해 온 범용 로봇 두뇌 개발에 있어 초기 단계이면서도 중요한 진전을 이룬 것으로 평가된다. 이 시스템은 익숙하지 않은 작업에 대해 간단한 언어로 지시를 받으면 이를 성공적으로 완수할 수 있다. 만약 이 결과가 검증을 거친다면, 로봇 AI가 대규모 언어 모델의 진화와 유사한 전환점을 맞이하고 있음을 시사한다. 즉, 기초 데이터가 시사하는 바를 뛰어넘는 방식으로 능력이 복합적으로 결합되기 시작한다는 것이다.
이 논문의 핵심은 '구성적 일반화(compositional generalization)'라는 개념이다. 이는 서로 다른 맥락에서 습득한 기술을 결합해 완전히 새로운 문제를 해결하는 능력을 의미한다. 전통적으로 로봇 훈련은 암기식 학습에 의존해 왔다. 즉, 특정 작업을 위한 데이터를 수집하고, 이를 바탕으로 특화된 모델을 훈련시킨 뒤, 새로운 작업이 생길 때마다 이 과정을 반복하는 방식이었다. 피지컬 인텔리전스(Physical Intelligence)는 π0.7이 이러한 순환 구조를 깨뜨렸다고 주장한다.
피지컬 인텔리전스의 공동 창립자이자 로봇 공학 AI를 전문으로 하는 UC 버클리 교수인 세르게이 레비네(Sergey Levine)는 "단순히 훈련된 데이터를 정확히 재현하는 단계에서 벗어나, 요소를 창의적으로 재조합하는 새로운 방식으로 넘어서는 순간, 능력은 데이터 양에 비해 선형적인 속도를 넘어서는 속도로 증가하기 시작한다"고 설명한다. "이러한 더 유리한 확장 역학은 언어 및 시각과 같은 다른 분야에서도 관찰된 바 있다."
이 논문의 가장 설득력 있는 실증 사례는 모델이 훈련 과정에서 사실상 전혀 접해본 적이 없는 에어프라이어와 관련된 것이다. 조사 결과, 연구팀은 전체 데이터셋에서 관련 사례 두 건만을 발견했다. 하나는 다른 로봇이 단순히 에어프라이어 문을 밀어 닫은 경우였고, 다른 하나는 오픈소스 데이터셋에서 로봇이 명령에 따라 플라스틱 병을 에어프라이어 안에 넣은 경우였다. 어떻게든 모델은 이러한 단편적인 정보와 광범위한 웹 기반 사전 학습 데이터를 종합하여, 해당 가전제품이 작동하는 방식에 대한 실질적인 이해를 도출해 냈습니다.
"지식이 정확히 어디서 비롯되었는지 파악하거나, 성공하거나 실패할 상황을 예측하는 것은 믿기 힘들 정도로 어렵습니다."라고 Physical Intelligence의 연구 과학자이자 스탠포드대 컴퓨터과학 박사 과정 학생인 애쉬윈 발라크리슈나(Ashwin Balakrishna)는 말합니다. 그럼에도 불구하고, 사전 지도 없이도 이 모델은 해당 기기를 사용하여 고구마를 조리하는 데 꽤 그럴듯한 시도를 보여주었습니다. 단계별 구두 지침(본질적으로, 신입 사원을 교육하듯 사람이 로봇에게 과정을 설명해 주는 방식)을 제공받았을 때, 모델은 작업을 성공적으로 완료했습니다.
이러한 코칭 능력은 로봇을 새로운 환경에 배치하고 실시간으로 개선할 수 있음을 시사하므로, 추가적인 데이터 수집이나 모델 재훈련의 필요성을 없애준다는 점에서 중요합니다.
그렇다면 더 넓은 의미에서 어떤 시사점이 있을까? 연구진은 모델의 한계를 솔직히 인정하며, 그 진전을 과대평가하는 데는 신중한 태도를 보인다. 적어도 한 가지 사례에서는 실패의 원인을 직접적으로 자신들의 팀 탓으로 돌렸다.
"때로는 실패가 로봇이나 모델 때문이 아닙니다,"라고 발라크리슈나는 말합니다. "우리 탓이죠—프롬프트 엔지니어링에 능숙하지 못했기 때문입니다." 그는 성공률이 5%에 불과했던 초기 에어프라이어 실험을 예로 들었습니다. 모델에 작업을 설명하는 방식을 약 30분 동안 다듬은 후, 성공률은 95%로 급상승했습니다.

이미지 출처:Physical Intelligence
또한 이 모델은 아직 단일한 고수준 명령만으로 복잡하고 여러 단계로 구성된 작업을 자율적으로 수행할 수 없습니다. "단순히 '토스트 좀 만들어 줘'라고 말할 수는 없습니다,"라고 레바인은 말합니다. "하지만 단계별로 안내해 준다면—'토스터의 이 부분을 열고, 저 버튼을 누르고, 이렇게 해'—그때는 꽤 잘 수행하는 편입니다."
연구팀은 또한 로봇공학 분야에 표준화된 벤치마크가 부족하여 자신들의 주장을 외부에서 검증하기가 어렵다는 점을 인정한다. 대신 이 회사는 π0.7을 개별 작업을 위해 맞춤 제작 및 훈련된 자체의 기존 전문 모델들과 비교했으며, 이 범용 모델이 커피 내리기, 빨래 개기, 상자 조립 등 다양한 복잡한 활동에서 기존 모델들의 성능에 필적한다는 사실을 확인했다.
연구진의 말을 그대로 받아들인다면, 이 연구에서 가장 주목할 만한 점은 특정 시연이 아니라, 훈련 데이터를 꿰뚫고 있으며 모델이 무엇을 할 수 있고 무엇을 할 수 없는지 정확히 파악해야 하는 전문가들조차 그 결과에 놀라움을 금치 못했다는 사실일 것이다.
"제 경험상 데이터를 깊이 이해하면 보통 모델이 무엇을 할 수 있을지 예측할 수 있었습니다."라고 발라크리슈나는 회상합니다. "저는 거의 놀라지 않는 편입니다. 하지만 지난 몇 달은 제가 진정으로 깜짝 놀란 첫 경험이었습니다. 무작위로 기어 세트를 사서 로봇에게 '이 기어를 돌릴 수 있나요?'라고 물었더니, 그냥 작동하더군요."
레바인은 연구진이 GPT-2가 안데스 산맥의 유니콘에 관한 이야기를 생성하는 것을 처음 목격했던 순간을 회상한다. "도대체 어디서 페루의 유니콘에 대해 배운 걸까?"라고 그는 말한다. "정말 기이한 조합이다. 로봇공학에서 그런 종류의 새로운 능력을 목격하는 것은 정말 특별한 일이다."
당연히 비평가들은 내재된 불균형을 지적할 것이다. 언어 모델은 인터넷 전체를 학습 자료로 삼았지만, 로봇에게는 그런 사치가 없으며 아무리 영리한 프롬프트를 사용해도 그 격차를 완전히 메울 수는 없다. 하지만 회의론이 어디서 나올 것으로 예상하느냐는 질문에 레바인은 전혀 다른 방향을 가리킨다.
"로봇 일반화 데모에 대해 항상 제기될 수 있는 비판은 작업들이 다소 평범해 보인다는 점입니다,"라고 그는 지적한다. "로봇이 백플립을 하는 건 아니니까요." 그는 이 관점에 이의를 제기하며, 화려한 로봇 데모와 진정으로 일반화되는 시스템 사이의 차이가 바로 핵심이라고 주장한다. 진정한 일반화는 정교하게 연출된 묘기보다 항상 덜 극적으로 보일 것이지만, 훨씬 더 실용적일 것이라고 그는 제안한다.
논문 자체는 전반적으로 신중한 표현을 사용하며, π0.7이 일반화의 "초기 징후"를 보이고 새로운 능력의 "초기 시연"을 보여준다고 기술하고 있다. 이는 상업용 제품이 아닌 연구 결과이며, Physical Intelligence는 상용화 일정에 대해 줄곧 신중한 태도를 유지해 왔다.
이 연구를 기반으로 한 시스템이 언제 실제 현장에서 사용될 준비가 될지 직접 묻자, 레바인은 추측을 피했다. 그는 "낙관할 만한 충분한 이유가 있으며, 진전 속도는 확실히 2년 전 내가 예상했던 것보다 빠르다"고 말했다. "하지만 확실한 답변을 드리기는 매우 어렵다."
현재까지 피지컬 인텔리전스는 10억 달러 이상을 조달했으며, 최근 기업 가치는 56억 달러로 평가되었다. 이 회사를 둘러싼 투자자들의 열광은 상당 부분 공동 창업자 라키 그룸(Lachy Groom)과 관련이 있다. 그는 피지컬 인텔리전스가 자신이 찾던 벤처 기업이라는 결론을 내리기 전까지 수년간 실리콘밸리에서 가장 존경받는 엔젤 투자자 중 한 명으로 활동하며 피그마(Figma), 노션(Notion), 램프(Ramp) 같은 기업들을 지원했다. 이러한 배경 덕분에 이 스타트업은 투자자들에게 구체적인 상용화 로드맵을 제시하지 않았음에도 상당한 규모의 기관 자금을 유치할 수 있었다.
보도에 따르면 이 회사는 현재 기업 가치를 110억 달러로 거의 두 배 가까이 끌어올릴 새로운 자금 조달 라운드에 대한 협상을 진행 중인 것으로 알려졌다. 회사 측은 이에 대해 논평을 거부했다.
관련 기사
암호화폐 거래소 OKX는 AI 에이전트들이 서로를 고용하고 급여를 지급할 수 있도록 지원하는 것을 목표로 하고 있다
AI 에이전트가 개인에게 서비스를 제공하고 서로 협력하기 시작함에 따라, 이들은 업무를 찾아내고, 서비스에 대한 대가를 지급하며, 신뢰도를 구축할 수 있는 메커니즘이 필요합니다. 암호화폐 거래소 OKX는 이러한 미래가 예상보다 빨리 도래할 것으로 전망하며, AI 에이전트가 서로를 모집하고, 독립적으로 결제를 처리하며, 온체인 평판을 유지할 수 있는 마켓플레
틸이 투자한 스타트업은 내부 고발자에게 위험이 따르더라도 AI가 저널리즘을 평가할 수 있다고 주장한다
가우커(Gawker)의 파산을 초래한 소송에 관여한 후, 아론 드수자는 미국 미디어 환경의 중대한 결함을 지적했습니다. 바로 보도로 인해 피해를 입은 개인들이 이에 대응할 효과적인 수단이 부족하다는 점이었습니다.그가 제시한 해답은 바로 기술이다. 드수자의 새로운 벤처 기업인 ‘오브젝션(Objection)’은 인공지능(AI)을 활용해 기사의 정확성을 평가한다
[[IMG_BASE64_PLACEHOLDER]]Prentis, Reid Hoffman와 Marc Pincus가 공동으로 설립한 새로운 AI 연구소, 1억 달러 자금 조달 협상 중
Prentis는 컴퓨터 사용 모델에 특화된 차세대 AI 연구소로, 시리얼 기업가 Ritankar Das와 기술 업계 리더인 Reid Hoffman, Marc Pincus가 공동 설립했다. 이 사안을 잘 아는 두 명의 관계자에 따르면, 현재 Prentis는 기업 가치 10억 달러로 1억 달러의 자금을 확보하기 위해 협상 중이다.Prentis는 4월 출시 이후 다양한 문서와 시스템에서 사무직 근로자의 일상적인 워크플로우를 어떻게 처리하는지 학습시
관련 특별 주제 추천
의견 (1)
0/500
샌프란시스코에 본사를 둔 2년 차 로봇 스타트업 ‘피지컬 인텔리전스(Physical Intelligence)’가 목요일 새로운 연구 결과를 발표했다. 이 회사는 베이 에어리어에서 가장 주목받는 AI 기업 중 하나로 부상했다. 연구 결과에 따르면, 이 회사의 최신 모델은 로봇이 이전에 구체적으로 훈련받지 않은 작업을 수행하도록 안내할 수 있는데, 이는 회사 연구진조차도 예상치 못했던 능력이라고 인정했다.
'π0.7'로 명명된 이 새로운 모델은 회사가 오랫동안 추구해 온 범용 로봇 두뇌 개발에 있어 초기 단계이면서도 중요한 진전을 이룬 것으로 평가된다. 이 시스템은 익숙하지 않은 작업에 대해 간단한 언어로 지시를 받으면 이를 성공적으로 완수할 수 있다. 만약 이 결과가 검증을 거친다면, 로봇 AI가 대규모 언어 모델의 진화와 유사한 전환점을 맞이하고 있음을 시사한다. 즉, 기초 데이터가 시사하는 바를 뛰어넘는 방식으로 능력이 복합적으로 결합되기 시작한다는 것이다.
이 논문의 핵심은 '구성적 일반화(compositional generalization)'라는 개념이다. 이는 서로 다른 맥락에서 습득한 기술을 결합해 완전히 새로운 문제를 해결하는 능력을 의미한다. 전통적으로 로봇 훈련은 암기식 학습에 의존해 왔다. 즉, 특정 작업을 위한 데이터를 수집하고, 이를 바탕으로 특화된 모델을 훈련시킨 뒤, 새로운 작업이 생길 때마다 이 과정을 반복하는 방식이었다. 피지컬 인텔리전스(Physical Intelligence)는 π0.7이 이러한 순환 구조를 깨뜨렸다고 주장한다.
피지컬 인텔리전스의 공동 창립자이자 로봇 공학 AI를 전문으로 하는 UC 버클리 교수인 세르게이 레비네(Sergey Levine)는 "단순히 훈련된 데이터를 정확히 재현하는 단계에서 벗어나, 요소를 창의적으로 재조합하는 새로운 방식으로 넘어서는 순간, 능력은 데이터 양에 비해 선형적인 속도를 넘어서는 속도로 증가하기 시작한다"고 설명한다. "이러한 더 유리한 확장 역학은 언어 및 시각과 같은 다른 분야에서도 관찰된 바 있다."
이 논문의 가장 설득력 있는 실증 사례는 모델이 훈련 과정에서 사실상 전혀 접해본 적이 없는 에어프라이어와 관련된 것이다. 조사 결과, 연구팀은 전체 데이터셋에서 관련 사례 두 건만을 발견했다. 하나는 다른 로봇이 단순히 에어프라이어 문을 밀어 닫은 경우였고, 다른 하나는 오픈소스 데이터셋에서 로봇이 명령에 따라 플라스틱 병을 에어프라이어 안에 넣은 경우였다. 어떻게든 모델은 이러한 단편적인 정보와 광범위한 웹 기반 사전 학습 데이터를 종합하여, 해당 가전제품이 작동하는 방식에 대한 실질적인 이해를 도출해 냈습니다.
"지식이 정확히 어디서 비롯되었는지 파악하거나, 성공하거나 실패할 상황을 예측하는 것은 믿기 힘들 정도로 어렵습니다."라고 Physical Intelligence의 연구 과학자이자 스탠포드대 컴퓨터과학 박사 과정 학생인 애쉬윈 발라크리슈나(Ashwin Balakrishna)는 말합니다. 그럼에도 불구하고, 사전 지도 없이도 이 모델은 해당 기기를 사용하여 고구마를 조리하는 데 꽤 그럴듯한 시도를 보여주었습니다. 단계별 구두 지침(본질적으로, 신입 사원을 교육하듯 사람이 로봇에게 과정을 설명해 주는 방식)을 제공받았을 때, 모델은 작업을 성공적으로 완료했습니다.
이러한 코칭 능력은 로봇을 새로운 환경에 배치하고 실시간으로 개선할 수 있음을 시사하므로, 추가적인 데이터 수집이나 모델 재훈련의 필요성을 없애준다는 점에서 중요합니다.
그렇다면 더 넓은 의미에서 어떤 시사점이 있을까? 연구진은 모델의 한계를 솔직히 인정하며, 그 진전을 과대평가하는 데는 신중한 태도를 보인다. 적어도 한 가지 사례에서는 실패의 원인을 직접적으로 자신들의 팀 탓으로 돌렸다.
"때로는 실패가 로봇이나 모델 때문이 아닙니다,"라고 발라크리슈나는 말합니다. "우리 탓이죠—프롬프트 엔지니어링에 능숙하지 못했기 때문입니다." 그는 성공률이 5%에 불과했던 초기 에어프라이어 실험을 예로 들었습니다. 모델에 작업을 설명하는 방식을 약 30분 동안 다듬은 후, 성공률은 95%로 급상승했습니다.

이미지 출처:Physical Intelligence
또한 이 모델은 아직 단일한 고수준 명령만으로 복잡하고 여러 단계로 구성된 작업을 자율적으로 수행할 수 없습니다. "단순히 '토스트 좀 만들어 줘'라고 말할 수는 없습니다,"라고 레바인은 말합니다. "하지만 단계별로 안내해 준다면—'토스터의 이 부분을 열고, 저 버튼을 누르고, 이렇게 해'—그때는 꽤 잘 수행하는 편입니다."
연구팀은 또한 로봇공학 분야에 표준화된 벤치마크가 부족하여 자신들의 주장을 외부에서 검증하기가 어렵다는 점을 인정한다. 대신 이 회사는 π0.7을 개별 작업을 위해 맞춤 제작 및 훈련된 자체의 기존 전문 모델들과 비교했으며, 이 범용 모델이 커피 내리기, 빨래 개기, 상자 조립 등 다양한 복잡한 활동에서 기존 모델들의 성능에 필적한다는 사실을 확인했다.
연구진의 말을 그대로 받아들인다면, 이 연구에서 가장 주목할 만한 점은 특정 시연이 아니라, 훈련 데이터를 꿰뚫고 있으며 모델이 무엇을 할 수 있고 무엇을 할 수 없는지 정확히 파악해야 하는 전문가들조차 그 결과에 놀라움을 금치 못했다는 사실일 것이다.
"제 경험상 데이터를 깊이 이해하면 보통 모델이 무엇을 할 수 있을지 예측할 수 있었습니다."라고 발라크리슈나는 회상합니다. "저는 거의 놀라지 않는 편입니다. 하지만 지난 몇 달은 제가 진정으로 깜짝 놀란 첫 경험이었습니다. 무작위로 기어 세트를 사서 로봇에게 '이 기어를 돌릴 수 있나요?'라고 물었더니, 그냥 작동하더군요."
레바인은 연구진이 GPT-2가 안데스 산맥의 유니콘에 관한 이야기를 생성하는 것을 처음 목격했던 순간을 회상한다. "도대체 어디서 페루의 유니콘에 대해 배운 걸까?"라고 그는 말한다. "정말 기이한 조합이다. 로봇공학에서 그런 종류의 새로운 능력을 목격하는 것은 정말 특별한 일이다."
당연히 비평가들은 내재된 불균형을 지적할 것이다. 언어 모델은 인터넷 전체를 학습 자료로 삼았지만, 로봇에게는 그런 사치가 없으며 아무리 영리한 프롬프트를 사용해도 그 격차를 완전히 메울 수는 없다. 하지만 회의론이 어디서 나올 것으로 예상하느냐는 질문에 레바인은 전혀 다른 방향을 가리킨다.
"로봇 일반화 데모에 대해 항상 제기될 수 있는 비판은 작업들이 다소 평범해 보인다는 점입니다,"라고 그는 지적한다. "로봇이 백플립을 하는 건 아니니까요." 그는 이 관점에 이의를 제기하며, 화려한 로봇 데모와 진정으로 일반화되는 시스템 사이의 차이가 바로 핵심이라고 주장한다. 진정한 일반화는 정교하게 연출된 묘기보다 항상 덜 극적으로 보일 것이지만, 훨씬 더 실용적일 것이라고 그는 제안한다.
논문 자체는 전반적으로 신중한 표현을 사용하며, π0.7이 일반화의 "초기 징후"를 보이고 새로운 능력의 "초기 시연"을 보여준다고 기술하고 있다. 이는 상업용 제품이 아닌 연구 결과이며, Physical Intelligence는 상용화 일정에 대해 줄곧 신중한 태도를 유지해 왔다.
이 연구를 기반으로 한 시스템이 언제 실제 현장에서 사용될 준비가 될지 직접 묻자, 레바인은 추측을 피했다. 그는 "낙관할 만한 충분한 이유가 있으며, 진전 속도는 확실히 2년 전 내가 예상했던 것보다 빠르다"고 말했다. "하지만 확실한 답변을 드리기는 매우 어렵다."
현재까지 피지컬 인텔리전스는 10억 달러 이상을 조달했으며, 최근 기업 가치는 56억 달러로 평가되었다. 이 회사를 둘러싼 투자자들의 열광은 상당 부분 공동 창업자 라키 그룸(Lachy Groom)과 관련이 있다. 그는 피지컬 인텔리전스가 자신이 찾던 벤처 기업이라는 결론을 내리기 전까지 수년간 실리콘밸리에서 가장 존경받는 엔젤 투자자 중 한 명으로 활동하며 피그마(Figma), 노션(Notion), 램프(Ramp) 같은 기업들을 지원했다. 이러한 배경 덕분에 이 스타트업은 투자자들에게 구체적인 상용화 로드맵을 제시하지 않았음에도 상당한 규모의 기관 자금을 유치할 수 있었다.
보도에 따르면 이 회사는 현재 기업 가치를 110억 달러로 거의 두 배 가까이 끌어올릴 새로운 자금 조달 라운드에 대한 협상을 진행 중인 것으로 알려졌다. 회사 측은 이에 대해 논평을 거부했다.
암호화폐 거래소 OKX는 AI 에이전트들이 서로를 고용하고 급여를 지급할 수 있도록 지원하는 것을 목표로 하고 있다
AI 에이전트가 개인에게 서비스를 제공하고 서로 협력하기 시작함에 따라, 이들은 업무를 찾아내고, 서비스에 대한 대가를 지급하며, 신뢰도를 구축할 수 있는 메커니즘이 필요합니다. 암호화폐 거래소 OKX는 이러한 미래가 예상보다 빨리 도래할 것으로 전망하며, AI 에이전트가 서로를 모집하고, 독립적으로 결제를 처리하며, 온체인 평판을 유지할 수 있는 마켓플레
틸이 투자한 스타트업은 내부 고발자에게 위험이 따르더라도 AI가 저널리즘을 평가할 수 있다고 주장한다
가우커(Gawker)의 파산을 초래한 소송에 관여한 후, 아론 드수자는 미국 미디어 환경의 중대한 결함을 지적했습니다. 바로 보도로 인해 피해를 입은 개인들이 이에 대응할 효과적인 수단이 부족하다는 점이었습니다.그가 제시한 해답은 바로 기술이다. 드수자의 새로운 벤처 기업인 ‘오브젝션(Objection)’은 인공지능(AI)을 활용해 기사의 정확성을 평가한다
[[IMG_BASE64_PLACEHOLDER]]Prentis, Reid Hoffman와 Marc Pincus가 공동으로 설립한 새로운 AI 연구소, 1억 달러 자금 조달 협상 중
Prentis는 컴퓨터 사용 모델에 특화된 차세대 AI 연구소로, 시리얼 기업가 Ritankar Das와 기술 업계 리더인 Reid Hoffman, Marc Pincus가 공동 설립했다. 이 사안을 잘 아는 두 명의 관계자에 따르면, 현재 Prentis는 기업 가치 10억 달러로 1억 달러의 자금을 확보하기 위해 협상 중이다.Prentis는 4월 출시 이후 다양한 문서와 시스템에서 사무직 근로자의 일상적인 워크플로우를 어떻게 처리하는지 학습시





집






