읽기 설정
AI Summary
이 연설은 로봇 공학 분야의 데이터 확장 문제와 Scaled라는 회사의 혁신적인 접근 방식을 다루고 있습니다. 현재 로봇 공학은 데이터 부족으로 발전이 더디지만, GPT-3와 같은 대규모 언어 모델처럼 데이터를 활용하여 '옴니바디 인텔리전스'를 구축하는 것을 목표로 합니다. 엔비디아의 GPU 자동화 사례는 이러한 기술의 가능성을 보여주며, 로봇들은 소음과 혼란스러운 공장 환경에서도 강건하게 작동하고 다양한 분야에 적용될 수 있습니다. 특히, '온몸을 감싸는 두뇌'라는 개념은 안전성 확보와 빠른 적응력을 가능하게 하며, 데이터 순환 구축을 통해 실제 애플리케이션에 배포하는 것이 중요함을 강조합니다.
Key Highlights
- •로봇 공학 분야의 데이터 확장 문제 해결을 위한 Scaled의 옴니바디 인텔리전스 목표 제시
- •데이터 확장 시 확장성, 다양성, 로봇과의 유사성을 고려하는 균형 잡힌 접근 방식의 중요성 강조
- •엔드 투 엔드 학습 방식을 통해 카메라 입력만으로 로봇이 작업을 수행하는 새로운 패러다임 소개
- •엔비디아 GPU 자동화 사례를 통한 로봇 기술의 실제 적용 가능성 입증 (공장 환경 적응, 다양한 분야 활용)
- •온몸을 감싸는 두뇌 개념을 통해 안전성 확보, 빠른 적응력, 형태 변화에 따른 유연한 작동 가능
Related Videos
여기 계신 분들 모두 아시다시피, 지난 다섯 년 동안 인공지능이 얼마나 발전했는지, 마치 백 년간의 발전보다 더 많이 진 것 같습니다.00:12
지난 백 년간의 발전보다 훨씬 더 많은 발전을 이룬 것 같아요.00:19
그리고 특히 인공지능 분야에서 일어나고 있는 일은, 인공지능이 언어를 시작으로 해서00:21
음성, 오디오, 비디오로 이어졌고, 이제 로봇 공학이 다음 단계라고 모두가 기대하고 있습니다.00:26
그리고 올해 어떤 이유인지 이 기대감이 최고조에 달하고 있습니다. 제가 아직 이해하지 못하는 부분입니다.00:32
또한, 젠슨과 같은 리더들이 로봇공학의 다음 단계로 물리적인 AI를 이야기하는 것을 볼 수 있습니다.00:39
트위터나 링크드인 같은 곳을 보면 로봇이 이미 여기에 와 있는 것처럼 보입니다.00:46
여러 사람들이 말하듯이, 아마 내년 12월쯤이면 가정용 로봇이 우리 집에 있을지도 모릅니다.00:51
하지만 제가 강조하고 싶은 점은 로봇 공학이 사실 지난 70년 동안 거의 우리 곁에 있었다는 것입니다.00:58
최근 네댓 년 동안 로봇 공학을 시작하신 분들은, 지금 당장 어떤 자료든 찾아보세요.01:07
로봇 공학 강의를 듣고서 30년 전과 현재의 로봇 관련 영상들을 구별할 수 있다면, 저녁 식사 대접해 드릴게요. 예시를 들어볼까요? 이 로봇을 한번 살펴봅시다.01:13
간단한 예를 보여드리겠습니다. 자, 이 로봇을 보십시오.01:21
이 로봇은 이미지이고, 이 로봇의 목표는 이미지에 있는 블록들을 보고01:26
로봇 앞에 동일한 패턴으로 배치하는 것입니다.01:31
이것은 매우 간단한 작업입니다. 하지만 생각해 보시면, 이건 3차원 블록이죠.01:38
각각의 면에서 3차원을 보고 이해해야 합니다. 그리고 로봇은 이것을 상당히 정확하게 할 수 있습니다.01:42
이 결과물이 얼마나 된 것 같은지 추측해 보실 분 계신가요?01:47
아무도 없네요. 그냥 추측입니다. 어떤 추측이라도 괜찮습니다.01:51
40년 정도요. 네, 가장 높은 값입니다.01:54
이것은 1960년대 것이에요. 컴퓨터가 있을 때 훨씬 이전의 시대입니다.01:59
이것은 MIT 복사 데모라고 불립니다.02:04
이것은 오늘날 우리가 알고 있는 인공지능보다 훨씬 이전의 시작입니다.02:07
이것 좀 보세요. 하나요.02:12
필라델피아 핵물리학 회의에서 전시된 것 중 인기를 얻을 완벽한 공식이 있네요.02:18
여기서 무슨 일이 벌어지고 있나요? 무대 뒤에 있는 사람이 이 로봇들을 조종하고 있는데, 선도-추종 시스템이네요.02:22
그리고 큰 연구실이나 회사, 또는 학술 연구실에서 데이터를 어떻게 얻는지 살펴보세요.02:28
텔레오퍼레이션 시스템을 사용하는데, 동일한 원리를 따르고 있습니다.02:33
이것은 몇 년도라고 생각하시나요?02:38
이제 모두들 연도에 대해 적극적으로 수정하실 거예요.02:42
하지만 이건 1957년 자료이고, 68년 전입니다. 알겠습니다?02:46
가족 중에서 혹시 더 드시는 분이 계시면 한번 물어보세요. 사실, 아마 안 계실 수도 있고요.02:51
60주년이기 때문에 80세 정도 되신 어르신께 당시 기술 수준이 어땠는지 여쭤봐야 할 것 같습니다.02:56
램처럼, 몇 KB 정도의 램으로 이만큼 큰 공간을 차지했던 시대가 있었습니다. 이런 규모의 장비였어요.03:02
그 시절에는 이렇게 작동하게 만들 수 있었던 사람들이 있었습니다.03:08
이것뿐만 아니라, 매십 년마다 다시 보면 영상들이 여전히 멋있어 보여요.03:11
여기 보시면 로봇이 사람과 함께 포켓볼을 치고, 인간이랑 축구를 하는 휴머노이드 로봇도 있어요.03:16
그리고 이것도 딥러닝이 등장하기 이전 시기의 영상입니다.03:22
이것은 8년 전 영상인데요. 이 로봇은 버클리에서 개발되었고, 테이블 전체를 청소하고 상자 안에 물건을 정리할 수도 있습니다.03:26
이것은 단 한 명의 대학원생과 하나의 GPU 머신으로만 만들어진 결과물입니다.03:33
지금 보여드리는 이 사진은, 과거 영상들을 컬러로 바꾸고 Gen AI 필터를 적용해서 현대적인 목소리로 만들었습니다.03:38
이 영상이 1967년인지, 아니면 오늘 찍은 건지 구별하기 어려우실 거예요.03:45
그리고 이것들은 가장 오래된 결과물도 아닙니다. 더 오래된 것들은 1940년대까지 거슬러 올라갑니다.03:50
그러니 지난 70년 동안 다른 모든 기술들은 엄청나게 발전했는데, 예를 들어 언어 이해, 컴퓨터 비전, 모바일폰, 칩 같은 것들이요.03:55
왜 로봇 공학만 뒤쳐진 걸까요?04:02
로봇공학이 왜 이렇게 원시적인 시대에 오랫동안 머물러 있나요?04:08
그 이유는 일반적인 두뇌 때문입니다.04:12
로봇 공학은 항상 하드웨어 문제를 근본적으로 해결하는 방식으로 접근해 왔습니다.04:15
그래서 로봇 공학 주변의 모든 기술은 발전했지만, 로봇 자체는 지난 70년 동안 같은 수준에 머물러 있는 이유입니다.04:19
그래서 매우 유명한 역설이 있는데, 모라베크의 역설이라고 합니다. 혹시 모라베크에 대해 아시는지 모르겠습니다.04:25
그분은 또한 CME 교수님이셨고, 저도 CME 교수입니다. 그러니까 반드시 그분의 말씀을 인용해야 할 것 같습니다.04:29
그는 인공지능 분야의 창시자 중 한 분이셨습니다. 로봇 공학 분야에서 30년 동안 일하신 후에, 매우 간단한 결론에 도달하셨어요.04:34
어려운 것은 쉽고, 쉬운 것은 어렵다고요. 인간이 어렵다고 믿는 것과는 달리...04:41
컴퓨터에게는 매우 쉬운 일이고, 반대로도 마찬가지입니다. 그리고 여러분 눈앞에서 실제로 일어나고 있습니다.04:46
수학을 하는 것은 어렵다고 말씀하실 겁니다. 수학 올림피아드 금메달은 정말, 정말 어려운 것이죠.04:51
계단을 오르는 건 정말 쉬운 일입니다. 지금 기술 분야를 둘러보세요. 무엇이 해결되었고, 아직 해결되지 않았는지 살펴보세요. 이것이 바로 로봇공학입니다. 인공지능의 또 다른 응용 분야가 아닙니다.04:56
로봇공학은 인공지능의 또 다른 응용 분야가 아니었습니다.05:03
인공지능이 태초에 설립되었을 때의 목표였지만, 거의 진전이 없는 부분입니다.05:09
이는 아직 심층 신경망을 활용하여 이 분야를 해결할 수 있는 또 다른 응용 분야가 아닙니다.05:14
기본 원리부터 처음부터 다시 생각해야 합니다. (Gi-bun won-ri bu-teo cheo-eum bu-teo da-si saeng-gak-hae-a mnida.)05:18
컴퓨터가 할 수 있는 아주 유명한 예시입니다. (Keom-pyu-teo-ga hal su it-neun a-ju yu-myung-han ye-si-imnida.)05:23
체스를 해서 90년대에 게리 카스파로프를 이겼지만, 아직 체스 기물을 집어 옮겨 어떤 체스판에도 배치할 수 있는 컴퓨터나 로봇은 없습니다.05:27
체스 기물을 집어 올려 어떤 체스판에도 배열할 수 있는 그런 컴퓨터나 로봇은 없었습니다.05:34
자, 그럼 어떻게 이 문제를 해결해 나아갈 수 있을까요?05:38
좀 더 긍정적인 측면에서 말씀드리면, 인공지능 성공을 위한 비법 같은 것이 있죠?05:44
큰 데이터 세트를 얻고, 큰 모델을 학습시키면 놀라운 일이 일어납니다.05:49
이제 이 틀이 여러 분야에서 매우 효과적으로 작동하는 것을 알게 되었습니다.05:54
자, 로봇 공학에도 같은 방법을 적용할 수 있을까요? 음, 직접적으로 적용하기는 어렵습니다.06:00
데이터가 없기 때문입니다. 로봇 데이터 인터넷이라고 할 만한 것이 존재하지 않습니다.06:05
앞서 말씀드린 것처럼, 원격 조작 로봇을 통해 데이터를 직접 수집하실 수도 있습니다.06:09
알아채셨겠지만, 원격 조작은 최근 5년 이내의 기술이 아닙니다.06:15
이건 68세 또는 70세쯤 된 일입니다.06:18
재밌는 부분은 GPT-3, GPT-4 모델의 전체적인 발전 과정을 되돌아보면요.06:21
GPT-3가 있던 지 삼 년 전으로 돌아가 보세요. 마치 아주 먼 옛날 같아요.06:28
GPT-3는 모델을 조인(train)하는 데 수조 개의 토큰이 필요했을 때, 그때부터 작동하기 시작해서 사람들의 관심을 받기 시작했습니다.06:33
GPT-3는 이미 30조 토큰 이상이었고, 현재는 수백 배의 토큰을 사용하고 있습니다.06:40
만약 매일 작업하면서 데이터를 직접 수집한다면, 하나의 예시를 얻는데 약 한 분 정도 걸립니다.06:45
계산해보시면 알겠지만, 미국 전체 인구를 고용한다고 해도 백 년이 넘게 걸릴 거예요.06:49
GPT-3과 같은 규모에 도달하는 데요. 그런데 솔직히 말씀드리면, 지금은 아무도 GPT-3을 사용하지 않아요.06:54
알겠습니다. 그러니까 이건 매우 느리고 비싸다는 뜻입니다. 로봇공학 분야에서는 제가 주장하겠습니다.07:00
아직 아무도 로봇공학을 제대로 확장한 적이 없으며, 다른 분야처럼 로봇공학 확장에 대해 이야기하기에는 아직 멀었습니다.07:05
규모의 확대를 경험해 보았는데요. 그래서 저희는 이 부분에 집중하고 있습니다.07:13
Scaled는 설립된 지 약 3년 정도 되었지만, 저는 이 문제에 10년 넘게 작업해 왔습니다.07:16
제 경력 내내 이것 한 가지 일만 해왔습니다. 다른 건 없었습니다.07:22
Scaled에서 저희가 주장하는 논제는 '옴니바디 인텔리전스'라고 부르는 것을 구축하는 것입니다.07:25
어떤 로봇이든, 어떤 작업이든, 하나의 두뇌로 할 수 있습니다. 괜찮죠?07:32
어떤 로봇이라도 상관없습니다. 인간형이 될 수도 있고, 사족보행 로봇이 될 수도 있고, 컨베이어 벨트 위의 로봇 팔이나 숙련된 손일 수도 있죠. 크게 중요하지 않습니다.07:36
이 가설조차도 인간보다 훨씬 더 일반적이라고 할 수 있는데, 왜냐하면 우리는 우리 자신의 몸을 통제하니까요.07:43
왜 그렇게 조심해야만 할까요? 그 이유는 로봇공학에서는 데이터가 아예 없다는 주장 때문입니다.07:50
그래서 제가 어떤 하드웨어를 사용할지 선택할 수 없습니다.07:56
그리고 우리는 어떤 종류의 하드웨어든, 어떤 작업이든, 어떤 상황이든 상관없이 데이터를 활용할 수 있어야 합니다.08:00
그리고 이것이 언어 모델이 3년 전 달성한 규모를 진정으로 이루는 유일한 방법입니다.08:04
여기서의 목표는 이 아이디어 전체, 즉 어떤 로봇이든, 어떤 작업이든 하나의 두뇌를 사용하는 것입니다.08:11
이 강연을 통해 로봇 공학으로 나아가야 할 방향이라는 것을 설득할 수 있기를 바랍니다.08:15
대략적인 소개는 여기까지입니다. 더 자세한 내용을 들어가기 전에, 간단하게 결과 미리보기 영상을 보여드리겠습니다.08:20
그래서 이 결과에서 보여드리는 모든 로봇은 서로 다른 회사에서 만든, 다른 하드웨어를 사용합니다.08:29
그리고 모두 숙련된 두뇌에 의해 제어됩니다. 사람이든, 아니면 더 발전된 시스템이든요.08:34
그리고 계단 위아래, 어떤 상황에서도 괜찮습니다. 그리고 이것들은 새로운 결과가 아니에요. 08:39
약 두세 년 전의 결과들이고, 외부 충격에도 강하게 반응합니다.08:44
새로운 상황에서도 바로 적용할 수 있습니다, 즉08:51
여기서 중요한 점은 이 영상에 나오는 모든 로봇입니다.09:03
세상 어디에서든 어떤 행동을 하더라도, 그 뒤에 숨겨진 두뇌는 개선됩니다.09:07
왜냐하면 이것은 온몸을 관장하는 두뇌이기 때문입니다. 네, 정말 어렵죠?09:13
계란처럼, 음... 좋아요, 저는 너무 기대돼요.09:17
그래서 이것이 저희가 하고 있는 일에 대한 예고편입니다. 이 강연을 좀 더 과학적으로 만들고 싶어요.09:32
그리고 회사 광고보다 더 유익하게 만들어 보고 싶습니다. 로봇 공학에서 데이터를 어떻게 확장할지에 대해 이야기해 보겠습니다, 네?09:36
사람들이 이 문제를 어떻게 해결하는지 되돌아보겠습니다.09:43
제 경력을 되돌아보며 말씀드리겠습니다. 데이터에 대한 저의 가설도 시간이 지나면서 변화해 왔습니다.09:47
제가 스케일링 작업을 시작했을 때는, 로봇 데이터를 수동으로 수집하는 것이 일반적인 방식이었습니다.09:52
하지만 너무 느립니다. 로봇 스스로 데이터를 수집할 수 있도록 허용해야 합니다.10:00
그래서 저희는 호기심 기반 탐색이라는 전체적인 아이디어를 떠올렸습니다. 로봇이 환경 속에서 호기심을 가지고 탐색하도록 하는 것이었습니다.10:04
그리고 사람이 필요 없고, 로봇이 계속 작동하면서 더 많은 데이터를 수집할 수 있다는 등 좋은 점도 많습니다.10:10
당시에는 이것을 '플레이 데이터'라고 불렀습니다. 힘, 센서, 그리고 관절 각도 정보가 포함되어 있어 매우 풍부합니다.10:16
하지만 어려움이 있는 건, 실제 세계에서만 가능하다는 점입니다.10:21
그래서 확장하기가 매우 어렵습니다. 당시 구글도 수백 대의 로봇을 사용하고 있었습니다.10:25
구글조차도 확장하기에는 너무 비싸고 느렸습니다.10:31
또 다른 아이디어는, 다시 말씀드리지만, 원격 조작입니다. 제가 말씀드린 것처럼 오래된 생각이지만, 역시 같은 문제점들이 있습니다.10:35
확장하기가 불가능합니다. 왜냐하면 이제 로봇뿐만 아니라 사람도 필요하거든요.10:40
그러다 보니 훨씬 더 비용이 많이 들고, 다양성도 매우 제한적입니다.10:43
로봇을 사람과 함께 한 설정에 두더라도, 천 개의 예시를 얻을 수 있지만, 모두 동일한 설정에서 얻게 됩니다.10:47
이상적으로는 매일 새로운 환경으로 로봇을 옮겨서 다양한 시나리오에서 사용해야 하는데, 그것은 실현 불가능합니다.10:53
확장하기가 어렵습니다. 그런 다음 시뮬레이션에서 학습하는 데 큰 진전이 있었습니다.11:00
이것은 하나였습니다.11:04
처음에는 시뮬레이션에서 학습한 심층 강화 학습이 실제 로봇으로 옮겨지는 결과를 보여주는 연구가 있었습니다.11:05
당시 이 논문은 수상작이었고, 현재는 거의 모든 곳에서 사용되고 있습니다.11:12
모든 회사에서 휴머노이드 로봇을 연구하고 있습니다. 이 논문은 버클리 대학과 CMU의 연구실에서 나왔습니다.11:18
다시 말씀드리지만, 장단점이 존재합니다. 규모를 키우기는 매우 쉽지만, 다양성을 확보하기는 어렵습니다.11:23
시뮬레이션 환경을 수동으로 하나하나 만들어야 하기 때문입니다.11:28
이것을 듣고 계신다면, 정답은 하나가 아닙니다.11:32
단 하나의 해결책은 없습니다. 이건 저희가 이전에 했던 또 다른 작업입니다.11:36
이건 모두 확장하기 전의 일입니다. 사람들의 영상에서 학습하는 과정이죠.11:41
사람이 하는 것을 보고 로봇이 따라 하는 방식이죠. 다시 한번 말씀드리지만 다양성이 높습니다. 유튜브 영상 같은 것들을 활용할 수 있고, 매우 확장 가능하지만, 데이터로서 품질은 아주 떨어지는 편입니다. 왜냐하면 로봇과 너무 동떨어져 있기 때문입니다.11:44
데이터로서 품질은 아주 떨어지는 편입니다. 왜냐하면 로봇과 너무 동떨어져 있기 때문입니다.11:50
그래서 여기 해결책은 무엇인가요? 답은 황금 같은 길은 없다는 겁니다.11:57
다양한 특징을 고려해서 데이터를 생각해야 합니다.12:01
제 생각에는 로봇 공학에서 중요하게 고려해야 할 세 가지 특징만 있습니다. 확장성, 다양성,12:07
그리고 로봇 관절 각도와 얼마나 가까운지가 그것입니다, 알겠습니다?12:14
확장 가능성이란, 다양한 환경에서 빠르게 적용할 수 있느냐는 뜻이고, 다양성이라는 건, 다양한 데이터를 얻을 수 있느냐는 뜻입니다.12:19
똑같은 환경과 시나리오의 데이터만 100조 토큰이 있어도 아무 소용이 없습니다. 그렇죠?12:25
로봇의 관절 각도와 얼마나 가까운지를 의미합니다. 즉, 로봇이 가진 실제 관절 각도와 얼마나 차이가 나는지를 나타내는 거죠?12:33
시뮬레이션으로 보면 확장성은 매우 뛰어나지만 다양성이 낮고, 로봇과 어느 정도 유사한 편입니다.12:38
사람 동영상은 확장성도 높고 다양성이 풍부하지만, 로봇 데이터와는 거리가 멀어요.12:44
사람 데이터를 로봇 데이터로 매핑하는 방법을 배워야 합니다. 이 다른 두 가지 방식인 원격 조작과 조작 인터페이스는 그 중간쯤에 있다고 볼 수 있어요.12:47
여기서 보시는 것처럼, 현재 전 세계 여러 회사들이 이 방법들 중 하나에 집중하고 있습니다.12:54
대부분은 원격 조작(tele-op)이나 UMI 설정에 집중하고 있고, 다른 방식들은 거의 사용하지 않는 것 같습니다.13:02
하지만 정답은 없는 것 같아요. 각각의 방식들은 단점을 가지고 있습니다.13:07
하지만 빛나는 점은, 이 모든 방식들이 서로 보완해 줄 수 있다는 것입니다.13:11
서로의 단점이 정확히 일치하는 것은 아니에요.13:16
여기에서 저희가 수년에 걸쳐 발전시켜 온 방법은, 학습을 두 부분으로 나누어 진행하는 것입니다.13:20
프리 트레이닝과 포스트 트레이닝이 있습니다. 하지만 놀랍지도 않죠? 그럼 어떻게 프리 트레이닝을 해야 할까요?13:28
데이터를 이용해서 프리 트레이닝을 하고 싶은데, 그 데이터는 확장성도 높고 다양해야 하지만, 품질은 낮을 수도 있죠.13:31
시뮬레이션이나 사람들의 영상 데이터 등등을 활용해서 사전 학습을 진행하는 것입니다. 그래서 이렇게 사전 학습을 하는 것이죠.13:36
그리고 사후 학습에서는 원격 조작 데이터를 사용합니다.13:39
자, 그럼 원격 조작 데이터가 무엇인가요? 품질은 매우 높지만 양이 적습니다. 알겠습니다.13:42
품질은 높고 양은 적다는 점이 언어 모델의 레시피를 정확히 떠올리게 합니다.13:47
인터넷 데이터로 사전 학습을 진행하고, 그런 다음 회사 자체적으로 코딩을 위한 추가 학습도 하시는군요.13:52
하지만 로봇 공학에서는 배포 데이터라는 또 다른 종류의 데이터가 있습니다.13:59
그리고 배포 데이터는 배포 규모가 커질수록 확장성이 매우 높습니다.14:02
그러다 보면 이 데이터가 점점 더 중요해질 거예요.14:07
모든 것이 그렇습니다. 그리고 저희가 만들려고 하는 것은 '데이터 플라이휠'이라고 부르는 것입니다. 이 데이터는14:10
학습 후의 데이터를 가져와서 사전 학습 단계에 다시 넣는 방식입니다.14:17
그래서 왜 이렇게 온몸을 가진 두뇌라는 개념이 매우 중요한지 이해하실 수 있을 겁니다. 왜냐하면 이것은 매우 드문 일이기 때문입니다.14:19
세상 모든 곳에서 영원히 하나의 로봇, 단 하나의 버전만 계속 사용될 가능성은 낮습니다.14:27
하드웨어 분야에서는 이런 경우는 거의 일어나지 않습니다. 칩을 제외하고는 제조가 매우 어렵기 때문입니다.14:32
아직도 많은 회사들이 인공지능 추론 칩을 계속해서 개발하고 있습니다.14:37
하드웨어에서는 이런 경우는 거의 없죠. 로봇은 단 하나의 버전, 단 하나의 형태로 존재하며, 이것이 바로 온니바디 인텔리전스가14:44
우리가 부르는 배포 데이터 플라이휠을 가능하게 하는 요소입니다.14:50
자, 이제 몇 가지 결과를 빠르게 살펴보겠습니다. 이 두뇌는 매우 일반적이어서 다양한 작업을 아주 빠르게 수행할 수 있습니다.14:56
여러분은 이미 세탁물 개접기와 같은 많은 작업들을 보셨을 수도 있을 겁니다.15:03
어째서인지 실리콘밸리에서 아주 인기 있는 작업이기도 합니다.15:07
여기서는 논지가, 티셔츠를 접을 때 손가락 하나만큼이라도 어긋나면 완전히 망쳐버리는지 생각해 본 적이 있느냐 하는 겁니다.15:11
티셔츠를 접을 때, 제가 손가락 하나만큼만 어긋나도 티셔츠 접기가 완전히 망가지냐고 생각해보신 적 있으세요?15:16
이렇게 생각하지 않으시잖아요. 사람들이 접는 동안에도 거의 생각하지 않고 그냥 아무 데나 잡아요.15:22
그냥 무언가를 하는 거예요. 그러니까 실수를 하더라도 허용 범위가 엄청나게 높아요.15:26
그렇다면 왜 이 작업은 어려운 걸까요?15:31
왜 사람들이 이 작업이 어렵다고 믿도록 속을까요?15:35
이렇게 말씀드리는 게 어떨까요.15:39
천이잖아요, 그렇죠? 왜 천을 다루기가 어려운 걸까요?15:42
시뮬레이션이죠. 하지만 아무도 시뮬레이션을 사용하지 않아요. 전부 텔레오퍼레이션으로 하고 있거든요. 왜 이것이 어려울까요?15:46
왜 어려운지 아시죠? 왜냐하면 기존 로봇 공학 방식으로는 어렵기 때문입니다.15:51
기존의 로봇 공학에서는 사람들이 전체 물리 법칙을 모델링하고, 손으로 모델을 만들어서 이런 작업을 수행했습니다.15:56
그것 때문에 매우 어렵습니다. 하지만 딥러닝 기반 로봇 공학에서는 가장 쉬운 작업입니다. 왜냐하면 오차에 대한 내성이 높기 때문입니다.16:01
그래서 완전히, 지금 많은 회사들이요.16:08
지금 이 작업에 집중하고 있는데, 어렵다고 말씀드릴 수 있는 건 바로 이 작업입니다.16:11
이 비디오를 보기 전에 제가 이 작업을 할 수 있는지 물어본다면, 손이 없어도 가능한지 여쭤보시겠죠?16:17
아마 절반 정도의 사람들은 안 된다고 말할 거예요. 왜냐하면, 얼마나 많은 분들이 에어포트를 잃어버렸는지 생각해 보면요.16:22
에어포트라고 하는데, 저희 회사에는 '오른쪽 에어포트'라는 채널이 있어요. 사람들이...16:27
사람들이 계속해서 오른쪽 공항을 놓치고 있습니다. 이 경우에는 로봇이 손 대신 그리퍼를 가지고 있기 때문에,16:32
그래서 여기서는 그리퍼에게 이 작업이 매우 어렵습니다. 따라서 더 높은 수준의 지능이 필요합니다.16:38
팔이 공항을 올바른 방식으로 집어 들 수 있도록 위치를 잡아야 합니다.16:43
그렇게 삽입될 수 있도록, 그리퍼는 위아래로만 닫힐 수 있습니다.16:50
그리퍼와 평행하게 놓여 있어요. 그래서 끝부분에서 공항을 돌릴 수 없습니다.16:54
지금 보시는 것들은 실제 공항이 아니에요. 테무에서 판매하는 가짜 제품들입니다. 개당 5달러, 10달러 정도 해요.17:00
그래서 안쪽에 자석이 없답니다. 로봇이 이 부품을 제대로 넣기 위해 정말 열심히 해야 합니다, 자석이 없어서요.17:06
쉽게 당겨낼 수 있는 자석의 힘이 없는 거죠. 다 가짜 제품들입니다.17:12
영상에서 보이는 것보다 훨씬 더 어렵습니다.17:15
일단 화면 뒤의 기본적인 두뇌를 구축하면, 그렇게 할 수도 있습니다.17:19
세부 조정 데이터가 없는 상태에서도 다양한 사람들의 영상을 보면서 직접 배울 수도 있습니다.17:23
따라서 이 시나리오에서 저희는 이렇게 인간의 영상, 예를 들어 일인칭 시점 영상을 활용하여 학습시켰습니다.17:29
현재 저희는 이것을 더 많은 시점의 영상으로 옮기는 것을 시도하고 있습니다.17:34
그리고 제3자 관점이 잘 된다면 유튜브나 다양한 공개 소스 데이터를 통해 학습할 수 있을 겁니다.17:38
따라서 이 경우에는 영상을 보고, 한 시간 미만의 로봇 데이터를 추가합니다.17:43
매우 빠른 변환이 이루어지고요. 그리고 나서 인간형 로봇으로 옮겨갈 수 있습니다.17:48
지금 이 제품들은 손을 가지고 있습니다. 손이 있느냐 없느냐가 큰 논쟁거리입니다.17:53
사람들은 종종 로봇 기술이 아직 보편화되지 않은 이유를 손의 유무로 돌리는 경우가 많습니다.17:57
하지만 그런 경우는 아니에요. 항상 뒤에서 작동하는 지능의 문제랍니다.18:01
지금 당장은 손을 사용할 수 없어요. 공장에 배치할 만한 손이 아직 없는 것이지요.18:07
모두 100시간 안에 고장 나요. 아무거나 골라 보세요.18:12
더 좋은 로봇 손이 있으시다면, 바로 10개 정도 구매해서 테스트해 보고 싶습니다.18:17
그래서 견고한 시나리오를 만들 수 있습니다.18:22
이제 아이디어는 인간을 관찰하면서 여러 가지 작업을 수행할 수 있다는 것입니다. 그리고 저희가 아주 적은 데이터로도 작업할 수 있는 이유는요,18:25
로봇 데이터가 한 시간 미만으로도 충분한 이유는 로봇이 스스로 상상하는 능력이 있기 때문입니다.18:31
그리고 다양한 시나리오에서 학습 효과를 극대화하려고 노력합니다.18:36
여기서 보시는 영상은 완전히 가상의 영상입니다. 로봇의 꿈이라고 부를 수도 있겠네요.18:39
로봇이 자체 모델 내에서 시나리오를 상상할 수 있는 공간이죠.18:44
이것은 실제 데이터가 아니에요. 로봇 자체 모델에서 만든 가짜 데이터입니다.18:48
더 복잡한 작업이나 저렴한 하드웨어로 옮겨서 사용할 수도 있습니다.18:52
이것은 계란 요리, 예를 들어 오믈렛 만드는 과제입니다.18:57
자, 여기 이 전체 세팅 비용은 약 4천 달러 정도 됩니다.19:02
시중에 있는 것들에 비해 정말 저렴한 팔을 사용했어요. 그리고 여기 보시면, 센서조차 없을 정도로 가격이 매우 저렴합니다.19:07
여기 보시면, 센서가 전혀 없는 걸 알 수 있습니다.19:10
여기 있는 센서는 카메라 하나뿐이고, 힘을 감지하는 것도 아무것도 없네요.19:17
그리고 로봇은 시각만으로도 힘이 필요한 작업을 수행할 수 있습니다.19:20
지금 제가 미래에 그런 일이 일어날 거라고 말하는 건 아니에요. 그러니까 이런 일을 하시면 안 된다는 거죠.19:25
센서가 분명히 더 좋아질 거라고 확신합니다.19:28
하지만 현재 센서 기술로는 지능적인 관점에서 우리가 도달할 수 있는 수준에 비해 아직 많이 부족합니다.19:30
그래서 계속 발전할 수 있습니다. 이 분은 버클리에서 저의 지도 교수님이십니다.19:38
그는 로봇이 그것을 할 수 있다고 믿지 않았어요. 그냥 한 시간 동안 서 있었고, 로봇은 계속 오믈렛을 만들었어요.19:42
흥미로운 점은 이것이 완전한 엔드 투 엔드 시스템이라는 거예요.19:48
상태 머신 같은 건 전혀 없습니다. 로봇이 계란을 만드는 이유는 앞에 빈 접시가 있기 때문입니다.19:51
왜 그러는지 제가 모르겠습니다. 영상에 편집된 부분은 없다고 확실히 말씀드릴 수 있습니다.19:57
HDMI 문제인 것 같아요. 접시를 치우자마자 이런 현상이 발생하는 이유를 모르겠습니다.20:01
네, 상태 머신이 전혀 없습니다. 로봇이 시작하고 종료될 때도 모두 자동화되어 진행됩니다.20:09
그리고 외부 충격에도 매우 강하답니다. 주변의 물건들을 바꿔 놓을 수도 있습니다.20:13
물건들을 추가할 수 있는데, 이 모든 것들이 처음 보는 물건들입니다.20:17
팬과 가스 부분만 동일하고, 나머지는 모두 다릅니다. 그리고 로봇은 계속 작동할 수 있습니다.20:20
기본적인 안정성을 확보할 수 있습니다. 이 모든 것이 10시간 미만의 데이터로 학습되었습니다.20:25
이러한 강건성을 학습하려면 데이터 양이 매우 적게 필요합니다. 그리고 이 모든 것이 백그라운드에서 작동하는 기본 모델에서 비롯됩니다.20:31
시간 관계상 이 부분은 생략하겠습니다. 기존 로봇 공학 파이프라인처럼 계획, 매핑 등이 있는 것과는 달리,20:37
이것은 엔드 투 엔드 방식으로 작동하는 두뇌입니다. 지금, '엔드 투 엔드'는 많은 인공지능 분야에서 자주 사용되는 용어입니다.20:44
제가 ‘엔드 투 엔드’라고 말씀드릴 때, 정말로 엔드 투 엔드라는 뜻입니다. 카메라로부터 직접 데이터를 읽어들입니다.20:50
그리고 모터에 직접 전력을 공급합니다. 중간에 아무것도 사용하지 않고, PID 컨트롤러 하나만 사용해요.20:55
매우 마지막 단계에서 100 헤르츠에서 500 헤르츠로 변환하기 위해 PID를 사용하지만, PID는 로봇 공학의 기여라고 보기는 어렵습니다.21:02
이것은 제2차 세계 대전 같은 시대 이전의 일입니다.21:07
이제 흥미로운 부분은 저희에게 비전이라는 것이 또 다른 입력 방식이라는 점입니다.21:11
그래서, 그렇게 놀랍운 건 아니에요.21:15
혹시 보셨을 수도 있지만, 로봇이 춤추거나 가라테,쿵푸, 뒤로 제자리 돌기를 하는 모습들을 많이 보셨을 겁니다.21:17
돌아가서 한번 생각해보세요. 로봇이 계단 위아래로 올라가는 영상을 얼마나 보셨어요?21:23
정말 얼마 없네요.21:29
최상위 휴머노이드 기업들조차도, 단순히 확인을 위해 한 번 올라가는 정도의 계단 시연만 보여줬을 뿐입니다.21:31
사람들은 중국과 미국 간의 휴머노이드 경쟁에 대해 이야기하지만, 그런 것은 다 헛소리라고 생각합니다.21:38
만약 휴머노이드가 계단을 오를 수 없다면 다리가 있을 이유가 있나요?21:45
그게 바로 다리가 있는 유일한 이유입니다. 지금 이 상황은 실제로 모라벡 역설의 한 형태라고 할 수 있습니다.21:50
왼쪽 것(들)은 로봇에게 훨씬 더 쉽습니다. 백플립이나 춤추는 것도 로봇이 하기에 훨씬 수월합니다.21:55
그리고, '왜 이런 역설이 존재할까?'라고 생각하실 수도 있습니다. 한 단계 더 깊이 생각해 보세요.22:01
로봇이 백플립을 할 때는 자신의 몸에 대해서만 알아야 하고 다른 건 몰라도 돼요.22:05
맞죠? 모든 것이 알려지거나 완전히 관찰될 때, 컴퓨터가 잘하는 바로 그 순간이죠.22:13
왜냐하면 그들은 가능한 모든 상황을 시뮬레이션할 수 있기 때문입니다.22:20
하지만 올바른 행동 하나를 하는 것조차도, 예를 들어 계단을 오르는 것조차도22:24
계단을 오르는 것과 같이, 우선 계단이 있다는 것을 보거나 높이나 폭을 알아야 하죠.22:27
정확하게 높이나 폭을 측정하는 것이 아니라, 여러 가지 변화에 맞춰 조절하는 것입니다.22:32
그리고 그것은 시각을 필요로 합니다. 따라서 올바른 것은 이해를 필요로 하고, 그래서 어렵고, 이런 것들을 전혀 보이지 않죠.22:36
하지만 저희에게는 그냥 또 다른 결과일 뿐입니다. 크게 중요하지 않습니다. 저희는 이 결과를 1년 반 전에 발표했었습니다.22:41
이 영상은 2년 반 전에 촬영했습니다.22:46
하지만 이 로봇은 어떤 상황에서도 움직일 수 있습니다. 그리고 넘어지지도 않고요.22:50
의도적으로 물건들을 밟아 넘어가요. 그리고 매핑이나 계획은 전혀 없고요. 주변 환경에 대한 3차원 지도를 만들지도 않아요.22:54
몸통에 있는 카메라만으로 모든 것을 작동시키고 있어요. 그리고 어떤 환경, 어떤 계단에도 이 로봇을 배치할 수 있습니다.22:59
여기서는 속도를 더 빠르게 내고 있습니다. 이쪽은, 아시겠지만, 화재 탈출 계단입니다.23:05
좀 이상하게 느껴지네요. 화재 탈출 계단은 긴급한 화재 상황 발생 시 사용하도록 만들어졌습니다.23:11
그리고 이것들은 모든 건물에서 가장 어려운 환경입니다. 그래서 다양한 환경에서 테스트하고 있습니다.23:15
하지만 어디든 설치할 수 있습니다. 방해해도 괜찮고, 크게 상관없습니다. 로봇이 끌려지고 있다는 것을 인지하지 못하기 때문에 초인적인 능력이라고 할 수 있습니다.23:20
로봇에게서 예상치 못한 반응을 이끌어내는 요소가 바로 올라가는 방식으로 당기는 것이죠.23:27
그리고 다시 한번 말씀드리지만, 모든 시나리오에서 동일한 모델을 사용하고 있습니다. 그래서 매우 쉽습니다.23:31
쉬운 파쿠르가 재미있어 보이는 건 맞지만, 사람들이 종종 이렇게 말하죠, 있잖아요,23:36
로봇도 이 모든 걸 할 수 있지만, 제가 방금 보여드린 것보다 훨씬 쉽습니다.23:46
지금 이 영상들을 보시는 분들도 많을 거예요. 제가 이건 쉽다고 말씀드려도 불구하고, 더 인상적이라고 생각하실 수도 있습니다.23:51
이 모델은 반 시간이면 학습이 완료되는데, 이전 모델은 훨씬 더 오랜 시간이 걸리고요.23:57
기존 모델보다 훨씬 더 어렵게 학습시켜야 합니다. 그래서 이 기본 모델을 다양한 작업에 빠르게 적용할 수 있습니다.24:01
이것은 약 1년 반 전의 아주 오래된 결과입니다.24:08
LAN 케이블 삽입 같은 작업들은 현재 매우 발전된 시스템을 사용하고 있습니다.24:11
하지만 저희는 이미 다양한 애플리케이션에 이 모델들을 배포하고 있습니다.24:14
예를 들어 데이터 순환 고리를 구축하는 것에서 가장 어려운 부분은 실제로 배포 자체입니다.24:18
지능이나 하드웨어 외에도 배포 과정에서 고려해야 할 문제가 정말 많습니다.24:24
챗GPT를 앱에 배포하는 것과는 완전히 다릅니다.24:29
많은 제약 사항들을 고려해야 하기 때문이고, 스카이디오가 이전에 관련 발표를 한 것으로 알고 있습니다.24:34
그리고 그들은 배포의 어려움에 대해 하루 종일 이야기할 수 있습니다.24:38
그래서 저희는 미래에 강력한 데이터 순환을 구축하기 위해 지금부터 배포를 시작해야 합니다.24:42
그리고 저희가 진행하고 있는 배포 사례를 몇 가지 보여드리겠습니다. 예를 들어 엔비디아가 휴스턴에 첫 공장을 열고 있습니다.24:47
현재 사용하시는 엔비디아의 GPU들은 모두 대만에서 주로 생산되고 있습니다.24:54
거기서는 전부 수작업으로 하고 있습니다. 그리고 사람들은 정말 효율적이고, 이 제품들을 만드는 데 있어서 매우 능숙합니다.24:59
하지만 미국 내에서 비용 유지, 확장성 확보, 생산량 증가는 이 노동력 없이는 달성하기가 매우 어렵습니다.25:05
그래서 저희는 이들의 GPU 조립을 자동화하고 있습니다.25:11
이건 실제로 NVIDIA GTC에서 라이브 데모를 진행했고, 지난주에 이미 공장에 배포되어 운영되고 있습니다.25:16
제가 강조하고 싶은 흥미로운 부분은 이 작업이 매우 전통적인 공장 업무라는 점입니다.25:22
하지만 전체 설정을 보면 굉장히 무작위적이고 소음이 심한 것을 알 수 있습니다.25:29
그리고 어느 공장에 가더라도, 매우 깨끗합니다.25:36
그래서 여기 있는 로봇은 동일한 두뇌를 가지고 있어서 아주 정밀한 작업도 수행할 수 있습니다.25:39
어떤 종류의 방해에도 매우 강건하게 대응할 수 있습니다. 즉, 이제 이 로봇들은 케이지 안에 있을 필요가 없다는 뜻입니다.25:44
그리고 공장 라인에 바로 배치될 수 있습니다.25:50
기존 공장 라인을 전혀 변경하지 않고 사람들과 함께 작업할 수 있습니다.25:55
그리고 사람이 있는 곳에는 어김없이 혼란이 따릅니다. 동일한 두뇌를 배송 애플리케이션에도 적용할 수 있습니다. 자, 여기 로봇이 트럭에서 물건을 배달합니다.25:58
현관까지 배달해야 합니다. 현관의 위치를 찾아야 하는데, 상식적인 문제이고 이동성 문제는 아닙니다.26:05
이미 저희가 백스테이지에서 패키지 배송을 진행해 왔습니다.26:10
이 지역의 집 앞까지 패키지를 배달하는 데 많은 파트너들이 협력하고 있습니다.26:15
동일한 설정으로 창고와 모든 곳에서 활용할 수 있습니다.26:19
이제 마무리 말씀을 드리면서, 이 주제를 닫으려고 하는데, 제가 말씀드린 것처럼 이것은 온몸을 감싸는 두뇌라고 말씀드렸고,26:24
그리고 왜 플라이휠을 구축하기 위해 온몸을 감싸는 두뇌를 갖는 것이 매우 중요한지 명확하게 이해되셨기를 바랍니다.26:29
하지만 또 하나의 추가적인 장점이 있습니다. 그건 바로 로봇이 시간이 지나면서 고장날 수 있고, 안전 시나리오에서도 그렇다는 점입니다.26:34
그리고 안전은 이 온몸 감각 뇌의 부산물입니다. 음, 건너뛰는 부분이 많으니 온라인에서 확인하실 수 있습니다.26:41
이 모든 내용은 온라인에서 확인하실 수 있습니다. 하지만 이 시스템이나 로봇 각각에 동일한 두뇌를 적용할 수 있습니다.26:48
이번 경우에는 이 로봇들에 대해 특별히 학습하지 않았습니다. 따라서 이것은 휴머노이드와 다른 모든 것에 대한 완전한 제로샷 전이입니다.26:56
로봇이 고장 나더라도요, 예를 들어 다리가 부러지더라도, 밀리세컨드 내에 회복할 수 있습니다.27:02
왜냐하면 다리가 부러지면, 세 발로 서 있는 로봇은 새로운 로봇이 되기 때문입니다.27:07
로봇의 형태가 크게 중요하지 않습니다. 여기서는 로봇 다리를 비활성화시키는 변화를 주고 있습니다.27:12
단 세 번의 시도만에 두 발로 걷는 방법을 학습합니다.27:17
지금 화면에서 보시는 것은 이 시스템 내에서 로봇이 학습하는 모든 과정입니다.27:21
그래서 몇 밀리초에서 최대 30초 정도까지 빠르게 적응합니다. 여기 예시처럼, 진행되는 것을 볼 수 있습니다.27:27
바퀴 위에서 바퀴가 막히면, 걸어 다니기 시작합니다.27:34
이것은 온몸을 갖춘 두뇌의 또 다른 부산물입니다.27:38
이런 모델의 경우 안전은 완전히 다른 의미를 갖게 되는데요, 로봇이 날 수 있거나,27:41
죄송합니다만, 몸통 절반만으로도 걸을 수 있거나 작동할 수 있을 때 말이죠.27:46
이 부분에서 몇몇 잔인한 장면은 삭제했는데, 로봇을 반으로 잘라도 각각의 조각이 따로 작동하는 모습을 보여드리기도 했습니다.27:51
더 자세한 내용은 유튜브에서 확인하실 수 있습니다. 이것밖에 준비되지 않았네요. 감사합니다.27:57
AI Summary
이 연설은 로봇 공학 분야의 데이터 확장 문제와 Scaled라는 회사의 혁신적인 접근 방식을 다루고 있습니다. 현재 로봇 공학은 데이터 부족으로 발전이 더디지만, GPT-3와 같은 대규모 언어 모델처럼 데이터를 활용하여 '옴니바디 인텔리전스'를 구축하는 것을 목표로 합니다. 엔비디아의 GPU 자동화 사례는 이러한 기술의 가능성을 보여주며, 로봇들은 소음과 혼란스러운 공장 환경에서도 강건하게 작동하고 다양한 분야에 적용될 수 있습니다. 특히, '온몸을 감싸는 두뇌'라는 개념은 안전성 확보와 빠른 적응력을 가능하게 하며, 데이터 순환 구축을 통해 실제 애플리케이션에 배포하는 것이 중요함을 강조합니다.
Key Highlights
- •로봇 공학 분야의 데이터 확장 문제 해결을 위한 Scaled의 옴니바디 인텔리전스 목표 제시
- •데이터 확장 시 확장성, 다양성, 로봇과의 유사성을 고려하는 균형 잡힌 접근 방식의 중요성 강조
- •엔드 투 엔드 학습 방식을 통해 카메라 입력만으로 로봇이 작업을 수행하는 새로운 패러다임 소개
- •엔비디아 GPU 자동화 사례를 통한 로봇 기술의 실제 적용 가능성 입증 (공장 환경 적응, 다양한 분야 활용)
- •온몸을 감싸는 두뇌 개념을 통해 안전성 확보, 빠른 적응력, 형태 변화에 따른 유연한 작동 가능


