Home

읽기 설정

좋은 소개 감사드립니다. 저는 다이나의 공동 창업자인 제이슨입니다.00:12

오늘, 저희가 고성능이고 매우 강력한 범용 로봇 정책을 어떻게 개발하고 있는지 말씀드리겠습니다.00:16

바로 시작해 보겠습니다. 오늘 발표는 로봇을 상용화 수준으로 만드는 과정과 이를 위해 저희가 무엇을 하고 있는지에 초점을 맞출 예정입니다.00:25

제가 말씀드린 것처럼, 이 모델들을 매우 고성능이고 견고하게 만들려고 노력하고 있습니다. 간단히 저희 회사에 대해 소개해 드리겠습니다.00:32

저희의 목표는 실제 세계에서 매우 강력하고 기초 모델 기반 자율성을 구축하는 것입니다.00:37

그래서 저희는 모델을 학습시키고, 요즘에는 이것과 함께...00:42

하드웨어는 여러 가지 경제적으로 유용한 물리적 작업을 수행할 수 있는 단일 플랫폼을 갖추도록 하는 것이 필요합니다.00:45

여기서 보여드리는 것과 같은 실제 세계에서 회사는 2024년 9월에 설립되었습니다.00:51

저희는 시리즈 A 단계의 회사이며, 약 1억 2천만 달러를 유치했습니다. 저희는 범용 조작에 집중하고 있습니다.00:56

그리고 저희의 핵심 가설은 로봇을 실제로 현실 세계에 투입하기 위해서는 상업적인 수준이 필요하다는 것입니다.01:04

유용한 작업을 수행하려면, 선도적인 연구와 많은 상업적 배치를 결합해야 합니다.01:09

연구 개발과 실제 배치 모두를 구축하여 우리가 생각하는 연구 및 배치 순환 고리를 만들 수 있습니다.01:14

플라이휠의 핵심은 저희가 사내에서 진행하는 연구 개발과 하드웨어 작업이01:18

실제 세계에서 상용화할 수 있는 업무와 워크플로우의 종류에 영향을 미친다는 것입니다.01:24

그래서 저희는 적극적으로 배치를 시도하고 있습니다. 요즘에는 여러 곳에서 다양한 작업을 진행하고 있죠.01:29

방금 말씀드린 작업들에 대해서는 조금 더 자세히 설명드리겠습니다.01:33

그리고 제품을 만들고 로봇을 배포하는 과정에서 여러 가지 효과가 있습니다.01:36

그 중 하나는 고품질의 배포 데이터를 수집하는 데 도움이 된다는 것입니다.01:41

그리고 저희의 모델이나 하드웨어가 아직 어떤 부분에서 부족한지 알려주기도 합니다.01:45

그래서 로봇 분야에서 어떤 문제를 집중적으로 연구해야 할지, 연구 방향을 구체화하는 데 도움을 줍니다.01:49

로봇 공학 분야에 익숙하시다면, 해결해야 할 문제가 너무 많다는 것을 아실 거예요.01:55

노력을 기울일 수 있는 분야가 너무 다양해서 어떤 것에 집중해야 할지 결정하기 어려울 수 있습니다.01:59

제품을 출시하고 개발하는 과정에서 어떤 문제를 해결해야 하는지 정확히 알 수 있습니다.02:02

단순한 시연이나 유튜브 영상으로 그치는 것이 아니라, 실제로 로봇 기술이 발전할 수 있도록 집중해야 할 부분을 파악할 수 있다는 뜻입니다.02:06

하지만 실제 세상에서 수백만 명의 삶에 영향을 미치는 것이 중요합니다.02:11

그래서 제가 다이나에서 구체적으로 어떤 일을 하는지 설명하기 전에, 간단하게 소개를 드리겠습니다.02:16

로봇 조작을 위해 저희가 어떤 모델들을 학습시키는지에 대한 내용입니다.02:21

전반적으로 말씀드리면, 데이터 수집 작업을 진행하는데요, 많은 양의 데이터가 수집됩니다.02:25

이것입니다. 여기 제가 로봇 하드웨어를 이용해서 티셔츠를 접는 영상이 있습니다.02:30

이렇게 데이터를 충분히 수집하면, 이 모든 것을 큰 뉴럴 네트워크에 넣을 수 있습니다.02:36

신경망에 넣을 수 있는데, 신경망은 기본적으로 세계의 표현, 이 경우에는 테이블이 어떻게 보이는지 카메라 영상을 입력받아서02:42

출력합니다.02:47

로봇의 관절 위치나 토크를 이용해서 로봇을 제어하고 작업을 수행하게 할 수 있습니다.02:52

데이터를 수집한 작업에 대한 고수준적인 내용이죠. 그렇죠?02:57

실제 세계에서 로봇 모델이 어떻게 작동하는지에 대한 것이죠.03:03

그럼, 실제로 다양한 작업을 수행할 수 있고 일반화 가능한 모델을 만들기 위해 이것을 어떻게 확장해 나갈 계획인가요?03:07

그래서 다이나에서는 실제 세계를 위한 사전 학습 데이터 피라미드에 집중하고 있습니다.03:14

로봇 데이터를 구하기 매우 어렵기 때문에 다양한 외부 로봇 데이터를 많이 수집하고 있습니다.03:18

그래서 저희는 카메라를 착용한 사람으로부터 데이터를 수집하고 있습니다.03:23

공개 데이터 세트에서도 가져오고 있고, 요즘에는 시뮬레이션 데이터도 고려해보고 있습니다만.03:27

로봇 데이터가 부족해서 로봇 데이터를 제외한 다른 데이터를 많이 수집하기도 합니다만, 오프-로봇 데이터만으로는 로봇이 아주 정밀한 작업을 수행하기에는 충분하지 않습니다.03:32

그래서 로봇 자체에서도 다양한 작업들을 수집하고 있습니다. 여러 가지 환경에서요.03:37

다양한 종류의 작업 환경에서 시나리오를 수집하고 있습니다. 예를 들어 산업 현장, 가정, 세탁소, 그리고 호텔과 같은 곳들입니다.03:42

로봇을 실제로 배치하면서 데이터를 수집할 수도 있습니다.03:49

모델의 현실 세계와의 격차를 줄이고 학습 및 테스트하는 데 도움이 되는 매우 고품질의 배포 데이터를 확보하고 있습니다.03:53

로봇을 개발할 때, 보통 로봇은 시설이나 연구실에 있는 경우가 많습니다.04:00

로봇을 실제로 배치하는 경우에는 환경이 매우 다릅니다.04:06

그래서 이 세 가지 데이터 소스를 결합하면 대규모 기초 모델을 학습시킬 수 있다는 것을 발견했습니다.04:08

실제 환경에서 매우 잘 작동합니다. 지금까지 저희의 학습 파이프라인에 20만 시간 이상의 데이터가 있습니다.04:14

그리고 모델 아키텍처는 대략적으로 고수준 추론 모델과 저수준으로 구성되어 있습니다.04:20

세밀한 고주파로 능숙한 동작을 실제로 출력할 수 있는 월드 액션 모델입니다.04:26

이것이 저희가 사용하는 아키텍처의 종류인데요, 현실 세계에서 생각해보면요.04:33

로봇이 실제 물리적인 작업을 수행하려면 세상에 대한 의미론적 이해가 필요하고요, 04:37

세밀한 수준에서 물리적인 상호작용도 이해해야 실제로 가능하답니다.04:42

실수로부터 회복하고 작업을 완료하기 위해 매우 정확한 행동을 할 수 있습니다.04:47

그래서 이 아키텍처와 많은 데이터를 결합하면 모델에 어떤 일이 발생하는지 살펴보겠습니다.04:52

실제 세계의 다양한 작업을 빠르게 미세 조정할 수 있습니다.04:59

그래서 여기에는 사무실에서 수행하고 있는 벤치마크 작업의 종류를 보여주는 이미지 갤러리가 있습니다.05:03

그러니까 쓰레기 청소부터 상자 개봉, 수건 접기, 티셔츠 접기와 같은 일들까지 포함합니다.05:08

그리고 저희 연구원들이 생각한 다양한 작업들도 많이 있습니다.05:15

정말 흥미로운 점은 좋은 사전 학습 모델을 사용하면 아무것도 없이도,05:19

아시겠지만, 제가 보여드리는 몇몇 작업들은 전혀 사전 학습 데이터에 포함되지 않았습니다.05:24

하지만 좋은 사전 학습을 거치면, 이 종류의 매우 정교한 도구 사용 작업을05:29

매우 적은 양의 데이터로도 후속 학습 모델을 통해 수행할 수 있습니다.05:34

여기서 보시는 두 영상 모두, 한 시간 미만의 작업별 데이터로만 학습되었습니다.05:38

하지만 로봇이 이러한 작업을 반복적으로 수행하는 것을 볼 수 있습니다.05:44

그리고 실패 없이 반복해서 이러한 작업을 수행할 수 있습니다. 저는 이것이 실제 상용화 수준으로 나아가는 중요한 발걸음이라고 생각합니다.05:49

왜냐하면 현실 세계에서는 인간과 로봇이 반복적으로 물리적인 작업을 수행해야 하기 때문입니다. 따라서 현실 세계에서의 적용을 가능하게 하는 것이 중요하다고 생각합니다.05:54

그리고 모델이 충분히 신뢰할 수 없다면 네, 이런 멋진 시연 영상을 만들 수는 있습니다.06:01

하지만 실제 적용까지는 아직 많이 부족합니다.06:04

그래서 제가 생각하기에 현재 대규모 조작을 위한 기초 모델 학습의 현 상태로 이어지는 내용입니다.06:09

많은 일을 할 수 있는, 관대한 모델들이라는 것이죠.06:16

제가 보여드린 것과 같은 여러 가지 작업들을 수행할 수 있지만, 예쁜 영상은 만들어도 성공률이 실제로는 아주 높지 않습니다.06:20

지금까지 말씀드린 것처럼, 많은 작업을 수행할 수 있기는 하지만, 실제로 성공률은 생각보다 높지 않습니다.06:25

You know, when these models are actually deploying, they're about 80 to 90 percent success rate.06:29

But if you're stuck at 80% to 90% success rate, then, you know, the chance that you can do the same task 10 times...06:34

연속으로 성공하는 경우는 실제로는 0.1% 미만입니다. 반면에 로봇 공학 역사에서 보면,06:41

매우 특화된 로봇과 매우 특화된 머신러닝 파이프라인을 활용해 온 경우가 있었습니다.06:47

픽앤 플레이스와 같은 특정 작업들 말이죠. 하지만 제가 생각하기에 이런 파이프라인은, 즉 전문 모델들은 확장성이 낮습니다.06:52

동일한 파이프라인을 단순히 다른 작업에도 적용하기 어렵다는 뜻입니다.06:57

새로운 작업도 빠르게 처리하고, 임의의 작업을 아주 빠르게 수행할 수 있도록 하는 것이 저희의 목표입니다.07:02

인용하신 것처럼, 이런 이분법적인 구분을, 범용 모델을 훈련시켜서 해결하고자 합니다.07:08

다양한 작업들을 많이 처리하면서도 상업적 배포에 충분히 신뢰성 있는 모델을 만들 수 있어야 합니다.07:13

그걸 어떻게 실제로 구현할까요? 오늘 발표에서는 저희의 진행 상황 중 일부를 간략하게 말씀드리겠습니다.07:17

매우 복잡한 작업을 매우 안정적으로 수행하고, 동시에 동일한 기술을 활용하여 성능도 발휘하는 것을 익히는 것이고요.07:23

연구실 환경에서 학습된 것뿐만 아니라, 실제 다양한 환경에서도 적용할 수 있도록 하는 것입니다.07:29

임의의 고객 사이트에 별도의 추가 학습이나 조정 없이 배포할 수 있는 것을 의미합니다.07:34

자, 이제 본론으로 들어가겠습니다. 저희가 답을 찾고 싶은 첫 번째 질문은 다음과 같습니다.07:40

가지고 있던 일반적인 사전 학습 및 사후 학습 레시피를 그대로 사용할 수 있을까요?07:45

그런 다음 이 모델들을 거의 100% 완벽하게 어떤 작업에도 적용될 수 있도록 만들 수 있을까요?07:49

그래서 이것은 작년에 저희가 발표한 첫 번째 연구 결과입니다.07:57

자세한 내용은 저희 블로그 게시글을 참고해 주시면 됩니다. 간략하게 말씀드리면, 모델을 어떤 작업에서도 100% 견고하게 만들고 싶다면요.08:00

정말 많은 작업들이 있는데, 우선 상업적인 활용 사례를 좁혀서 시작하는 것이 아주 좋을 것 같습니다.08:07

어느 정도 어렵지만 연구 진전을 이룰 수 있고 동시에 상업적 가치도 있는 그런 사례를 선택하는 것이죠.08:12

가치입니다. 그래서 저희 회사를 작년에 처음 시작했을 때 알게 된 것은, 만약 여러분이08:16

어떤 식당에 가든, 아시겠지만 고급 레스토랑이나 딤섬 가게 같은 곳에서요.08:22

미국에서는 식탁 위에 예쁘게 접힌 냅킨이 놓여 있잖아요, 그렇죠?08:26

치즈 케이크 팩토리에 가시면 그런 냅킨들을 보실 수 있을 거예요. 그리고 뒤쪽에서는요...08:30

식당 사무실에는 보통 직원들이나 식당 직원들이 직접 하나하나 접고 있는 경우가 많습니다.08:35

정말 지루하고 반복적인 과정이죠.08:40

저희와 대화하신 많은 고객분들께서도 이와 같은 작업을 수행할 수 있는 로봇에 관심을 갖고 계십니다.08:44

그래서 이것은 저희가 모델을 매우 강력하게 학습시키는 방법에 대해 진행했던 가장 초기 사례 연구 중 하나입니다.08:50

그래서 저희 연구 결과는 '디노-원(Dino-1)'이라는 모델인데, 이것은 다양한 작업을 수행할 수 있는 일반적인 로봇 기반 모델입니다.08:54

이 모델은 종이접기 작업에 맞춰 미세 조정되었으며, 99.4%의 높은 성공률을 달성할 수 있습니다.09:01

24시간에 걸쳐서 진행됩니다. 여기서는 모델이 작업을 수행하는 타임랩스 영상을 보여드리는데, 속도를 약 천 배로 빠르게 해서 보여드리는 것입니다. 배경의 시계가 빠르게 움직이는 것을 통해 진행 상황을 확인할 수 있습니다.09:07

속도가 빨라진 영상입니다. 배경에 있는 시계를 보시면 진행 과정을 잘 알 수 있을 거예요.09:14

모델들과 제가 가장 좋아하는 부분은 영상에서 시계가 지금처럼 대략 오전 7시를 가리킬 때입니다.09:19

아침이고, 그래서 빛이 실제로 나오기 시작합니다.09:26

외부 환경도 시간이 지남에 따라 조명 때문에 변하고 있습니다.09:29

로봇이 냅킨을 접고 있지만, 모델은 충분히 견고해서 계속 작동합니다.09:33

자, 그럼 어떻게 이 작업을 수행할 수 있는 모델을 만들게 될까요? 우선, 아시겠지만, 저희가 올린 이 영상은09:38

단 한 번의 일회성 이벤트가 아니에요. 모델이 이걸 정말 여러 번 반복해서 할 수 있습니다.09:44

사무실에서 하는 테스트인데, 이 네 가지는 모두 24시간 동안 진행되는 독립적인 시험입니다.09:50

기술적인 부분에 들어가기 전에, 이 작업이 얼마나 어려운지 강조하고 싶습니다.09:56

냅킨 접기 과제에서 보시는 것처럼, 옆에 냅킨 더미를 시작으로 가지고, 로봇이 정확하게 하나씩 집어 올리는 것이 중요합니다.10:00

로봇은 아주 정확하게 특정 냅킨을 골라내야 합니다.10:04

냅개 한 장을 꺼내서 접고, 바구니에 넣어야 합니다.10:09

대부분의 실패 사례는 이 병렬 작업 그리퍼들 때문에 발생하는 것 같습니다.10:13

그리퍼를 배치하는 과정에서, 정확도가 충분하지 않아서 한 장의 냅킨만 집어낼 수 없는 경우가 있을 수 있습니다.10:17

정확히 한 장의 냅킨을 집지 못할 때, 모델은 어떻게 복구해야 하는지를 학습해야 합니다.10:22

냅킨을 너무 많이 꺼내는 실수가 발생하는 경우도 있고요.10:26

그리고 두 번째로, 연구실 시연과는 달리 상업적인 환경에서는...10:29

저희처럼 작업 성공을 생각하는 사람들도 실제로 매우 명확하게 정의된 성공 기준이 있습니다.10:35

이러한 작업들의 성공 기준은 매우 잘 정의되어 있습니다. 오른쪽에서 저희가 그레이드 5로 평가하는 접기의 차이를 보실 수 있습니다.10:42

레스토랑에서 받아들일 수 있는 접기 품질과, 세 단계로 평가되는 품질은,10:48

허용 기준 이하의 수준입니다.10:53

보시는 것처럼, 두 번째 접기의 솔기 높이가 겨우 한 인치 정도밖에 차이가 없습니다.10:55

그럼 어떻게 하면 정말 잘 작동하는 모델을 만들 수 있을까요?11:03

그래서 저희 내부적으로 시도했던 방법은, 정말 많은 시간 동안 데이터를 이용해서 사전 학습을 하고, 그리고 말씀드린 것처럼 사후 학습 레시피를 적용하는 것이었습니다. 11:06

이렇게 하면 대략 80% 정도의 성공률을 얻을 수 있습니다.11:13

그리고 모델이 처음에는 괜찮은 것 같은데, 실수를 하면 바로 분포에서 벗어나서, 회복할 수 없게 되는 경우가 있습니다.11:19

일반적으로 그렇게 됩니다. 즉, 데이터 분포 범위를 벗어나 갇혀버리는 거죠.11:26

기존의 사전 훈련과 사후 훈련 방식보다 더 해야 할 일이 필요합니다.11:29

이 방법은 로봇 공학뿐만 아니라 다른 분야에서도 매우 인기 있습니다.11:34

그래서 저희가 한 일은, 보상 모델을 개발했는데, 특히 복잡하고 장기적인 관점을 가진11:37

지평선 문제를 다루는 데 적합하다고 생각합니다.11:39

조작 작업들입니다. 이 모델들은 로봇 비디오를 보고11:45

작업 해결을 향한 진행 상황을 정확하게 평가할 수 있습니다, 그렇죠?11:49

자, 영상들을 다시 한번 보여드리겠습니다. 여기는 동일한 모델이, 음, 할 수 있는 것을 보여주는 겁니다.11:53

로봇이 이 복잡하고 장기적인 과제를 수행하는 동안 얼마나 잘 하고 있는지 점수를 매길 수 있습니다.11:58

음, 작업을 시작해서 끝까지 진행하는 것을 말이죠.12:03

로봇이 작업을 완료할 수 있다는 것은 제로에서 원으로 넘어갈 수 있다는 뜻이고, 자세히 보면요.12:07

이 비디오들을 보면, 로봇이 실제로 실수를 할 때마다 보상 모델에서 약간의 하락이 있다는 것도 알 수 있습니다.12:12

그럴 때가 있습니다.12:16

실제로 이 점이 이러한 모델을 매우 강력하게 만드는 방법에 대한 중요한 통찰력을 제공합니다.12:21

자, 여기서 로봇의 자율적인 작동 중에 이런 모델을 실행할 때 어떤 일이 발생하는지 살펴보겠습니다.12:26

로봇이 잘 작동하고 냅킨을 접고 있을 때, 진행 상황 추정치가 대체로 증가하는 모습을 보입니다, 그렇죠?12:32

그것은 계속해서 올라가기 때문이죠.12:35

로봇이 실수를 하고 있지는 않아요. 하지만 정말 흥미로운 점은 제가 조금 빨리 넘어가겠습니다. 모델이 실수를 하기 시작하면, 여기 보세요, 이것은요12:40

앞으로 조금만 가보죠. 모델이 실수를 하기 시작할 때마다, 자, 여기 있습니다. 이건요12:45

아홉 번째 냅킨 접기입니다. 모델이 실수를 할 때 이런 식으로 나타나는 것을 볼 수 있습니다.12:50

모델이 실수를 하면 진행률 추정이 마치 이렇게, 음, 로봇이 문제를 일으키는 것을 나타내는 비단조적인 징후를 보이게 됩니다.12:54

그리고 이것은 매우 중요합니다. 왜냐하면 모델이 어느 정도 수준, 대략 90% 정도의 정확도를 보일 때, 사람이 직접 감독하는 것은 매우 비효율적이기 때문입니다.13:01

모델이 충분히 잘 작동하게 되면, 사람이 일일이 확인하는 것이 효율성이 떨어집니다.13:03

로봇이 실패를 감지하고 스스로 복구하도록 할 수 있습니다. 하지만 이 보상 모델을 갖게 되면,13:10

제가 생각하기에 확장 가능한 감독(supervision)을 실제로 수행할 수 있습니다.13:16

그래서 로봇이 알아서 전화하도록 할 수 있습니다.13:19

렌디의 보상 모델이 백그라운드에서 작동하고 있어서, 모델이 실수를 하면 연구원이나 운영자가 바로 알 수 있습니다.13:22

모델이 어려움을 겪는 영상 사례가 어떤 것인지 즉시 알 수 있고, 매우 구체적인 데이터 수집과 오류13:29

수정 데이터를 모델에 적용하여 모델을 다시 미세 조정할 수 있습니다.13:36

그래서 전체적인 파이프라인은 인간의 개입을 포함하는 능동 학습 프로세스와 같이, 보상 모델을 활용하여 모델이 어떤 실수를 하는지 파악하고13:40

모델이 취약한 유형의 실수를 잡아내고 그에 맞춰 데이터를 수집할 수 있습니다.13:46

모델을 더 좋게 만들고 반복하는 타겟팅된 데이터 수집입니다.13:51

그리고 저희가 발견한 것은 이 과정을 몇 번 반복하면 시작하게 된다는 것입니다.13:54

매우 강력하고 모든 종류의 오류에서 회복할 수 있는 모델을 갖게 되어, 마침내14:00

상용 로봇에 한 발짝 더 다가서게 되었네요. 자, 여기 몇 가지 예시를 보여드리겠습니다.14:05

정리하자면, 24시간 시험 평가 동안의 주요 내용이라고 할 수 있겠네요.14:13

방금 보신 것처럼 로봇이 실수로 여러 장의 냅킨을 집어 들었고, 모델은...14:16

냅킨을 분리할 수 있고, 음, 여기서는 그런 작업을 하고 있는 것 같습니다.14:21

그리고 계속해서 발전해 나갈 수 있습니다.14:26

저희가 매우 흥미롭게 발견한 점은, 냅킨 접기가 변형 가능한 물체 조작이라는 것입니다.14:30

그러니까 냅킨이 가질 수 있는 상태나 구성이 거의 무한대에 달할 수 있습니다.14:36

따라서 모든 오류 사례에 대한 데이터를 완벽하게 수집하는 것은 불가능합니다.14:41

하지만 액티브 러닝을 여러 번 반복해서 진행한 후에,14:46

모델이 스스로 실수를 극복하는 새로운 방법을 학습하여 계속해서 발전하는 모습을 확인할 수 있었습니다.14:48

그 점이 99.4%의 높은 성공률을 달성하는 데 기여했습니다.14:55

그래서, 제가 이번 시험에서 가장 인상 깊었던 부분을 말씀드릴게요.15:02

보통 로봇 영상들을 보면 성공적인 사례만 보여주는 경우가 많습니다.15:06

하지만 여기서는 모델이 실수로 전체 식탁보 더미를 끌어당겼을 때조차도15:11

이렇게 오류 복구 능력을 보여줄 수 있다는 점을 강조하고 싶었습니다.15:15

모델을 개발할 때 저희에게도 매우 놀라운 일이었습니다. 그리고 이것이 모델이 계속해서 실행될 수 있게 된 데 기여했습니다, 그렇죠?15:19

여기서 보시면, 굉장한 실수를 저질렀지만, 정말 인상적인 방식으로 여러 가지를 당겨낼 수 있습니다.15:25

알아보시는 것처럼, 실수를 만회하고 계속 진행하는 방식으로 동작하네요.15:33

네, 그러니깐, 이런 기술을 개발한 후에 저희는 실제로 많은 곳에 모델을 배포하는 데 성공했습니다.15:39

미국 내 많은 식당들입니다.15:47

자, 이것은 저희 로봇이 손님들을 위해 식당의 뒷 사무실에서 냅킨을 접는 실제 적용 사례입니다.15:48

냅킨 접기 외에도 레시피가 상당히 일반화되어 있어서, 이제 저희는15:56

다양한 상업적인 작업들을 수행하는 모델들도 가지고 있습니다.16:01

자, 여기는 새크라멘토의 실제 세탁소에 있습니다. 이번에는 고객을 위해 수건 접기를 하도록 모델을 미세 조정했습니다.16:03

고객에게 수건을 접어 드리고 있습니다.16:10

보시는 것처럼, 음, 식당이 있거나 세탁소 직원이 이곳에 와서16:13

계속해서 빈을 채우고 있는데, 로봇은 고객을 위해 수건을 계속해서 접고 있습니다.16:18

자, 이제 복잡한 작업을 마스터할 수 있는 레시피가 있다는 것에 대해 이야기해 보겠습니다. 하지만 여기서 주의해야 할 점은 모든 영상에서...16:24

지금부터는 매우 복잡한 작업들을 완수할 수 있는 비법에 대해 말씀드리겠습니다. 다만, 이 모든 영상에서...16:27

지금까지 보여드린 것처럼, 로봇이 배치된 정확한 고객 장소나 위치에서 데이터를 수집하기도 했습니다.16:34

하지만 로봇을 어떤 작업이나 고객 장소로든 확장한다고 생각해보시면 훨씬 더 좋거나 효율적일 겁니다.16:41

모델이 이전에 보지 못했던 환경에도 쉽게 일반화할 수 있다면 가장 이상적입니다.16:48

그래서, 작년 말쯤에 저희가 데이터 레시피를 찾아낸 작업들을 진행했습니다.16:53

로봇이 새로운 환경에 추가 데이터 없이도 배치될 수 있도록 다양한 작업을 모아 유지하면서 성능을 유지할 수 있도록 했습니다.17:00

그래서, 이것은 저희가 코랄 2025에서 시연했던 데모입니다.17:07

코랄은 로봇 학습 분야에서 가장 권위 있는 학술 대회이며, 작년에 한국에서 개최되었습니다.17:12

로봇을 미국에서 한국으로 가져오는 것 자체가 제가 감당할 수 있는 도전 과제였습니다.17:18

오프라인에 대해서 말씀드릴 수 있는데, 저희가 발견한 레시피 덕분에 로봇을 그냥 저희 전시 부스에 가져다 놓고17:23

그냥 놓았더니 로봇이 스스로 할 수 있더라고요.17:28

다양한 티셔츠를 계속해서 접기 시작하는데, 로봇이 컨퍼런스 참석자들을 향하고 있는 모습이 보입니다.17:33

사람들이 일부러 로봇을 방해하거나 티셔츠를 사용하려는 시도가 정말 많았습니다.17:40

로봇 카메라를 가리거나, 아시다시피 학회에서 볼 수 있는 다양한 장난스러운 행동들을 하려고 했습니다.17:45

하지만 모델은 무려 사흘 동안 티셔츠를 계속해서 접을 수 있었습니다.17:49

단순히 회의에서 문제를 해결하는 능력을 보여주기 위해 직접 시연했습니다.17:55

이전에 본 적 없는 환경에서 테스트했는데, 불을 질러서 실제와 훨씬 더 가깝게 만들었습니다.18:00

로봇 회사가 갖추고 싶어 하는 이상적인, 그러니까 시장 출시 전략 같은 거죠.18:04

그냥 로봇을 현장에 가져다 놓으면 바로 작동하기 시작하는 그런 방식이죠.18:09

최근에는 다양한 업무에도 참여하고 있습니다. 레드불과 파트너십을 맺어서, 레드불 행사에서 레드불 캔을 따는 일도 하고 있습니다.18:12

레드불 행사에서 레드불 음료를 개봉하는 모습을 보여주는 영상이 있습니다. (혹시) 제대로 재생되지 않을 수도 있지만, 대략적인 내용은 이해가 되실 겁니다.18:19

그래서 저희 로봇의 영상이 있는데, 음, 이 영상은 제대로 재생되지 않을 것 같아요. 하지만 대략적인 내용은 아시겠죠.18:24

하지만 요점이 전달되었기를 바랍니다.18:31

저희는 이 로봇을 레드불 이벤트에 가져갔고, 레드불 음료를 열 수 있습니다. 컨퍼런스 참석자들에게 계속해서, 18:34

무사히 반복해서 열어줄 수 있습니다. 비록 이...18:40

특정 환경에 배치되었는데, 음악 축제라서 배경 조명이 항상 변하거든요. 하지만 모델은 계속해서 잘 작동해요. 네, 음...18:44

예상치 못한 상황에서도요.18:49

비디오가 재생되지 않아서, 요약하자면 다이나의 목표는 다음과 같습니다. 범용 모델과 로봇을18:54

다양한 작업에 능숙할 수 있도록 만드는 것입니다.19:00

다양한 작업들을 수행하는 것뿐만 아니라, 집중력을 발휘하여 높은 성능을 달성할 수 있도록 하는 것이 중요합니다.19:05

최근 저희의 발전 상황을 상업적인 작업에 대해 보여드린 적도 있습니다.19:10

복잡한 작업들을 익히고, 그 기술을 로봇이 이전에 경험해 보지 못한 환경에도 적용할 수 있도록 하고 있습니다. 저희는 시리즈 A 단계의 회사이며 활발하게19:15

성장하고 있습니다.19:18

성장하고 채용도 진행하고 있습니다. 저희와 협력하여 배포나 다른 부분에 관심이 있으시다면 언제든지 연락 주시고 말씀 나눠 주세요.19:24

발표 후에 저에게 편하게 연락 주시면 됩니다.19:27

이야기 듣게 해 주셔서 감사합니다, 정말 멋졌습니다. 제이슨 씨, 진심으로 감사드립니다. 혹시 다이나 로보틱스를 실제로 보신 분 계신가요?19:31

아직 못 보셨다면 꼭 한번 확인해 보세요. 네, 봤습니다. 매우 인상적이네요.19:37

성능 관련해서요, 혹시 질문 있으신 분 계신가요 아니면 궁금한 점이 있으신가요? 좋아요. 감사합니다.19:42

발표 공유해 주셔서 감사합니다. 혹시 이미 비슷한 종류의 일을 하고 계신지 여쭤봐도 될까요?19:52

로봇과 함께 개발자 키트나 SDK, 프레임워크 등을 제공하는 것처럼요?19:58

상업적 파트너를 위해서요? 네, 개발자 키트는 아직 작업하고 있지 않지만, 아시죠.20:03

현재 시점에서는 저희가 자체 하드웨어 스택을 구축하고 있어서, 어쩌면 미래에 로드맵에 포함될 수도 있지만, 지금은 아니에요.20:11

지금 당장은 아닙니다.20:19

혹시 교육 분야에도 관심을 가지셨는지 궁금합니다. 예를 들어, 초등학생들에게 수학을 가르치는 것과 같은 용도로요.20:26

그런 비슷한 사용 사례를 시도하신 적이 있으신가요?20:34

네, 교육 분야 활용 사례는 아직 검토해 보지 않았죠. 하지만 미래에는,20:36

아시겠지만, 저희의 풀스택 로봇 공학 파이프라인이 성숙하고, 자체 하드웨어를 갖추게 되면요.20:41

데이터 수집 도구 키트 같은 것들은 가능할 거라고 생각하고, 굉장히 흥미로울 것 같아요.20:46

교육 분야 활용 사례에 도전해 보는 것도 좋을 것 같습니다. 로봇 기술은 앞으로 더욱 발전할 테니까요.20:51

앞으로 미래에는 아이들과 젊은층을 이 분야에 참여시키고, 실제로 모델을 학습시켜 과제를 수행하는 방법을 배우도록 하는 것이 정말로, 정말로 흥미로울 것 같습니다. 감사합니다.20:57

아이들이 이 분야에 관심을 갖고 학습하도록 돕는 것은 매우 의미있는 일이라고 생각합니다. 감사합니다.21:01

발표 정말 좋았는데요, 질문이 있습니다. 혹시 이 기술을 소비자에게 직접 제공할 계획이 있으신가요? 예를 들어 잔디 깎기나 세탁물 개기와 같은 사용 사례를 봤는데요,21:08

아까 말씀하신 것처럼 소비자에게 직접 판매하는 방향으로 구상하고 계시는지 궁금합니다.21:14

많은 분들이 빨래 개기를 싫어하시겠지만, 저는 정말 좋은 활용 사례라고 생각합니다. 혹시 그거에 대해 고려하고 계시는지 궁금합니다. 물론 비용 같은 여러 측면도 있겠지만, 어떤 계획을 가지고 계신가요?21:21

어떤 생각을 하고 계신지 여쭤봐도 될까요?21:26

이 기술에 대한 장기적인 계획이 있으신가요?21:31

네, 저희의 장기적인 계획은 로봇 모델과 하드웨어를 함께 개발하는 것입니다.21:33

누구나 어디든 배포할 수 있는 플랫폼을 만드는 것이고요. 소비자에게 직접 판매하는 것도 포함될 수 있습니다.21:38

현재 저희 모델은 다양한 종류의 의류를 접을 수 있습니다.21:44

하지만 시장 진출 전략 측면에서 볼 때, 현재는 기업용 사례에 집중하고 있습니다.21:49

배포 채널이 좀 더 쉽게 협력할 수 있다고 생각하기 때문입니다.21:54

기업 고객님들께서는 바로 배포하고, 고객님들의 피드백을 반영하여 개선해 나갈 수 있다는 장점이 있습니다.22:00

소비자 제품의 경우에는 훨씬 더 많은 부분에서 고려해야 할 사항들이 있을 거라고 생각합니다.22:04

굉장히 완성도가 높아야 하고, 실수를 용납하지 않으며, 개인 정보 보호 문제도 많습니다.22:10

현재는 다루지 않으려고 하는 안전 관련 우려 사항들도 있습니다.22:14

배포를 막는 순간적인 문제는, 저희 생각에는 인공지능 로봇의 병목 현상은22:19

인공지능과 하드웨어가 매우 효과적으로 함께 작동하도록 하는 것이라고 생각합니다. 그리고 상업 환경에서는...22:26

이 단계에서 이 환경은 회사와 전체 분야 모두에게 이상적인 테스트 장을 제공합니다.22:31

감사합니다, 제이슨 씨.22:36

제 이름은 아흐메드이고, 음성 AI 분야에서 일하고 있습니다. 최소한 소비자 로봇의 경우, 사람들이 로봇에게 음성 명령을 내릴 거라고 생각합니다.22:40

사람들이 로봇에게 음성 명령을 내리는 것을 원할 것이라고 믿는 소비자 로봇에 대해서는 특히 그렇습니다.22:48

혹시 기존의 의도 기반 음성 처리 시스템과 로봇용 VLA 모델들을 어떻게 통합하는지에 대해 말씀해 주실 수 있나요?22:54

어떤 종류의 모델들과 기존의 의도 기반 음성 스택을 연동하는 방법에 대해 이야기해 주실 수 있을까요?22:59

네, 아주 좋은 질문입니다. 로봇과 인간의 상호작용은 정말 중요하다고 생각합니다.23:06

궁극적으로는 가르칠 수 있는 모델을 개발하고 싶습니다.23:12

사람들이 말하면 정말 좋을 것 같아요.23:15

로봇이 작업을 수행하도록 하는 거죠. 제가 생각하는 방식은, 음… 저는 음성이나…23:18

음성 배경인데, 제가 생각할 수 있는 건 아주 성숙한 음성-텍스트 변환 모델이 있다는 것이죠,23:22

그래서 그걸 이용해서 로봇에 탑재된 시스템에서 인간의 의도나 말을 텍스트로 번역할 수 있습니다.23:28

매우 빠르게 그리고, 아시다시피, 그 부분이 저희의 추론 모델과 세계 모델이 작동하는 곳입니다.23:34

두 모델 모두 텍스트 명령을 해석할 수 있기 때문에, 모델이 번역하도록 허용합니다.23:40

명령어를 행동으로 옮기는 것은 좋지만, 전체적인 시스템에서 병목 현상은 아직 로봇 기반 모델에 있습니다. 현재 모델들은 저희 모델들과23:46

아직은 로봇 기반 모델의 성능이 부족합니다.23:51

다른 사람들의 모델은 아직 임의의 명령을 실행할 준비가 되어 있지 않기 때문에,23:56

아직 로봇의 저수준 조작에 있어서 격차가 있는 것 같습니다.24:00

거기까지는 아직이지만, 결국 우리가 목표하는 바는 모델을 갖는 것입니다.24:03

누구나 조종하고 가르칠 수 있는 모델이죠. 네, 알겠습니다. 감사합니다. 어떻게 하실까요?24:07

일반적인 기반 모델과, 예를 들어 세탁물 개접기와 같은 특정 작업에 특화된 모델 간의 지능 분배에 대해 어떻게 생각하시나요?24:15

어떤 종류의 중간 단계가 필요하다고 생각하시는지요?24:20

특정 배포 환경에서 필요로 하는 현장 특화 교육이 중요합니다.24:27

네, 둘 다 매우 중요한 것 같습니다. 바로 그 종류의...24:32

가지고 있는 레시피는 사전 학습, 사후 학습, 그리고 일종의 능동 학습이 포함되어 있습니다, 맞죠?24:38

사람을 생각해 보시면, 아시다시피,24:44

네, 아시다시피 기본적인 의미론적이고 물리적인 이해 수준이 있어서요,24:48

어떤 물리적인 작업에도 아주 빠르게 적응할 수 있게 해줍니다. 그리고 제가 생각하기에 가장 좋은 방법은 이것을 구축하는 것인데...24:52

현재 상용 로봇들이 그렇게 함으로써 가능해지고 있습니다.24:57

일반적인 모델 학습을 많이 할수록 물리 세계에 대한 일반적인 이해가 생기는데, 이것은 매우 유용합니다.25:01

그리고 저희가 확인해 본 바로는, 이 부분은 발표에서 다루지 못했던 내용인데, 모델이 다양한 오류를 복구하는 과정에서25:07

많은 부분이 그러한 종류의 에러로부터 회복하는 데에도 활용되었습니다.25:12

다른 작업들을 수행하면서 얻게 되는 다양한 오류 복구 행동을 추론하는 데서 비롯되는 것이죠?25:16

모델이 수천 가지의 작업을 경험했기 때문에, 회복할 수 있는 데이터가 어느 정도 확보된 것 같습니다.25:22

다양한 종류의 실수를 복구하면서, 필요할 때마다 즉시 실행할 수 있게 됩니다.25:27

처음부터 모델을 특정 작업에만 특화시키면,25:33

그러면 모델이 실제로는 물리적인 지식을 많이 놓치게 되어서, 하나의 작업에만 학습하는 것보다 훨씬 더 견고하게 만들 수 있는 능력을 잃게 됩니다.25:38

그리고 저희가 꾸준히 확인해 온 내용입니다. 그래서, 혹시 발표 초반부에서 말씀드렸던 것처럼요.25:44

일반적인 사전 학습 기반 모델을 갖는 것의 중요성을 강조하기도 했습니다. 그리고 나서 추가 학습과 능동 학습을 진행하는 것이죠.25:48

단 하나의 작업에만 집중하는 것이 아니라, 실제 상용화 수준의 사용성을 확보하기 위해서입니다.25:54

하지만 동일한 레시피를 여러 작업에 반복 적용할 수도 있습니다.25:58

네, 좋습니다. 제이슨 씨, 감사합니다. 정말 감사드립니다. 세션은 이것으로 마무리됩니다.26:03

혹시 더 궁금한 점이 있으시면 세션 후에 제이슨에게 질문하셔도 됩니다.26:08

네, 이것으로 오늘 아침 세션을 마무리하겠습니다. 오후에는 유니트리, 스카이딜, 수크스, 그리고 구글 DMI가 진행될 예정입니다.26:12

그래서 저희가 다시 만나뵙고, SQL AI도 함께 하겠습니다. 오후에 다시 만나요.26:19

감사합니다, 여러분.26:22

AI Summary

다이나 로보틱스는 범용 로봇 모델 개발을 목표로 연구를 진행하고 있습니다. 기존의 특화된 모델은 확장성이 낮고 실제 환경 적용에 어려움이 있었기에, '디노-원(Dino-1)'과 같은 일반적인 로봇 기반 모델을 통해 다양한 작업을 빠르고 안정적으로 처리할 수 있도록 하는 데 집중하고 있습니다. 특히 보상 모델을 활용하여 복잡한 작업에서도 견고성을 높이고, 냅킨 접기 과제와 같이 실제 상업적 환경에서 요구되는 엄격한 기준을 충족하는 것을 목표로 합니다. 현재 시리즈 A 단계에 있으며, 소비자 시장 진출 및 교육 분야 활용 가능성도 검토 중이며, 음성 인터페이스 통합과 일반 모델-특정 모델 지능 분배 등 다양한 기술 개발을 통해 로봇 공학 분야의 혁신을 이끌어갈 것으로 기대됩니다.

Key Highlights

  • •다이나 로보틱스는 범용 로봇 모델 개발을 목표로 합니다.
  • •'디노-원(Dino-1)'과 보상 모델을 활용하여 작업 성공률 및 견고성을 높입니다.
  • •냅킨 접기 과제를 통해 실제 상업적 환경에서의 적용 가능성을 검증합니다.
  • •소비자 시장 진출, 교육 분야 활용, 음성 인터페이스 통합 등 다양한 미래 계획을 가지고 있습니다.
  • •사전 학습, 사후 학습, 능동 학습 등의 레시피를 활용하여 상용화 수준의 사용성을 확보하는 데 집중합니다.

Related Videos