Home

읽기 설정

네, 시작해 볼까요. 아민입니다. 저는 Perceptron의 공동 창업자이자 CEO입니다.00:13

저희가 하는 일에 대해 조금 말씀드릴 예정이지만, 오늘 주로 이야기하고 싶은 것은 이것입니다.00:20

저희의 연구 방향성을 말씀드리면, VLM, VLA, 월드 모델과 같은 구분 없이00:25

저희가 '엠바디드 파운데이션 모델'이라고 부르는 것으로 넘어가고 싶습니다.00:33

그래서 퍼셉트론에서 저희가 구체적으로 하는 일은, 저희의 가장 중요한 목표라고 할 수 있는 것은, 물리적인 AI 기반을 구축할 수 있도록 하는 것입니다.00:42

그것이 저희에게 실시간으로 물리 세계를 인식하고 이해하며 상호 작용할 수 있는 능력을 제공합니다.00:50

그래서 저희의 궁극적인 목표는 현실 세계와 디지털 세계를 연결하는 것입니다. 기본적으로 말씀드리면,00:55

저희의 목표는 어떤 기기나 장비, 로봇, 카메라가 있는 곳이라면 어디든 적용할 수 있도록 하는 것입니다.01:02

센서가 본질적으로 지능을 제공하고 있습니다.01:09

특히 우리가 인지하고 추론할 수 있는 이러한 패러다임을 이야기할 때요.01:15

행동할 수 있는 능력이라는 것은, 이것을 전통적인 다중 모드 모델링의 일종의 통합으로 보고 있습니다.01:19

저는 FAIR에서 근무했는데, 그곳에서 6년 동안 목표는 정말로 그것을 파악하려고 노력하는 것이었습니다.01:26

다중 모형에 대한 레시피를 어떻게 확장할 것인가에 대한 내용입니다. 저희가 처음으로 작업하기 시작한 것 중 하나는,01:32

저희는 이 분야에서 많은 논문을 발표했는데, 초기 퓨전과 관련된 연구였습니다. 즉, 가능한 한 빨리 모든 모달리티를 통합하려는 개념이죠.01:38

그리고 실제 복잡한 부분은 실제로 어떤 방식으로 해야 하는지 파악하는 것입니다.01:44

입력과 출력 모두에서 다양한 모달리티를 적절하게 표현하는 방법을 찾는 것이죠.01:48

모든 것을 전체적으로 표현할 수 있기를 원합니다.01:54

그래서 다중 모드 모델이라고 말할 때, 아마도 VLM(비전 언어 모델)을 떠올리실 겁니다.01:57

그래서, 이미지, 비디오, 그리고 텍스트를 입력받아 텍스트를 출력할 수 있는 능력이라고 할 수 있습니다.02:02

사실입니다. 그리고 이것의 변형이 많이 있습니다. ER 모델이나 임베디드 모델과 같은 것들이 있죠.02:08

추론 모델들은, 아마 지각적 위치를 출력하거나 공간적인 이해나 추론을 조금 더 잘 할 수 있는 능력을 가지고 있습니다.02:13

그리고 VLA라는 것들이 있는데, 이것들은 텍스트 외에 행동까지 출력 영역을 확장하는 방식입니다.02:20

그리고 이러한 모델들은 전통적으로, 물론 현재까지도 표준 VLM 기반 구조에 의존하여 구축되고 있습니다만,02:25

VLM에서 벗어나 역할 모델과 같은 다른 방식으로 전환하려는 시도도 있었습니다.02:31

모델이나 월드 액션 모델도 있지만, 아직은 큰 성과를 거두지 못했습니다.02:37

그리고 좀 더 흥미롭고 복잡한 다중 모달 모델의 변형들을 살펴보게 됩니다.02:42

세계 모델처럼, 기본적으로 입력으로부터 영상을 출력하는 방식이 있습니다. 그리고02:47

입력은 이미지나 비디오일 수도 있고, 솔직히 말씀드리면 이미지, 비디오, 그리고 행동 데이터일 수도 있습니다.02:51

마지막으로 말씀드릴 부분은 최근에 저희가 '시맨틱 월드 모델(Semantic World Models)'이라고 부르는 내용인데,02:56

아무것도 출력하는 것은 아니지만, 미래에 유용할 만한 어떤 종류의 표현 방식을 학습하게 됩니다.03:00

저희가 일종의 구체화된 기반 모델이라고 보는 것은, 사실 양쪽 모두를 가능하게 하는 프레임워크입니다.03:07

표준적인 인지 능력과 구체화된 추론을 수행하고, 궁극적으로 제어라는 목표를 달성할 수 있도록 해줍니다.03:13

모든 것을 하나의 모델 안에서 처리하는 것이 중요합니다. 입력 데이터의 다양한 감각 양식에 걸쳐 추론할 수 있어야 합니다.03:18

그리고 제가 말씀드린 대부분의 기능을 출력에서도 수행할 수 있도록, 모든 것을 단일하고 통합된 모델 안에 구현해야 합니다.03:24

그래서 아주 빠르게 두 가지 어려움에 대해 말씀드리겠습니다. 이들은 우리가 직면한 근본적인 연구 과제들입니다.03:31

저희 회사에서 어떻게 접근했는지, 그리고 다른 분들이 여기에서 무엇을 하고 있는지에 대해서도 말씀드리겠습니다.03:37

가장 먼저 고려해야 할 점은 영상과 같이 무언가를 모델링하려고 할 때, 예를 들어 한 시간 분량의 영상을 다룬다고 생각해 봅시다.03:43

사용하는 표현 방식에 따라 시각적 토큰이 1백만 개 정도 입력될 수도 있습니다.03:50

사실은 실제로 효과적으로 사용할 수 있는 정답 데이터가 존재하지 않습니다.03:54

그러다 보니 사람들이 당연히 해왔듯이 여러 가지를 시도해 볼 수 있습니다.04:00

예를 들어, 받아쓰기를 추출하거나, 비디오에서 받아쓰기를 예측하거나, 아니면 인위적으로04:03

프레임을 레이블을 달거나 질문을 던지는 방식으로 해볼 수도 있습니다. 그런데 이렇게 하는 것은 굉장히 규모가 큰 일이라는 것이 밝혀졌습니다.04:08

정말 엄청난 낭비죠. 모델에 무엇이 들어가는지 생각해보면, 백만 토큰이 들어가고,04:13

전체 데이터의 0.2% 정도에 대해서 손실을 계산하고 있는 셈이니까요.04:16

들어가는 토큰들이죠. 그래서 이것이 매우 근본적으로 문제가 되고, 사실은04:22

어떤 식으로든 이 문제를 해결하려고 하면, 결국 잘못된 것을 주입하는 것과 같습니다.04:27

학습 신호입니다. 신호가 너무 희박하거나, 너무 인공적이거나, 너무 무분별한 경우죠.04:30

그래서 단순히 인공적인 풍부화 이상의 접근 방식은 음... 예측해 봅시다.04:36

단일 픽셀 정도예요. 물론, 굉장히 밀집된 신호이긴 하지만, 실제로는 매우 형편없게04:41

주의를 할당하고 있어요. 배경 픽셀과 같은 중요도를 부여해서 처리하는 거죠.04:45

손잡이나 끝부분, 접촉점, 특정 실패 지점 또는 물리적인 현상과 똑같이 대우하고 계시는 거거든요.04:51

그래서 저희 Perceptron에서는, 이것이 저희 핵심 기술 중 하나인데, 무엇을 생각해야 할까요?04:56

자연스러운 인지 목표는 어떤 모습일까요?05:02

구체적으로 말씀드리면, 미래에 중요할 것으로 생각되는 인지를 어떻게 매우 자동화된 방식으로 예측할 수 있을까요?05:05

예를 들어 설명하자면, 로봇 팔이 있을 때, 그 끝부분, 즉 집게의 끝이 미래에 예측할 수 있는 매우 유용한 정보가 될 수 있습니다.05:11

미래에 예측해 볼 만한 아주 유용한 정보를 제공합니다.05:16

그리고 많은 분들이 이와 같은 작업을 시작하고 있습니다. 예를 들어 AI2의 MOMO 앱 개발팀에서 이렇게 했습니다.05:20

다른 VLA들도 이와 같은 작업을 수행했습니다. 하지만 여전히 하드 코딩된 인지 정보입니다.05:25

그래서 질문은 모델이 의미적으로 이 독특한 목표를 스스로 학습할 수 있는 방법을 찾을 수 있느냐는 것입니다.05:28

사실 저희는 그 방법을 찾아냈습니다.05:34

여기서는 어떻게 하는지 자세히 말씀드리지는 않겠지만, 희소성 문제를 해결하는 접근 방식에 대한 힌트를 조금 드리려고 합니다.05:38

저희가 많은 시간을 집중적으로 다루어 온 두 번째 핵심 문제는 맥락입니다.05:46

부풀어 오르는 현상이죠. 항상 카메라를 켜두거나, 기다리지 않고 움직이는 로봇의 경우,05:50

멈추지 않고 계속해서 작동하기 때문에 매우 긴 시간 동안 추론을 해야 합니다.05:55

토큰으로 이루어져 있고, 텍스트는 비교적 밀도가 높지만 비디오는 비교적 희소합니다.06:01

그래서 질문은, 이러한 문제를 해결할 수 있도록 할 건축적인 혁신이 존재하는가입니다.06:05

이 문제를 근본적으로 해결하는 것이 중요하고, 인위적인 방식으로 균형을 맞추려고 노력하기보다는 자연스럽게 처리해야 합니다.06:11

불균형을 어떻게 해결할 수 있을지 파악하는 것보다 더 중요한 점이 있습니다.06:17

그래서 할 수 있는 몇 가지 방법이 있습니다. 한 가지 핵심적인 원칙은, 완전히 다른 방식으로 여러 모달리티를 학습하기 시작해야 한다는 것입니다.06:20

완전히 다르게 학습해야 합니다.06:24

다르답니다. 그래서 텍스트 토큰을 이미지 토큰이나 오디오, 비디오 토큰과 똑같이 취급할 수 없어요.06:29

시작해 볼 수 있는 일 중 하나는 공간 압축 또는 토큰 압축에 집중하는 것을 고려해보는 거랍니다.06:34

그리고 사람들은 정말 어리석은 행동을 하곤 하고, 저희도 처음에는 어리석은 방법으로 시작했었는데, 그게 효과가 있었어요.06:39

영상이나 이미지에 대해 패치 단위로 표현을 평균내는 것을 고려해 볼 수 있습니다.06:44

흥미로운 압축률을 얻기 시작할 수도 있는데, 최대 10배까지 가능합니다.06:50

하지만 아직은 일종의 임시방편적인 방법이고, 잘 활용되지 않았습니다.06:54

이를 실제로 해결할 수 있는 아키텍처적인 방법들을 사용해 볼 수도 있습니다.07:00

그래서 지난 몇 달 동안 저희는 우리가 생각하는 접근 방식을 공개했습니다.07:03

희소성의 다양한 정도를 처리하는 것은 모델 스스로 어떤 토큰을 살펴봐야 하는지 결정하도록 하는 것입니다.07:07

어떤 토큰은 보고 어떤 토큰은 보지 않도록 할 수 있습니다. 그래서 저희는 데이터 희소 혼합 전문가 논문을 발표했는데, 이는 본질적으로...07:13

이렇게 하실 수 있도록 도와줍니다. 모델 내부에 라우터가 있어서 실제로 예측할 수 있게 해줍니다.07:20

어떤 토큰을 입력해야 하고, 어떤 토큰은 건너뛰어야 하는지를 결정하고, 여러 레이어를 거치면서 거의 무료처럼 처리할 수 있습니다.07:26

그리고 모델에게 그냥 학습하도록 내버려 두면, 즉 중요한 구조적 사전 지식을 직접 코딩하지 않으면, 모델이 실제로 학습하게 됩니다.07:34

모델이 실제로 학습합니다. 따라서 저희 모델에서 사용하는 데이터 희소 컴퓨팅을 시각화하면 실제로 확인할 수 있습니다.07:42

모델이 본능적으로 매우 높은 밀도의 정보에 집중하기 시작하는 것을 학습합니다.07:49

정보 또는 작업과 관련된 정보를 말이죠. 그림의 오른쪽 상단에서 조금 볼 수 있습니다.07:54

모델이 그래프에서 집중해야 할 부분을 결정하는데, 실제로 인간인 당신도 그렇게 보게 될 겁니다.07:58

관심을 가질 만한 부분에 확대해서 볼 수 있죠. 왜냐하면 이것이 그림 안에서 흥미로운 부분일 가능성이 높기 때문입니다.08:02

그리고 보니, 08:06

심지어 작업 의존적인 할당도 결국 발생하네요.08:08

그래서 왼쪽 아래를 보시면, 아주 일반적인 질문을 던질 경우, 전체적으로08:14

이미지 전체에 걸쳐 주의 집중 그래프가 나타나는 것을 보실 수 있습니다. 모델이 적절한 컴퓨팅 할당 방식은 아직 모르는 것 같습니다.08:19

동시에, 만약 과일을 모두 분리해 달라고 요청하면, 더 많은 토큰을 할당하는 것을 볼 수 있습니다.08:25

모델이 과일이라고 생각하는 토큰에 집중하게 됩니다. 이것은 저희가 사용하고 발표했으며 다른 사람들도 시작한 아주 멋지고 영리한 방법입니다.08:31

아키텍처에 임베딩 사전 정보를 활용하는 방법이죠. 다양한 모달리티의 희소성 불균형을 처리하기에 유용하지만,08:38

너무 가혹하지 않도록 하는 것이 중요합니다.08:42

모델들이 실제로 원생적으로 학습하고 있는 것이 아니라는 점입니다.08:49

그래서 저희가 이 모든 것을 종합했고, 여러분들께서도 발표를 보셨을 수도 있지만요.08:54

저희는 저희가 최초의 온몸 경험 기반 모델이라고 생각하는 모델을 출시했습니다, 며칠 전에요. 그리고 이 모델은 제미니 3.1 프로와 비교했을 때 최첨단 기술을 사용한 것이라고 할 수 있습니다.08:58

이 모델은 제미니 3.1 Pro에 비해 성능이 뛰어난 수준입니다.09:03

실제로 제미니의 임베디드 추론 능력보다 더 뛰어나고, 비용은 약 15배 정도 저렴합니다.09:10

그리고 저희가 수집한 거의 모든 데이터를 포함하는 이 페타바이트 규모의 데이터 세트로 학습되었습니다.09:15

인터넷 크롤링 데이터부터 저희가 직접 제작한 중간 학습 레시피나 합성 데이터 파이프라인까지 포함됩니다.09:21

텍스트, 이미지, 비디오, 그리고 트래젝토리 데이터를 포함하여 총 1페타바이트의 데이터를 보유하고 있습니다.09:28

매우 일반적일 수 있습니다. 데스크톱 사용 경로 데이터도 될 수 있고요.09:34

비디오 게임 플레이 경로 데이터가 될 수도 있습니다.09:38

그러다 보니 이런 것들을 시작하면 아주 흥미로운 특징들이 나타나는 것을 알게 되었습니다.09:42

그래서 저희가 발견한 가장 큰 특징은, 돌이켜보면 꽤나 당연해 보이는데, 실제로 그렇게 생각하고 할 수 있다는 것입니다.09:46

기존의 컴퓨터 비전 작업들을 에이전트 기반의 작업으로 생각할 수 있습니다.09:53

그래서 이번 경우에는 저희가 탐지 작업을 에이전트 기반의 작업으로 재정의했습니다. 그래서 저희 모델은 코드를 작성할 수 있습니다.09:57

특정 부분을 확대해 달라고 요청하거나, 대비를 조절할 수도 있습니다. 여기에서 실제로 확인할 수 있듯이요.10:03

이것은 매우 어려운 문제입니다. 찾기 힘든 객체나 이미지를 찾는 문제로 이와 관련된 서브레딧도 있을 정도입니다.10:10

저희 모델들은 본질적으로 이것을 아주 잘 수행하지만, 에이전트적인 방식으로 처리합니다.10:17

이것은... 기존의 '이 박스를 찾아라'와 같은 방식과는 다릅니다.10:21

이 모델이 실제로 타일로 덮어야 할 필요가 있고, 대비를 조절해야 한다고 판단하는 것입니다.10:25

상자가 여기 나타나고, 여기서 대비가 증가하며, 새를 찾을 수 있습니다.10:29

그래서 다시 말씀드리지만, 인간에게도 매우 어렵습니다. 인간은 인지적인 작업에 아주 능숙하지만, 이것은 상대적으로10:36

어려운 일입니다. 그리고 이러한 모든 것은 본질적으로 내재된 모델을 가지고 실제로...10:43

다양한 모달리티를 어떻게 봐야 하는지 이해하고, 이어서 이것이 어떤 관련이 있는지 살펴볼까요.10:49

로봇 공학 분야의 일반적인 물리 AI 관점과 어떻게 연결되는지 말씀드리겠습니다. 이 슬라이드는 GDM 팀에서 가져온 것입니다.10:54

그래서 로봇이나 에이전트 시스템에서 저희가 보기 시작한 것 중 하나는 이것입니다.11:00

저희가 '구체화된 추론 모델' 또는 '오케스트레이터'와 '촉각'이라고 부르는 것들의 분리 현상입니다.11:08

정책 모델이라고 할 수 있습니다. 문제를 이렇게 생각할 수 있죠. 예를 들어, 제가 커피를 만들 때, 세 분 정도 걸린다고 가정해 보겠습니다.11:13

제가 가진 전체 VLA가 이 개별 작업을 어떻게 처리해야 하는지 알아내도록 억지로 시도해 볼 수도 있습니다.11:19

혹은 제가 할 수 있는 일은, 오케스트레이터 모델을 활용해서 이 작업들을 하위 작업으로 나누는 것입니다.11:26

그리고 그 위에 촉각 제어 정책이 실행되고 있습니다. 그리고 전체적인...11:31

전체 VLA만 사용하는 것부터 이 에이전트 시스템까지, 그 스펙트럼이라고 할 수 있습니다.11:35

제가 강조하고 싶은 주된 내용은 몸체 기반 추론은 아직 해결되지 않은 매우 흥미롭고 복잡한 문제라는 점입니다.11:39

그 점을 말씀드리면, 저희 모델들은 여전히 몸체 기반 추론 분야에서 선도적인 위치를 유지하고 있습니다.11:46

그리고 그만큼 앞서나가기 때문에, 이전에는 보지 못했던 정말 멋진 현상들을 관찰하기 시작합니다.11:51

여기 아주 복잡한 자율적 또는 비자율적인 로봇 데이터 어노테이션의 구체적인 예시가 있습니다.11:55

여기서 모델이 여러 부분을 살펴보고 뛰어다니는 것을 조금 볼 수 있습니다.12:02

영상 부분을 잘라내고, 자막이 정확한지 확인하고, 스스로 검증하는 과정을 거칩니다.12:06

그리고 저희는 모델 속도가 빠르고, 다른 것들에 비해 훨씬 저렴하기 때문에 모두 이 작업을 할 수 있습니다.12:13

제미니로 이 작업을 시도해 보신다면, 영상 처리 비용이 몇 달러 정도 나올 거예요. 저희에게는 그보다 훨씬 저렴하게 느껴집니다.12:18

이 모든 기능들은 최첨단 몸체 기반 추론 능력을 갖추고 있기 때문에 자연스럽게 나타납니다.12:25

다른 모델에서는 이전까지 보지 못했던 점이 있습니다.12:29

알겠습니다. 저희가 가진 가장 큰 연구 성과를 공유할 예정이고, 더 자세한 내용도 나눌 생각입니다.12:37

앞으로 몇 주 안에 아마 트위터에 공유할 것 같습니다. 하지만 저희가 발견한 한 가지는 바로 몸체 기반 기초 모델을 위한 새로운 스케일링 법칙을 발견했다는 점입니다.12:43

이 모델들은 다시 말씀드리지만, 함께...12:49

컨트롤 기반 학습을 할 수도 있고, 트래젝토리 학습이나 인지적 학습도 가능합니다. 몸의 추론 학습도 할 수 있습니다. 만약 올바른 방법을 찾으신다면,12:54

그렇게 하면 가장 적절한 방식으로 진행할 수 있습니다.13:00

이 모든 것을 함께 섞고 올바른 목표를 사용하면, 실제로 매우 흥미로운13:03

이전에는 보지 못했을지도 모르는 레버들이 나타납니다. 제가 이야기할 구체적인 레버는요.13:08

이것은 일반적인 비디오 사전 훈련 데이터를 원격 조작 데이터와 교환할 수 있는 능력입니다.13:13

원격 조작 데이터는 매우 고가라는 것은 이미 알고 계실 겁니다.13:21

시간당 데이터 당 약 100달러 정도 되는 비용입니다.13:25

100달러면 훨씬 더 많은 비디오 사전 학습 데이터를 수집할 수 있습니다.13:28

그래서 이 그래프가 보여주는 것은 순수한 VLA만 학습시키는 경우, 또는 순수한 정책만 학습시키는 경우,13:33

이러한 범위 내에서 성능 변화가 나타납니다. 따라서 여전히 스케일링 손실이 발생하며, 더 많은 텔레오프 데이터로부터 이점을 얻을 수 있습니다.13:39

그렇지만 말씀드린 것처럼, 이 통합된 에이전트 기반 모델을 실제로 학습시키는 것만큼 큰 효과는 아닙니다.13:45

그래서 그래프의 하단 부분에 해당하는 내용입니다.13:51

그리고 저희가 얻을 수 있는 정말 멋진 요소는, 13:56

비디오 사전 학습 데이터가 10배 더 많다면 텔레오프 데이터를 10분의 1로 줄일 수 있다는 점입니다.14:00

그래서 지금까지는 저희 회사에서 확보할 수 있는 컴퓨팅 자원에 맞춰 진행해 왔습니다.14:06

앞으로도 이러한 에이전트 기반 기초 모델의 한계를 계속해서 확장하게 될 것입니다.14:11

그래서, 곧 오픈 소스로 공개될 가능성이 있는 작은 모델들의 정책을 보여주는 몇 가지 영상이 있습니다.14:22

몇 주 안에 공개될 예정이지만, 이것 모두가 하나의 모델 내에서 원활하게 실행되고 있으며, 몸체 기반 추론 능력을 갖추고 있습니다.14:29

작업을 파악하기 위해서입니다. 실제로 제어 토큰들을 열고 있습니다.14:36

하나씩요. 조금 흔들리는 모습이 보이지만 괜찮습니다.14:40

규모가 커지면 해결될 거라고 기대합니다. 이전에는 순수한 VLA(Vision-Language Agent)로는 정말 어려웠을 아주 복잡한 작업들을 실제로 확인할 수 있습니다.14:43

오른쪽 영상에서 보시면 알 수 있을 겁니다.14:49

이것은 모델이 책 제목을 실제로 읽고, 어떤 종류의 책인지에 대한 지식을 갖도록 요구합니다.14:54

그리고 나서 적절하게 빈 중 하나에 책을 배치해야 합니다.14:58

이것은 실제로 인식과 제어 사이의 다단계 작업인데, 정말로 어렵습니다.15:03

순수한 엔드투엔드 제어 모델처럼 다양한 것을 인지하지 못한다면 더욱 그렇습니다.15:07

이 작업을 수행하기 위해 해결해야 할 인지적인 과제들이 있습니다.15:13

정말 멋지다고 생각합니다. 또한 별도의 추가 작업 없이도 비교적 잘 작동해서, 저희는 이 기능을 빠르게 선보일 수 있게 되어 기대하고 있습니다.15:25

몇 주 안에 몇 분들께 전달될 예정입니다. 7월 중으로요.15:31

네, 질문 시간을 조금 남겨두겠습니다만, 만약에...15:39

관심 있으신 분들은 연결해 드릴게요. 저희 회사에서 하고 있는 멋진 점은요, 실제로15:44

제한된 파트너들을 대상으로 마크 1 모델 가중치를 제공하고 있습니다.15:49

저희는 저희의 더 큰 몸체 기반 모델 가중치를 일부 파트너에게 제공하고 있습니다.15:52

이메일로 연락 주시거나 트위터에 DM으로 보내주셔도 되고, 편하신 방법으로 연락 주세요. 그러면 제가 연결해 드리겠습니다.15:55

질문하실 시간이 조금 남았습니다.16:01

네, 네, 질문은 어떻게 해서 저희가 시간적 요소와 이해도를 이 정도까지 구현할 수 있는지에 대한 것이네요.16:41

좋은 질문이네요. 솔직히 말씀드리면, 아직 완벽하게 해결된 건 아니에요. 실제로 안정적으로 배포할 수 있을 만큼 발전하려면 더 많은 노력이 필요합니다.16:48

핵심적인 부분은 어떻게 맥락 관리를 생각해야 하는지에 달려있습니다.16:55

상대적으로 컨텍스트의 크기가 제한적이죠. 제가 생각하기로는 이 모델들은 백만 개의 컨텍스트를 가지고 있는데, 비교적 고화질 영상에 쉽게 맞춰 넣을 수 있습니다.16:58

그래서 어떤 흥미로운 일들을 할 수 있을지 고민해 봐야 합니다.17:05

제 생각 하나 말씀드리겠습니다. 예전에 이런 방식도 사용했지만, 지금은 넘어선 단계예요.17:12

하지만 키 프레임과 델타 프레임을 어떻게 구분해서 생각해야 할까요?17:15

이 두 가지를 학습시키면서 제 컨텍스트 관리는 어떻게 할 수 있을까요?17:19

그리고 사전 훈련 목표 중에 어떻게 하면 원천적으로 정보를 흡수할 수 있을지 고민하기 시작합니다.17:23

로봇 작업에 유용할 만한 것을 어떻게 생각해야 할까요? 예를 들어, 심지어 제미니 모델조차도17:30

예전에 어려워했던 것들이죠. 새로운 버전은 꽤 괜찮아진 것 같아요. 하지만 개수나 양을 파악하는 것은요.17:37

그러니까 좌우를 구별하는 건 인터넷 규모로 크롤링을 하다 보면 굉장히 어렵습니다. 왜냐하면17:41

인터넷에는 이 객체가 다른 객체의 왼쪽에 있다거나, 아래에 있다는 식으로 레이블링하는 사람이 필연적으로 있는 것은 아니기 때문입니다.17:45

데이터 분포를 초기에 깊이 고민하는 것은 비교적 빠르게 그런 능력을 갖게 해줍니다.17:51

그리고 ER처럼, 이러한 구체적인 몸 현상 기반 추론은 저희의 매우 중요한 목표였고, 그래서 우리가 그렇게 할 수 있었다고 생각합니다.17:56

제미니 ER을 비교적 적은 컴퓨팅 자원으로 어느 정도 능가할 수 있습니다.18:03

네, 저희가 본 가장 멋진 강건성(robustness) 중 하나는 특히 VLA 모델에서 나타났습니다.18:28

예를 들어 중국 모델 중 하나를 가져와서 특정 정책에 맞게 미세 조정하려고 한다면,18:34

테이블 안에서 배경만 조금 바꿔도, 정책이 실패할 수 있습니다.18:39

테이블 배경을 조금만 바꿔도 정책이 실제로 실패할 수 있습니다.18:44

정말 흥미로운 점은 이처럼 합동적인 인지 및 제어 모델링을 수행하면 훨씬 더...18:48

이런 종류의 오류에 더 강건하게 만들거나, 빛이 약간 다른 각도로 비칠 때에도 잘 작동하도록 하는 것이죠.18:52

저희는 주로 배경 변화에 대한 강건성을 확보하는 방식으로 보고 있습니다.18:57

기존 모델들이 반드시 가지고 있는 것은 아니라고 생각합니다. 그래도 과장해서 말씀드리지는 않을게요. 아직은 비교적 어렵습니다.19:02

만약 제가 팔 하나에 손전등을 비춘다면, 아마 작동하지 않을 거예요.19:08

하지만 이러한 것들을 함께 모델링할 수 있다는 점이 상당히 도움이 됩니다.19:13

저희는 또한 온라인 증강 기법도 많이 사용하고 있습니다. 그래서 저희는...19:17

사실은 가짜이고, 제가 잘 모르겠지만, 팔에 있는 카메라 중 하나가 꺼져 있을 수도 있죠?19:21

특정 방향에서 들어오는 햇빛을 가짜로 만들어 넣는 거죠?19:28

그래서 저희는 훈련 과정에서 이러한 작업들을 진행해서요.19:32

하지만 큰 효과는 이 초기 융합 방식을 채택하고 로봇 공학 분야로 확장할 때 얻을 수 있습니다.19:34

아, 지식 베이스 말이죠. 이미지나 비디오에 자막을 달 때 유용하게 쓰일 수 있고, 비교적 잘 활용할 수 있습니다.19:52

저희는 이런 복잡한 자기 중심적인 어노테이션처럼 로봇 파트너들과 협력하고 있습니다.19:58

그러니까 온톨로지에 기반하는 것은 필수가 아니고, 매우 깊이 있는 구조화된20:02

추출을 수행할 수 있다는 것이라고 생각합니다. 저희 모델은 그 점에 있어서 매우 뛰어납니다.20:07

참고로 제가 방금 보여드린 모든 것은 공개 API들이라, 자유롭게 사용해 보실 수 있습니다.20:11

벤치마크 결과도 공개되어 있습니다.20:16

시간이 다 된 것 같아요. 방송을 끊으시는 것 같네요. 밖에 있는 분들과 이야기할 수는 있지만, 감사합니다.20:18

AI Summary

새로운 AI 모델 개발 과정과 특징을 설명하며, 토큰 압축, 데이터 희소성, 에이전트 기반 접근 방식 등을 활용하여 기존 모델 대비 성능 향상 및 비용 절감 효과를 얻고 있습니다. 특히 몸체 기반 기초 모델의 새로운 스케일링 법칙 발견으로 학습 효율성을 높였으며, 원격 조작 데이터와 비디오 사전 훈련 데이터를 교환하며 비용을 절감하고 복잡한 작업 수행 능력을 향상시켰습니다. 앞으로 소규모 모델 정책은 오픈 소스로 공개될 예정이며, 제한된 파트너 대상으로는 모델 가중치를 제공할 계획입니다.

Key Highlights

  • •토큰 압축, 데이터 희소성, 에이전트 기반 접근 방식을 활용하여 AI 모델을 개발하고 있습니다.
  • •몸체 기반 기초 모델의 새로운 스케일링 법칙 발견으로 학습 효율성을 높였습니다.
  • •원격 조작 데이터와 비디오 사전 훈련 데이터를 교환하며 비용을 절감하고 복잡한 작업 수행 능력을 향상시켰습니다.
  • •시간적 요소 이해도 구현 어려움을 맥락 관리 개선(백만 개의 컨텍스트 활용)으로 해결했습니다.
  • •소규모 모델 정책은 오픈 소스로 공개될 예정이며, 제한된 파트너 대상으로는 모델 가중치를 제공할 계획입니다.

Related Videos