Home

읽기 설정

안녕하세요, 여러분. 어서 오세요. 저를 보러 와주신 분들은 정말 감사드립니다. 그냥 여기 계시는 분들도 감사합니다.00:13

와 주셔서 감사합니다. 편하게 쉬고 계시는 분들께도 감사 인사를 드립니다.00:20

여러분들을 즐겁게 해 드리고, 새로운 것을 가르쳐 드리려고 노력해 보겠습니다.00:23

다시 한번 말씀드리지만, 제 이름은 라파엘입니다. 저는 Bright Data에서 일하고 있습니다. 그리고 Bright Data에 8년 이상 몸담고 있습니다.00:29

그리고 브라이트 데이터에서는 데이터를 수집하고 혁신을 위해 노력하고 있습니다.00:34

오늘 저는 에이전트 기반 세계 모델 학습을 위한 비디오 검색에 대해 이야기하고 싶고, 저희는...00:38

무엇을 의미하는지 조금 설명해 드릴게요. 오늘, 무엇이 필요할까요? 보고 이해하고 행동할 수 있는 시스템을 구축하려면요.00:45

이해하고 행동하게 하려면 어떻게 해야 할까요?00:53

제가 말씀드리고 싶은 건, 인공지능이 무엇인지 파악했고, 계속해서 개선하고 있다는 점입니다.00:57

아시겠지만, 그 부분은 어느 정도 해결된 것 같아요. 하지만 이제 어려운 문제는 어떤 데이터를 제공해야 하는지가 되겠습니다.01:02

데이터 없이는 인공지능은 그냥 상자일 뿐이라는 건 누구나 알 거예요, 그렇죠?01:08

잠시 과거로 돌아가 볼까요.01:14

역사적으로 보면요, 그렇죠? 2022년에 구글에서 로봇에게 이미지와 함께 실제 세계의 행동을 가르쳤습니다.01:17

그리고 나서 2023년에는 큰 도약이 있었습니다.01:24

저희는 실제로 인공지능이 여러 로봇을 제어하게 만들었습니다.01:31

2024년에 오픈 소스가 공개되면서 판도를 바꾸게 되었죠. 오픈 소스를 확보하는 순간부터요.01:37

모든 연구실에서 AI에 접근할 수 있게 되었고, 이미 로봇에 AI를 적용하기 시작했죠.01:43

그래서 이제...01:51

이 모델들은 이미 인간형 로봇을 운전하고 있습니다. 물론 대부분은 원격으로 조종되지만, 샌프란시스코에는 운전자 없이 위모(Wimeo)가 운전하는 모습도 볼 수 있죠. 정말 멋지네요.01:52

물론 대부분은 원격 제어되고 있지만, 샌프란시스코에서는 운전자가 없는 위모(Wimeo)가 운전하는 것을 보실 수 있습니다. 얼마나 멋진 일인가요.01:59

처음 차에 탔을 때는 정말 죽는 줄 알았는데, 사실은 굉장히 좋았어요.02:06

그럼 이제 어떻게 운전하는 법을 스스로 배우게 되었는지 설명해주시겠어요? 학습을 통해서요?02:13

블랙박스 카메라 있죠. 모든 차에 블랙박스가 있으니까, 그걸 인공지능에게 제공해서 기계를 어떻게 작동하는지 알아낼 수 있게 할 수 있습니다.02:20

제가 말씀드린 것처럼, 인공지능을 만드는 게 더 어려운 부분이 아니고요. 데이터가 중요한 부분입니다.02:27

이것에 대해 말씀드리고 싶습니다. 채팅 LLM의 경우,02:36

조억 단어 정도가 있습니다.02:43

그리고 텍스트 데이터가 정말 많습니다. 이미지 생성 LLM을 학습시키기 위해, 02:44

수십억 개의 데이터를 확보했습니다.02:51

이미지 데이터베이스가 있고, 라벨링된 이미지도 많아서 그 또한 엄청난 데이터베이스이지만, 로봇공학 분야에는02:52

거의 약...02:59

백만 개의 동영상도 있습니다. 로봇이 무언가를 하는 아주 작고 제한된 데이터 세트죠.02:59

그래서 여기의 아이디어는 많은 회사들이 당연히 이런 일을 한다는 겁니다.03:09

사람들한테 행동을 녹화하도록 돈을 주시는 경우가 많죠?03:17

예를 들어, '저를 어떻게 녹화해 보세요' 라고 하시는 것처럼요.03:20

문 열거나 의자에 앉는 모습을 기록해 달라고 할 수도 있겠죠. 그런데 문제는 누군가에게 특정 행동을 하도록 지시받으면, 그 행동이 자연스럽지 않다는 거예요.03:23

사람들이 시키는 대로 하면, 본래대로 하는 것과는 다른 행동을 하게 되는 경향이 있습니다.03:29

그러다 보니, 제가 지시했듯이, 문을 여는 모습을 기록해 달라고 하면, 03:34

누군가를 위해 그렇게 한다면, 그냥 혼자서 할 때와는 다를 거예요.03:39

집 안으로 들어가는 움직임은 완전히 다르기 때문에, 그 데이터가 괜찮은 걸까요?03:43

제 생각에는 로봇 훈련에 적합하지 않고, 편향된 데이터이며, 그렇지 않습니다.03:48

결과도 똑같이 나오지 않을 테니, 당연히 로봇이 직관적으로 작동하는 것만큼 효과적이지는 않겠죠?03:52

그래서 슬라이드에 몇 가지 예시를 간단하게 넣었습니다. 수동으로 만든 데이터는요...04:00

곁에 있는 데이터와는 조금 다른 것 같아요.04:08

그리고 사실은, 사람들이 카메라 앞에 있으면 행동이 매우 다르게 변한다는 점도 있습니다.04:11

아시다시피, 어떤 분들은 카메라를 싫어하시죠. 그래서 카메라만 켜면 행동이 바뀌시는 경우가 있습니다.04:17

하지만 자연스러운 상황에서는 완전히 다릅니다.04:23

그래서, 브라이트 데이터에서 저희가 해결하려고 하는 문제가 바로 이거예요. 맞죠, 그리고 다시 한번 말씀드리면,04:27

그럼 왜 기존의 데이터 소스들이 충분하지 않은 걸까요? 그렇죠.04:35

시뮬레이션이나 가상 환경은 비용이 저렴하지만, 아시다시피 누구나 비디오 게임을 하고 있죠.04:38

비디오 게임의 물리 엔진은 거의 비슷하지만, 아직 충분히 정확하지는 않네요.04:44

로봇을 이용해서 제어하는 방법을 훈련시키려면, 사람이 로봇을 조종하는 거죠. 가능하지만...04:48

하루에 얼마나 많은 시간을 기록할 수 있나요? 로봇은 하루에 몇 시간이나...04:52

대규모 데이터를 확보하려면 실제로 사람들의 도움이 필요하죠.04:58

하루에 8시간씩 매일 녹화한다 해도, 일 년 동안 얼마나 많은 시간을 얻을 수 있을까요?05:01

확장하기는 어려울 것 같아요.05:06

물론 이미 만들어진 데이터 세트도 있지만, 말씀드린 것처럼 크기가 작습니다.05:09

현재는 대략 백만 개의 영상밖에 없습니다. 그럼 다른 방법은 무엇일까요? 다른 방법은 웹입니다.05:14

유튜브만 생각해 봅시다. 유튜브에는 몇 개의 영상이 있을까요?05:20

정확히는 모르겠지만, 아마 오십억 개 정도 될 것 같아요.05:24

그 영상들 안에 로봇이 따라 할 수 있는 행동은 얼마나 많을까요?05:27

제가 말씀드리고 싶은 건, 한번 생각해 보면요. 사람이 문을 열 때의 시점 영상을 얼마나 많다고 생각하세요?05:34

수백만 시간이나 될 거예요. 아마 놀라실 겁니다. 그러니까...05:42

매일 웹 비디오에서 중력과 움직임이 보이지 않습니까?05:49

원인과 결과도 당연히 있고, 가장 큰 원인과 결과는 사고겠죠.05:54

사람들이 물건을 어떻게 다루는지, 그리고 수십억 시간의 영상 자료입니다.06:00

로봇 학습에 아주 좋은 자료이지만요.06:04

무슨 문제가 있나요? 문제는 소음이 많다는 거에요, 맞죠?06:07

아, 그리고 예를 들어서요. 메타에서 학습시킨 인공지능 모델 중 하나가 있었는데, 약한...06:12

실제 세계 영상 자막으로 백만 시간 분량의 데이터를 사용했는데, 실제 로봇을 제어하는 데는 단 62시간의 로봇 데이터만 필요했습니다.06:18

그것은 실제로 로봇을 제어하기 위해 필요한 실제 로봇 데이터 양이었습니다.06:24

생각해 보면요, 06:29

데이터는 공개적으로 수집되었고, 로봇은 그냥 무작위 데이터로 학습받았죠.06:30

사물들을 인식하고 나서, 62시간의 로봇 작업 시간 만에 이미 움직이기 시작했어요. 비록 시뮬레이션이 필요하지 않았지만,06:37

자율적인 로봇 개발을 빠르게 진행할 수 있었습니다.06:43

영상에서 로봇이 어떻게 움직이는지 보여주지는 않죠. 그래서 아마 '정말 유용할까?'라고 생각하실 수도 있을 거예요.06:53

사람이 컵에 물을 따르는 모습은 로봇에게 얼마나 도움이 될 수 있을까요? 하지만 실제 방법들이 있답니다.06:58

거기서 인공지능이 어떻게 구별하고 실제로 영상 속 행동으로부터 학습할 수 있는지요.07:04

두 프레임을 한 프레임씩 가져와서 인공지능이 그 변화를 측정하는 것을 보세요.07:09

움직임의 차이 같은 거죠? 이미지 에이와 이미지 투가 있고, 그 사이에 작은 움직임 변화가 있는데, 인공지능은 실제로07:14

그것을 감지할 수 있습니다.07:18

그 변화를 측정하는 거예요. 영상을 전체적으로 계속 그렇게 한다면 인공지능은07:23

실제로 각도나 거리 같은 필요한 모든 것을 파악해서 학습할 수 있습니다.07:28

로봇이죠. 센서 데이터는 필수는 아니지만, 당연히 비디오가 필요합니다.07:33

유튜브에서 다운로드한 비디오나 데이터를 추출한 비디오 자체도 괜찮습니다.07:40

반드시 거기까지 완벽하게 만들어주는 것은 아니에요. 추가적인 처리 과정이 필요하지만요.07:46

이미 자료는 있고, 구할 수 있으며, 필요한 건 그걸 처리하는 것뿐이에요. 몇 가지 더 예를 들어볼까요.07:52

예를 들어, 엔비디아가 코스모스 로봇을 학습시킬 때, 영상의 약 96%를 버린다고 합니다.08:00

그게 무슨 뜻이냐고요? 다운로드하는 영상은 시간으로 따지면 백만 시간에 달합니다.08:07

유용한 데이터는 단 4%에 불과하고, 나머지는 전부 버려집니다. 그게 낭비되는 컴퓨팅 자원입니다.08:12

그것은 낭비되는 대역폭이고, 낭비되는 저장 공간이며, 결국 많은 돈이 낭비되는 것입니다.08:18

스테이블 비디오 디퓨전은 다운로드하는 영상의 74%를 버리고 있습니다.08:23

브라이트 데이터에서는 이 문제를 해결하려고 노력하고 있으며, 이를 개선하기 위해 노력하고 있습니다.08:30

앞으로 나아가세요. 저희가 제안하는 방식은 먼저 검색하고, 그 다음에 수집하는 것입니다. 08:36

저희가 하는 일은 실제로...08:41

비디오를 색인화하고 있으며, 특정 행동을 검색할 수 있도록 지원하고 있습니다.08:43

사람이 문을 여는 것에 대해 이야기하고 있으니, 이 예시를 계속 사용하도록 하겠습니다.08:49

저희 플랫폼에서는 상세한 정보를 입력하시고, 쿼리를 작성하실 수 있습니다. 예를 들어, 설거지를 하는 사람, 티셔츠를 접는 사람과 같은 검색어를 입력하시면 저희가 그에 맞는08:55

결과를 제공해 드립니다.09:02

이러한 동작들의 영상에서 발췌한 부분들입니다.09:08

그게 무슨 뜻이죠? 그건 바로 이런 의미라는 뜻입니다.09:12

데이터 수집의 낭비도 줄이고, 저장 공간 또한 절약됩니다.09:20

맞죠? 작동 방식에 대해 조금 더 설명드리겠습니다. 당연히 찾고 싶은 것을 정의하시겠죠?09:24

저희는 수십억 개의 미리 색인된 비디오를 검색합니다.09:32

키워드가 아닌 동작을 기준으로 검색하며, 바로 사용 가능한 클립들을 제공해 드립니다.09:36

그리고 당연히 이미 학습에 사용할 수 있도록 준비되어 있어서, 그냥 처리만 조금 하시면 돼요. 예를 들어 모션이나 거리 센서 같은 것들을 적용해서09:44

로봇이 바로 인식할 수 있도록 데이터를 넣을 수 있습니다.09:49

저희 플랫폼에서 실제로 어떻게 작동하는지 보여주는 짧은 영상 예시가 있습니다. 잠시만 재생해 보겠습니다.09:58

여기서 손으로 설거지를 하는 사람을 볼 수 있습니다. 싱크대에서 제거하고 있습니다.10:03

스펀지와 비누를 사용하여 접시의 기름기를 제거하고, 헹구고, 건조대에 접시를 놓는 모습입니다.10:10

지금은 손과 상호작용하는 모습을 클로즈업해서 보여드리고 있는데, 현재 검색을 진행하고 있습니다.10:16

지금 비디오가 수십억 개 정도 있습니다. 이 영상은 조금 오래된 것 같고, 현재 약 1억 개의 인덱스만 가지고 있지만요.10:23

현재는 11억 개 이상의 비디오를 보유하고 있고, 지금 보시는 것처럼 속도를 약간 빠르게 했습니다.10:28

여러분 시간 낭비하지 않으려고 했는데, 사람들의 설거지하는 모습이 담긴 영상 클립들을 보여드릴 거예요. 지금 찾은 모든 영상을 여기서 확인하실 수 있습니다.10:34

여기에서 저희가 찾아낸 모든 비디오를 보실 수 있습니다.10:40

이 영상들 중 일부는 설거지와 관련 없을 수도 있습니다. 주방 청소와 관련된 내용일 수도 있고, 다른 어떤 것과도 관련이 있을 수 있습니다.10:47

또 다른 예시를 보여드리겠습니다. 예를 들어 사람이 다양한 종류의 옷을 접는 모습 등이 있습니다.10:53

네, 조금 더 자세한 설명을 추가할수록 더 정확한 결과를 얻을 수 있습니다.10:59

다시 속도를 높여서 한번 보겠습니다.11:07

이해하실 수 있도록, 어떤 것이든 될 수 있습니다. 예를 들어 화장하는 사람이나, 특정 브랜드가 있다면, 그 브랜드가 등장하는 영상을 찾고 싶을 때도 가능합니다.11:15

모든 정보는 제공될 수 있습니다.11:19

사람들이 옷을 접는 것을 보시는 것처럼, 이제 로봇에게 옷 접는 방법을 가르칠 수 있습니다.11:24

물론 모든 기능은 API를 통해 제공됩니다. 저희는 사람들이 실제로 그렇게 하기를 기대하지 않습니다.11:34

수동으로 처리하는 일은 없고요, API를 통해 실행하실 수 있습니다. 결과를 돌려받으실 수 있습니다.11:38

비디오의 짧은 부분과 함께 비디오 URL을 제공해 드립니다. 원본 비디오 링크도 드릴 수 있습니다.11:43

보고 싶으시겠지만, 여기서 중요한 건 저희가 비디오 스니펫을 제공해 드릴 수 있다는 점입니다.11:49

로봇 학습에 활용하실 수 있도록 비디오 스니펫을 제공하는 거죠. 혹시 여러분 중에 로봇 학습을 하시는 분 계신가요?11:54

로봇에 대해서 말씀드리고 있는데, 또 다른 예시를 들어서 얼마나 유용한지 보여드리겠습니다. 자,12:00

만약 여러분의 브랜드가 있고, 여러분의 브랜드를 어떤 영상에서 어떻게 시연하는지 알고 싶다고 가정해 봅시다.12:05

영상 제목은 중요하지 않습니다. 왜냐하면 실제로는 관련이 없거든요.12:14

제품에 대한 내용이 아니에요. 그냥 어떤 사람이 팟캐스트 녹음을 하거나 무언가를 하고 있을 뿐입니다.12:18

화장을 하는 여성을 보셨을 때, 테이블 위에 당신 브랜드의 화장품이 놓여 있는 것을 볼 수 있습니다.12:24

이제 갑자기 당신 브랜드가 사용된 오래된 영상들을 찾을 수 있게 되는 거죠?12:30

비디오 제목으로 검색하면 찾을 수 없습니다.12:36

비디오 인덱싱을 통해 관심 있는 특정 장면을 찾아낼 수 있습니다.12:39

사과가 나무에서 떨어지는 장면 같은 것들, 그리고 그 외의 상황들도 있습니다. 그럼 무엇이 다시 나타날까요?12:45

저희는 이 타임스탬프를 제공해 드립니다.12:50

저희는 점수 매칭을 제공합니다. 귀하의 질문과 얼마나 가까운지, 그리고 물론 프레임 수를요.12:52

찾고 계신 내용과 관련된 프레임 수가 몇 개인지 알려드립니다.12:58

그래서 이 변경 사항은 어떤 의미가 있을까요? 많은 변화가 있습니다.13:04

알겠습니다, 불필요한 낭비는 줄어들 거예요. 수백 시간의 영상을 다운로드할 필요 없이 실제로 얻을 수 있게 됩니다.13:08

관심 있으신 특정 행동들을 정확히 보여줍니다.13:14

다시 한번 말씀드리지만, 매우 중요합니다.13:19

로봇 학습인데, 노이즈가 문제를 일으키고 환각 현상을 유발하죠. 이 기능은 그걸 제거합니다.13:23

그 노이즈를 없애줍니다.13:30

로봇뿐만 아니라 자율주행차에도 유용합니다. 예를 들어, 위미오 같은 경우도 있고요.13:34

대시캠 영상으로 학습되었고, 유튜브에는 수백만 시간의 영상이 있습니다.13:40

대시캠 영상들 중에서 사고 영상을 보시는 분 계신가요? 아마도 계실 거라고 생각합니다. 러시아의 엄청난 운전 실력을 보시는 분들도 분명히 있을 거예요, 그렇죠?13:47

바로 이런 것을 말씀드리는 거죠.13:52

영상 자료들은 이미 많이 나와 있어요. 신호 위반하는 사람, 정지선에서 멈춰 서는 사람, 좌회전하거나 우회전하는 등등… 그런 모든 것들이 학습을 위한 아주 유용한 데이터가 될 수 있습니다.13:59

모두 다 활용할 수 있죠.14:05

그리고 다른 세계 모델이나 물리 법칙도 필요하죠. 로봇이 물리를 이해해야 하니까요.14:11

중력은 무엇이고, 어떻게 앉아야 하고, 어떻게 걸어야 하며, 어떻게 움직여야 할까요?14:16

물론 미리 녹화할 수도 있습니다. 지금 많은 분들이 저에게 말씀하시는데,14:22

그분들은 수백만 명의 사람들에게 영상을 찍어달라고 부탁합니다. '여러분, 제가 문을 여는 모습을 촬영해 주세요!' 정말 미친 짓이죠.14:28

왜 그렇게 많은 사람들이 그걸 해야 하는데, 모든 게 온라인에 다 있는 거죠?14:34

온라인은 정말 거대한 데이터베이스 중 하나인데, 사람들은 잘 활용하지 않죠. 사용하기가 편하지 않은 것 같아요, 그렇죠.14:39

현재 저희가 사용할 수 있는 검색 기능은 영상 제목의 키워드로 이루어져 있습니다.14:47

물론, 전체 공개 영상 웹을 한 곳에 모아둔 자료도 있습니다.14:52

유튜브나 비메오처럼 정말 다양한 동영상 제공업체들이 있죠, 많은 곳에 있습니다.14:59

거기에만 해도 수십억 시간의 학습 데이터가 여러분을 기다리고 있답니다.15:06

그걸 가져오고, 수집하고, 처리하는 거죠. 기본적으로 저희 Bright Data에서 만들고 있는 새로운 제품입니다.15:12

특정 동작을 찾으실 수 있도록 영상을 색인하는 것이죠.15:17

생각할 수 있는 어떤 것이든, 아시죠, 또 브랜드에도 유용하게 쓰일 수 있습니다.15:23

데이터 학습뿐만 아니라, 생각할 수 있는 모든 것이 유용하게 활용될 수 있습니다.15:28

아마 게임을 즐기시는 분이시고, 이 레벨을 어떻게 깨는지 궁금해하실 수도 있지만,15:34

정확히 그런 내용을 담은 영상은 없을 거예요.15:37

그러니 비디오 게임 레벨을 깨는 사람들의 영상을 검색할 수도 있습니다. 세상에 있는 모든 것이 가능합니다.15:43

여기까지 마무리하겠습니다. 혹시 질문 있으신 분은 없으시겠지만, 연결하고 싶으시면요.15:53

저와 더 자세히 이야기하고 싶으시다면 링크드인에 저를 추가해 주세요. 그리고 감사합니다.15:58

여러분16:05

시간 내주셔서 감사합니다. 그리고 혹시 더 자세히 이야기하고 싶으시면, 브라이트 데이터 부스에서 찾아뵐 수 있습니다. 정말 감사드립니다.16:05

참석해주셔서 감사합니다.16:13

AI Summary

로봇 학습 및 다양한 분야에서 활용 가능한 비디오 데이터 검색 플랫폼에 대한 내용입니다. 현재 온라인상에는 방대한 양의 영상 데이터가 존재하지만, 효과적으로 활용하지 못하는 문제점을 해결하고자 Bright Data에서 새로운 제품을 개발하고 있습니다. 이 제품은 기존 검색 기능의 한계를 극복하고 특정 행동이나 내용을 담은 영상을 색인하여 사용자가 원하는 데이터를 효율적으로 찾고 활용할 수 있도록 지원합니다. 또한, API를 제공하여 자동화된 데이터 처리 및 활용이 가능하며, 로봇 학습에 필요한 깨끗하고 정확한 데이터를 제공하여 환각 현상을 방지하는 데 도움을 줍니다. 게임 레벨 공략 영상 검색 등 다양한 분야에서 활용될 수 있으며, 더 자세한 정보는 링크드인 연결이나 Bright Data 부스를 방문하면 얻을 수 있습니다.

Key Highlights

  • •온라인 영상 데이터의 비효율적인 활용 문제 해결
  • •행동 기반 색인화를 통한 세분화된 검색 기능 제공
  • •API를 통한 자동화된 데이터 처리 및 활용 지원
  • •로봇 학습 외 다양한 분야 (게임, 자율주행 등) 적용 가능성 제시
  • •Bright Data에서 개발 중인 새로운 제품 소개

Related Videos