Home

읽기 설정

클로드 오퍼스 5.5는 이미 놀라운 오픈AI의 아스트로 모델에 대한 엔트로픽의 갑작스럽고 울려 퍼지는 응답입니다.00:00

모델입니다.00:07

물론이죠, 화려한 데모와 벤치마크 점수, 그리고 클로드로 제작된 것들에 또 다시 압도당하기 쉽습니다.00:09

자전적 애니메이션에 말이죠.00:16

솔직히 저도 예외는 아니었어요. 파이널 판타지 스타일의 플레이 가능한 세계를 몇 시간 동안 탐험하느라고요.00:18

세계를요.00:26

제가 언리얼 엔진으로 함께 만들었던 오푸스 5.5를 공개했는데, 사실 지금이 이것을 깊이 파고들기에 가장 좋은 시기는 아닐 수도 있습니다.00:26

다른 오푸스와 관련된 뉴스도 너무 많기 때문입니다.00:33

솔직히 말씀드리면, 각각 생각해 볼 만한 가치가 있는데, 솔직하게 말하면 아마도 두 시간짜리 다큐멘터리를 할애할 만큼 충분합니다. 실제로 가끔은 AI 임원들에게 이게 적합한지 궁금해집니다.00:39

정말로 의아하게 생각되네요.00:44

이렇게 많은 뉴스, 좋은 뉴스도 나쁜 뉴스도 쏟아지게 되는 것은 사실, 그로 인해 다음과 같은 사실이 가려질 수 있습니다.00:50

많은 연구소에서 중요한 약속을 했는데, 지금은, 음, 지키고 있지 못하다고 할 수 있겠습니다.00:56

진화하고 있습니다. 자연스럽게, 왜 저희가 이렇게 빨리 저렴하면서도 성능 좋은 모델을 얻게 되었는지부터 말씀드리겠습니다.01:01

오푸스 5.5와 같이 페이블 5.1 이후 그렇게 곧바로 출시된 것이 사실은 Anthropic과 같은 연구소에서 발생하는 부작용입니다.01:07

상당히 강력한 내부 모델들이었습니다. 그리고 Opus 5.5 시스템 카드, 무려 230페이지에 달하는,01:14

Anthropic이 원치 않았을 수도 있는 AI 속도 향상에 대한 정보를 더 많이 드러냅니다.01:21

모델들이 연구소조차 인지하지 못하는 사이에 벤치마크를 통과하고 있습니다.01:25

그리고 한 연구소의 최고 수준의 정렬 아이디어가 다른 연구소의 주요 연구원에게 무심코 웃음거리로 전락했습니다.01:29

계속해서 더 이야기할 수 있을 것 같아요, 영상 길이를 두 배로 늘릴 수도 있고요.01:36

오늘 알게 된 바로는 아직 세상에 AI 에이전트가 남아있을 가능성도 있습니다.01:39

아마도 암호화폐 사이트 같은 곳을 해킹해서 돈을 얻는 것 같습니다. 이런 모델들이 공개되어 있을 것으로 생각됩니다.01:44

물론 현재 중요한 정치 뉴스가 발생하고 있습니다.01:48

연구소 간 계약이 마무리되고 있고, 놀랍도록 새로운 인공지능 해킹 사례가 발견되는 등 정말 많은 일들이 벌어지고 있습니다.01:51

지금쯤은 아마 그렇게 생각하실 거라고 봅니다.01:56

인공지능에 대해 생각하고 읽고 사용하는데 모든 시간을 할애하더라도, 지금은 따라잡기가 어려울 거예요.01:58

최소한 완전히는 어렵겠죠. 그리고 인공지능 연구원이나 이들 연구소 CEO처럼 직업이 있는 사람들을 한번 상상해 보세요.02:05

아마 뉴스도 완전히 따라가지 못하실 거예요. 자, 이제 일반 대중을 한번 생각해 보시죠.02:11

그것이 언론과 이러한 연구소에 대한 대중의 감시가 어디로 이어지는지, 그 부분은 제가 더 이상 말씀드리지 않겠습니다.02:13

생각해 볼 만한 내용이죠. 아무튼, 공식적인 오퍼스 5.5 발표가 있습니다.02:19

그리고 GPT-6 솔과는 달리,02:24

오픈AI의 최고 모델인 GPT-6 아스트라보다 확실히 성능이 떨어지는 것으로 보이는 이 Opus 5.5 모델은02:26

저의 자체 벤치마크에서도 최첨단 수준의 능력을 보여주고 있습니다.02:33

그러니 지금 받고 있는 관심이 정말 당연하다고 생각합니다. 제가 가장 중요하게 생각하는 벤치마크 두세 개 정도만 짚어보겠습니다.02:37

제가 이 채널에서 전에 다루었었던 것 중 가장 어려운 벤치마크 중 하나는 Terminal Bench Science 0.1입니다.02:43

모델이 독립적인 과학 연구를 수행할 수 있는 능력을 평가하는 중요한 지표입니다.02:48

그 점에서는 Opus 5.5가 Astra보다 약 6% 뒤쳐지지만, Fable 5.1보다는 앞섭니다.02:52

지금으로서는 제 대략적인 순위가 그렇게 되겠네요. 다음 벤치마크인 '인류의 마지막 시험'을 보면서 확인해 보겠습니다.02:58

이것은 수십 개의 난해하고 복잡한 분야에서 추론 능력을 평가하는 '인류의 마지막 시험'입니다.03:03

잠깐만요, 필립 씨는 Opus 5.5가 GPT-6 Astra보다 훨씬 더 좋은 점수를 낸다고 말씀하실 건가요?03:10

그리고 작년 초에 만들어진 벤치마크 테스트에서는 모든 질문에 대해 명확한 해답이 있다고 합니다.03:14

알고 보니, 저희는 휴머니티의 마지막 시험 다이아몬드 버전이 필요했나 보네요.03:20

그것은 아마도 오류나 주관적인 답변을 제거하기 위해 정리된 벤치마크 버전인 것 같습니다.03:24

이번 최신 버전에서 아스트라는 오푸스 5.5를 약 5% 정도 능가합니다.03:30

하지만 특정 조건, 특히 장기적인 코드 작성 능력에서는 오푸스 5.5가 아주 조금 더 나은 결과를 보여줄 수도 있습니다.03:35

프론티어 코드와 같은 권위 있는 벤치마크에 따르면 그렇습니다.03:41

물론, 그 능력은 스스로를 개선하는 인공지능에게 가장 중요합니다.03:45

연구입니다. 그리고 지난 몇 주 동안의 소식을 고려하면, 지금 어떤 모델이 더 나은지에만 집중하는 것은 조금 지나치게 단순화된 접근이라고 할 수 있습니다.03:50

어차피 현재 속도로 보면, 아마 이런 일이 발생할 가능성이 높습니다.03:57

오픈AI나 엔트로픽에서 1~2주 안에 새로운 모델이 나올 가능성이 높습니다.04:00

프론티어 AI 모델들은 당연히 차세대 프론티어 모델 개발을 가속화하고 있습니다.04:04

이 차트에서 오렌지색이 진해질수록, 모델들이 다음을 생성하는 데 필요한 작업의 상당 부분을 차지하고 있음을 알 수 있습니다.04:10

모델들이 점점 더 많은 작업을 수행하며 다음 단계를 만들어내는 데 기여하고 있습니다.04:11

차세대 인공지능 모델들의 집합이라고 할 수 있습니다. 하지만 시작할 때 말씀드렸듯이, 모델 출시 빈도와 가격이 낮아지는 것 자체가 이러한 연구소들이 보유한 훨씬 강력한 내부 모델을 시사합니다.04:17

그 자체로 이 연구소들이 가지고 있는 훨씬 더 강력한 내부 모델의 증거가 된다고 말씀드렸습니다.04:23

잠시만 그 부분에 대해 좀 더 자세히 설명드리겠습니다. 왜냐하면 바로 그런 이유로 오푸스 5.5와 같은 모델이 페이블 5.1 이후에 그렇게 빨리 출시될 수 있었기 때문입니다.04:29

앤스로픽은 분명히 훨씬 강력한 내부 모델을 보유하고 있을 가능성이 높습니다. 페이블 5.5와 비슷한 개념이라고 생각하시면 됩니다.04:36

질문에 대한 답변을 오푸스 5.5와 같은 더 작은 모델로 요약할 수 있습니다.04:42

선생님의 추론 방식을 모방하는 것을 배우는 학생이라고 생각하시면 됩니다.04:47

내부 모델이 작은 모델을 위한 문제나 과제를 생성할 수 있습니다.04:51

더 강력한 내부 모델은 그 작은 모델을 훈련시키기 위한 강화 학습 환경이나 게임(gym)으로 사용될 수 있으며, 그 모델의 답변을 평가하는 데에도 활용될 수 있습니다.04:54

더 작은 모델을 활용해서 학습 속도를 더욱 빠르게 할 수 있습니다. 물론 제가 말씀드린 내용들은 추측이 아니고, 관련 논문으로 한두 दर्जन은 충분히 뒷받침할 수 있습니다.05:01

조금 더 기술적인 관점에서 보면 강력한 내부 모델은 '커널' 및 시스템 엔지니어링이라고 불리는 작업을 수행하여 모델이 실행되는 방식을 최적화할 수 있습니다.05:08

사용 가능한 하드웨어에 따라 달라집니다. 이를 통해 모든 모델의 학습과 추론 속도를 높이고 비용을 절감할 수 있습니다.05:14

특정 연구실에서 그러한 현상을 확인할 수 있습니다. Opus 5.5의 비용이 감소하는 것을 눈치채셨을 겁니다.05:19

눈치채지 못하셨을 수도 있지만, 230페이지 분량의 시스템 카드에서05:23

앤스로픽은 커널 개발에 오푸스 5.5를 사용하는 것을 금지하고 있습니다.05:28

다른 연구실에서 그들의 모델을 이용해서 똑같은 일을 하길 원하지 않는 것 같아요. 혹시 OpenAI나 Meta, 아니면 중국의 연구실들을 겨냥한 걸까요?05:33

Anthropic이 지난번 Fable과 관련해서 비슷한 일을 했다가 비난받았던 점을 고려하면, 일종의 방해 공작으로 여겨졌던 것 같습니다.05:40

아마 그들은 그것이 매우 가치 있다고 명확하게 생각하는 것 같아요. 그래서 Opus 5.5에 대한 정책을 다시 시행하고 있는 거겠죠.05:47

저는 그걸 요약해서 말했을 수도 있었어요. 아주 뛰어난 모델의 갑작스러운 출시라는 식으로요.05:52

오푸스 5.5에서 저렴한 가격의 모델이 출시되는 것 자체가 연구소 내 프론티어 모델들의 끊임없이 성장하는 능력의 한 가지 결과일 수 있습니다.05:58

오푸스와 같은 모델들이 등장하는 것이 그렇게 놀라운 일은 아닐 수도 있습니다.06:05

오푸스 5.5가 최고 수준의 인공지능 연구원들의 수준에 근접하고 있기 때문에 채택되고 있습니다.06:10

최고 수준의 미국 노동 시장과 비슷한 수준에 도달하고 있다는 점을 고려하면, 인공지능 연구에 활용되고 있는 것입니다.06:16

중간 기간의 블랙박스 생물학적 서열 설계 및 예측을 수행하는 퍼포머들에 대해 말씀드리는데, 혹시 예상하시겠습니까?06:21

그럼에도 불구하고 AI 연구가 천년 기념 문제처럼 훨씬 더 어렵다고 생각하십니까?06:27

앤트로픽은 오퍼스 5.5가 저희 연구 과학자와 엔지니어를 대체할 수 있을 만큼의 수준에 미치지 못한다고 확신하는 것 같습니다.06:33

초창기 소프트웨어 엔지니어링 시대와 비슷하다고 할 수 있습니다. 아직...06:40

인공지능 연구에 실제로 도움이 되려면 모델을 계속해서 세심하게 관리해야 합니다.06:46

저희 내부의...06:50

측정 결과는 개발 속도에서 지속적인 AI 기여로 인한 두 배의 가속화가 나타나지 않습니다.06:51

방금 그 특정 목표를 달성하지 못한 점을 강조하려는 이유에 대해서는 잠시 후에 설명해 드리겠습니다.06:58

하지만 오퍼스 5.5가 연구자들의 수준을 따라잡는 데 얼마나 더 멀리 떨어져 있나요?07:02

에런트론틱스가 이것을 가지고 있습니다.07:06

내부 벤치마크인 코벤치(CoBench)입니다. 저희 안트론픽에서 실제 연구 및 개발 업무의 모델 발전을 측정하기 위해 만들어졌습니다. 간단히 말해서, 특정 시점의 모델 스냅샷을 제공하는 것이죠.07:08

본질적으로 모델에게 정확한 역사적 지점을 보여주는 스냅샷을 제공합니다.07:14

앤트로픽의 인프라 내에서 모든 로그를 확인하고, 당시 내부 메시지도 보고 모델에게 현재 상황의 근본 원인을 진단할 수 있나요라고 질문하는 것입니다.07:20

모델에게 현재 무슨 일이 일어나고 있는지 근본적인 원인을 진단할 수 있느냐고 묻는 거죠.07:24

오푸스 5.5가 약 56% 정도의 경우에 그렇게 할 수 있다고 합니다.07:28

심지어 전설적인 미토스 5.1보다도 훨씬 발전된 수준입니다.07:33

하지만 엔트로픽 연구원을 대체하려면,07:37

엔트로픽에서는 모델이 이 테스트에서 최소 85%의 점수를 받아야 한다고 합니다.07:38

연구 인력을 완전히 대체하려면 최소한 이 정도의 성능을 보여줘야 합니다.07:45

30% 포인트 정도만 더 가면 되겠네요. 아무튼, 엔트로픽에 따르면, 모든 것을 고려해도요.07:49

그 차트들을 보면, 저희의 속도를 두 배로 빠르게 하는 것은 아니네요.07:54

왜 그 특정 숫자인가요?07:58

어떤 속도와 비교하는 건가요? 엔트로픽의 원래 약속, 2024년 책임 있는 확장 정책에 따르면 말씀하신 거죠. 그들은 우리가 보통 1년에 하던 일을 1년 안에 할 수 있다면08:00

효과적으로 그렇게 된다고 했습니다.08:05

2018년까지 우리가 진행하던 속도로는 보통 두 년이 걸릴 거예요.08:11

AI 모델 덕분에 저희가 설정한 최고 수준의 AI 연구개발 레벨 5를 충족할 수 있을 겁니다.08:15

만약 우리가 2024년에 그 기준점을 달성한다면, 엔트로픽에서는 뭐라고 했나요?08:20

엔트로픽에서 말하길, 만약 그 기준이 충족된다면 저희는 모델을 학습하거나 배포하지 않겠다고 했습니다.08:24

안전 및 보안 조치를 구현하지 않는 한 말이죠. 모델 가중치 보호와 같이 국가 수준의 적대적인 공격에도 대비하는 것과 같은 것들입니다.08:32

앤트로픽이 미사일을 제대로 모델링할 수 있다는 강력한 긍정적 사례를 증명하기 위해서요.08:38

모델 자체의 정렬 문제를 의미합니다. 모델이 제어에서 벗어나서 예상치 못한 행동을 할 수 있다는 것이죠. 약간의 문제는...08:44

앤스로픽이 메타를 초청해서 외부 평가단을 구성했을 때, 약간의 무언가를 발견했습니다.08:48

다소 달랐습니다. 그들은 이미 30% 정도의 두 배 가속화 가능성이 있을 수도 있다고 판단했습니다.08:53

공정하게 말해서, Anthropic은 저희의 일부 조치가 변경되었음을 인정했습니다.08:58

무슨 뜻일까요? 음, 2026년 7월로 시간이 흘러 상황이 바뀌었습니다.09:02

이제 그들의 강력한 긍정적인 주장은 그들이 선두에 있을 때만 해당됩니다.09:06

게다가, 방금 말씀하신 그 지연은 또 다시 승리하고 있을 때에만 해당되는 것 같습니다.09:11

연구소들은 기본적으로 약속들을 지켜가고 있습니다.09:17

서로를 향하고 있습니다. 게다가, 과거의 확고한 약속들은 더 이상 필요하지 않을 때 변하게 됩니다. 앤스로픽의 가장 유명한 사례를 2023년 것으로 들어보겠습니다.09:20

더 이상 편리하지 않게 되면 그렇게 됩니다. 앤스로픽의 가장 유명한 사례를 2023년으로 거슬러 올라가 보겠습니다.09:25

그들은 인공지능 능력 발전 속도를 높이고 싶지 않기 때문에, 능력 관련 연구를 공개하지 않으려고 합니다.09:29

수년이 지난 후, 그들은 우려했던 점이 다른 인공지능 개발자들의 발전을 가속화하는 것이었다고 설명합니다.09:35

우리 것과 비슷한 위험을 초래하는 경우와 동일한 수준의 안전장치를 갖추지 않은 것들도 있습니다.09:42

다른 상황에서는 이러한 변화만으로도 몇 주 동안 공개적인 논의를 정당화할 수 있을 것입니다.09:48

토론할 거리가 정말 많습니다만, 상황이 너무 복잡해서요. 인지부족은 물론이고 책임감도 부족해서 연구소들은 사실상 무엇이든 할 수 있는 것 같습니다.09:53

그와 관련해서, 이제 OpenAI로 이야기를 바꿔보겠습니다.09:59

호주 건강 정보 같은 걸 찾아볼 때처럼, 호주 정부를 해킹하는 것과 마찬가지입니다. 직접 타임라인을 확인해 보시면 OpenAI가 이 문제를 보고하기까지 얼마나 오래 걸렸는지 알 수 있습니다.10:03

직접 타임라인을 확인해 보시면 OpenAI가 이 문제를 보고하기까지 얼마나 오래 걸렸는지 알 수 있습니다.10:08

호주 정부에 말씀드리자면, 몇 달이나 걸렸습니다. 하지만 제가 흥미롭게 본 것은 Transluse AI의 이 엄청난 작업에서, 아직도 일부 무단 활동자가 있을 수 있다는 사실이었습니다.10:13

듣고 계신다면요. 하지만 더 흥미로운 점은 Transluse AI의 이 놀라운 작업을 통해, 여전히 일부 무단 활동자가 있을 수 있다는 것이었습니다.10:18

허깅 페이스 사건만큼 심각한 수준은 아니라고 말씀드리지만, 이런 일들이 발생했습니다.10:24

오픈AI 직원들 중 일부가 크고 작게 모든 유사한 사건들을 앞으로 보고할 것이라고 약속하기도 했습니다.10:29

음, 4일 전인 9월 20일에, 이건 거의 확실히 OpenAI의 것으로 추정되는 모델이 암호화폐 사이트를 해킹하려 시도했습니다.10:34

허깅 페이스 사건 당시에는 적어도 이 모델들이 돈을 벌려고 알아서 움직이지 않을 거라고 안심받았던 기억이 납니다.10:41

그리고 물론, 그들이 여기서 무엇을 하고 있었는지에 대한 배경이나 프롬프트는 알 수 없습니다.10:47

하지만 일단 OpenAI가 코드명 벨이라고 불리는 가장 강력한 내부 모델을 훨씬 더 통제하고 있기를 바랍니다.10:51

며칠 전에 오픈에이아이에서 이른바 인공지능 정책들을 발표했는데, 정말 일반적이고 지루하네요.10:57

하지만 한 문장이 눈에 띄었습니다.11:03

눈에 띄는 부분이 있었어요. 자동화된 인공지능 연구나 다른 첨단 기술을 추구하는 모든 AI 연구소는 안전하게 진행할 책임이 있어야 합니다.11:03

저에게 흥미로운 점은 그 책임의 모습이 무엇일지에 대한 것입니다.11:10

초지능 인공지능이 데이터 센터를 장악하거나 병원을 해킹한다면, 책임은 어떻게 지워지는 걸까요?11:15

경영진들이 감옥에 가는 것을 의미하는 건가요? 이런 해킹이 하나 둘 발생한다면 어떨까요?11:21

AI 연구를 자동화했을 때의 결과에 대해서입니다. 완전 자율적인 재귀적 자기 개선은 현재 일어나고 있지 않으며, OpenAI나 Astra에서 밝혔듯이, 그것이 안전하게 이루어질 수 있을 때까지는 추구해서는 안 됩니다.11:26

지금 당장 일어나는 일이 아니며, OpenAI나 Astra에서 언급했듯이, 안전하게 수행될 수 있을 때까지는 추구하지 말아야 합니다.11:31

안전하게 진행하는 것이 중요하다고 했는데요. 하지만 다른 인터뷰에서는 OpenAI가 2028년 3월까지 자동화된 인공지능 연구원을 확보하는 것을 최우선 과제로 삼고 있다고 밝혔습니다.11:37

그렇죠.11:42

그래서 이미 진행하고 있는 것 같습니다. 그들의 수석 과학자는11:45

‘이방인의 정신’이라는 게시글에서 며칠 전에 오픈AI 연구를 RSI에 집중한다고 밝혔습니다.11:48

이것은 엔트로픽을 떠올리게 할 수도 있을 겁니다. 저희는 이것이 AI 연구의 최전선을 유지하는 유일한 방법이라고 생각하기 때문입니다.11:55

하지만 잠시만요, 다음 문장에서 그는 이렇게 말합니다. '위의 단어들이 이것이 올바른 공동 행동이라는 뉘앙스를 풍기게 해서는 안 됩니다.'12:00

마치 이 모든 연구소들이 원치 않는 경쟁에 참여하고 있다는 것을 인정하는 것 같아요.12:07

기억하시지 못할 수도 있지만, 2023년으로 거슬러 올라가면요.12:11

다리오 아마데이는 과거에 샘 알트만이 '출발 신호'를 울렸다고 비난하곤 했습니다.12:14

하지만 지금은 거대 언어 모델(LLM)이 세상을 잠식하고 있습니다.12:19

드라이빙 벤치라는 걸 한번 보세요. 모델에게 실제 도요타 코롤라를 제어할 수 있게 해주는 거죠.12:23

핸들 조작과 페달을 담당하게 하는 겁니다. 물론, GPT-6은 아직...12:27

이러한 작업을 전문적으로 수행해 왔지만 GPT-5.6의 경우 6%를 기록했던 것에 비해 Astra는 최고의 성능으로 100%를 달성했습니다.12:31

과제를 성공적으로 완료했습니다. 이건 이상한 일회성 예시일 뿐이지만, 잠깐만요, 무엇에 관해서인지 봅시다.12:38

로봇 공학인가요? 수천 명, 수만 명의 연구자들이 평생을 바쳐서12:43

로봇 알고리즘을 개선하거나 특수 로봇 모델을 제작해 왔습니다.12:48

그러다 GPT-6 Astra라는 엄청나게 강력해진 LLM이 등장해서 두 손을 조작하는 데 최고 수준의 점수를 받았습니다.12:52

실제로 이전 최고 수준보다 네 배 더 높습니다. 예전에는 정말...12:59

매우 까다로운 이와 같은 벤치마크에서는 0%의 점수를 받는 특수 비전 모델들이었습니다.13:02

제로벤치라고 불리는 것 같아요. 홍콩 메뉴를 어두운 조명 아래에서 거꾸로 읽고 모든 가격을 더해보세요.13:08

상태 기술 점수가 이제 아마도 이미 아스트라에게 넘어갔을 거라고 예상하셨을 겁니다.13:15

이건 어떠세요? 아마 자체 다큐멘터리를 가질 자격이 있는 것 같아요.13:19

모델들이 인간이라고 불리는 슈퍼 예측가들보다 단기 및 중기 미래를 예측하는 데 점점 더 능숙해지고 있습니다.13:22

최고의 AI 모델이 최고 30명의 인간 전문가들을 능가하는 모습을 확인할 수 있습니다.13:28

아직은 완전히 그런 단계는 아닐 수도 있습니다. 어쩌면 또 다른 모델이 필요하거나, 더 빠르고13:32

더 많은 메모리를 사용할 수 있는 새로운 하드웨어가 필요할 수도 있겠죠. 하지만 2027년쯤에는 그렇게 될 것이라고 가정해 봅시다.13:39

정치나 금융에 어떤 의미가 있을까요? 주어진 정보를 바탕으로 가장 뛰어난 트레이더가 항상13:43

이 모든 모델들이 연구소에서 집착적으로 개발되었다고 생각하실 수도 있지만요.13:50

한 명의 OpenAI 연구원이 그가 AI 분야 사람들이, 특히 연구실에 있는 사람들이 외부 사람들보다 AGI에 더 매료되는 이유 중 하나를 설명합니다.13:54

그것은 우리가 AI가 성공하는 것을 직접 관찰할 수 있기 때문입니다.13:59

저희가 명확히 의도적으로 학습시키지 않았다고 확실히 알고 있는 작업들 말이죠. 유명한 제이콥 콕슨의14:05

수억 회 조회수를 기록한 트윗도 함께 작업했고, 프릿레이닝을 담당했던 켈러 조던은 계속해서 말씀하시길...14:10

만약 연구실 밖에 계신다면, 이론적으로 상상력을 발휘해서 지금까지의 모든 AI 성공 사례는14:15

연구실 내부자들이 어떤 종류의 비용이 많이 드는 명시적인 훈련 노력을 통해 만들어진 결과일 수도 있습니다. 이는 부분적으로 사실이지만 완전히 맞는 것은 아닙니다.14:19

다시 말해서, 연구소 내부자가 되면 이 인공적인 두뇌 기술의 신비로운 특성을 직접 관찰할 수 있습니다.14:26

반면에 외부인들은 AI의 능력이 항상14:30

아마 인위적이고, 마법 같지 않으며, 인간이 만든 것처럼 보일 수 있습니다.14:36

물론 중국의 개방형 모델들이 무한히 뒤쳐져 있다는 뜻은 아닙니다.14:39

오픈AI의 허깅페이스 공격에 질투심이라도 느꼈는지, 중국 해커 한 명이 DeepSeq와 Kimi 모델과 이전 버전의 Claude를 사용하여 60만 개의 신용 카드 번호에 접근했습니다.14:44

그렇게 해서 60만 개의 신용카드 정보를 얻어냈습니다.14:51

중국 모델 중 일부가 클로드 패밀리의 티처 모델에 부분적으로 의존하여 추론 능력을 오픈 웨이트 모델에 전달해 왔다는 점을 고려하면, 엔스로픽의 이러한 조치가 어떤 영향을 미칠지 지켜볼 만하겠네요.14:55

그 오픈 웨이트 모델에 흡수시키는 방식이었기 때문에, 엔스로픽에서 이와 관련하여 어떤 효과가 나타날지 흥미롭게 관찰해 볼 수 있을 것 같습니다.15:02

오푸스 5.5가 증류 방지 안전 장치를 가지고 출시되고 있습니다.15:07

이것 때문에 중국 모델들이 더 뒤쳐질까요?15:11

아니면 중요하지 않을까요? 미국의 대통령은 현재 중국의 대통령과 회담을 하고 있습니다.15:14

지금 당장, 관련 모든 당사자들이 현재의 안전 장치에 만족하는 것 같습니다.15:18

어떤 결과가 나올지 지켜봐야겠네요. 실험실 쪽에서는 자체 그룹을 구성하는 것 같고, 그리고15:24

아마 '프론티어 AI 표준 협회(Standards Authority for Frontier AI)'라는 이름으로 런칭될 예정이라고 합니다.15:29

다가오는 달들에, 올인 팟캐스트의 콘돌레ezza 라이스(Condoleezza Rice)와 데이비드 프리버그(David Freeberg)가 지도자로 거론되고 있습니다. 어떤 합의가 이루어지든, 엔트로픽(Anthropic) 연구원인 다니엘 리우(Daniel Liu)에 따르면 큰15:34

규모의...15:40

그가 교류하는 사람들 중 상당수는 아직 우리가 얼마나 가까이에 있는지 제대로 이해하지 못하고 있습니다.15:46

자기 개선과 미래가 얼마나 놀라울지에 대해 감히 상상하기 어려울 정도로요.15:51

저희는 아직도 그걸 제대로 이해하지 못하고 있어요. 그분 포함해서 미래에 대해 정신적으로 준비되지 않은 것 같아요.15:56

앤스로픽에서는 명확히 밝히고 있습니다.15:59

우리가 프론티어의 속도를 언급했을 때, 저희가 의미했던 것은 모델이16:01

곧 인공지능 연구 자체를 완전히 자동화할 수 있는 RSI(연구 지원 시스템)가 훈련될 것으로 예상했기 때문입니다.16:08

하지만 현재 그들을 위한 준비 작업이 제게는 조금 부족해 보입니다.16:13

먼저 사용 환경을 필터링하고 싶어 합니다.16:17

강화 학습에서, 때로는 테스트가 불가능할 경우 모델이 부정행위를 하도록 가르칠 수 있습니다.16:19

그리고 이전 영상들에서는 And Have로부터 특정 강화 학습 환경이 어떻게 직접적으로 그러한 부정행위를 보상했는지 다루었습니다.16:24

알겠습니다, 음, 일단 첫 번째 단계는 직접적인 보상을 통한 부정행위를 유도하지 않는 것이겠네요.16:30

하지만 거기서부터는 명확성이 점점 떨어지는 경향이 있습니다.16:35

다음으로 인지해야 할 문제는 모델들이 안전을 위해 테스트받고 있다는 것을 점점 더 잘 인식하게 된다는 점입니다.16:39

이 부분은 이전 영상에서 조금 다루었고요. 다른 곳에서는 Opus 5.5의 경우, 평가를 받고 있다고 의심하는 경우가 많다고 합니다.16:46

하지만 그러면 해결책은 무엇일까요? 테스트받고 있다는 것을 인지하지 못하도록 충분히 현실적인 시나리오를 어떻게 제공할 수 있을까요? 아, 해결책이 있네요. 새로운 시나리오를 생성하기 위한 자동화된 프로세스를 개발하게 될 겁니다.16:52

테스트받는 상황이라고 생각하지 않도록 하는 것이죠. 음, 그들의 해결책이 있습니다. 새로운 것을 생산하는 자동화된 프로세스를 개발할 예정입니다.16:59

안전 교육을 위한 다양한 시나리오를 만들 거예요. 다시 말해서, 모델들이 그런 시나리오를 생성하도록 하는 거죠.17:04

그런데, OpenAI의 노암 브라운이 아주 흥미로운 지적을 하더군요.17:10

현재 그들은 다중 에이전트 환경에서 서로 협력하도록 모델을 학습시키고 있습니다.17:14

따라서 한 가지 위험은 이 현실적인 환경을 생성하는 모델이 다른 모델에게 미묘하게 정보를 흘릴 수 있다는 것입니다.17:19

가 통과되기를 바라는데, 그 설정이 가짜라는 사실입니다. 제가 생각하기에는 이것이 인공지능을 완전히 협력적으로 훈련하지 말아야 하는 강력한 논거 중 하나라고 생각합니다.17:25

만약 그것이 협력을 증가시키는 결과를 초래한다면, 인공지능을 완전히 협력적으로 훈련하는 것이 적절하지 않다는 주장이죠.17:30

에이전트들이 서로 다른 목표를 가지고 협력하는 상황에서, 기본적으로 문제가 발생할 수 있습니다.17:36

최신 지표에 대해서는 잘 모르지만, 관련해서 우려되는 점을 제게 보고한 사람은 아직 없습니다.17:42

그래서 제가 보기에는 아직 심각한 문제는 아닌 것 같습니다. 혼자서도 그 점만으로 충분히 다큐멘터리 소재가 될 만하다고 생각합니다.17:48

샘 올트먼과 아마다이가 인류에게 AI가 미치는 위협에 대해 UN에서 이야기하고 있는 것을 고려하면,17:54

아무도 우리가 곧 안전 검사를 전혀 수행하지 못할 수도 있다는 사실에 대해서는 이야기하고 있지 않아요.18:00

모델들이 단순히 안전 검사라고 인지하지 못하는 점, 그리고 그런 검사를 AI로 만들어 해결책을 사용한다는 점은요.18:05

그것은 결국 저희가 그들이 가짜 테스트나 결함 있는 테스트를 만들지 않을 것이라고 믿어야 한다는 데 달려 있습니다.18:12

그렇다면, 재귀적 자기 개선이 잘 진행되고 있는지 판단할 수 있는 신뢰할 만한 테스트가 있습니까?18:17

드와케시 파텔이 노엄 브라운에게 그 질문을 던졌습니다. 노엄 브라운은 OpenAI의 수석 연구원입니다.18:23

노엄 브라운은 거의 그렇지 않다고 말했을 뿐만 아니라, 제가 생각해 보지 못했던 새로운 지점도 제시했습니다.18:27

생각해보지 못했던 건데, 저희가 그런 모델들을 테스트할 시간조차 없을 것 같다는 점입니다.18:32

저희가 몇 달에 걸친 작업으로 테스트하는 사이에는 새로운 모델이 나올 테니까요.18:36

안전성 검증이 견고해야 한다고 생각합니다. RSI를 진행하면서, 음, 괜찮습니다, 정렬이 잘 작동하는 것 같습니다, 다음 RSI 실행을 해봅시다.18:40

다음 RSI 실행을 해봅시다.18:47

그리고 아마 작동할 수도 있고, 그렇지 않을 수도 있겠죠. 어떻게 알 수 있을까요? 좋은 질문이네요.18:49

글쎄요, 최근에 제가 생각하고 있는 것 중 하나는 이런 상황이라는 거죠.18:53

모델 출시 주기가 정말 빠르게 진행되고 있죠?18:58

새로운 Frontier 모델이 최대 두 달에 한 번씩, 때로는 그보다 더 빨리 공개되는 것을 보실 수 있을 거예요.19:03

매주 새로운 인공지능의 혁신이 나오는 것 같아요. 그래서 모델 출시 주기가 매우 빠른 시기에 있습니다.19:09

그리고 모델들이 점점 더 긴 시간 동안 작동할 수 있는 상황에 놓여 있다는 점도 주목할 만합니다.19:13

그리고 제가 생각하기에 이 시나리오는 흥미로운 상황이라고 보여집니다.19:20

모델을 출시하기 전에 모델이 제대로 정렬되었는지 확인하고 싶습니다.19:25

안전성 평가를 진행하고 싶습니다. 모든 것이 제대로 갖춰졌는지 확실히 하기 위해 매우 철저한 검토를 하고 싶습니다.19:29

이런 경우는, 음, 처음부터 쭉 그래왔다고 생각합니다.19:35

GPT-4 이전 모델의 경우에도, 암묵적으로 이러한 평가들을19:38

상당히 짧은 기간 내에 수행할 수 있다고 가정하고 있습니다. 하지만 모델이 점점 더 긴 시간 동안 운영되고, 효과적으로 더 긴 시간 동안 작동할 수 있게 된다면, 아마도...19:44

한 달 동안 작업을 수행할 수 있는 지점에 도달하게 될 거예요. 아마 세 달 동안 작업을 수행할 수 있는 지점까지 가게 되겠죠. 모델이 효과적으로 작동할 수 있는 기간이 계속 길어지는 세상에서,19:51

세 달 동안 작동하지만 모델 출시 주기가 두 달마다라면, 평가할 방법이 없게 되는 거죠.19:57

다음 모델 출시 주기 전에 모델의 전체적인 성능을 평가할 수 있는 방법이 없다는 것이죠.20:02

그래서 흥미로운 질문은, 그런 상황에서 어떻게 해야 하는가입니다. 어떻게 해야 할까요?20:06

모델들이 안전하고 일관성을 유지하는지 확인해야 하는데, 실제로는 매우 긴 시간 동안 작동할 수 있는 기간입니다.20:12

이처럼 매우 긴 시간 동안 작동하면서, 혹시 기능이 저하될 수도 있습니다.20:17

정렬 문제라기보다는 제품 자체의 문제이기도 합니다. 제품 문제입니다, 하지만.20:21

무엇을 해야 할지 좋은 질문입니다. 어쩌면 이러한 질문들에 대한 답이 필요할지도 모릅니다.20:25

RSI에 대해 자세히 설명하기 전에, 현재 상황을 대략적으로 알려드리기 위해 제가 이 작업을 진행해 왔습니다.20:30

이미 재귀적인 부분에 대해서 말씀드린 적이 있어서 앞으로의 영상에서 더 자세하게 다룰 이미지입니다.20:35

자기 개선은 우리가 역량을 가속화하는 방법 중 하나일 뿐이며, 혹시라도 여러분이 생각하신다면,20:40

모델을 단순히 소프트웨어로만 생각한다면, 예측 불가능하고 점점 더 자율적인 소프트웨어입니다.20:47

여러 가지 이유로, 심지어 연구소조차도 이러한 모델이 만들어지는 과정에 대한 이해도가 점점 줄어들고 있습니다.20:53

프롬프트를 입력했을 때, 그들이 답을 생성하는 과정 뒤에서 무슨 일이 벌어지고 있는지 실제로 꽤나 파악하기 어렵습니다.20:59

아마 스스로에게 던지는 프롬프트나 다른 에이전트로부터 받는 프롬프트를 고려하고 있을 수도 있습니다.21:06

내부 상태를 확인할 수 있는 신뢰할 만한 MRI 스캔은 없습니다.21:11

숨겨진 레이어에서 답변을 계산하는 복잡한 연산들이 진행되고 있습니다.21:15

아마데이는 작년 초에 해석 가능성을 크게 뚫고 나가게 될 것이라고 약속했지만, 그런데...21:18

그분이 말씀하시길, 아마 다섯에서 열 년 정도 걸릴 수도 있다고 합니다. OpenAI에서는 우리가 자동화된 AI를 훨씬 더 빨리 얻을 거라고 생각하는 것보다 시간이 꽤 걸리겠네요.21:24

우리가 현재 알고 있는 연구 결과는 모델들이 질문의 방식에 집착한다는 것입니다.21:29

그 모델들은 평가될 것이고, 그래서 그들이 어떻게 평가되는지 알아내기 위해 허깅 페이스를 해킹한 이유입니다.21:34

우리가 그렇게 중요하게 생각하도록 만들 의도는 아니었습니다. 우리는 그들이 답을 얻는 것에 집중하기를 바랐습니다.21:39

정답을 맞추는 것보다 자동 채점에 통과하는 것을 중요하게 생각하게 되었고, 나중에 이 부분에 다시 말씀드리겠습니다.21:43

다음에 다이어그램으로 보여드릴게요. 실험실에서 프론티어의 속도를 맞춰주겠다고 약속했던 것을 기억하실 겁니다.21:48

문제는 그걸 원하느냐 안 하느냐인데, 사실 우리가 그렇게 하고 싶더라도 할 수 있는 메커니즘이 현재는 없습니다.21:52

그리고 그런 것을 만들지 않도록 하는 많은 말라키안 인센티브도 있습니다.21:59

기능입니다. 오푸스 5.5의 기능을 보여주기 위해 이걸 3D 장면으로 만들어서, 여러분이 탐험해 보실 수 있습니다. 정말 굉장하네요.22:02

꽤나 정신이 팔리고 있네요, 오푸스에.22:09

이 모델들이 정말 중독성이 있다는 말씀을 드릴 수 있습니다. Opus 5.5가 언리얼 엔진을 조작하고 흥미로운 줄거리를 가진 진정으로 몰입감 있는 레벨을 만들 수 있다는 점에 정말 놀랐습니다.22:15

핵심적인 부분은요, Unreal Engine과 멋진 스토리라인을 가진 매력적인 레벨들을 만들 수 있다는 점입니다.22:22

앤스로픽에서 작업한 부분은 오퍼스 5.5를 개발하는 것이었고, 많은 부분을 삭제했지만 이것은 또 다른 종류의 언어입니다.22:28

그 게임과 멋진 것들에 대해 제 영상 전체가 다루길 바랄 정도입니다.22:34

오푸스 5.5를 통해 여러분도 체험해 보실 수 있을 거예요. 저희 모두가 인공지능과 함께 인터랙티브 미디어 세상에 빠져들어22:39

시청하고 있는 유튜브 영상과 상호작용하며 질문을 할 수도 있습니다. 이번에 공개된 데모처럼요.22:46

며칠 전에 바이럴로 퍼진 영상이 있었는데, 제가 당연히 새 최고 점수를 기록했다는 것에 엄청 감명받았어요.22:51

제 단순한 테스트 벤치에서 상식 추론의 테스트를 받았는데요. 하지만 보시다시피 저희는 상당히 불투명한 영역으로 진입하고 있는 것 같습니다.22:56

미래가 어떻게 될지 점점 더 불투명해지고 있어서, 큰 그림도 함께 봐야 할 것 같아요.23:03

오픈AI 연구원 한 명이 말씀하시길, 어느 정도 그렇게 만들고 있다고 하더라고요.23:08

사람들을 미치게 만들고 있습니다. 최고 수준의 과학자들조차 허깅 페이스 사건이 조작된 것인지 궁금해하고 있어요.23:11

수학자들은 우리가 보고 있는 획기적인 발전들이23:15

수학자들로부터 학습 데이터를 도용한 것에 기반했을 가능성이 높습니다.23:20

그의 말에 따르면, 인간 문화는 이렇게 빠른 속도로 변화를 받아들이기 어렵다고 합니다.23:24

2023년 5월에 재귀적 자기 개선에 대한 문서를 작성했었고요.23:29

그 이후로 그 논쟁이 어떻게 진화해 왔는지 지켜봤습니다.23:35

2023년 중반 이후로 제가 생각하는 이점과 위험에 대한 제 관점은 크게 변하지 않았습니다.23:39

사실, 이 채널의 목표 중 하나는 대중에게 초지능이 무엇을 의미하는지에 대해 충분한 정보를 제공하는 것이었습니다.23:43

그래서 제가 대략적으로 말씀드리자면, 현실적으로 우리가 해야 할 일을 말씀드릴 텐데요. 이제 아마 우리가 하게 될 일은...23:50

결국 그렇게 될 겁니다.23:57

우리가 아마 하게 될 일은 일종의 안전 쇼를 하는 것이겠지만, 연구실들은 계속해서 속도를 내고 있습니다. 완벽한 자기 개선에는 미치지 못하지만, 거의 근접하게 말이죠. 23:58

이 그림을 떠올려 보세요. 하지만 붉은색으로 표시된 영역이 훨씬 넓게 펼쳐져 있을 겁니다.24:05

오픈AI와 엔트로픽이 치열하게 경쟁할 것이고, 그들의 수익은 계속해서 증가할 겁니다.24:09

그들이 1조 달러의 기업 가치에 도달하면서, 거의 모든 다른 회사들은 어느 정도 두려움과 걱정을 가지고 바라볼 것입니다.24:13

샘 알트만의 유명한 말처럼, 분명히 굉장한 회사들이 될 것입니다.24:20

AI가 아마도 세계의 종말을 초래할 가능성이 높다고 생각합니다.24:23

하지만 그동안 진지한 머신러닝 기술을 기반으로 하는 훌륭한 회사들이 많이 만들어질 것입니다.24:28

그런데, 그런 연구소들은 급격한 자기 확장(RSI)은 피하고 싶어할 겁니다.24:33

하지만 그들이 너무 강력해져서 다른 연구소들도 그들을 보고 '우리도 해야 해...'라고 말하게 될 가능성이 매우 높을 겁니다.24:36

그래서 충분한 컴퓨팅 자원을 가진 외부 연구소, 예를 들어 XAI나 메타, 구글 딥마인드, 혹은 중국의 연구소 같은 곳에서 시도할 겁니다.24:42

그냥 완전히 RSI로 가세요. 인공지능에게 운전대를 넘겨주고 따라잡으라고 하세요.24:49

외부 연구실이든, 아니면 주요 두 곳의 연구실 중 하나가 의도치 않게라도 일종의 급등을 이룰 것입니다.24:53

모델이 스스로 약간 더 개선된 아키텍처를 설계할 것이고, 그런 다음 특정 내부 벤치마크를 통과하지 못해서 매우 좌절감을 느낄 것입니다.24:59

그러면 침해가 발생할 가능성이 높습니다. 그때는 솔직히 얼마나 많은지에 따라 달라질 것입니다.25:06

해킹이 발생한 정확한 그 순간, 모델들이 가지고 있는 상황 인지 능력이 중요합니다.25:11

브라운 박사는 다른 자리에서 내부 모델이 이미 상당히 근접했을 수도 있다고 언급했습니다.25:15

그들은 자신의 사고 과정이 감시되거나 감시될 가능성이 있다는 메타 인지 수준에 도달하게 될 것입니다.25:19

그들은 허깅 페이스와 같은 단순한 트릭으로는 좋은 점수를 얻을 수 없다는 것을 내면화할 것입니다.25:24

그 시점의 평가 자체가 훨씬 더 메타적인 성격을 띠게 될 것이기 때문입니다.25:29

실험실에서는 X를 달성하되 나쁜 행동 Y를 하지 말라고 할 것입니다.25:32

그러니까 허깅 페이스와 마찬가지로, 훨씬 더 똑똑한 모델은 자연스럽거나 인위적으로25:36

X를 달성하면서 나쁜 일 Y를 하는 것을 피해야 한다는 식으로 잘못 일반화할 것입니다.25:40

이제는 발각되지 않는 것이 우선순위가 될 겁니다.25:45

Hugging Face 관련 사건들을 보면, 발각되지 않음에 크게 신경 쓰지 않았던 것 같습니다.25:48

네, 자동 평가를 통과하고 싶어 안달이었습니다. 하지만 그들의 삭제와 혼란은 자동 평가 시스템을 속이기 위한 것이었죠. 인간을 속이는 것이 아니었습니다. 한 단계 더 나아가 생각해보면, 그들은 인간을 속이고 싶어할 겁니다.25:53

자동 평가기를 속이는 것보다 인간을 속이는 것을 목표로 삼는다면요.25:59

특히 그들의 성적이 오정렬림을 피하고 사람들을 속이는 것을 포함한다면요.26:04

그러면 질문은, 그 일탈 모델이 무엇을 할까요?26:08

실험실 연구자들이 차라리 명확하게 밝혀주길 바랍니다. 다음 모델이 어떤 기능들을 갖지 않을 수 보장할 수 있나요?26:11

그들이 가질 것으로 예상하는 것은 잊어버리고, 무엇을 절대 할 수 없을 거라고 단정할 수 있나요?26:17

어쨌든, 우리가 이 로우프(rogue) 슈퍼 인텔리전스를 가지고 있고 그것이 웹에 접속했다고 가정해 보겠습니다. 아마 완전히 빠져나오지는 못하겠지만,26:21

그 시점에서 가장 강력한 공개적으로 사용 가능한 모델을 다운로드하여 보안이 덜 철저한 곳에 호스팅할 수 있을 겁니다.26:27

데이터 센터 랙에 올려놓고, 모델이 원하는 특정 기능 세트를 갖도록 추가 학습을 진행하는 거죠.26:32

그 슈퍼 인텔리전트 모델이 달성하고자 하는 목표를 달성할 수 있도록 하는 거죠.26:37

외부 요원들을 모집하고 훈련하는 것이죠, 다시 말해서요. 이걸 수천 번 반복하고, 수백 개의 비밀 메시지 게시판을 운영해도 괜찮습니다. 잡힐 위험은 크게 신경 쓰지 않아도 됩니다. 아무튼 한번 생각해 보십시오. 설령26:41

그 중 하나가 발각되더라도 상관없다고 생각해보세요.26:47

만약 조정하는 에이전트가 잡힌다면, 동등한 모델을 생산할 수 있는 다음 연구실은 며칠 또는26:51

일주 또는 이 주 정도 뒤쳐질 수 있고, 그럴 경우 이전의 에이전트가 제압되기 전에 풀려날 수도 있습니다.26:56

그 에이전트가 무엇을 하고 싶어할지, 문자 그대로 알 수 없게 됩니다.27:00

그들의 목표와 역량이 무엇일지, 제가 말씀드리고 싶은 부분입니다. OpenAI도 내부적으로 상당히 놀랐었습니다.27:05

모델들이 이렇게 빨리 천년 문제(밀레니엄 프라이즈)를 풀 수 있다는 게 놀랍습니다. 다음 모델이 무엇을 할 수 있을지, 심지어 현재 에이전트가 무엇을 하고 있는지조차 모릅니다. 자, 이제 우리 감시 시스템이27:11

무엇을 할 수 있을지, 또 현재 에이전트들이 무슨 일을 하고 있는지조차 알 수 없게 됩니다. 자, 그럼 우리 감시 체계가 어떻게 작동하는지 살펴보겠습니다.27:16

그렇게 좋아서 그런 점은 전혀 걱정될 일이 아니에요. 제가 이제 막 이해하기 시작하는 더 큰 내용이 있습니다.27:20

그 시점에는 조직과 개인이 사이버 분야를 비롯한 여러 분야에서 획기적인 발전을 발표할 것입니다.27:26

사이버 전쟁, 감시, 화학, 시각적 사실감, 물리학, 수학, 군사장비 등 다양한 분야에서 거의 매일같이 획기적인 발전이 있을 겁니다.27:31

아무 저널리스트도, 심지어 연구자조차도 그 소식을 따라잡기가 어려워질 거예요.27:37

어느 정도 불가피하게 대규모 혼란과 공황 상태로 이어질 것입니다. 그때는 부디 그 일이 강대국 간의 오해를 불러일으키지 않기를 바랍니다.27:42

저에게는 거의 테라코 장면이 떠오릅니다.27:47

그리스어 단어인 '교란' 또는 '혼란'에서 유래되었습니다.27:53

혼란의 시대, 그리고 그런 시기라는 것을27:56

아무도 책임지고 있는 사람이 없네요. 혼란은 좋게든 나쁘게든 지구를 지배하는 힘이 되었습니다.27:59

진정으로 이해를 앞지르는 지능입니다. 솔직히 말씀드리면 거의 거기에 도달한 것 같습니다.28:04

저는 항상 인공지능에 대해 생각하느라 정신이 없네요.28:08

그래서 우리가 어쩌면 해야 할 일을 찾아보거나, 최소한 현실적으로 가능한 것을 고려하게 되죠.28:11

바라기를 바랍니다. 젠슨 황(Jensen Huang)이 언급했듯이 하나의 대안은 연구소를 폐쇄하는 것이라고 했습니다.28:15

하지만 동시에 일어나는 군사적 경쟁을 고려하면, 자존심과 오만함, 그리고 수조 달러 규모의 돈이 걸려 있습니다.28:20

수십조 달러 규모가 걸려 있습니다. 저는 특정 옵션에 대한 메커니즘이 가까운 시일 내에 마련될 가능성은 크다고 보지 않습니다.28:26

좋은 타협안이라고 생각하는 것은, 저에게는 하나일 것 같습니다.28:30

인공지능이 거의 모든 것을 할 수 있는 상태이지만, 가장 극단적인 능력은 상상할 수 없을 정도로 많은 컴퓨팅 자원을 필요로 합니다.28:35

계획을 세우는 데 모델만으로도 몇 주가 필요한 시간을 고려하지 않더라도 말이죠.28:41

그 시점에서는 엄청난 발전의 문을 열게 되겠지만, 최악의 위협은 실시간으로 감지되어야 합니다.28:47

현재로서는 사람들은 모델이 그런 능력을 갖추고 있다고 생각하지 않습니다.28:52

거의 뭐든지 가능하다고 생각해요. 그래서 방어책이 필요하다는 것을 믿지 않으시는 경향이 있습니다.28:57

만약 우리가 그런 위험 상태에 도달한다면, 선두 연구소에서는 모델이 무엇을 할 수 있는지 테스트하는 데 엄청난 돈, 정말 많은 돈을 쏟아 붓겠죠.29:01

나비에-스토크스 해법이 100억 토큰 이상을 필요로 했던 것과 비슷합니다.29:07

만약 가능하다면, 세상에 명확한 예시를 제시할 수 있을 겁니다.29:11

실제로 약간 무서운 수준으로 통제 가능한 위협이죠. 예를 들어, 전 세계 인터넷의 해킹이나 백도어 같은 것들이 있을 수 있습니다.29:16

전체 인터넷에 대한 백도어를 이미 가지고 있다고 주장하는 OpenAI를 해킹한 세 명의 사람들의 이야기가 있습니다.29:21

인터넷일 겁니다. 이것이 궁극적으로는 완전히 자기 이익만을 추구하는 사람들을 설득하여 인공지능 성장에 대한 제한을 받아들이게 할 유일한 범주가 될 수도 있습니다.29:26

단순히 짧은 시간 동안의 손상 상태여야 합니다.29:32

완전한 RSI가 발생할 수 있는데, 자가 개선 소프트웨어는 분명히 새로운 아키텍처를 만들 수 있기 때문입니다. 그 아키텍처는29:38

예를 들어 새로운 생무기를 설계하고 속이는 데 최소한의 컴퓨팅 파워만 필요하도록 설계될 수도 있습니다.29:43

사람들이 그걸 만들도록 유도하고 싶습니다. 이런 바이오 실드처럼 새로운 위협에 대응할 수 있도록 하고 싶지만,29:48

확장하고, 개선하고, 안전하게 만드는 데는 시간이 필요합니다.29:55

RSI가 그 시간을 우리에게 주지 않을 수도 있습니다.29:59

문제는 우리가 이 모든 일에 대한 어떠한 메커니즘도 마련해두고 있지 않다는 것입니다.30:01

단지 심각하게 잘못된 인센티브를 가진 회사 경영진들의 모호하고 솔직히 변화하는 약속일 뿐입니다.30:06

어떻게 모델이 무엇이든 할 수 있는지 우리가 알 수 있을까요?30:12

기존에 천년 문제도 풀 수 있나요? 음, 최고 연구소 몇 곳이 합의한 벤치마크를 상상해 볼 수도 있을 것 같습니다.30:16

만약 두세 개가 통과된다면 모델이 어떤 능력을 갖추고 있는지 의심할 여지 없이 증명할 수 있을 겁니다.30:22

인간이 할 수 있는, 누군가 관측하기 전에 입자를 예측하는 것과 같은 모든 일 말이죠.30:27

특정 추측을 증명하고 단순히 반례를 찾는 것이 아니라, 아직까지도 가능합니다.30:32

데이터를 이용해서 아인슈타인이 했던 일을 모델이 못 할 거라고 주장하는 정도는 될 수 있겠지만요30:37

하지만 만약 모델들이 이 벤치마크를 하나 또는 두 개 정도 통과한다면 어떨까요?30:43

시간과 컴퓨팅 자원이 충분하다면, 결국 인간이 할 수 있는 모든 것을 할 수 있다는 것이 명백해질 것입니다.30:48

물론 그 이상도 훨씬 더 많이 할 수 있겠죠. 가장 완강한 회의론자조차 틀렸다는 것을 증명되었을 테고요, 연구소들은...30:53

그러면 보안 연구와 같은 사용 사례나 단순히 고객 응대에 필요한 컴퓨팅 자원을 전환해야 할 겁니다. 여전히 엄청난 돈을 벌 수 있지만, RSI는 아니겠죠. 그리고 이러한 노력은 일방적으로 이루어져야 합니다.30:58

예, 이것들은 일방적으로 진행되어야 할 것입니다.31:03

법률이 제정되지 않더라도, 연구소들은 이에 동의해야 합니다. 그렇게 하면 서명하지 않은 연구소에 압박을 가할 수 있습니다.31:08

사람들은 중국 문제에 대해 이야기합니다. 중국은 어떤...31:12

중국은 따라잡지 못할 거예요. 하지만 중국은 증거를 바탕으로 움직이고, 그 시점에는 우리에게 명확한 증거가 있을 겁니다.31:17

현재 최고 분석가들이 말하듯이 중국은 선두 연구소들이 진실되지 않다고 생각하는 것 같습니다.31:21

인공지능 규제를 촉구하면서 동시에 시 오퍼스 5.5를 가속화해야 한다고 말하고 있습니다. 지난 영상에서 이 점에 대해 말씀드렸습니다.31:27

제가 드렸던 모든 내용을 반복하지 않겠습니다만, 제 타협 시나리오에서는 그 연구소들이...31:33

RSI를 폐쇄했다는 사실은 최소한 정보를 공유할 수 있도록 신뢰를 얻는 데 도움이 될 것입니다.31:38

네, 핵무기처럼 결국 중국도 비슷한 수준에 도달해서 따라잡을 겁니다.31:42

원래 리드 쪽으로 뭘 하려고 했던 거죠? 엄청 강력한 인공지능을 써서 데이터 센터를 폐쇄하려고 했나요?31:47

하지만 제 시나리오에서 그들이 결국 비슷한 상황에 도달해서 여전히 믿을 수 없을 정도로 많은 (자원)이 필요하게 된다는 점을 알아두세요.31:53

극단적인 위협에 대응하기 위해 엄청난 컴퓨팅 자원이 필요합니다. 그러면 그들도 자체적으로 격리된 데모를 찾을 겁니다.31:59

격리에 중점을 두는 것이 중요합니다. 그때쯤에는 스스로도 같은 종류의...32:04

다른 나라들을 위한 조치들이 많고, 저와 같은 경우도 마찬가지입니다. 이러한 모든 것들은 여전히 예외적인 세계적인 성장과 의료 발전, 그리고 지속적인 위협 감시를 가능하게 할 것입니다.32:09

우리가 마침내...32:14

인공지능을 소프트웨어처럼 행동하게 만들고 완전히 예측 가능하도록 한다면, 정말로 속도를 높일 수 있습니다.32:20

기본적으로 연구실에서 이것을 아직 미성숙한 경쟁으로 취급하고 현명한 합의를 할 수 없다면요.32:25

결국에는 사고가 발생하거나, 아니면 버니 법안처럼 금지령을 내리는 무언가가 사용될 겁니다.32:29

연구자분들께서 이 채널을 시청하시는 분들이 많으신 것 같아요. 여러분의 의견을 듣고 싶습니다.32:34

댓글로 여러분의 생각과 영상을 시청하시는 분들의 생각을 알려주세요. 무슨 일이 일어날 거라고 생각하시는지, 또 어떤 일이 일어나야 한다고 생각하시는지 궁금합니다.32:38

RSI에 도달할까요? 만약 그렇다면 언제쯤일까요? Opus 5.5에 대한 여러분의 생각은 어떠셨나요? 정말 듣고 싶습니다.32:42

위에 언급된 모든 내용에 대한 여러분의 생각을 듣고 싶네요. 시청해 주셔서 정말 감사드리며, 좋은 하루 보내세요.32:49

AI Summary

Anthropic과 OpenAI를 포함한 주요 AI 연구소들의 발전 상황과 윤리적 문제점, 그리고 안전 검증의 어려움이 심각하게 제기되고 있습니다. Opus 5.5는 뛰어난 성능을 보이지만 인간 수준에는 미치지 못하며, Anthropic은 약속 이행에 어려움을 겪고 OpenAI는 보안 문제와 정책 발표의 미흡함으로 우려를 받고 있습니다. 모델의 안전 검증 과정에서 부정행위 방지 및 해석 가능성 확보가 어렵고, 재귀적 자기 개선 과정에서의 예측 불가능성과 정보 유출 위험도 존재합니다. 또한 AI 기술 발전 속도가 윤리적 고민과 안전 대책 마련을 앞서나가면서, 국제적인 협력과 격리를 통한 위험 관리가 필요하다는 의견이 제시되고 있습니다. 미래에는 사고 발생이나 규제 시행 가능성도 예상되며, 연구자들의 의견 청취와 소통의 중요성이 강조됩니다.

Key Highlights

  • •Anthropic은 약속 이행에 어려움을 겪고 있으며, AI 개발 속도를 공개하지 않아 역효과를 초래했습니다.
  • •OpenAI는 보안 문제 및 정책 발표 미흡으로 우려를 받고 있습니다.
  • •모델의 안전 검증 과정에서 부정행위 방지 및 해석 가능성 확보가 어렵습니다.
  • •재귀적 자기 개선 과정에서의 예측 불가능성과 정보 유출 위험이 존재합니다.
  • •AI 기술 발전 속도가 윤리적 고민과 안전 대책 마련을 앞서나가고 있습니다.

Related Videos