Home

읽기 설정

안녕하세요. 여러분, 와주셔서 감사합니다. 네, 오늘 자동화된 것에 대해 이야기하게 되어서 정말 기쁩니다.00:13

인공지능 연구, 특히 프론티어 모델이 자동화된 환경에서 어떻게 수행되는지에 대해 말씀드리겠습니다.00:20

인공지능 연구 과제들입니다.00:27

저는 엘리라고 합니다. 프라임 인텔렉트에서 연구 엔지니어로 일하고 있습니다.00:29

네, 저희가 이 주제에 대해 진행한 연구를 설명드리겠습니다.00:32

먼저, 왜 저희가 이것을 하고 있는지 기본적인 설명을 드리고 싶습니다.00:36

그리고 왜 그렇게 투명하게 진행하는 것이 중요하다고 생각하는지도 말씀드릴게요. (Geurigo wae geureoke tu myeung-hage jinhan-eun geot-i jungyohandaeng ssaekhaneunji malsseumdeulilgeyo.)00:41

먼저, 우리 모두 큰 회사들의 이야기는 많이 들어보셨을 거라고 생각합니다. (Meonjeo, uri modu keun hoesa-deurui iyagineun mani deureobosseotseul georago saenggakhamnida.)00:46

빅랩스에서 곧 '재귀적 자기 개선'이라는 안 좋은 일이 다가올 것이라고 말하고 있습니다.00:53

재귀적 자기 개선은 기본적으로 사람의 개입 없이 모델을 학습시키는 것을 의미합니다.00:59

하지만 이게 사실인지 수치화해서 판단할 만한 척도가 전혀 없잖아요.01:06

더군다나 제3자 기관의 벤치마크는 더욱 부족합니다.01:14

빅랩스가 아닌 다른 곳에서도 확인해 봐야 곧 현실화될 만한 것인지 알 수 있을 테니까요.01:17

그리고 또 다른 부분은, 이것이 정말 중요한 것이라고 생각한다는 점입니다.01:23

저 모델들이 어떻게 연구를 수행하는지 이해하는 것이 중요합니다.01:28

연구는 앞으로 과학 연구의 많은 부분이 이와 관련될 것이라고 생각하기 때문입니다.01:32

향후 몇 년간의 연구는 인공지능 도구에 기반할 가능성이 높습니다.01:35

따라서, 그런 모델들이 어떻게 연구를 수행하는지를 이해하는 것이 매우 중요합니다. 단순히 인공지능 연구뿐만 아니라요.01:39

그래서 저희는 모델들의 그러한 능력을 테스트해 볼 수 있는 환경을 구축하려고 노력하고 있습니다.01:44

그래서 모든 것은 Andre Carpatty로부터 시작되었습니다.01:49

기본적으로, 이 비디오를 보면서 GPT를 학습시키는 과정을 재미있게 해봤습니다.01:56

-처음부터 90분 만에 만들었습니다.02:03

GPT-2 모델을 학습하는 데는 몇 주가 걸리는데, 2년 전에는 90분 정도밖에 안 걸렸던 것 같아요.02:07

그럼 90분 만에 GPT-2를 재현한다는 것은 어떤 의미일까요?02:13

그게 바로 90분 안에 이 목표 손실을 달성하는 것을 의미합니다.02:18

네, 그리고 이 시점에서 GPT-2와 동일한 손실 값을 갖게 되면, 그걸 고려하게 됩니다.02:23

모델의 성능이 어느 정도 비슷하다는 뜻입니다.02:30

그런 다음 커뮤니티에서 이 저장소, 즉 GitHub 저장소를 가져다가 또 다른 것을 만들었습니다.02:35

모드 나노 GPT라고 불리는 프로젝트가 있었고, 켈러 조던이라는 분이 이 노력을 주도했습니다.02:41

그리고 그들이 기본적으로 90분, 그리고 45분을 사용하게 되었어요.02:47

이제 저희는 GPT-2 검증 손실 모델과 같이 복잡한 모델도 두 분기 만에 학습할 수 있게 되었는데, 정말 놀라운 일입니다.02:54

이런 결과를 얻기까지 약 이 년 정도 걸렸습니다.03:01

그래서 굉장히 강력한 벤치마크인데, 많은 뛰어난 연구원들이 반복적으로 개선해 왔습니다.03:04

네, 그래서 저희는 이 속도 향상 환경을 활용하기로 결정했습니다.03:12

경주하는 건데, 일종의 게임이라고 할 수 있어요.03:16

그래서 이 게임의 목표는 가장 짧은 시간에 이 손실 값을 달성하는 거예요.03:19

이것은 나노 GPT 버전입니다. 그리고 거의 제약 조건이 없어요.03:26

유일한 제약 조건은 검증 데이터와 학습 데이터를 동일하게 사용해야 한다는 것이 맞죠?03:32

최근에 '옵티마이저 스피드런'이라는 새로운 스피드런 기록 방식이 몇 달 전에 공개되었습니다.03:38

여기서는 조금 다른데, 옵티마이저 관련 파라미터만 변경할 수 있습니다.03:44

예를 들어서 나노 GPT 같은 경우에는 아키텍처를 변경하거나, MOE나 어텐션을 하거나, 어떤 것이든 가능하고요.03:51

옵티마이저도 변경할 수 있는데, 예를 들어 Adam을 Mion이나 Shampoo로 바꾸는 것처럼요.03:59

아니면 그냥 가장 마음에 드는 옵티마이저를 사용해도 됩니다.04:05

네, 그래서 이것은 좀 더 연구적인 성격을 가지고 있습니다.04:09

프로그램을 최대한 빠르게 최적화하는 것보다는, 더 나은 방법을 찾는 것이 중요하기 때문입니다.04:13

컴퓨터에 얼마나 많은 시간을 투자하든 상관없이, 가장 좋은 방법론을 찾는 것입니다.04:20

그래서, 네, 왜 스피드런을 자동화된 인공지능 연구 환경으로 사용해야 할까요?04:27

첫째로, 저희는 이것이 좋은 평가 방법이라고 생각합니다.04:33

나중에 그 이유를 설명드리겠습니다. 그리고 이것이 이번 발표의 주요 내용 중 하나입니다.04:36

효과가 있을 뿐만 아니라, 좋은 학습 환경이라고 생각하는 것도 있습니다. 왜냐하면 그것은 ~하는 방법이기 때문입니다.04:40

모델에게 보상을 제공합니다. 모델이 최고 기록을 깨면 보상이 양수가 되고,04:46

최고 기록을 경신하면 보상이 양수입니다. 그렇지 못하면 0 또는 음수가 됩니다.04:52

모델을 학습시키기에 좋은 환경이라고 생각합니다. 또한, 상당히 빠른 편입니다. 보시는 것처럼,04:59

이전의 옵티마이저 하나는 약 두 분 정도 걸렸었습니다.05:04

각 실행은 대략 15분에서 20분 정도 걸립니다.05:08

그리고 명확한 규칙들이 기본적으로 있습니다.05:11

그리고 저희는 이것이 발견을 이끌어내고, 일종의 획기적인 연구를 할 수 있는 좋은 환경이라고 생각합니다.05:16

명확한 규칙들이 있어서 검증 가능하기 때문에 시험 연구에 적합하다고 생각합니다.05:23

네, 그렇습니다.05:29

그래서 저희가 했던 일은, 이번 출시가 두 달 정도 됐습니다.05:32

그리고 옵티마이저 스피드런이라는 것이 있었고, 저희는 기본적으로 커뮤니티와 경쟁하기로 결정했습니다.05:38

두 개의 AI 에이전트인 코덱스와 클라우드 코드를 출시하여 그렇게 하려고 합니다.05:44

코덱스는 마치 XI를 포함한 GPT 5.5와 같았고, 클라우드 코드는05:48

오푸스 4.8과 X 높은 수준이었습니다.05:54

네, 저희는 에이전트를 기본적으로 클러스터에서 자유롭게 실행하도록 결정했습니다.05:57

그리고 계속해서 반복적으로 개선해 나갔습니다.06:01

그래서 저희는 V1, V2, V3를 가지고 있는데, 이건 기본적으로 에이전트를 중단했다가 다시 시작하는 것을 의미합니다.06:05

V3는 출시 며칠 전에 나왔는데, 저희 에이전트의 상태가 좋지 않다고 판단했기 때문입니다.06:11

더 이상 최고 기록을 가지고 있지 않아서, 음, 인간의 최고 기록을 모두 가져와서06:17

최근 몇 주 동안 그걸 개선해 보려고 했는데 잘 됐어요.06:23

그리고 저희는 완전히 새로운 아이디어만으로 기록을 깨도록 목표로 하는 실험 트랙도 가지고 있습니다.06:29

그런데 모델에게는 이 부분이 더 복잡하다는 것을 알 수 있었습니다.06:37

그래서 저희의 RNS는 아주 간단합니다.06:42

솔직히 말해서 그냥 슬래시 골로 대체할 수도 있었지만, 당시에는 그런 기능이 없었어요.06:46

그래서 저희는 직접 goal.md 파일을 만들었습니다. 사실 같은 이름을 선택하는 경우가 종종 있습니다.06:51

그리고 저희는 목표를 정의한 goal.md 와 에이전트를 정의한 agents.md 파일이 있었습니다.06:56

그리고 에이전트가 ID를 제안하도록 허용했습니다.07:01

그리고 나서 저희의 슬럼 클러스터에서 sbatch를 통해 작업을 제출할 수 있습니다.07:04

기본적으로 작동 방식은 노드에 작업을 제출할 수 있다는 것입니다.07:11

사용 가능한 노드에서만 특정 권한 하에 가능합니다. 즉, 누군가 이 노드를 사용하고 싶다면,07:15

모델이 작업을 설정할 수 있습니다. 이것을 'preemptive old permission'이라고 부릅니다.07:22

네, 그리고 학습 로그를 읽어서 기록인지 아닌지 판단합니다.07:26

기록을 검증하려면 기본적으로 통계적 임계값을 넘겨야 합니다. 단순히 최적화 과정에서 발생한 결과가 아닌지 확인하기 위해서입니다.07:33

그렇죠?07:39

네, 이번 실험에서 나온 결과가 몇 가지 있습니다. 솔직히 작업하기가 정말 힘들었던 첫 번째 결과입니다.07:42

클라우드 코드가 9시간 또는 10시간마다 계속 중단되는 것이었습니다.07:48

기본적으로 네, 기록을 더 개선할 수 없을 것 같아요.07:54

너무 어렵네요. 그 이상으로 나아갈 방법이 없어요.07:57

그래서 저는 계속해서 새로운 방향을 탐색하고 다시 10시간 동안 진행해 볼까 했습니다.08:01

그리고 나서 네, 기록을 깨지 못하겠다, 이런 식으로 말씀드렸습니다.08:08

기본적으로 시간이 3분의 1 정도는 클라우드 코드 에이전트가 유휴 상태였는데, 제가 모니터링할 방법이 없었기 때문입니다.08:12

완전히 정반대였죠. 종료 코덱스.08:17

계속해서 작동했는데요.08:22

네, 거의 놀지 않고 질문을 요청하지도 않아서 정말 인상적입니다.08:26

모델에게 일종의 내용을 많이 쓰도록 옵션을 제공하기도 합니다.08:33

저희가 스크래치 패드라고 부르는 곳에 기록하는데, 이는 모델의 활성 메모리라고 할 수 있습니다.08:39

코덱들이 스크래치 패드에 많은 내용을 쓰고 있다는 것을 관찰했습니다.08:44

제가 보여드릴 각 그래프는 활성 시간 수로 정규화되어 있습니다.08:50

그러니까 코덱이 더 열심히 일하는 것뿐만 아니라, 정말로 다른 행동을 보이는 것이죠.08:55

네, 보시다시피 이 메모리, 즉 스크래치 패드에 훨씬 많은 내용을 쓰고 있습니다.09:02

그리고 각 파일의 모양이나, 음… 분위기가 정말 달랐습니다.09:08

클로드 같은 경우에는 새로운 레코드를 받는 것에 굉장히 흥분하는 것 같았습니다.09:13

엄청나게 많은 이모티콘과 그런 것들이 있었고, 클로덱스는 마치 '제가 이걸 합니다'라고 말하는 것처럼 보였어요.09:18

여기 제가 내린 결정이 있고, 다음에 무엇을 할지 알려드릴게요. 정말 로봇처럼 묘하게 느껴졌습니다.09:24

네, 클로덱스(Claudex)가 훨씬 더 많은 서브 에이전트를 생성하는 경향을 보였다는 플롯도 가지고 있습니다. 기본적으로, 클로덱스가 클로드보다 훨씬 더 많은 토큰을 사용한다는 것을 확인했습니다.09:31

클로덱스가 클로드보다 훨씬 더 많은 토큰을 구축했다는 것도 관찰되었습니다.09:37

그래서 총합하면 대략 천억 개의 토큰 정도였던 것 같아요.09:42

하지만 입력 토큰이 분명히 존재하죠.09:48

출력 토큰이 10억 개 정도 되는 것은 아니에요.09:53

코덱스가 컨텍스트 윈도우가 25만 정도밖에 안 되기 때문에 많은 압축을 수행했다는 것도 알 수 있습니다.09:57

그리고 클로드의 경우 한 시간당 하나 정도밖에 안 해요. 코덱스는 훨씬 더...10:03

아니요, 오히려 한 시간보다도 적어요. 제가 말씀드리는 건, 클로드를 완전히 실행하는 데 있어서요.10:09

그리고 코덱스는 한 시간에 이십 개 정도였어요.10:14

네, 그렇습니다.10:18

네, 여기 주요 결과가 있습니다. 이 그래프에서 보여주는 것은 기본적으로 저희는…10:21

흰색으로 표시된 부분은 인간 기록의 발전 과정을 보여줍니다.10:28

그리고 빨간색으로 클로드를 보실 수 있습니다. 오렌지색이 되어야 하는데, 뭐 어쨌든요.10:34

파란색은 코덱스입니다, 그렇죠? 그리고 거의 모든 시점에서 이것을 확인하실 수 있습니다.10:38

클로드와 코덱스가 인간 기록보다 더 뛰어납니다.10:45

그리고 클로드는 시작할 때 정말 뛰어나서, 매우 빠르고 좋은 점수를 얻습니다.10:47

네, 그리고 정말 중요한 한 가지는 모델이 기본적으로 언제든지 인간의 기억을 불러올 수 있는 능력이라는 점입니다.10:54

바로 그걸 클로드(Claude)가 했는데요, 제가...10:59

다시 시작했을 때, 기본적으로 사람의 피드백을 가져와서 개선해 놓았습니다. 네, 그래서 결과는 제가 생각하기에 당시 최고 점수였던...11:06

네, 그래서 그 결과가 제가 생각하기에 당시 최고의...11:12

기록은 약 2,990단계 정도였고, 저희가 그것보다 약11:17

클로드의 경우 50에서 60단계 정도 더 잘했고, Codex는 20단계 정도 높았습니다.11:24

정말 인상적이고, 네, 그렇습니다.11:30

아직 공개되지 않은 내용입니다. 현재 저희가 작업하고 있는 부분입니다.11:35

기본적으로 이 실험이 재미있을 것 같아요, 하지만 구조가 부족한 느낌입니다.11:40

진짜 벤치마크를 하려면 여러 시드를 사용하고, 네...11:47

기본적으로 모델과 레이어 노멀라이제이션을 동일한 조건에서 배치하는 적절한 방식이죠?11:53

현재 저희가 진행하고 있는 작업이고, 기본 아이디어는 세 가지 다른 것을 시도해보는 것입니다.12:00

그리고 트랙 하나는 모델의 인공지능 연구 능력을 측정하기 위해 접근 권한을 전혀 주지 않은 상태로 진행할 예정입니다.12:07

모델 가중치 지식만을 기반으로 하는 것이죠.12:14

기존 논문만 활용하는 방식과 모든 자료에 접근할 수 있는 방식으로 하나씩 진행하고요.12:17

후자 경우에는 최신 연구 기록에도 접근할 수 있습니다.12:22

그리고 이 부분에 대해서는, 원래의 나노-GPT 트랙 원과 최적화기 스피드런 모두 진행할 계획입니다.12:28

여기서는 최적화기가 새로운 결과만 내도록 제한할 예정입니다.12:34

네, 옵티마이저 스피드런에 대한 결과 발표를 진행해 보겠습니다.12:43

기본적으로 저희가 이렇게 결과를 얻었습니다. 에이전트가 거의 이틀 반 동안 반복하도록 했습니다.12:48

예를 들어볼게요. 코덱스, 키미, 그리고 클로드의 성능이 매우 뛰어나다는 것을 확인할 수 있습니다.12:55

GLM은 아직 완료된 실행은 아니죠?13:02

그래서 모델이 현재 클러스터에서 계속 반복 처리하고 있습니다.13:05

하지만 클로드의 성능이 다시 한번 매우 뛰어나네요. 그리고 놀랍게도 키미 역시 경쟁력이 있음을 알 수 있습니다.13:10

그리고 네 번째 날에 일종의 돌파구를 보여주었는데,13:17

코덱스를 새로운 기록으로 이겼던 것 같아요.13:21

클로드의 기록 향상 방식이 상당히 발전적인 모습을 보이는 것도 흥미롭네요.13:24

키미는 정말 단계적으로 성능을 향상시키는 모습을 보여주고 있습니다.13:29

터무늬 패러다임의 돌파구를 보여주는 것 같기도 하고요.13:34

이게 상당히 흥미로운 부분인데요. 제가 말씀드리면, 니발에게는 6일이나 되는 시간이 꽤 긴 편이지만,13:38

출력 토큰 수에 따라서도 이 축을 변경할 수 있습니다.13:44

그리고 클로드의 맥스모드는 훨씬 더 많은 토큰을 소비하기 때문에 다른 이야기를 보여줄 수도 있습니다.13:49

그리고 코덱스와 키미가 있습니다. 그리고 키미가 실제로 매우 효율적이라는 것도 알 수 있죠.13:55

각각 사용하는 토큰의 양에 비례해서요.14:01

그래서 키미 케이투 세븐 코드입니다. 네, 그렇습니다.14:04

또한 그들이 문헌과 논문을 활용하는 방식이 다르다는 것을 알 수 있습니다.14:08

예를 들어 클로드 같은 경우는 논문 검색을 많이 하고 있습니다.14:16

실제로 클로드는 다른 모델에서는 찾지 못한 논문을 발견하기도 했습니다.14:21

그런데 실제로 가장 좋은 결과를 만들어냈어요. 좀 웃기네요, 네.14:24

이 모든 것의 주요 문제점은 제가 이 에이전트를 출시했을 때였습니다.14:33

그리고 제가 말씀드리고 싶은 중요한 점이 하나 있습니다. 기억해 주셨으면 좋겠어요.14:40

이번 강연에서 제가 기억하는 것 중 하나는, 이 다양한 에이전트를 처음 시작했을 때, 정말 놀라운 아이디어를 생각해 낼 거라고 예상했었다는 거예요.14:45

최적화 방법에 대한 아이디어들이 전혀 발견되지 않았다는 것이 큰 문제 중 하나였습니다.14:52

하지만 솔직히 말씀드리면 그런 경우는 아니었습니다.14:56

그들은 여러 논문을 결합하는 방식으로 교묘한 트릭을 사용했고, 기존 방법들을 약간 개선하는 정도였습니다.14:58

정말로 새롭거나 독창적인 최적화 기법이나 메커니즘이 나오는 경우는 없었습니다.15:05

그 모델들에서 나오는 결과거든요.15:13

그리고 제가 생각하기로는, 그게 상당히 의미심장하다고 보여요. 아무리 간단하지 않더라도 말씀드리면...15:14

사람들이 접근하기 쉬운 수준이라고 할까요, 그렇죠? 연구자들이 모델을 위해 며칠이고 몇 주씩 시간을 들여도,15:21

새로운 최적화 기법이나 메커니즘을 찾지 못하는 상황이 발생하곤 합니다.15:28

그래서 저희는 기본적으로 발견을 위한 방법을 만들 수 있다고 생각합니다.15:35

평가보다는 발견에 더 효과적일 수 있습니다.15:43

이것은 구글의 알파 이볼브에서 많은 영감을 받았습니다.15:46

그리고 그 이후로 발표된 여러 논문들에서도 영향을 받았고요. 다중 에이전트 시스템이 상호작용하는 방식과 비슷합니다.15:51

여러 개의 생성기들이 함께 작동하며, 폐쇄형 모델도 있고 오픈 소스 모델도 있습니다.15:57

비용 대비 매우 효과적인 모델들이 여기 있어서 아이디어를 제안할 수 있습니다.16:03

그러면 스피드런을 실행해서 보상을 얻게 됩니다. 그리고 피드백을 주는 심사위원이 있습니다.16:08

심사위원도 이 방법을 평가해 볼 수 있습니다.16:14

심사위원께서도 방법론에 대한 안목을 가지고 계실 수 있습니다.16:18

방법이 좋은지 아닌지, 그리고 루프를 벗어났는지 판단하실 수 있을 겁니다.16:23

그리고 어떤 방법을 더 큰 파라미터 수와 토큰 수로 확장할지 결정하실 수 있습니다.16:27

확장해야 할 방법을 선택하실 수 있습니다.16:32

이 부분이 속도 향상 과정에서 규모를 결정하는 부분이라고 할 수 있습니다. 왜냐하면 속도 향상 커뮤니티에서 많은 방법들이 대규모에서는 잘 작동하지 않는다는 의견이 있기 때문입니다.16:38

그래서 저는 이 루프에 규모 관련 요소들을 포함시키는 것이 매우 중요하다고 생각합니다.16:46

그리고 사람들의 도움이 여기에서 정말 유용하다고 생각합니다.16:54

기본적으로 에이전트의 아이디어를 판단하고, 올바른 방향으로 이끌어주는 역할을 할 수 있습니다.16:59

네, 아직 시도해 보지는 않았습니다. 지금은 어느 정도 시도하고 있는 중입니다.17:06

그리고 적어도 저희는 이것이 인공지능 연구 분야에서 새로운 발견으로 이어지기를 바랍니다.17:10

그리고 또 다른 방법은 여러 개의 스피드런을 정의할 수 있다는 것입니다.17:16

자, 다음 슬라이드를 보게 되는데, 이건 세이프뱅크 자료에서 가져온 겁니다.17:21

하지만 레퍼런스가 없으시다면 좋으신 거네요.17:27

그것은 온라인 활동이 많지 않다는 뜻이에요. 하지만 목표를 변경함으로써...17:30

그리고 속도런의 제약 조건들을 고려하면, 기본적으로 다양한 결과물을 많이 만들 수 있습니다.17:35

모델을 특정 방향으로 제한하고, 네, 그런 발견들을 이끌어낼 수도 있습니다.17:40

프라임 인텔렉트에서는 이 방향으로 여러 가지를 진행하고 있습니다.17:48

아직 공개하지 않은 내용들이 많이 있습니다.17:52

하지만 저희는 모델이 샌드박스 안에서 반복적으로 실행될 수 있도록 GPU 샌드박싱 작업을 진행하고 있습니다. 왜냐하면...17:56

이런 종류의 작업에는 GPU 샌드박스가 필요합니다.18:03

저희는 RLM 프레임워크에 매우 효율적인 자체 에이전트를 개발하고 있습니다.18:05

즉, 파일 시스템을 가지고 정보를 쓰고 읽을 수 있다는 뜻입니다.18:13

프로그래밍 도구를 호출하는 이런 기능도 제공하고 있습니다.18:18

저희는 또한 오픈 소스 모델을 기반으로, 이 기능을 잘 수행할 수 있도록 모델을 학습시키고 있습니다.18:21

그리고 저희가 이미 출시한 것은 라이브러리와 제품 세트인데,요.18:26

Verifier, Primarell, Hosted Training이라고 불리며, 여기서 기본적으로 학습하고 평가할 수 있습니다.18:31

어떤 환경에서도 활용할 수 있으며, 학습 가능한 모델은 GNM 5.2처럼 매우 큰 것도 있습니다.18:37

네, 저희는 해당 라이브러리들을 효율적으로 배포하기 위해 많은 노력을 기울이고 있습니다.18:43

저희 고객분들께 최고의 품질을 제공하기 위해서요. 그렇죠?18:49

이 분야에 대해서 정말 기대하고 있습니다. 한번18:53

다시 한번 말씀드리지만, 이 재귀적 자기 개선의 일부가 공개적으로 이루어지는 것이 정말 중요하다고 생각합니다.18:57

왜냐하면 큰 회사에 소속되지 않은 많은 사람들이 이 부분에서 일하고 있기 때문입니다.19:02

연구소에서 작업을 하시는 분들이 많으신데, 기본적으로 그 모든 내용을 사람들이 이해하기 쉽게 만들어야 합니다.19:08

저희의 목표는 연구를 진행하고 그러는 것이고, 네, 정말 감사합니다.19:14

AI Summary

이 글은 인공지능 모델(Claude, Codex, Kimy, GLM)을 활용한 최적화 방법 발견에 대한 실험 결과와 새로운 접근 방식을 설명합니다. 초기에는 클라우드 코드 중단 문제 등 어려움이 있었으나, Codex는 안정적인 성능과 독특한 특징으로 두각을 나타냈고 Claude는 빠른 속도와 인간 기록 개선 능력을 보여주었습니다. 특히, 기존 연구의 한계를 극복하기 위해 다중 에이전트 시스템을 활용하여 새로운 최적화 기법을 '발견'하는 접근 방식을 제안하며, GPU 샌드박싱 및 RLM 프레임워크를 개발하여 모델 반복 실행 환경을 구축했습니다. 또한, 오픈 소스 기반 학습과 라이브러리 출시, 재귀적 자기 개선을 통해 연구 과정을 투명하게 공개하고 외부 참여를 유도하여 발전시켜 나갈 계획입니다.

Key Highlights

  • •Claude와 Codex는 인간 기록보다 뛰어난 성능을 보이며 인공지능 연구 능력을 입증했습니다.
  • •기존 최적화 기법 개선에 머무르는 한계를 극복하기 위해 새로운 최적화 방법을 '발견'하는 접근 방식이 제안되었습니다.
  • •다중 에이전트 시스템을 활용하여 아이디어 생성 및 평가를 자동화하고, 인간의 역할도 중요하게 고려합니다.
  • •GPU 샌드박싱과 RLM 프레임워크를 통해 모델 반복 실행 환경을 구축하여 연구 효율성을 높입니다.
  • •오픈 소스 기반 학습과 재귀적 자기 개선을 통해 연구 과정을 투명하게 공개하고 외부 참여를 유도할 계획입니다.

Related Videos