Home

읽기 설정

안녕하세요 여러분. 저는 이리나이고, 이전에는 마이크로소프트와 슈퍼셀에서 엔지니어로 일했습니다. 오늘 제가00:12

다중 에이전트 AI 마을에서의 자동 연구에 대해 이야기하고 싶습니다.00:19

여기서는 AI 빌리지와 같은 비디오 게임을 예시로 사용하겠습니다만, 더 넓은 질문은요,00:23

많은 AI 엔지니어들이 이제부터 마주하게 될 문제라고 생각합니다.00:30

장기간 상태를 유지하는 에이전트들을 어떻게 평가하고 개선해야 할까요?00:35

오토 리서치 레이어에 들어가기 전에, 프로젝트 패러독스에 대해 조금 이야기해 보겠습니다.00:43

저희는 슈퍼셀의 AI 혁신 연구소에서 프로젝트 패러독스를 개발했습니다.00:49

제 동료와 저는 자연스럽게 돈을 버는 콘텐츠를 만들어요.00:54

저희는 개발자가 쉽게 연결할 수 있는 모듈식 인공지능 프레임워크를 만들었습니다.00:59

비디오 게임 내에서 상호작용하고, 경쟁하거나, 협력할 수 있는 지능적이고 자율적인 에이전트를 구현할 수 있습니다.01:04

다른 플레이어나 에이전트들과도 상호작용하며 역동적인 게임 동반자로 만들 수 있습니다.01:11

이제 에이전트들이 할 수 있는 일들을 예시로 들어보겠습니다. 에이전트는 의도를 가지고 움직일 수 있습니다.01:20

그들은 원하는 장소나 사람에게 갈 수 있으며, 그들만의 기억, 감정 또는 호기심에 따라 움직입니다.01:27

이러한 에이전트들은 세상과 상호작용할 수 있고, 물건을 집어 들거나 어디든 놓을 수 있습니다.01:33

그리고 그들은 주변 환경의 맥락에 대해서도 인지하고 있습니다. 예를 들어 오브젝트나01:41

다른 캐릭터나 에이전트들도 인식합니다.01:46

게임 개발자분들은 이 에이전트들에게 새로운 행동을 추가하실 수도 있다는 점도 말씀드리고 싶습니다.01:49

단순히 물건을 떨어뜨리거나 놓는 것 외에도, 저희 프레임워크 내에서 다양한 작업을 수행할 수 있도록 할 수 있습니다.01:55

에이전트들은 주변에서 일어나는 상황에 당연히 반응할 수 있으며, 이러한 사건들이02:04

주변에서 발생하며 그들의 믿음과 감정에 즉각적으로 영향을 미치기도 합니다.02:11

물론이죠, 에이전트들이 대화를 시작할 수 없다면 완벽하지 않겠죠?02:16

에이전트는 이...02:21

시나리오 속에서 다른 에이전트나 플레이어에게 다가가게 되는데, 이게 게임을 더욱 생동감 있게 만듭니다.02:23

물론 이러한 대화들은 그들의 기억 속에 저장됩니다.02:30

각자의 고유한 방식에 따라 감정이나 신념, 목표 등에 영향을 미치기도 합니다.02:36

이 모든 요소들이 함께 저희의 멀티 에이전트 프레임워크를 구성합니다.02:42

그래서 아키텍처는 의도적으로 상태를 유지하도록 설계되었습니다.02:54

이것은 의도적으로 상태를 저장하는 구조였습니다.02:58

가장 중요한 부분 중 하나는 에이전트별 메모리였습니다.03:02

각 에이전트는 RAG를 기반으로 자체적인 메모리 네임스페이스를 가지고 있습니다. 그래서 메모리가03:06

에이전트 간에 정보가 유출되지 않았습니다. 두 번째로, 감정을 작은 벡터로 추적했습니다.03:13

따라서 사건이나 대화 후에 시스템은 기쁨과 같은 값을 업데이트할 수 있었습니다.03:19

슬픔, 두려움, 분노, 또는 역겨움과 같은 감정들이 있었습니다. (seulpeum, du ryeoum, bunno, ttoneun yeokkeowum-gwa gateun gamjeongdeuri isseotseumnida.)03:25

세 번째로, 에이전트들은 다른 에이전트와 플레이어에 대한 신뢰 점수를 가지고 있었습니다. (se beonjjae-ro, ejenteudeureun dareun ejenteo-wa peulleieoe daehan sinri jeomsureul gajigo isseotseumnida.)03:28

이것을 일종의 신뢰도 행렬이라고 생각하시면 됩니다. 예를 들어,03:36

상호작용이 발생한 후, LLM은 신뢰도 점수가 올라가거나 내려갈지, 아니면 변하지 않아야 할지를 결정합니다.03:40

점수가 올라가거나 내려가거나, 혹은 전혀 변하지 않아야 할지 결정하는 거죠.03:45

그리고 네 번째로, 모든 기억은 중요한 점수를 받습니다.03:48

이것을 더 잘 설명하기 위해, 예를 들어 며칠 전에 저녁 식사를 했다고 해 볼게요. 아마 뭘 먹었는지 기억하지 못할 거예요, 그렇죠?03:54

하지만 며칠 전에 살인이 발생했다면, 확실히 그 사실을 기억하실 겁니다.04:01

에이전트가 사건의 중요도를 평가하거나 언어 모델이 평가하게 됩니다.04:08

그리고 그 점수가 특정 기준점을 넘어서면요,04:14

그 특정 기억을 별도의 캐시에 저장할 겁니다.04:17

그러면 나중에 중요한 맥락을 더 잘 불러올 수 있습니다.04:22

그리고 이것이 실제로 작동하는 예시가 여기 있습니다.04:26

저희는 한 캐릭터에게 저희와 함께 피크닉을 가달라고 부탁할 예정이었어요.04:32

여기 블로섬이라는 캐릭터가 과자를 집어 들기로 결정했어요.04:36

우리가 부탁했기 때문에 피크닉 장소로 가려고 합니다.04:42

참고로, 배경에서 대화가 진행되는 동안 그녀는 이 모든 행동 순서를 계획하고 있습니다.04:46

그리고 저희가 나중에 그녀와 이야기를 나눌 때요.04:52

그녀는 맥락에 맞춰 답변을 할 것입니다요.04:57

네.05:03

하지만 여기서 흥미로운 문제가 실제로 시작되었어요.05:06

지난 예시에서 보셨듯이, 단기적인 게임플레이 같은 경우에는 저희 아키텍처가 꽤 잘 작동했어요.05:11

캐릭터가 계획을 세우고 돌아다닐 수도 있습니다.05:19

대화하고 최근 상호작용을 기억하며 우리나 다른 캐릭터에게 반응할 수 있지만요.05:22

시간이 길어질수록 사회적 일관성이 약해지는 것을 알 수 있습니다.05:29

예를 들어, 한 에이전트가 다른 에이전트에게 망고 할인 소문을 퍼뜨리는 상황입니다.05:36

그리고 그 요원이 정보를 받고 다른 요원에게 전달하는 상황입니다.05:43

나중에 플레이어가 한 요원에게 질문한 시점과 사이에 여러 사건들이 발생한 후에 말이죠.05:49

그래서 이 예시에서는 한 에이전트가 다른 에이전트에게 망고 할인 소문을 퍼뜨리고, 그 에이전트는 정보를 받아 또 다른 에이전트에게 전달하는 상황입니다. 플레이어가 에이전트 중 한 명에게 망고에 대해 질문했을 때, 기대했던 맥락을 정확히 저장하지 않습니다.05:56

또는 우리가 원하는 종류의 맥락을 제공하지 않을 수도 있습니다.06:02

이게 자연스럽게 좀 복잡해지기 시작하는 부분입니다.06:06

시스템은 대략적인 주제는 기억할 수 있지만, 그 주제의 출처는 잃어버릴 수 있습니다.06:11

소문이 그냥 소문으로 남지 않고 사실처럼 여겨질 수도 있습니다. 예를 들어, 에이전트가 그것을 사실이라고 주장할 수 있죠.06:17

혹은 에이전트가 사실을 알고 있을 수도 있지만, 계획을 세우는 과정에서 잊어버릴 수도 있습니다.06:24

그 행동에 따라 달라질 수 있습니다.06:31

그래서 여기서 우리가 고민하게 된 질문은, 장기간 사회적 상호작용을 하는 다중 에이전트 시스템을 어떻게 개선할 수 있을까였습니다.06:32

행동 자체에 대한 것이고, 단 하나의 응답에 국한된 것이 아니냐는 질문이 나왔습니다.06:39

바로 이 부분이 우리가 자동 연구를 도입하고 싶었던 지점입니다. 그리고 이것은 해결해야 할 문제들이었습니다.06:42

아시다시피, 몇 달 전 카파시가 오토 리서치를 발표했고, 저희는 바로 큰 관심을 갖게 되었답니다.06:48

저희 모두 아시는 것처럼, 얼마 전에 Karpathy 님이 오토 리서치에 대한 글을 올리셨고, 그 덕분에 저희는 즉시 매우 궁금해졌습니다.06:51

아마 가능할 수도 있습니다.06:58

시스템 스스로 실험을 수행하게 할 수 있을까요? 그리고 이것을 저희 시스템에 활용할 수 있을까요?07:00

저희도 그렇게 생각합니다. 저희가 이해한 바로는 프롬프트를 수동으로 조정하거나 시연을 보는 대신에07:06

시나리오 세트를 정의하고 에이전트를 실행하며 추적 정보를 수집하고 점수를 매길 수 있습니다.07:14

행동을 관찰하고, 작은 정책 부분을 변경해서 실제로 점수를 향상시키는 변화만 유지할 수 있습니다.07:21

바로 이 지점에서 프로젝트 패러독스와 자동 연구를 연결하려고 노력하고 있습니다.07:27

연구죠. 그래서 지금 저희의 다중 에이전트 프레임워크 프로젝트 패러독스는 기본적으로 좀 더...07:33

실험대와 같고, 오토 리서치는 그것을 둘러싼 실험 루프가 되는 거죠.07:39

그리고 중요한 점은 이것이 RAG 검색 성능을 향상시키는 것만이 아니라는 것입니다.07:44

더 넓은 관점에서 보면, 에이전트 최적화가 핵심입니다.07:50

에이전트가 기억을 어떻게 기록하고, 불러오고, 불확실성을 전달하며, 업데이트하는 프로토콜과 같은 것들을 다루는 거죠.07:53

우리는 속성 출처를 신뢰하고 새로운 사실에 맞춰 계획을 세웁니다. 기본적으로요.08:00

이 맥락에서 저희 연구는 또 다른 에이전트가 아닙니다.08:10

저희 연구는 다른 에이전트와는 구별됩니다.08:13

제가 말씀드린 것처럼 마을 안에서 일어나는 일이에요. 이건 마을 바깥에 있는 메타 시스템입니다.08:20

물론 마을 사람들은 지역적인 관점을 가지고 있습니다.08:25

그들은 그들이 봤던 것, 들었던 것, 기억했던 것, 또는 추론했던 것에 대해서만 압니다.08:28

그들 사이에 공통된 기억 데이터베이스가 없기 때문에 정보는 이동합니다.08:33

다른 에이전트들이 적절하게 전달하면요.08:39

자동 연구 레이어는 여기서 다른 역할을 합니다.08:44

실행 기록 전체를 읽고, 시나리오의 정답과 비교하며, 행동을 평가하고, 에이전트에 제약 조건이 적용된 변경 사항을 제안합니다.08:47

정답을 확인하고, 행동 점수를 매기며, 에이전트에 대한 제한적인 변경을 제안하는 것이죠.08:53

프로토콜 또는 인지 정책이라고 할 수 있습니다.09:01

그런 다음 시나리오를 다시 실행하고 사회 전체의 행동이 개선되었는지와 같은 사회적 수준의 행동 변화를 평가합니다.09:03

이것이 우리가 찾고 있었던 핵심적인 변화입니다.09:10

그래서 우리는 더 이상 하나의 답을 평가하는 것이 아니라 전체 실행 결과를 평가하게 되었습니다.09:14

이것은 루프 중 하나가 어떻게 생겼을지 보여주는 모습입니다.09:21

먼저 통제된 시나리오를 정의하는데, 나중에 좀 더 자세히 설명드리겠습니다.09:25

예를 들어, 한 에이전트가 공적인 사실을 배우거나, 또는 한 에이전트가 소문을 듣는 경우입니다.09:31

그것은 통제된 시나리오가 될 수 있습니다. 그런 다음 시뮬레이션을 실행합니다.09:38

실험 진행 중에 구조화된 기록, 관찰 내용, 대화, 기억 저장09:43

검색 기록, 믿음 업데이트 등, 그 경우 우리에게 필요한 모든 것을 수집합니다.09:49

그런 다음 이 행동을 평가합니다. 정보가 우리가 예상했던 대로 퍼졌는지 확인하는 것이죠.09:55

정보 출처 추적이 유지되었는지도 확인해야 합니다. 예를 들어, 에이전트가 소문을 누가 시작했는지 기억하는지 여부를 말이죠.10:01

불확실성이 불확실성을 유지했나요? 에이전트들은 실제로 알고 있는 정보에 따라 행동했나요?10:07

그리고 여기 자동 연구 레이어에서 작은 정책 변경을 제안합니다.10:13

그리고 이것은 중요합니다. 당연히 전체 애플리케이션을 다시 쓰면 안 됩니다.10:20

제어된 정책 영역만 수정해야 합니다.10:26

그리고 다시 실행합니다. 점수가 향상되고 안전장치가 유지되면 개선 사항을 적용합니다.10:30

그렇지 않으면 간단히 이전 상태로 되돌립니다.10:37

그리고 대화도 필요합니다.10:43

통제된 시나리오에 대해 말씀드리자면, 시나리오 설계가 중요한 이유는 사회적 측면 때문입니다.10:44

일반적으로 행동이 조금 불분명하게 느껴질 수 있습니다.10:51

즉, 에이전트들을 그냥 내버려 두면요.10:56

환경 안에서 자유롭게 돌아다니는 건 보기에는 멋있을 수도 있고, 좋은 상호작용도 얻을 수 있을지도 모르지만요,10:59

실제로 시스템이 개선되었는지 평가하기는 매우 어렵습니다.11:06

그래서 저희는 통제된 시나리오가 필요하다고 생각합니다.11:11

예를 들어, 하나의 시나리오는 공공(의) 서비스를 테스트할 수 있습니다.11:16

사실 확산입니다. 예를 들어, 에이전트 A가 제빵소가 내일 문을 닫는다는 것을 알게 되었다고 가정해 보겠습니다.11:20

정확한 에이전트들이 그것을 배우나요? 누가 무엇이라고 말했는지 기억하나요?11:26

이 사실에 기반하여 그들은 계획을 변경하나요?11:31

또 다른 시나리오는 소문 불확실성을 테스트할 수 있습니다.11:35

에이전트 A가 에이전트 C가 마을을 떠날 수도 있다고 들었다고 가정해 보겠습니다.11:40

이 소문이 퍼지면 '떠날 수도 있다'는 표현이 갑자기 어떻게 변할까요?11:45

떠나는 것으로 바뀌나요, 아니면 '떠날 수도 있다'는 상태로 유지되나요?11:50

사실이 되는 건가요, 아니면 계속해서 소문으로 남게 되나요?11:54

또 다른 시나리오가 재계획을 시험해 볼 수 있습니다.11:59

그룹에는 계획이 있지만, 한 요원이 그들이 가고 싶어 했던 경로가 있다는 것을 알게 된다고 해 봅시다.12:02

막혔네요.12:09

요원들은 이런 상황을 업데이트하고 서로 공유해서 부적절한 계획을 피하나요?12:10

혹은 오래된 행동 방식인가요? 중요한 것은 이러한 특정 상황이 항상 적용되는 것은 아니라는 점입니다.12:18

저희가 말씀드리고 싶은 부분은, 장기적인 계획을 가진 에이전트들은 다양한 시나리오에 적합해야 한다는 것입니다.12:25

망고 예시를 다시 말씀드리자면, 저희 자동 연구 루프 중 하나를 실행한 후에,12:32

이번에는 오랜 시간이 지난 후입니다.12:39

플레이어가 마망이에 대한 판매에 대해 에이전트에게 질문했을 때,12:46

에이전트가 응답할 수 있다는 것을 확인했습니다.12:49

이번에는 지난번과 비교했을 때 맥락 안에서 말씀드리는 거예요.12:56

네. 그리고 이번 발표에서는 정확한 공식이 저희 생각에 덜 중요합니다.13:03

점수판의 형태보다 더 중요하다고 생각합니다.13:11

에이전트 품질과 같은 단일하고 모호한 지표는 원하지 않습니다.13:14

이렇게 하면 흥미로운 실패들이 모두 가려지게 될 거예요. 대신 균형 잡힌 성과 지표를 원하시는 겁니다.13:19

전파의 경우, 예를 들어 N단계 후 몇 명의 담당자가 해당 사실을 알고 있는지와 같이 도달 범위를 측정할 수 있습니다.13:26

기원 추적의 경우, 그것을 아는 에이전트들에게서 출처 정보가 얼마나 유지되는지 측정합니다.13:33

에이전트들이 어디에서 왔는지 등, 몇 명이 기억하는지 확인하는 것이 중요합니다.13:39

유언비어의 경우, 불확실성 유지 및 허위 확실성 비율을 측정할 수 있습니다.13:43

계획 수립의 경우에는 행동 일관성과 재계획 시간이라는 지표를 측정할 수 있습니다.13:48

그리고 개인 정보 보호 측면에서는 격리 정도를 측정할 수 있습니다.13:53

이것은요13:56

이것은 중요합니다. 왜냐하면 하나의 지표만 최적화하는 것은 좋지 않은 결과를 초래할 수 있기 때문입니다. 예를 들어서,13:57

디퓨전만을 최적화한다면, 에이전트들이 모든 것을 과도하게 공유하도록 학습할 수도 있습니다.14:04

만약 메모리 회상을 최적화하는 데만 집중한다면, 노이즈가 많거나 오래된 기억을 만들 수도 있습니다.14:10

그래서 이 성과표는 시스템의 공정성을 유지하고 자동 연구 에이전트가 잘못된 행동을 하지 않도록 막아줍니다.14:18

시스템을 게임화해서 특정 점수를 하나만 높이는 것부터 시작할 수도 있습니다.14:25

이번 프로젝트를 진행하면서 배운 또 다른 중요한 공학적 교훈은 다음과 같습니다.14:32

편집 가능한 부분을 정말 작게 유지하는 것이 중요합니다요.14:40

자동 연구 레이어는 코드 베이스 전체를 임의로 수정할 권한을 가져서는 안 됩니다요.14:44

대신, 하니스와 시나리오, 그리고 지표를 고정하는 것이 정말 중요합니다.14:51

고정해야 합니다.14:54

그래서 저희는 최적화하고 싶은 시스템의 일부만 노출시키고 있습니다.14:58

프로젝트 패러독스에서는 저희에게 있어서 메모리 쓰기 정책이나 검색 정책 같은 것들이 해당되었습니다.15:04

의사소통 프롬프트, 믿음, 신뢰 규칙, 출처 명시, 재계획 트리거 등등이 있습니다.15:12

이렇게 하면 검색 과정에서 행동을 개선할 수 있는 여지가 생깁니다.15:18

하지만 평가를 직접적으로 조작하는 것을 방지하기도 합니다, 앞서 말씀드린 것처럼요.15:23

그리고 이것이 언어 모델이 무작위 패치를 작성하는 것과의 차이점입니다.15:28

이는 언어 모델이 무작위 패치를 작성하는 것과, 언어 모델이 제어된 정책 공간 내에서 실제로 검색하는 것 사이의 차이점입니다.15:33

그리고 여기 제가 이 루프가 검색해야 할 종류의 변경 사항에 대한 예시들이 있습니다.15:40

출처 정보가 사라진다면, 정책 변경 내용이 출처를 보존한 채로 유지될 수 있습니다.15:48

메모리에 저장되고 기록되며, 메모리 쓰기와 요약으로 이어질 수 있습니다.15:54

만약 소문이 사실로 굳어진다면, 정책 변경은15:59

신뢰도를 저장하고, 직접 경험인지 여부를 표시할 수 있습니다.16:02

중요한 점은 이러한 변화는 간접적인 정보에서 비롯되며, 불확실한 주장을 다시 전달할 때 신중하게 접근해야 한다는 것입니다.16:06

공적인 사실이 지역에 머물러 있다면, 정책 변경은 유용한 공적인 사실로 분류될 수 있습니다.16:10

다르게 행동하고 에이전트들이 중요한 출처 증거를 적극적으로 공유하도록 만듭니다.16:17

중요한 점은 이러한 변화가 에이전트 프로토콜의 작은 변경 사항이라는 것이지만, 큰 영향을 미칠 수 있습니다.16:21

다중 에이전트 시스템에서 사회 전체의 행동에 더 큰 영향을 미칠 수 있습니다.16:28

시스템입니다. 여기서는 주장에 신중해야 할 것 같습니다.16:33

반복적인 순환 결과가 없다면, 제가 말씀드리기로 시스템이 그냥 일반적으로 개선된 것이라고 단정할 수는 없을 겁니다.16:40

저희는 이 표면을 자동 연구에 노출시키는 올바른 방식이라고 말하고 싶습니다.16:48

레이어 루프인데, 제어가 가능할 만큼 작으면서도 사회적 행동을 어느 정도 바꿀 수 있을 만큼 충분히 풍부합니다.16:54

최소한 그런 변화를 이끌어낼 수 있습니다.17:01

저에게 가장 큰 교훈이라고 한다면, 아마 기억만으로는 충분하지 않다는 것이었습니다.17:05

에이전트에 RAG 메모리를 추가할 수도 있습니다.17:12

그래도 원하시는 장기적인 행동 양상을 얻지 못하는 경우가 있습니다.17:15

에이전트는 때때로 그 정보의 출처를 알아야 하기 때문입니다.17:22

정보가 직접적인 경험에서 왔는지, 아니면 다른 경로를 통해 얻었는지, 그리고 검증되었는지 또는 불확실한지에 대한 정보도 보존해야 합니다.17:28

때로는 에이전트가 현재 믿고 있는 내용과 원본 회상 내용을 분리해야 할 때도 있습니다.17:34

그리고 행동은 느낌이 아닌 시나리오를 통해 테스트해야 합니다.17:39

따라서 다른 교훈은 롤백 또한 선택 사항이 아니라는 점입니다.17:44

소셜 행동을 최적화할 때, 변화가 한 가지는 개선하고 다른 한 가지는 손상시킬 수 있습니다.17:50

따라서 공공 사실을 더 빠르게 확산시키는 정책은 개인 정보 유출의 위험도 있을 수 있습니다.17:56

기억을 더 많이 불러오는 정책은 오래된 메모리 사용량을 늘릴 수 있습니다.18:02

그래서 루프는 기본적으로 래칫처럼 작동해야 합니다.18:07

변경 사항을 시도하고 점수를 매긴 다음, 점수가 개선되고 안전장치가 유지되는 경우에만 적용해야 합니다.18:11

그리고 저희는 이것이 게임 에이전트에게만 관련 있는 것이 아니라고 확신합니다.18:19

제가 예시로 게임 빌리지를 보여드렸지만, 저희는 생각합니다만...18:25

예를 들어 지원 에이전트라고 한다면, 지원 에이전트는 어떤 것을 알아야 합니다.18:32

정책 업데이트는 어디에서 오는지, 그리고 기존 답변을 대체하는지 확인해야 합니다.18:36

개인 비서의 경우 예를 들어, 그들이 기억해야 할 약속들을 기억해야 합니다.18:40

이전에 만들어졌고, 사용자가 변경을 원할 경우 수정도 가능합니다.18:45

개인적인 약속들을 기억해야 하고, 연구 지원 에이전트는 출처 정보, 인용문, 모순 등을 필요로 합니다.18:52

처리하고, 가설을 업데이트해야 합니다. 코딩 에이전트는 장기적인 컨텍스트를 필요로 합니다.18:58

문제점, 파일, 팀원 및 변화하는 요구사항에 대한 정보를 관리해야 합니다.19:04

워크플로우 에이전트는 세계가 변할 때 접근 제어, 인수인계 및 재계획 기능이 필요합니다.19:07

이 모든 시스템은 동일한 근본적인 문제를 가지고 있습니다.19:12

그들은 시간이 지남에 따라 상태를 유지하며, 그 상태는 미래의 행동에 영향을 미칩니다.19:17

그래서 저희가 제안하는 것은 통제된 시나리오와 행동 성과 측정 지표를 갖는 것입니다.19:24

그러니 요약하자면, 장기적인 관점의 에이전트를 위한 레시피입니다.19:31

제가 여러분께 꼭 기억해 주셨으면 하는 실용적인 레시피가 있다면 이것입니다.19:36

하네스를 고정하고, 시나리오를 정의하며, 추적 로그를 기록합니다.19:41

행동을 평가하고, 작은 정책 인터페이스만 노출해야 합니다.19:46

이 변경 사항들을 살펴보시고, 측정에서 살아남는 변경 사항만 유지하세요. (I baengyeong sahangdeureul salbeobosinago useo, cheukjeongeseo saranameun baengyeong sahangman uyujuhaseyo.)19:50

그리고 이것은 저희가 의미 있다고 생각하는 엔지니어링 패턴입니다. (Geurigo igeoseun jeohyeoga uimi itdago saenggakhaneun enjineo-ring paeteonimnida.)19:56

장시간 운영되는 에이전트의 경우, 저희가 생각하기에 진짜 문제는, 20:02

통제된 실행 환경에서 시스템이 더 나은 방식으로 작동하는지 여부입니다.20:06

마무리하자면, 프로젝트 패러독스는 3D 세계에서 게임 에이전트가 살아있는 듯한 느낌을 주고자 하는 시도에서 시작되었습니다만,20:13

하지만 우리에게 더 깊은 공학적 문제는 애니메이션이나 대화가 아니라 상태였습니다.20:20

어떤 에이전트가 무엇을 알고 있는지, 어떤 에이전트가 누구에게 말했는지, 무엇이 진실이고 불확실하거나 오래된 정보인지,20:26

그리고 에이전트들이 기억하는 것을 바탕으로 행동하는지 여부와 같은 것들입니다.20:33

오토르 연구는 저희가 이 문제를 조금 더 체계적으로 접근할 수 있는 방법을 제시해 주었습니다. 단순히 시연을 믿거나20:36

무한정 프롬프트를 조정하는 방식이 아니라, 통제된 실험을 수행함으로써요.20:43

그리고 저희 측정 과정을 통해 살아남은 변경 사항만 유지하고 있습니다.20:49

장기적인 목표를 가진 에이전트는 실험이 필요합니다.20:53

그리고 프롬프트뿐만 아니라, 이 강연에서 얻으시는 주요 내용이 되었으면 좋겠습니다.20:56

네, 그리고 저희와 꼭 연락 주세요.21:00

혹시 질문 있으시면 언제든지 편하게 말씀해주세요. 경청해 주셔서 정말 감사합니다.21:04

AI Summary

이 연구는 에이전트 기반 시뮬레이션 환경에서 사회적 행동(정보 전파, 소문 확산, 계획 수립 등)을 개선하기 위한 자동 연구 루프 시스템 개발에 대해 설명하고 있습니다. 핵심은 '마을 모델'과 같은 제한된 정보와 지역적인 관점을 가진 에이전트를 활용하여, 시뮬레이션 결과를 분석하고 정책 변경을 제안하는 자동 연구 레이어를 통해 시스템을 개선하는 것입니다. 특히, 단일 지표 최적화의 위험성을 인지하고 다양한 성과 지표를 고려하며, 코드 베이스 전체를 임의로 수정하지 않고 특정 정책 영역만 수정하도록 제한하여 시스템 안정성을 유지합니다. 장기적으로 안정적인 에이전트 시스템 구축을 위해 제어 가능한 범위 내에서 정책 변경을 반복하고 평가하는 방식, 정보 출처 및 신뢰도 관리, 작은 변화가 사회 전체에 큰 영향을 미칠 수 있다는 점 등을 강조하며, 지속적인 실험과 객관적인 측정을 통해 개선 사항을 검증해야 함을 제시합니다.

Key Highlights

  • •자동 연구 루프 시스템 개발을 통한 사회적 행동 개선
  • •마을 모델 기반의 제한된 정보와 지역적 관점을 가진 에이전트 활용
  • •다양한 성과 지표를 고려하여 균형 잡힌 접근 방식 유지
  • •시스템 안정성을 위한 제한적인 수정 범위 적용
  • •정보 출처 및 신뢰도 관리의 중요성 강조

Related Videos