읽기 설정
AI Summary
Weights & Biases의 주빈 이솔라 발표 내용을 바탕으로 ARIA 에이전트 개발 및 평가 프레임워크에 대한 주요 내용들을 정리했습니다. ARIA는 YAML 사양으로 정의된 평가 작업을 통해 사용자 플로우를 시뮬레이션하며, 다양한 작업 유형(연구 자동 수행, 페르소나 기반 언어 모델 시뮬레이션 등)을 지원합니다. 특히 'Eval Flywheel' 시스템을 통해 프로덕션 데이터를 활용하여 에이전트 프레임워크를 지속적으로 개선하고 있으며, 자체 도구를 사용하여 행동 패턴을 분석하고 추적하는 프로젝트를 진행하고 있습니다. Weave는 에이전트의 안내 능력과 오류 분석 능력을 평가하는 데 사용되며, 자동 모드 전환 기능을 통해 개발자의 코드 작성 부담을 줄여줍니다. 앞으로는 프로덕션 환경 가시성 확보, ARIA 자체 개선 과정 관찰, 그리고 안전 장치 구축에 집중할 예정입니다.
Key Highlights
- •ARIA 에이전트는 YAML 사양으로 정의된 평가 작업을 통해 사용자 플로우를 시뮬레이션합니다.
- •Eval Flywheel 시스템을 활용하여 프로덕션 데이터를 기반으로 지속적인 개선이 이루어집니다.
- •자동 모드 전환 기능을 통해 개발자의 코드 작성 부담을 감소시킵니다.
- •Weave는 에이전트의 개념적 안내 능력 및 오류 분석 능력을 평가하는 데 사용됩니다.
- •향후 프로덕션 환경 가시성 확보, ARIA 자체 개선 과정 관찰, 안전 장치 구축에 집중할 계획입니다.
Related Videos
네, 안녕하세요. 와주셔서 감사합니다.00:16
제 이름은 주빈 이솔라입니다. 저는 Weights & Biases에서 일하고 있습니다.00:20
저희가 월요일에 일반 공개한 ARIA 에이전트를 개발하고 있습니다.00:23
혹시 Weights & Biases에서 함께 일하는 동료인 팀의 발표를 보셨을 수도 있을 겁니다.00:28
어제 메인 스테이지에서 발표했었습니다. 그래서 저희가 어떻게 ARIA 에이전트를 평가하고 구축하는지 조금 더 자세히 설명드리려고 합니다. 특히, 저희가 사용하는 평가 프레임워크와 그 방법에 대해00:33
초점을 맞춰서 말씀드릴게요.00:37
저희는 ARIA를 활용해서 연구 과정에서 스스로 강화하도록 하고, Weights & Biases에 대한 내용도 조금 이야기해 보려고 합니다.00:43
네, 이 슬라이드는 제가 NeurIps에서 발표했던 자료에서 가져온 것입니다.00:49
에이전트 하니스를 사용하는 것에는 흥미로운 점들이 몇 가지 있다고 생각합니다.00:53
청중이나 이 컨퍼런스에 참석하신 분들 대부분이 에이전트 하니스를 구축하거나, 스킬과 함께 클라우드 코드를 사용하는데 관심이 많을 거라고 상상됩니다.00:57
다양한 패키지 형태로 제공되기는 하지만, 인공지능 에이전트를 패키징하는 방식에는 상당한 차이가 있습니다.01:03
다양한 벤치마크에서 서로 다른 도구 호출과 함께 사용할 경우에도 그 차이를 확인할 수 있습니다.01:09
그래서 영감을 받아, 저희 Weights and Biases에서 여러분을 위해 Weights and Biases 플랫폼 내에서 연구를 수행하기 위한 자체적인 에이전트 하니스를 구축하는 작업을 진행하고 있습니다.01:12
그리고 아마 다른 여러 가지들도 제가 말씀드리지 않아도 다들 아실 거라고 생각합니다.01:19
왜 소프트웨어 에이전트가 필요하고, 단순히 LLM을 자유롭게 실행시키고 도구를 호출하게 하는 대신 소프트웨어 하니스를 사용하는지에 대한 질문입니다.01:23
하지만 그 부분에 대해서는 지금 이야기하지 않겠습니다.01:27
하지만 큰 문제가 하나 나타나는데, 사실 제가 매일 밤 잠자리에 들 때까지 생각하는 바로 그 문제예요.01:32
벤치마크와 평가, 그리고 에이전트의 구성 방식은 모두 서로 연관되어 있습니다.01:36
따라서, 동적으로 변화하는 시스템에 원칙적인 평가를 적용하려면 좋은 측정 방법이 필요합니다.01:42
시스템의 실제 성능을 확인하기 위해서이고, 특히 프로덕션 환경에서 어떻게 작동하는지 확인하고 싶으실 겁니다.01:48
그리고 오프라인 환경에서도 마찬가지입니다. 만약 오래전에 RL을 접하셨다면, 시뮬레이션에서 실제 세계로의 격차에 대해 생각해보셨을 겁니다. 즉, 시뮬레이션 환경을 실제 환경으로 어떻게 옮겨야 하는지에 대한 문제죠.01:54
기본적으로 이것은 시뮬레이션 환경이 실제 환경으로 얼마나 잘 변환되는지를 나타내는 것입니다.01:59
그래서 제가 이야기할 내용이 두 가지 정도 있는데, 바로 라이브 데모도 보여드리려고 합니다.02:06
제가 생각하기에 최소한 가장 좋은 도구는 weights and biases weave for agents입니다.02:10
에이전트의 프로덕션 및 오프라인 추적을 위한 관측성 플랫폼인데, 주로 그렇게 사용합니다.02:15
제가 오프라인 측면에서 시뮬레이션 환경을 구축하고 아리아 에이전트를 실행하는 일을 합니다.02:20
그리고 웨이브에서 그 결과를 추적하는데, 저뿐만 아니라 저희 팀 전체에서도 그렇게 하고 있습니다. 그래서 저희의 모든 성능을 확인할 수 있어요.02:25
저희 팀의 다른 절반은 프로덕션 환경을 담당하고 있습니다.02:29
에이전트를 배포하고 동일한 형식으로 동일한 내용을 로깅하여 제가 그 프로덕션 트레이스를 저희 환경으로 가져와서 활용할 수 있도록 합니다.02:33
그리고 나서, 이를 통해 힐 클라이밍을 하거나 오류를 해결합니다.02:37
꽤 괜찮은 순환 고리 시스템이네요. 그리고 물론 제가 말씀드리고 싶은 다른 중요한 부분은 Weights & Biases의 ARIA라는 에이전트입니다.02:41
기본적으로 저희가 이제 자체를 구축하기 위해 사용하는 도구인데, 오프라인 힐 클라이밍을 수행할 만큼 충분히 정교합니다.02:45
스스로 할 수 있습니다. 자, 간단하게 실시간 데모를 보여드리고 나서, 몇 가지02:52
다른 슬라이드를 통해 오프라인 평가 프레임워크를 어떻게 구축했는지 설명드리겠습니다.02:56
웨이트 앤 바이어스 플랫폼으로 들어가시면, 제가 ARIA라는 이름의 데모 프로젝트를 만들었습니다.03:00
ARIA에 대한 연구가 여기 진행되고 있으며, 저는 이제 ARIA와 대화하면서 스스로 자동 연구를 수행하도록 요청할 예정입니다.03:04
그래서 이건 제가 다른 세션 중 하나에서 생성하도록 한 비교적 긴 프롬프트입니다.03:10
하지만 살펴볼 때, 이 코드는 Weights & Biases 아티팩트로 기록되어 있는데, 여기에서 확인할 수 있습니다.03:14
이 코드 베이스를 대상으로 학습 작업을 실행할 거예요. 저희의 오프라인 평가 프레임워크입니다.03:22
저희가 가지고 있는 프로덕션 추적 정보를 검토하고, 새로운 태스크들을 힐 클라이밍에 추가하며, 그런 일들을 할 겁니다.03:27
그래서 이 작업은 조금 시간이 걸릴 거예요. 평가를 진행하는 데 약간의 시간이 필요하답니다.03:32
그래서 저희는 ARIA가 스스로 새로운 버전을 만들려고 시도하는 것을 볼 수 있을 거예요.03:36
이 방정식의 다른 쪽은 실제 운영 측면입니다.03:41
따라서 이것은 내부 고객 추적 또는 ARIA의 내부 추적을 정리한 버전이라고 할 수 있습니다.03:44
그러면 저희는 아주 빠르게 ARIA가 여기 나타나는 것을 확인할 수 있을 거예요. 지금 저희가 진행하고 있는 정확한 대화 내용이 바로 여기에 표시될 겁니다.03:49
하지만 이 추적 과정에서 저는 Weave에 기록된 생산 로그 중 하나를 가져와서 오프라인 환경에 적용해 볼 기회로 삼을 예정입니다.03:57
평가 프레임워크를 이용해서 최적화를 할 수 있도록 하겠습니다. 지금 바로 진행해 보겠습니다.04:04
비교적 간단한 작업을 요청할 건데요, 조금 흥미로운 점은 이것이 약간 자기 참조적인 성격을 띨 거라는 겁니다.04:07
하지만 여기로 이동해서 새로운 ARIA 탭을 열고, 그냥 물어볼게요. 있잖아요,04:13
이 트레이스를 가져다가 저희 오프라인 평가에 기록해주세요.04:17
맞춤법이 크게 중요하지 않다고 생각합니다. 그리고 후보 모델과 운영 환경 에이전트를 실행해 보겠습니다.04:22
그리고 그것을 처리하도록 설정할 겁니다.04:28
그리고 평가 결과가 실행되는 동안 Weave에 기록되는 것을 확인할 수 있습니다. 이것이 제가 매일 하는 일의 기본적인 방식입니다.04:31
제가 기본적으로 매일 하는 일은 저희 Weights에 있는 운영 환경 추적 데이터를 살펴보는 것입니다.04:36
그리고 저희의 웨이브 플랫폼에서 편향을 확인하고, 코드 베이스 내에서 평가를 실행합니다. 이것은 저희의 오프라인 평가 샌드박스입니다.04:40
이후 새로운 버전의 에이전트를 배포하고 팀과 협력하여 그 작업을 진행합니다.04:45
그리고 저희의 프로덕션 프로젝트를 살펴보면, 지난 일곱 주 동안 매일 밤 CI 작업에서 발생한 다양한 로그들을 확인할 수 있습니다.04:49
여기서는 에이전트가 프로덕션 환경에서 평가되고, 저희가 검토했던 다른 후보 모델들도 함께 실행됩니다.04:55
그래서 시간이 지남에 따라 저희의 상대적인 성능을 확인할 수 있습니다.04:59
한동안 CI가 작동하지 않았습니다. 어젯밤에도 스스로 수정해야 했습니다.05:02
하지만 일부 작업에서는 약 66% 정도의 성능을 보이고 있습니다. 그 외에도 여러 가지가 있고요.05:05
그래서 저희는 에이전트가 수행하도록 훈련하는 다양한 작업을 가지고 있습니다.05:09
그래서 이제 발표 자료의 실제 버전을 보면서 조금 더 자세히 설명드리겠습니다.05:12
오프라인 언덕 등반을 위한 시뮬레이션 환경 구축에 대한 이론적인 배경을 좀 더 깊이 있게 다뤄보려고 합니다.05:16
기본적으로 소프트웨어 에이전트를 구축하는 것인데, 전통적으로 강화 학습을 한다면 견고함을 기대할 수 있습니다.05:21
하지만 요즘은 주로 프롬프트 엔지니어링을 하고 있는데, 정교한 모델들은 상대적으로 괜찮은 성능을 보입니다.05:27
무게와 편향을 조정하여 작업을 수행하는 것보다 소프트웨어 에이전트의 기술을 구축하는 데 더 집중하고 있습니다.05:31
하지만 동일한 방법론을 에이전트 구축 방식에 적용하는 것이 중요하다고 생각합니다. 즉, 같은 안정성을 유지하는 것입니다.05:37
환경을 시뮬레이션하는 방식 자체가 저희 작업에 정말 도움이 됩니다.05:41
그래서 저희는 실제 운영 환경과 시뮬레이션 환경 모두에서 동일한 에이전트 버전을 성능 테스트하고 있습니다.05:45
이 슬라이드에 제가 클로드에게 정리해 달라고 한 텍스트가 많이 있습니다만, 그림 위주로 진행하겠습니다.05:50
그래서 여기에서 가장 흥미로운 부분은 Weave의 로깅 프레임워크를 사용하는 것 자체가 라는 생각입니다.05:56
저희가 시스템을 설계한 방식대로, 연구용 코드와 실제 서비스에 사용되는 코드가 완전히 동일합니다.06:00
실제로 저희는 생산 환경에서 저희 쪽으로 데이터를 동기화하는 데 4시간이 걸리는 작업도 진행하고 있습니다.06:04
연구자들이 새로운 에이전트 변형이나 기술 등을 개발하고, 시행착오를 거치는 과정에서 데이터 드리프트가 발생하지 않도록 연구 환경을 구축했습니다.06:07
그래서 저희는 배포 계층과 오프라인 벤치마킹 계층의 양쪽에서 서로 밀접하게 연결된 루프를 가지고 있습니다.06:14
그리고 저희 팀 내부적으로, 점수를 매긴 경로를 생성하기 위한 여러 개의 실행 평가 명령어를 제공합니다.06:21
그래서 제가 말씀드린 큰 프로젝트는 바로 이러한 다양한 경로 예시들을 가지고 있는데, 하나를 클릭하면요.06:27
로딩될 때 다양한 지표들의 상대적인 점수를 확인할 수 있습니다.06:33
하지만 기본적으로 에이전트가 시간이 지남에 따라 어떻게 작동하는지에 대한 매우 안정적인 추적 결과를 얻게 됩니다.06:38
여기에서 얻을 수 있는 정보량이 정말 많고요, 이 배경에는 엄청난 양의 데이터를 생성해서06:43
무엇을 할지 결정하는 것이라는 생각입니다. 엄청난 양의 데이터를 어떻게 활용할지를 고민하면서요.06:47
에이전트의 성능을 파악하고, 창발적 특성을 측정하여, 특정 방향으로 에이전트를 조정하려고 합니다.06:51
제가 수동으로 살펴보는 방법은 두 가지가 있습니다.06:56
처음 예시에서 했던 것처럼, 제가 아리아에게 자체적으로 생성한 실행 계획을 검토하거나 다른 실행 계획을 검토해서 무엇이 잘못되었는지 또는 잘 되었는지 판단하고, 프롬프팅을 통해 그러한 행동을 강화하도록 요청할 것입니다.07:00
무엇이 잘못되었거나 잘 되었는지 파악하고, 프롬프팅을 통해 그 행동을 강화하려고 합니다.07:05
혹은 다른 어떤 것이든요.07:11
그리고 에이전트의 실제 작동 방식은 비교적 간단합니다.07:13
다양한 모델들을 테스트해 보려고 합니다. 코어 위브 추론을 통해 제공되는 모델들과, 파운데이션 모델 플레이어를 통해 제공되는 모델들 등 다양한 모델을요.07:18
그래서 저희는 압축 방식을 다루는 비교적 일반적인 소프트웨어 스택을 정의합니다.07:25
그리고 컨텍스트를 준비하고 UI 페이로드를 조립하는 방식 등도요.07:29
다시 말씀드리지만, 이 뒤에 있는 기본적인 생각은 최대한 단순하게 만드는 것이 중요합니다.07:33
정확히 동일한 구성의 변형을 많이 가지는 것을 의미합니다.07:38
기본적으로 에이전트의 다양한 구성을 찾기 위해 YAML 파일을 활용하여 여러 개의...07:41
병렬 변형들을 만들어서 모두 테스트하고 결과를 확인해 보려고 합니다. 궁극적으로 문제를 더 좋게 만들기 위한 통찰력을 얻을 수 있지만, 만약 우리가07:46
오래된 강화 학습 훈련이나 단순한 모델 훈련에서 가져온 격언이 있다면, 적은 실험보다 많은 실험을 하는 것이 좋습니다.07:53
그래서 에이전트 하니스 자체의 핵심 이론도 바로 그거입니다, 네.07:59
그래서 에이전트 뒤에 있는 샌드박스 스택에 대해서도 이야기하게 됩니다.08:03
이 컨퍼런스와 다른 곳에서도 코드 모드에 대한 언급이 많이 있는 것 같습니다.08:07
저희는 고객들에게 최고의 제품을 제공하기 위해, 고객들이 무엇이든 할 수 있는 샌드박스 환경을 갖추고 싶습니다.08:11
원하는 대로 할 수 있는 환경을 만들고 싶었습니다. 예를 들어 어제까지는 ARIA가 여러 작업을 동시에 처리할 수 있을지 확실하지 않았습니다.08:18
그래서 발표 준비 과정과 함께 이 질문을 던져봤습니다.08:24
단순히 자체적으로 실행할 수 있는 테스트 환경을 만드는 것이었습니다.08:30
자체 연구 루프의 여러 개의 병렬 실행을 하는 것입니다. 그런 제약 없는 환경이 필요합니다.08:34
에이전트가 스스로 진화하는 행동을 하도록 유도하는 데 정말 도움이 됩니다.08:39
정확히 어떤 것인지 잘 모르겠습니다.08:45
여섯 개의 구절이 레코드당 의미하는 바는 잘 모르겠지만, 이론적인 관점에서는 그걸 구축하고 싶습니다.08:46
이러한 시뮬레이션 환경을 생성하기 위한 좋은 패턴이라고 생각합니다. 저희는 비교적 중립적인...08:52
전통적인 머신러닝 맥락에서 생각해볼 수 있는 DAG인데, 저희는08:57
설정 파일을 가져와서, YAML 파일들을 불러들여서 필요한 실시간 데이터를 로드합니다.09:01
환경을 설정합니다. 그리고 환경과 가중치, 편향은 상당히 비용이 많이 드는 편입니다. 왜냐하면 테스트해보고 싶은 많은 프로덕션 데이터가 있기 때문입니다.09:06
이는 완전한 머신러닝 훈련 로그입니다. 자동 연구를 수행한다면 GPU 실행을 시뮬레이션해야 할 수도 있습니다.09:12
그건 비교적 많은 자원을 사용하는 과정이기 때문에 병렬 처리하는 것이 좋을 수 있습니다. 그런 다음 다시 데이터를 불러오게 되는데, 종종 런타임 설정이 있어서09:19
YAML 사양에 포함할 수 없는 경우가 있기 때문입니다.09:24
그래서 그 데이터를 설정 파일에 다시 패치하시고요. 그리고 에이전트를 실행합니다.09:28
그리고 에이전트 실행은 아주 간단합니다. 처음에 말씀드린 것처럼, 운영 환경과 완전히 동일한 버전으로 실행하신 후 스코어링을 진행하시면 됩니다.09:33
그리고 제가 많은 시간을 할애하는 부분은 바로 결과 측정의 견고성을 고민하는 것입니다. 기본적으로 그렇게 하려고 노력합니다.09:39
여기 계신 분들 대부분이 이런 점들을 생각하는 데 능숙하다고 생각하며, 한번 실행 방법을 구성하게 되면 그 시간만큼 가치가 있다고 생각합니다.09:45
평가에 대해, 저희 이메일의 견고함에 대해서도 생각하고 있습니다. 제가 지금 화면에 보여드릴 수 없는 슬랙 메시지가 있는데, 한 팀원에게서 오늘 받았는데, 정말 기뻤습니다. 그는 어제 하루 종일 평가의 건강성에 대해 생각했거든요.09:52
그는 어제 하루 종일 평가의 건강성에 대해 생각하고 있었어요.09:58
그리고 저희의 평가와 실제 운영 환경 간의 차이점에 대해서도 생각해야 합니다. 왜 특정 기능이 잘 작동하는지, 또는 제대로 작동하지 않는지에 대한 이런 사고방식을 갖는 것은 정말 유용하다고 생각합니다.10:03
저희가 이 두 가지 패턴에서 발견하는 격차를 파악하는 것도 중요합니다. 저희의 경우, Weights and Biases ARIA 점수를 자체적으로 평가합니다.10:10
두 가지 패턴으로, 규범적으로는 작업을 통과했는지 여부를 판단하고, 상대적으로는 스타일을 설정할 수 있습니다.10:16
사용자에게 질문하는 방식과 질문하지 않는 방식으로 두 가지 변형이 있습니다.10:22
상대적인 점수 체계를 사용할 때 어느 쪽이 더 나은 성능을 보이는지 대략적으로 확인할 수 있습니다.10:27
강화 학습 관점에서는 상당히 전통적인 방식이라고 할 수 있습니다.10:30
그리고 물론, 이것을 병렬로 실행한다면 종료해야 합니다. 다시 시작하고 싶고, 팀원들의 작업을 망치고 싶지 않기 때문입니다.10:34
그래서 이번 프로젝트에서 어떤 일이 벌어질지 지켜보려고 합니다. 제 팀원들이 지금 평가를 진행하고 있기 때문입니다.10:41
그래서 아리아가 어떻게 수행될지 지켜봐야 할 것 같습니다.10:44
그리고 좀 더 전통적으로 말씀드리면, 작업의 경우 평가 작업은 단순히 YAML 사양이라고 생각합니다.10:47
우리가 환경의 시작 조건으로 사용자 설정들을 묶어서 정의하고, 또 원하는 종료 조건이 되도록 하는 것을 의미합니다.10:52
저희의 경우, 작업은 사용자 플로우인데, 이것을 세 가지 방식으로 시뮬레이션합니다.11:00
단순한 텍스트를 사용합니다. 예를 들어, 'ARIA야, 여기 지시사항이 있어.' 와 같이 말이죠.11:04
여기 채팅에서 ARIA가 생성하는 작업은, 로깅을 하는 과정이라고 생각하실 수도 있습니다.11:08
실제로는 프로덕션에서 특정 추적을 저희 로컬 프레임워크로 가져오는 것이 단순한 질문 하나와 비슷하게 보입니다.11:13
기본적으로 제가 던진 질문이었는데, ARIA가 스스로 자동 연구를 수행하는 바로 그 질문이었습니다.11:19
그냥 그렇게 하도록 계속 진행해 달라고 요청할 수도 있습니다.11:23
그리고 그 작업은 단 하나의 질문으로 이루어져 있습니다.11:29
이러한 작업의 다른 변형도 존재합니다. 여기서 저희는 언어 모델을 시뮬레이션합니다.11:31
특정 사용자의 페르소나를 가진 언어 모델이라고 가정하고, '이 사용자처럼 행동해서 특정 질문을 해 보세요'라고 요청하기도 합니다.11:36
특정 순서대로 질문을 던져서, 저희 에이전트와의 다중 회화 환경 및 상호작용을 시뮬레이션할 수 있습니다.11:40
그리고 이것들을 여러 번 실행하는 거죠. 저희는 886개의 작업을 가지고 있고, 난이도별로 분류했습니다.11:44
저희는 이 작업들을 제품 팀에 공개하여 그들이 작업이 충분히 좋은지, 그리고 저희의 벤치마크에서 중요하게 생각하는 것들을 반영하는지 판단할 수 있도록 합니다.11:48
그리고 저희는 이것을 여러 번 반복해서 실행합니다.11:54
네, 네, 그리고 결국 중요한 건 이 트레일러리가 제가 살아가는 데이터이자 핵심이라는 점입니다.11:57
그래서 저는 저희의 트래픽과 오프라인에서 존재하는 프로덕션 트레이스를 살펴봅니다.12:02
그것들이 존재하고, 저는 양쪽에서 모두 행동 패턴을 최대한 활용하려고 노력합니다.12:06
그래서 저희는 자체적으로 도구를 만들어 트레이스를 이해하려고 합니다.12:10
우리는 프로덕션과 오프라인 환경 모두에서 실행하는 행동 추적 프로젝트 같은 것들을 가지고 있습니다.12:14
네, 이것이 평가 순환(eval flywheel)입니다. 기본적으로, 모든 프로덕션에서의 실수나 좋은 결과도 마찬가지로...12:19
긍정적인 방향으로 탐색하는 것이 우리 에이전트 프레임워크의 과제가 될 수 있다고 생각합니다.12:25
그래서 그걸 이용해서 에이전트를 정의하고 개선해 나가고 있습니다.12:29
이것은 바로 Weave에서 가져온 실제 결과 값입니다. 저희는 여러 가지 다양한 범주를 기준으로 평가하고 있습니다.12:34
에이전트가 개념적으로 안내하는 능력은 정말 뛰어나다고 생각합니다. 프로젝트의 오류 분석 능력을 더 향상시키고 싶습니다.12:39
에이전트가 실제로 얼마나 잘 수행하는지 시험해 보기 위해, 저희는 이러한 과제를 최대한 어렵게 만들려고 노력합니다.12:44
자, 이제 ARIA로 다시 돌아가 보겠습니다. 데모 시간이 5분 정도 남았습니다. 현재 ARIA가 무엇을 하고 있는지 보여드리겠습니다.12:50
지금은 이 프로덕션 트레이스를 가져오고 프레임워크에 기록하려고 하면서 여러 코드를 실행할 겁니다.12:56
제가 방금 긴 프롬프트를 통해 시작한 이 라이브 데모로 들어가면, ARIA가 수행한 연구 실행 결과를 알려줄 거예요.13:00
이 링크들을 클릭해서 살펴볼 수 있습니다. 방금 실행했던 결과의 가중치와 편향 보고서를 이용해서 보고서를 작성해 달라고 요청했습니다.13:07
여기서 되돌려보면, 이 로그가 가장 최근에 기록된 프로덕션 추적 정보인 것을 확인할 수 있습니다.13:14
새로운 작업을 스스로 만들어서 실행하고 점수를 매겼습니다.13:17
따라서, 이 프로덕션 버전이 저희가 만든 특정 작업에 대해 벤치마크되고 있는 것입니다.13:20
생성된 보고서를 보면, 제가 시켰던 데모가 여기 있습니다.13:24
그래서 실제 WANB 에이전트 추적을 실행해서 WBAF 회귀 작업으로 만들었습니다.13:27
WBAF는 제가 구축하는 공장인데, 가중치와 편향 에이전트 공장을 의미합니다.13:33
저희 오프라인 벤치마킹의 기본 원리는 바로 이것입니다. 문제점은 저희가 SDK 호출 중 하나인 weave.log를 호출하지 않았다는 것을 파악했습니다.13:37
샌드박스 환경에서 제대로 실행되지 않았습니다. 소스 트레이스를 클릭해서 확인할 수 있고, 에이전트의 여러 버전을 테스트합니다.13:43
에이전트가 스스로를 어떻게 개선하는지 확인하기 위한 것입니다. 목표 지점을 추가했는데, 이는 문제 해결을 위해 무엇을 해야 하는지를 나타냅니다.13:49
추적을 실행했고, 그러면 마지막에 정확히 무엇이 발생했는지에 대한 설명을 조금 얻을 수 있는지 확인할 수 있습니다.13:56
프로덕션 버전과 후보 변형은 어떻게 수행되었나요?14:02
아시겠지만, 이게 제가 현재 사용하는 환경입니다. 그래서 이 플라이휠이 저에게는 정말 매력적이라고 생각합니다.14:07
제가 클라우드 코드로 돌아가서 오프라인 벤치마크를 작성하고 에이전트가 무엇을 해야 할지 고민하는 대신, 그냥 이 플랫폼에서 생활하게 될 것 같습니다.14:13
그리고 제가 실시간으로 트레이스를 확인하는 프로덕션 추적 프로젝트와 왔다 갔다 하면서 ARIA가 스스로 구축되는 것을 지켜볼 수 있습니다.14:20
다시 오프라인 평가 프로젝트로 돌아가 팀에서 무엇을 하고 있는지, 제가 무엇을 하고 있는지, 그리고 어떤 변경 사항을 원하는지 확인할 수 있습니다.14:27
어떤 변경을 프로덕션 스킬이나 에이전트에 적용했죠?14:33
이것이 배포되는 과정을 지켜보면서, 저희가 안고 있는 큰 과제 중 하나라고 생각합니다.14:40
이런 작업들 중 일부는 에이전트가 모든 것을 처리하도록 자동 모드로 전환하기가 정말 쉬울 수 있습니다.14:45
저는 아마 여덟 달 정도 코드를 한 줄도 작성하지 않았어요. 왜냐하면 제 코드는 모두 클로드에게 쓰도록 요청하고 있으니까요.14:49
정말 좋은 패턴이긴 하지만, 개선 방향을 고민하는 책임에서 벗어나게 해주지는 않습니다.14:54
이러한 도구를 활용하여 스스로를 발전시키는 것은 매우 가치 있는 일이라고 생각합니다. 왜냐하면 실제로 고민하며 사고하는 회색 지대에 더 많은 시간을 할애할 수 있기 때문입니다.14:59
어떻게 이 시스템을 더 좋게 만들 수 있을까요? 그렇죠? 에이전트를 구축하신다면, Weights & Biases를 사용하여 해당 에이전트를 추적하는 것을 강력히 권장합니다. 그 외에도 필요할 겁니다.15:06
저희는 모델 추적 플랫폼도 정말 훌륭한 편입니다. 그래서 지금까지 보여드린 다른 데모들도요.15:12
ARIA가 H200에서 실행되는 코어 인프라에 머신러닝 모델을 학습시키고 있습니다.15:16
그리고 카파시의 NanoChat이나 대규모 생산 프로젝트를 위한 자동 연구도 진행하고 있습니다.15:21
하지만 제게 가장 흥미로운 점은 이제 이 플랫폼을 떠나지 않고도 제 일을 할 수 있다는 것입니다.15:25
저는 프로덕션 환경에서도 전체적인 가시성을 확보하고, 오프라인 환경에서도 전체적인 가시성을 확보할 수 있습니다. 그리고 ARIA가 말하는 내용을 보면, 현재 실행되고 있는 것을 알 수 있습니다.15:31
저를 대신해서 스스로를 개선하기 위한 많은 평가들을 진행하고 있습니다. 그리고 방금 말씀드린 자동 모드는 정말 흥미롭습니다. 이제 제가 시간을 들여15:38
이 시스템을 더 잘 강화할 수 있도록 어떻게 해야 할지 생각하는 데 모든 시간을 쏟을 수 있게 되었거든요. 제가 이 주변에 설정할 수 있는 촘촘한 안전 장치들이 있죠.15:45
여러분 모두에게 더 유용한 도구로 만들고, 궁극적으로 저에게도 도움이 되도록 하기 위해서입니다.15:50
네, 간단한 시연이었습니다. 여기 ARIA에서 제공하는 프로덕션 콜 트레이스를 함께 살펴보겠습니다.15:55
이것은 방금 실행된 평가 결과입니다. 실제 추적을 살펴보면 ARIA가 많은 작업을 수행한 것을 알 수 있습니다.16:00
이 예측 점수 열에서 실행되었습니다. 여러 도구 호출이 실행되었고, 채팅으로 돌아가면 실제로 실행된 변형을 확인할 수 있습니다.16:06
주어진 후보 변수는 시스템 프롬프트나 특정 스킬에 주입된 짧고 간결한 프롬프트를 사용했던 것 같습니다.16:13
정확히 SDK 오류를 해결하고 완화하기 위한 목적이었던 것으로 보입니다.16:17
그리고 프로덕션에서 시뮬레이션으로, 그리고 에이전트로 데이터를 복제하고 개선 패턴을 정의하는 것과 같은 방식은요.16:21
제가 오늘 이 자리에 계신 분들께 드리고 싶은 말씀은 바로 그것입니다.16:26
그래서 이것이 코어위브 아리아입니다. Weights and Biases에 오신 것을 환영합니다.16:31
오늘 발표가 흥미로우셨기를 바라며, 저희가 오프라인 평가 지표를 구축하고 생산 환경에서 데이터를 수집하는 방법에 대한 내용이었습니다.16:34
그리고 에이전트를 구축하고 매일매일 고민하는 일들에 대한 피드백 루프입니다. 16:40
네, 시작하겠습니다. 모두 정말 감사합니다.16:45
AI Summary
Weights & Biases의 주빈 이솔라 발표 내용을 바탕으로 ARIA 에이전트 개발 및 평가 프레임워크에 대한 주요 내용들을 정리했습니다. ARIA는 YAML 사양으로 정의된 평가 작업을 통해 사용자 플로우를 시뮬레이션하며, 다양한 작업 유형(연구 자동 수행, 페르소나 기반 언어 모델 시뮬레이션 등)을 지원합니다. 특히 'Eval Flywheel' 시스템을 통해 프로덕션 데이터를 활용하여 에이전트 프레임워크를 지속적으로 개선하고 있으며, 자체 도구를 사용하여 행동 패턴을 분석하고 추적하는 프로젝트를 진행하고 있습니다. Weave는 에이전트의 안내 능력과 오류 분석 능력을 평가하는 데 사용되며, 자동 모드 전환 기능을 통해 개발자의 코드 작성 부담을 줄여줍니다. 앞으로는 프로덕션 환경 가시성 확보, ARIA 자체 개선 과정 관찰, 그리고 안전 장치 구축에 집중할 예정입니다.
Key Highlights
- •ARIA 에이전트는 YAML 사양으로 정의된 평가 작업을 통해 사용자 플로우를 시뮬레이션합니다.
- •Eval Flywheel 시스템을 활용하여 프로덕션 데이터를 기반으로 지속적인 개선이 이루어집니다.
- •자동 모드 전환 기능을 통해 개발자의 코드 작성 부담을 감소시킵니다.
- •Weave는 에이전트의 개념적 안내 능력 및 오류 분석 능력을 평가하는 데 사용됩니다.
- •향후 프로덕션 환경 가시성 확보, ARIA 자체 개선 과정 관찰, 안전 장치 구축에 집중할 계획입니다.

![Argy & Omnya - Aria [Live from Tomorrowland]](https://i.ytimg.com/vi/vn5RYH3MJIE/mqdefault.jpg)
