Home

읽기 설정

네, 안녕하세요 여러분, 그리고 이 세션에 참석해 주셔서 감사합니다.00:13

저는 티모시 스위니입니다. 웨이츠 앤 바이애스와 코어위브의 수석 엔지니어입니다.00:16

다음에 20분 동안은 저희의 새로운 인공지능 연구 및 반복 에이전트인 ARIA에 대해 이야기해 보겠습니다.00:21

시작하도록 하겠습니다.00:27

먼저, 분위기를 좀 내고 박수를 유도하기 위해, 여기 머신러닝 연구자라고 생각하시는 분 계신가요?00:30

모델을 학습시키고, 마치 뇌를 훈련시키는 일을 하시는 분이시군요. 한 분 들렸습니다.00:37

와우, 좋아요, 정말 멋진데요, 아주 훌륭합니다. 그럼 여기 계신 분들 중에 어플라이드 엔지니어, 이 컨퍼런스의 이름을 따서 만든 분은 누구신가요?00:43

여기 실제로 봇을 만드는 분은 누구신가요?00:48

네, 좋아요. 사실 좀 더 기대했는데. 혹시 인공지능 관리 쪽 일 하시는 분 계신가요?00:51

여러분은 이 컴퓨팅 자금을 지원하고 계시는군요.00:55

네, 네, 좋네요. 뒤에서 보니까 멋지네요. 자, 이제 여러분에 대해 조금 알게 됐으니,00:58

저에 대해서도 간단히 말씀드릴게요. 제 이름은 팀입니다. 저는 조지아텍에서 머신러닝과 강화학습 석사 학위를 취득했습니다.01:03

그래서 저는 그 연구원을 맡았었고요.01:10

현재 Weights & Biases 에이전트 아리아를 개발하고 있는데, 그래서 응용 엔지니어라고 생각하시면 됩니다.01:11

이전에는 트위터의 머신러닝 스택 PM을 맡았었고요, 아마 중간 관리자분들과도 공감하실 수 있을 겁니다.01:17

오늘의 주요 내용은 세 가지 섹션으로 나뉘어져 있으며, 각 세션에서 유익한 정보를 얻으실 수 있기를 바랍니다.01:22

여러분의 많은 분들이 유용한 정보를 얻으셨으면 좋겠고, 우선 아리아 자체에 대해 알아보겠습니다. 그리고01:29

인공지능 및 머신러닝 워크플로우를 혁신적으로 개선할 수 있는 방법에 대해 자세히 살펴보겠습니다. 자동 연구 과정을 살펴볼 것입니다.01:34

잠시 후에 라이브 데모를 진행할 예정입니다.01:39

그럼 이제 저희가 Weights and Biases와 CoreWeave를 활용하여 Aria를 어떻게 구축하는지 살펴보겠습니다.01:42

시청자 여러분 중 많은 분들이 직접 에이전트를 개발하고 계신 것으로 알고 있습니다. 저희는 이러한 구성 요소들이 여러분의 노력에 도움이 될 것이라고 믿습니다.01:48

그리고 발표 후반부에는, 시스템을 효과적으로 프로덕션 환경으로 옮기기 위한 몇 가지 주요 팁과 트릭을 살펴보겠습니다.01:55

혹시 Weights and Biases가 익숙하지 않으신 분들을 위해 말씀드리자면, Weights and Biases는 세계 최고의 AI 개발 플랫폼입니다.02:02

저희는 벌써 9년 동안 사업을 해왔고, 약 1년 전에 CoreWeave 가족에 합류하게 되었습니다.02:08

저희는 다양한 제품군을 보유하고 있지만, 모델, 학습, 추론, 그리고 WeaveStack으로 특히 잘 알려져 있습니다.02:13

이 기능은 인공지능 개발 및 머신러닝 워크플로우에 대한 데이터를 수집하고, 그 정보를 실용적인 정보로 활용할 수 있도록 돕습니다.02:18

그리고 사용자들이 다음에 무엇을 해야 할지 가장 좋은 결정을 내릴 수 있도록 지원합니다.02:25

그럼 더 이상 지체하지 않고, 아리아라는 저희 에이전트에 대해 바로 알아보겠습니다.02:30

데모를 보여드리고, 그 다음에 슬라이드로 다시 돌아가겠습니다.02:34

네, 좋습니다.02:40

이걸 조금 더 크게 만들어 볼까요. 더 크게 필요하시면 말씀해주세요. 여기 보이는 것은 Weights & Biases 워크스페이스입니다.02:42

익숙하지 않으신 분들을 위해 말씀드리자면, 왼쪽에 다양한 실험 목록이 보이고 있습니다.02:49

이 프로젝트에서는 200개 이상의 학습 작업을 진행하고 있습니다.02:55

오른쪽에는 이 경우 감소하는 지표를 나타내는 산점도가 보입니다. 좋은 결과네요.02:59

이는 손실이 시간이 지남에 따라 감소하고 있다는 의미입니다. 그리고 이 화면은 저희 도구를 사용하시는 분들께 익숙하실 겁니다.03:04

설명을 위해, 현재 Carpathia 자동 연구 프로젝트를 사용하고 있는데, 아마 많은 분들이 이미 알고 계실 겁니다.03:10

혹시 익숙하지 않으신 분들을 위해 말씀드리자면, 굉장히 간단한 프로젝트로 LLM을 학습시키는 것입니다. 아주 좋은 기반이 될 수 있습니다.03:17

자동 연구 시연에 적합한 기초가 되기 때문에 코드 베이스가 매우 단순하고 시간이 지남에 따라 반복적으로 개선할 수 있습니다.03:22

자, 그럼 프로젝트로 돌아가서 오른쪽 상단의 파란 버튼을 클릭해서 ARIA를 열어보겠습니다.03:30

이 버튼을 누르면 익숙한 채팅 인터페이스가 나타납니다. 음, 무엇을 도와드릴까요? 몇 가지 안내 문구가 보일 거예요.03:35

그리고 제 프로젝트에 다양한 컨텍스트를 추가하거나 이미지 같은 것도 넣을 수 있습니다.03:41

여기 계신 분들은 모두 에이전트 빌더시니까, 에이전트 인터페이스가 어떻게 생겼는지에 대한 자세한 설명은 드리지 않아도 될 것 같습니다.03:48

하지만 간단한 소개를 여기 입력해 보겠습니다.03:53

안녕하세요, 아리아입니다. 에이아이 월드 페어 2026 무대에서 진행하고 있습니다.03:57

자기소개를 부탁드립니다. 그리고 계속 진행되면서 멋진 이모티콘이 나오기를 바랍니다.04:01

네, 저는 아리아입니다. 관객분들과 대화하고 있습니다, 정말 좋네요.04:06

하지만 이제 여러분이 오신 이유의 핵심적인 부분으로 들어가 보겠습니다. 지금 이 채팅을 열어볼게요. 저는 벌써 200번 넘게 이 채팅을 진행해 왔습니다.04:09

오랜 기간 동안 계속해서 운영해 온 채팅입니다.04:14

오토 리서치 루프를 사용한 실험을 진행하는 데 도움이 되었고, 코드를 다운로드하고 설정 작업을 하고, 실행 작업을 설정하고 GPU도 설정해 주었으며,04:18

코드 자체적으로 자율적으로 반복할 수 있는 기능을 가지고 있습니다.04:24

그리고 하이퍼파라미터는 잠시 후에 확인해 보겠습니다만,04:28

이 작업을 진행하는 동안 바로 여기에서 라이브 반복을 시작할게요. 무엇을...04:32

말씀하시는 건, 또 다른 실험 배치를 진행해 달라는 뜻이네요.04:37

지금은 2026년 인공지능 엔지니어 박람회 무대 위에 계십니다. 저희는 여기서 최고의 모델을 실시간으로 찾기를 바랍니다.04:40

저희는 모델들을 격려해야 한다고 생각하기 때문에 여러분을 믿습니다.04:46

그래서 이 작업을 한동안 해왔어요. 여기서 하고 있는 것은 '좋아요, 잘 됐네요'라고 말하는 거예요.04:50

큰 구조 변경은 위험하다고 느껴지기 때문에 하고 싶지 않습니다.04:54

아마 약간의 수정 사항을 적용할 것으로 예상됩니다.04:56

하이퍼파라미터를 설정하고, 여기서 셸 호출을 실행하고 있습니다.05:01

실제로 그 실험 루프를 실행하는 과정입니다.05:04

발표 내내 주기적으로 이 부분을 확인해 보겠습니다. 하지만, 어떤 일이 진행되고 있는지 설명하고 싶습니다.05:10

화면 뒤에서는 웨이츠와(waits and)를 설정했습니다.05:16

런칭 큐를 시작합니다. 런치는 저희 제품으로, 컴퓨팅 클러스터를 연결하고 인간과 에이전트가05:19

장시간 실행되는 실험 작업을 시작할 수 있도록 지원하며, 특히 GPU를 활용하는 데 유용합니다.05:26

여기서는 제가 쿠버네티스 클러스터의 터미널 출력을 보고 있는데, 실제로 실험이 진행 중인 것을 확인할 수 있습니다.05:30

실시간으로 실험이 진행되고 있는 모습입니다. 지금 이 화면에서 바로 진행되는 것이고, 가짜 시연은 아닙니다. 좋습니다.05:37

되돌아가 보면, 이 시점에서 작업 대기열이 시작되었고 지금은 단순히 폴링하면서 기다리고 있습니다.05:44

잠시 후에 다시 돌아가서 확인해 보겠습니다.05:50

하지만 다른 예시들을 좀 더 자세히 살펴보겠습니다.05:53

다른 흥미로운 점은, 아마도 다음과 같은 기능을 사용할 수 있다는 것입니다.05:55

프로젝트에서 가장 성과가 좋은 실행 결과를 요약해 달라고 질문할 수도 있습니다.06:01

이 사용 사례는 새로운 팀원이 프로젝트에 합류하여 연구 내용을 이해하고 싶어하는 경우와 비슷합니다.06:05

혹시 휴가 중에 다른 분이 업무를 진행하셨고, 그 내용을 따라잡고 싶으실 수도 있습니다.06:11

잠시 후에 어떤 결과가 나올지 확인해 보겠습니다. 또 다른 예로는 프로젝트에서 패턴을 찾는 것이 있습니다.06:16

그래서 여기에서 제가 이렇게 물어봤습니다. '이 연구에서 패턴을 찾아줄 수 있나요?'06:23

그리고 그 결과가 나타났습니다.06:27

자동 연구가 진행되는 동안 새로운 모델 패밀리가 등장했습니다.06:30

배치 사이즈가 중요한 파라미터라는 것을 찾아냈습니다.06:35

아주 유망해 보이는 아키텍처 레시피를 찾아냈습니다.06:41

그리고 제가 혼자서 몇 시간 또는 며칠이나 걸렸을 다른 여러 가지 통찰력들도 발견했습니다. Aria는 그것을 바로 해낼 수 있습니다.06:45

제가 이미 사용하고 있는 인터페이스 안에서 바로 저에게 제공되네요.06:51

텍스트 기반의 결과물을 내놓는 것뿐만 아니라, 다양한 기능과도 깊이 연동될 수 있답니다.06:55

여기서는 가중치와 편향 시각화 유틸리티들을 활용해서 보고서를 생성하도록 요청했습니다. 이 보고서는, 익숙하지 않으신 분들을 위해 말씀드리자면, 마크다운 파일보다 훨씬 강력합니다. 내장된 플롯, 차트, 그래픽 등이 포함되어 있습니다.07:01

여기서는 가중치와 편향 시각화 유틸리티들을 활용해서 보고서를 생성하도록 요청했습니다. 이 보고서는, 익숙하지 않으신 분들을 위해 말씀드리자면, 마크다운 파일보다 훨씬 강력합니다. 내장된 플롯, 차트, 그래픽 등이 포함되어 있습니다.07:08

그리고 여기에서, 음, 이 프로젝트의 핵심 내용을 설명하고 있습니다.07:15

다양한 데이터 패널을 출력했고, 실제로 저는 이것이 상당히 흥미롭다고 생각합니다.07:19

저희가 좀 더 난해한 패널 중 하나를 사용해서요.07:24

매개변수 중요도 차트를 통해 여러 요소들의 상관관계를 알려주었습니다.07:26

이 학습 작업 내의 다양한 파라미터들에 대해서도 보여줍니다.07:32

보고서 외에도 정말 유용하게 활용할 수 있습니다.07:34

워크스페이스를 다루는 데 익숙해지도록 도와줍니다. 따라서 웨이트 앤 바이어스 사용자들이라면 많은 시간을 워크스페이스를 설계하고 작업하는 데 쓰실 거예요.07:39

ARIA는 실제로 맞춤 설정되고 프롬프트되어서, 사용자분들이 워크스페이스를 디자인하고 작업하는 데 드는 시간을 절약해 드릴 수 있습니다.07:44

작업 공간을 구축하고, 플롯을 만들고, 데이터 분석을 보완하는 방법을 정말 이해하려면,07:50

무게와 편향 사용자들이 잘 알고 사랑하는 내장 독점 차트를 사용하여 실시간 그래픽으로 작업할 수 있습니다.07:55

자, 그럼 이제 프롬프트 몇 가지를 다시 확인해 보겠습니다. '이 프로젝트 요약해 주세요'라는 프롬프트가 현재 처리 중인 것을 확인할 수 있습니다.08:02

Weights and biases에 쿼리를 보내고, 패치를 적용하고, 자체 코드를 작성하고 있습니다.08:09

잠시 후에 다시 확인해 보겠습니다. 그리고 저희의 장시간 실행 중인 학습 작업은 아직 결과를 불러오고 있습니다.08:12

GPU에서 열심히 처리하고 있는 것을 확인할 수 있습니다.08:18

그래서 GPU를 열심히 돌리면서 데이터 과학 작업도 실시간으로 진행하고 있습니다.08:21

그게 완료될 동안, 발표 화면으로 다시 돌아가 보겠습니다. 잠시 후에 다시 확인하겠습니다.08:25

아니에요. 사전을 보고 있는 게 아니에요. 아프리조를 보고 있습니다. 좋습니다. 좋아요.08:33

자, 간단히 요약해 보자면, 방금 전에 ARIA가 무엇을 보여줬나요?08:38

다섯 분 동안 보여드릴 내용입니다. 먼저, Aria가 Weights and Biases 내에서 데이터 과학 도구로서 여러분의 조력자가 되어08:41

알지 못했을 통찰력을 발견하는 데 도움을 줄 수 있습니다.08:46

실험 규모가 커지고 팀의 규모도 늘어날수록 인사이트를 발견하는 데 도움이 됩니다.08:50

다음으로 복잡한 보고서 작성과 복잡한 그래프 생성 문제를 해결합니다.08:55

Weights and Biases 사용자분들은 정말로 그들의 인사이트를 시각적인 커뮤니케이션 도구로 만들고 싶어하시더라고요.08:59

동료들과, 그리고 함께 일하는 분들과 소통하고 싶어합니다. 그래서 Aria는 기본적인 요소들을 이해할 수 있도록 처음부터 설계되었답니다.09:04

그리고 코파일럿을 도와 함께 사용자 인터페이스 안에서 조작할 수 있습니다.09:10

그리고 오늘 처음으로 발표합니다. ARIA를 저희 iOS 앱에 출시하게 되었습니다.09:15

그래서 아리아는 월요일에 출시되었고, 저희 iOS 앱에도 아리아가 내장되었습니다.09:21

만약 여러분이 하이퍼파라미터 튜닝 작업을 진행하고 있거나, 모델을 학습시키고 있거나, 아니면 Weights & Biases 생태계 안에서 연구를 하고 있다면,09:27

예르바 부에나 정원에서 잔디를 밟으시면서도 하이퍼파라미터 튜닝 작업을 조정하실 수 있습니다.09:33

모바일 기기에서 모든 것을 할 수 있고요. 무엇을 위한 것인지 궁금하신가요?09:40

이것은 완전 자동화된 엔드 투 엔드 연구 플랫폼으로 이어지는 과정입니다. 저희는 강화 학습 연구자들을 대체하려는 것이 아니라,09:43

여러분의 워크플로우를 보완하고자 합니다. ARIA는 작업 조정과 GPU 워크로드 이해에 탁월합니다.09:50

WANB 생태계 내의 이벤트에 대응하고, 연구자들의 의견을 경청하며, 아카이브 논문들을 검색하고 가설을 함께 검토합니다. 그래서 ARIA가 여러분이 신경 쓰지 않아도 되는 메커니즘들을 처리하도록 할 수 있습니다.09:55

ARIA가 여러분이 원하지 않는 부분을 처리하면서 새로운 아이디어, 새로운 구조, 그리고 시도해보고 싶었던 새로운 파라미터에 집중하실 수 있도록 돕습니다.10:01

새로운 아이디어, 새로운 아키텍처, 그리고 시도해 보고 싶었던 새로운 파라미터에 집중하실 수 있도록 처리하는 번거로움을 원치 않으실 겁니다.10:06

네, 좋습니다. 간단히 말해서 이것이 ARIA입니다. 꼭 사용해 보시길 바랍니다.10:13

그리고 잠시 후 자동 연구 부분으로 돌아가서 새로운 최고 기록을 달성했는지 확인해 보겠습니다.10:17

하지만 그 전에, 저희가 어떻게 가중치와 편향, 그리고 코어 위브를 활용하여 ARIA를 실제로 구축하는지 이야기해 보도록 하겠습니다.10:22

여기 계신 많은 AI 에이전트 개발자분들께 말씀드리자면요.10:27

간단하게 마크-어-텍스처를 보여드리겠습니다. 왼쪽에 보시면 저희의 웹 클라이언트 또는 iOS 클라이언트가 API 서버와 통신하는 것을 확인할 수 있습니다.10:31

데이터를 저희의 회전 데이터베이스에 저장하고, 저희 워커 하니스가 처리합니다.10:38

이것은 아마 대부분 여러분께서 현재 만드시는 것과 매우 유사하며, 저희 백엔드에서도 동일하게 사용하고 있습니다.10:42

하지만 그 하니스 워커는 마치 마법 상자와 같아서 여러 중요한 유틸리티와 연결되어 있습니다.10:49

가장 먼저, 임의의 셸 명령을 실행하고 파이썬 데이터 과학 등을 수행할 수 있는 샌드박스가 있습니다. 저희는 여러분께 이것을 권장합니다.10:54

코어위브 웨이츠 앤 바이어스 샌드박스를 사용해 보시고, 여러분의 아키텍처에 맞게 적용해 보세요.11:01

다음으로 LLM 제공업체가 필요합니다. GLM 5.2나 다른 모델을 사용하고 계시다면요.11:06

미세 조정된 모델들을 사용해보시라고 Weights and Biases 추론을 초대하고, 이를 워커에 연결하는 것을 권장합니다. 만약11:12

저희처럼 장시간 실행되는 작업을 메인 루프 외부에 실행해야 한다면요.11:19

에이전트 학습을 진행하는 과정에서 날짜 단위 또는 때로는 며칠 동안 학습해야 할 때, Weights & Biases Launch를 통해 이를 지원하고, Coreweave GPU는 컴퓨팅 성능을 향상시키는 데 도움을 줄 수 있습니다.11:23

Weights & Biases Launch는 실제로 그러한 과정을 용이하게 하고, Coreweave GPU는 컴퓨팅 능력을 제공할 수 있습니다.11:27

더욱 좋게 만들고, 마지막으로 정말 중요한 것은 관측 가능성 레이어가 필요하다는 것입니다.11:31

에이전트가 세션에서 무슨 일이 일어나고 있는지 기록할 수 있도록 하는 것이 매우 중요합니다.11:37

그들의 차례, 사용하는 도구 호출, 발생하는 오류 등등을 기록하고 있습니다. 저희는 'Weights and Biases Weave'라는 제품이 있는데,11:41

저희와 팀에서 학습할 수 있도록 모든 추적 정보를 기록합니다. 그리고 그것이...11:47

여기서는 프로덕션 환경에서 오프라인으로 전환하여 저희 팀이 Weights & Biases Weave를 활용할 수 있습니다.11:52

분석 결과를 도출하고, 행동 패턴을 파악하며, 일종의 단위 테스트와 같은 작업을 수행할 수 있습니다.11:58

귀하의 모델을 평가하고 반복적으로 개선해 나가도록 합니다. 저희는 모델 저장소를 가지고 있으며, 필요에 따라 Weights and Biases 아티팩트를 사용하여 에이전트나 모델을 저장할 수 있습니다.12:03

저희는 평가 결과를 Weave로 전송합니다.12:09

여기서 저희는 공동 대시보드를 가지고 있어서 다양한 프롬프트 변경이나 아키텍처 변경에 대한 실행 가능 여부를 결정할 수 있습니다.12:16

그것은 저희가 개선 루프라고 부르는 연구 루프로 이어지는데, 여기서 가설을 세우고 후보 에이전트를 구현합니다.12:22

그리고 평가 결과를 분석해서, 저희는 서로 보완적이면서도 경쟁적인 두 가지 연구 루프를 가지고 있습니다.12:28

오프라인에서 데이터가 Weights & Biases Weave로 흘러 들어가 결국 식별하도록 진행되고 있습니다.12:33

최고의 모델을 만들어서 저희 레지스트리를 통해 프로덕션으로 배포하고, 데이터 순환 고리를 닫을 수 있도록 하겠습니다. 다음으로는, 대략 세 분에서 일곱 분 정도 시간을 내어 웨이츠에 대해 이야기하겠습니다.12:39

데이터 플라이휠을 닫기 위해, 다음에는 약 삼분에서 일곱 분 정도 웨이츠에 대해 말씀드리겠습니다.12:43

그리고 biases weave를 통해 저희 팀이 실제로 이 워크플로우를 진행하는 방식을 보여드리겠습니다.12:49

저희는 이것이 여러분 모두, 특히 에이전트 빌더분들께도 도움이 될 것이라고 믿습니다. 네, 다음 데모입니다.12:53

네, 좋습니다.13:00

알겠습니다. 새로운 응답이 들어왔으니, 나중에 열어볼 때 더 좋은 지표를 얻었는지 확인하는 것이 기대되네요.13:03

네, 화면을 조금 확대해서 보여드릴게요. 여기는 에이전트 대시보드를 보고 있는 화면입니다.13:10

이것은 라이브 웨이트와 바이어스 에이전트, 즉 ARIA 에이전트 대시보드로, Weave에 내장되어 있습니다.13:15

와, 정말 많은 브랜드 용어가 있네요. 저희 도구를 사용하시면 이런 대시보드를 얻으실 수 있습니다.13:21

그리고 스팬 볼륨, 볼륨, 대화량, 토큰 추적 등 다양한 지표를 확인하실 수 있습니다.13:26

이걸 에이전트의 새 내려다보는 시점이라고 생각하시면 돼요. 그런데 저는 이 대화 보기 기능이 정말 마음에 들거든요.13:32

저를 위해서라면, 특히 이 대화 보기 화면이 좋았습니다.13:34

이 탭에는 미리 로드된 정보가 있습니다. 이 대화 보기에서는 ARIA를 통과하는 모든 대화를 실시간으로 확인할 수 있지만, 내부 직원으로 필터링되어 있어서 조금 축소된 세트입니다.13:39

현재 진행 중인 ARIA의 대화들을 실시간으로 보여주는 화면이며, 내부 직원들의 대화만 표시되도록 설정되어 있어 데이터가 약간 줄어든 상태입니다.13:45

제가 가장 좋아하는 건 이 중간 스팬즈 보기인데, 이게13:51

어떤 트레이스의 토폴로지를 시각적으로 보여주는 지표가 됩니다.13:55

다른 색상과 모양은 에이전트 내에서 일어나는 다양한 상황을 나타냅니다.13:58

도구 호출이나 LLM 호출, 사고 블록 등과 같이 제가 이해하는 데 정말 도움이 되는 형태와 토폴로지가 있습니다.14:03

해당 대화의 특정 부분입니다. 물론, 이 대화 중 하나를 열어서14:10

대화 내용을 확인할 수 있습니다. 시스템 프롬프트, 사용자 메시지, 셸 등을 볼 수 있죠.14:14

통화 기록이나 추론 블록 같은 것들인데요. 제 연구 리드, 저 그리고 제품 관리자(PM)가 이 부분에서14:20

메모를 추가하고 피드백을 남기며, 이모지를 사용하고, 그런 인사이트들을 논의하고 발견하기 위해 방문합니다.14:25

방금 말씀드린 행동 양상들의 미묘한 차이점을 고려해서 업무로 연결할 수 있도록 합니다.14:30

ARIA는 Weights and Biases 시스템에도 내장되어 있습니다. 여기 보시면 요약 버튼이 있는데, 이런 버튼들이 곳곳에 배치되어 있습니다.14:35

Weights and Biases 애플리케이션에서 요약 버튼을 그냥 클릭하면 제가 보고 있는 내용과 관련된 새로운 채팅이 시작됩니다.14:41

그러면 이 내용을 보고, 해당 대화의 간략한 요약을 제공해 달라고 요청합니다.14:48

만약 주의 깊게 보고 계시다면, 저희가 하고 있는 일은 ARIA를 활용해서14:53

ARIA 자체의 대화를 분석하여 ARIA를 개선하는 방법에 대한 제안을 UI 내에서 제공하는 것입니다.14:58

네, 좋습니다. 그게 처리되는 동안 보여드릴 게 하나 더 있습니다. 바로 Weave 에코시스템 내의 시그널 기능입니다.15:06

오늘 평가(evals)와 LLM 심판(LLM judges)의 가치에 대해 많이 이야기를 들었을 겁니다.15:13

위브는 실제로 통합된 LLM 심사 환경을 제공합니다.15:17

여기서 조금 확대해서 보면 사용자 불만 신호가 있다는 것을 알 수 있습니다.15:21

저품질 응답 신호, 사용자 요청 신호 등등이 있습니다. 이들은 실시간으로 실행되는 LLM 평가 모델들입니다.15:26

실시간 트래픽에 대해 작동하며, 사용자의 불만족 순간이나 저품질 응답과 같은 다양한 신호를 확인할 수 있습니다.15:31

이러한 지표들은 저희 팀에서 이러한 행동 패턴을 파악하여 다음 주 반복 과정에서 수정할 수 있도록 도와줍니다.15:38

자, 바로 실시간으로 확인해서 무엇이라고 표시되어 있는지 한번 보겠습니다. 여기에는 사용자가 명시적으로 언급했습니다.15:43

제가 손실 곡선에 만족스럽지 않다고 말씀하셨어요. 보기 안 좋고, 분명히 실망감을 나타내는 것 같아요.15:49

여기서 LLM 심사관의 실시간 재-를 확인할 수 있습니다.15:54

자, 확인해 보겠습니다. 남은 시간은 4분입니다. 완벽하네요.16:02

그 점과 관련해서, 저는 '태스크(task)'라는 용어를 많이 사용하고 있습니다. 제가16:05

지금까지 보여드린 것은 프로덕션 로그를 추적하는 실시간 생산 루프입니다.16:09

사람들이 직접 확인하고 있거나, 심지어 LLM을 활용하여 분석을 보조하기도 합니다.16:14

결과적으로 저희는 그걸 작업(task)으로 변환하게 됩니다.16:18

이 부분은 조금 기술적인 내용이 될 수 있습니다만, 저희의 작업(task)들은 모두 YAML 파일로 정의되어 있습니다.16:21

모델에 대한 일종의 단위 테스트라고 생각하시면 됩니다. 여기서는 예시 사용자 프롬프트를 정의한다고 말씀드릴 수 있습니다.16:26

이 실행 결과와 저 실행 결과를 확인해 달라고 하는데, 둘 다 좋은 결과를 보여주고 있습니다.16:32

이걸 통해 무엇을 배울 수 있을까요? 어떤 차이가 있을까요? 저희는 ARIA가 여러분 모두에게 유용하게 잘 작동하도록 만들고 싶습니다.16:37

필요한 메타데이터 이후에는 LLM 평가 모델을 정의했습니다.16:44

그래서 여기서는 질문의 맥락에서 정확성이 무엇을 의미하는지 정의했습니다.16:49

그리고 나서 두 번째 LLM 평가 모델도 정의했습니다.16:52

그 통찰력이 실제로 흥미로운지 판단하는 역할을 합니다.16:56

그리고 세 번째 규칙 기반 평가 모델을 정의했는데, 결과물을 실제로 생성할 수 있었는지 확인합니다.17:00

단 여섯 번의 도구 호출 안에 해결했어요. 어느 정도 신속하게 답을 찾았다는 의미입니다.17:07

이런 결과들을 모아서 200개 정도 묶어서 평가 세트를 만들고 있습니다.17:12

매일 밤 실행되죠. 그리고 다시 말씀드리지만, Weave를 이용해서 모든 평가들을 추적하고 있습니다.17:18

여기 보시면 화면이 조금 작을 수 있지만, 보시는 게 매일 밤 진행된 평가 목록입니다.17:22

이것은 바로 이틀 전의 결과입니다. 저희 후보 모델의 평가 점수가 실제 서비스 환경에서 73%를 기록했는데, 이는 저희 평가 스위트 기준으로는 72%를 기록한 기존 모델보다 높은 수치입니다.17:28

따라서 이번 주 금요일에 해당 모델을 적용할 예정입니다.17:35

오른쪽에 성능 그래프를 확인할 수 있습니다.17:41

이러한 유틸리티들은 Weave를 선택하고 이 도구를 사용하기로 결정하신다면 기본적으로 제공되는 것들입니다.17:44

이전에 나눴던 대화로 돌아가서, 혹시 이 추적 결과를 간단하게 요약해 주실 수 있는지 여쭤봤었는데요. 확인해보니 실제로 그 대화를 분석하고 어떤17:50

내용인지 이해한 것을 알 수 있습니다.17:55

사용자가 무엇을 하고 있었는지 분석했고, 결국 이 추적이 상당히 유효하다고 판단했습니다.18:00

남은 시간이 두 분 반 정도 남았네요. 간단하게 요약해 보겠습니다.18:07

우선, 웨이브를 이용해서 하는 일은 생산 트래픽을 수집하는 것입니다.18:11

학습하고 개선하기 위해서는 모든 생산 트래픽을 수집하는 것이 매우 중요합니다.18:14

두 번째로, 이를 활용해서 인사이트를 생성합니다. 사람으로서도 직접 분석하고, ARIA와 LLM 평가 모델을 이용해서도...18:19

이러한 행동 양상의 미묘한 차이를 파악합니다.18:26

그런 다음 저희는 작업들을 풍부하게 만들고, 모델을 구현하고, Weights and Biases Weave를 공유 대시보드로 사용하여 평가합니다. 이를 통해18:28

팀 전체가 함께 의사 결정을 할 수 있습니다. 궁극적으로 가장 좋은 모델을 확신에 찬 마음으로 발전시킬 수 있도록 돕습니다.18:35

자, 자신감 있는 프로덕션화를 말씀드리자면, 방에 계신 관리자분들께 잠시 이야기 드리겠습니다.18:43

성공적인 결과를 얻기 위한 몇 가지 팁이 있습니다.18:47

첫 번째는 에이전트 중심의 관측 가능성에 투자하는 것입니다.18:51

저는 조금 편향적일지도 모르지만, Weights and Biases Weave가 미래의 관측 가능성 플랫폼이라고 믿습니다. 하지만 여러분이 가장 좋아하는 것을 선택하세요.18:55

무엇이든 간에 세션 기록을 남기고, 턴 기록을 남기고, 도구와 피드백도 기록하세요.19:02

이렇게 하면 우리 세계에서 발생하는 새로운 유형의 버그, 즉 행동 버그를 잡을 수 있게 됩니다.19:05

예외나 성능 문제가 아니라, 행동 관련 버그입니다.19:10

다음 주제는 작업과 평가가 새로운 CI 환경이라는 것입니다.19:14

이것에 대해 많이 들어보셨을 겁니다. 만약 소프트웨어 엔지니어라면, 평생 유닛 테스트를 작성해 오셨을 거예요.19:17

연구원들이 여러분과 같은 스크럼 팀에 참여하여 작업 개발을 하고 성능 지표를 함께 검토하는 관행을 만들어야 합니다.19:22

진정한 성공 또는 실패를 결정하는 것이 중요합니다. 하지만 그것을 보완하기 위해서는 인간이 필수적인 판단자 역할을 해야 합니다.19:28

LLM이 포착하지 못할 행동 양상의 미묘한 차이가 있습니다. 반드시 여러분의 제품을 사용해 보셔야 합니다.19:35

그리고 팀 전체가 매주 회의에서 이 추적 로그들을 직접 검토해야 합니다. 게시판을 보면서 가장 좋고 나쁜 추적 로그를 살펴보는 거죠.19:39

모델의 성능이 어떻게 나타나는지 이해하기 위해서입니다.19:46

마지막으로, 컨텍스트와 도구를 활용하여 가치를 더하는 것도 좋은 방법입니다.19:49

메모리나 이와 관련된 창의적인 기능을 과도하게 구현하려는 유혹을 받을 수도 있습니다.19:55

저희는 에이전트에게 귀사의 사업 분야에 대한 정보, 사용 가능한 기본 요소, 그리고 특정 사업 데이터를 제공하는 것만으로도 많은 쉽게 얻을 수 있는 성과를 달성할 수 있다는 것을 발견했습니다.20:01

즉, 현재 사용 가능한 원시 데이터와 귀사의 특정 사업 데이터를 제공하는 것입니다.20:07

그래서, 이제 연구 에이전트의 진행 상황을 확인해 보겠습니다.20:12

이제 작업 공간을 변경하고, 네, 다음과 같이 나타나야 합니다.20:18

네, 작은 점이네요. 아, 알겠습니다. 점심에 했던 이전 점수는 5.831입니다.20:24

이번에는 5.833을 기록했습니다. 거의 실시간으로 개선될 수 있는 아주 가까운 수준이었네요.20:30

그래서 모델이 이렇게 결과를 낼 수 있었습니다.20:37

실제로 여기에서 여러 번 테스트를 진행했네요. 시간이 지나면서 확인하고 있습니다. 곧 닫겠지만, 총 12번 실행했습니다.20:40

해당 실험 배치 내에서 다양한 실험을 진행했고, 밤새 더 많은 실험을 계속할 예정입니다.20:47

아리아 스캔을 사용해보시고 QR 코드를 확인하시고 문서를 살펴보세요. 여러분이 무엇을 하시든 정말 보고 싶습니다.20:51

이용해 주셔서 감사합니다. 앞으로도 잘 부탁드립니다.20:56

AI Summary

Weights and Biases에서 개발한 ARIA는 연구자의 워크플로우를 지원하고 생산성을 높이는 AI 코파일럿입니다. ARIA는 연구 내용 이해, 보고서 자동 생성, 워크스페이스 관리 지원 등 다양한 기능을 제공하며, iOS 앱을 통해 모바일 환경에서도 활용 가능합니다. 또한, Weights and Biases Weave를 활용하면 에이전트 개발 및 개선 프로세스를 최적화하여 데이터 분석, 모델 평가, 실시간 모니터링 등을 수행하고, 지속적인 개선 루프를 구축할 수 있습니다. 핵심은 에이전트 중심 관측 가능성에 투자하고, 작업 정의를 통해 모델을 테스트하며, 인간의 판단과 컨텍스트 활용을 통해 가치를 더하는 것입니다.

Key Highlights

  • •ARIA는 연구자의 워크플로우를 지원하는 AI 코파일럿으로, 다양한 기능을 제공합니다.
  • •Weights and Biases Weave는 에이전트 개발 및 개선 프로세스 최적화를 위한 관측 가능성 레이어를 제공합니다.
  • •지속적인 개선 루프를 통해 데이터 분석, 모델 평가, 실시간 모니터링을 수행할 수 있습니다.
  • •에이전트 중심 관측 가능성에 투자하고 작업 정의를 통해 모델을 테스트하는 것이 중요합니다.
  • •인간의 판단과 컨텍스트 활용을 통해 LLM이 놓치는 미묘한 차이를 파악하여 가치를 더해야 합니다.

Related Videos