읽기 설정
AI Summary
인공지능 모델 효율성, 비용 절감, 그리고 TypeSafe의 JEV 모델에 대한 논의와 함께 IBM의 Malaya 프로그램, 시스템 원/시스템 투 사고 방식 등이 소개되었습니다. 특히 JEV는 특정 목적(코딩 등)에 최적화된 '목적에 맞는 모델'로서 주목받고 있으며, AI 기술이 과학적 문제 해결에도 기여할 수 있다는 점이 강조되었습니다. 또한 쇼 진행자의 능력과 참여자들의 경험을 통해 청취자 참여도 증가 및 개인의 평판 형상에도 긍정적인 영향을 미칠 수 있음을 보여주었습니다.
Key Highlights
- •JEV 모델은 특정 목적에 최적화된 '목적에 맞는 모델'로, 기존 LLM과는 차별점을 가집니다.
- •IBM의 Malaya 프로그램은 결정적인 의사 결정을 내리는 영역을 해결하기 위해 JEV와 같은 모델을 활용합니다.
- •시스템 원/시스템 투 사고는 AI 모델의 작동 방식을 이해하는 데 도움을 줍니다.
- •AI 기술은 달 표면 운석구덩이 분석 등 과학적 문제 해결에도 활용될 수 있습니다.
- •쇼 진행자의 능력은 청취자 참여도 증가 및 개인의 평판 형상에 긍정적인 영향을 미칩니다.
Related Videos
이것은 심각한 효율성 문제로 이어지고 있습니다.00:01
그리고 이제 모델 이름의 중요성이 줄어들면서 새로운 프론티어 모델이 사용되던 시절과는 달리 느껴집니다.00:03
마치 중요한 사건처럼 느껴졌었는데, 이제는 몇 주마다 하나씩 나오고 있습니다.00:11
제가 정말 궁금한 건 무엇이 바뀌었는지예요. 이 모든 것과 더 많은 이야기가 이번 주 Mixture of Experts에서 다뤄질 예정입니다.00:14
저는 팀 황입니다. Mixture of Experts에 오신 것을 환영합니다. 매주 MOE는 인공지능 분야의 최전선에서 일하고 있는 가장 뛰어난 분들을 모아 주간 뉴스를 안내해 드립니다.00:25
각 분야 최고의 전문가들과 함께 이번 주 뉴스를 살펴보겠습니다.00:29
이번 주 에피소드에는 Kauter L. McGrawey님, AI 네이티브 시스템의 수석 연구원,00:35
Gabe Goodhart님, AI 파운데이션의 최고 아키텍트, 그리고 Martin Keen님, 마스터 발명가께서 함께 하셨습니다.00:41
늘 그렇듯이, 제 공동 진행자인 데이비드 잭스 씨가 함께 해 주셨습니다. 그는 IBM Think의 기고자입니다.00:45
오늘 세 가지 주요 소식을 다룰 예정입니다. 광범위하게 홍보된 Jev 모델에 대해 이야기하고, 정말 흥미로운 협업에 대해서도 말씀드리겠습니다.00:50
아이비엠과 NASA 간의 협업에 대해 이야기하기 전에, 최근 몇 주 동안 모델 출시가 정말 많다는 점을 먼저 말씀드리고 싶습니다.00:56
지난 몇 주 동안 모델 출시가 엄청나게 많았습니다.01:01
다시 한번 말씀드리지만, 모델 출시의 계절이라고 할 수 있겠네요.01:07
그록 4.7이 나왔고, 클로드 오푸스 5.5가 나왔으며, GPT-6 솔루나가 나왔습니다. 다들 그렇습니다.01:11
모델을 출시하고 가격이 점점 더 낮아지고 있습니다. 음, 아마도...01:19
마틴 씨, 먼저 질문드리겠습니다. 모델 출시 때마다 항상 나오는 질문인데, 이게 중요한가요?01:26
여기서 뭐가 다른 걸까요? 이 모델들이 그냥 조금씩 더 나은 것들인가요? 전체적으로 어떤 변화가 일어나고 있다고 보시는지, 아시죠?01:32
아마 그게 더 흥미로운 질문일지도 모르겠네요. 이번 주에 출시된 모델들은 모두 효율성이라는 주제를 중심으로 하고 있습니다.01:39
그래서 이번에 큰 모델 출시들이 있었습니다.01:46
아스트라나 페이블 같은 것들인데, 이 모델들은 최첨단이고, 정말 똑똑한 모델들입니다.01:48
지금까지 나온 것 중에 가장 좋은 모델들이긴 하지만, 토큰을 엄청나게 많이 소모하기도 합니다. 구독 서비스를 이용하시거나 API 비용을 지불하시는 분들은 그 점을 매우 잘 알고 계실 거예요. 너무 많은...01:55
자원을 필요로 한다는 것을요.02:02
이 모델들을 실행하려면 컴퓨팅 자원이 많이 필요합니다. 이번 주에 출시된 모델들은 바로 그 효율성을 개선하기 위해 노력했습니다.02:08
파라미터 수는 조금 더 작다고 생각하지만, 훨씬 많은 일을 처리할 수 있습니다.02:13
희망적으로는 지능이 크게 떨어지지 않으면서, 특히 클로드 모델의 경우에02:19
클로드02:26
출시된 오퍼스 5.5인데, 아마도 가장 큰 페이블 5.1 모델만큼 좋을 수도 있습니다.02:27
페이블 5.1의 큰 모델과 거의 비슷하다고 생각합니다.02:34
이것은 앞으로 Fable 5.5 버전이 나올 가능성이 있다는 것을 보여주는 것이고요.02:38
기존의 큰 모델들이 할 수 있는 거의 모든 일을 훨씬 적은 토큰 비용으로 처리할 수 있습니다.02:43
그리고 지금 제 뒤에 있는 기계들은 그 모델을 실행하며 여러 비디오 편집 작업을 하고 있습니다.02:49
정말 효율적이어서 놀랍습니다.02:55
새로운 솔 공개 버전도 ChatGPT 6.0과 마찬가지로 같은 점이 적용될 수 있습니다.02:58
기본적으로 이것은 이전 모델인 5.6보다 훨씬 효율적인 버전입니다.03:05
오늘, 이번 주에 우리가 실제로 보고 있는 것은 훨씬 더 효율적인 모델들이 정말로,03:10
이러한 연구소에서 개발한 가장 큰 규모의 모델만큼 성능도 좋다는 것이죠.03:16
네, 확실히 그렇습니다. 그리고 카토 씨께 질문이 있었는데요, 제가 그렇게 이해한 걸로 보아, 지금은 모두가03:19
효율성에 집중하고 있는 것 같습니다. 카토 씨는 하드웨어 분야에서 많은 일을 하시면서 이 문제를 어떻게 생각하시는지 궁금합니다.03:24
저도 그렇게 생각이 드네요, 어느 면에서는요.03:31
그렇지 않으면, 그들도 마찬가지로 최대한 활용하고 있는 것 같아요.03:34
컴퓨팅 측면도 고려해야 하고, 효율성 증진에 대한 당신의 의견이 궁금하네요.03:39
음, 기업들이 투자하는 막대한 시간과 자원을 생각하면 어떻게 보시는지 궁금합니다.03:43
자체 컴퓨팅 자원을 소모하고 있어요. 네, 확실히 효율성 문제가 커지고 있습니다. 그리고 지금은,03:48
알다시피 모델 이름이 중요하지 않은 지점에 다가가고 있고, 새로운 프론티어 모델이 나타나고 있습니다.03:53
예전에는 큰 이벤트처럼 느껴졌는데, 이제는 몇 주마다 나오고 있어요. 제가 정말 중요하게 생각하는 것은03:59
무엇이 달라졌는지입니다. 더 오래 작동할 수 있나요? 도구를 안정적으로 사용할 수 있나요? 저에게 도움이 될 수 있나요?04:05
제 비용을 줄일 수 있나요? 더 저렴한가요? 효율적인가요? 인프라에 어떤 영향을 미치며, 무엇이 필요한가요?04:10
비용을 줄일 수 있을까요, 아니면...04:17
아마 새로운 알고리즘이 있거나, 더 나은 하드웨어 소프트웨어 공동 설계 기술 같은 것들이 필요할 수도 있습니다.04:21
기본적으로 효율성을 높이는 데 도움이 되는 것들 말이죠. 마틴의 의견에 동의합니다.04:28
여기 효율성이 정말 중요해지고 있고, 이제 경쟁은 모델 지능에서 시스템 지능으로 옮겨가고 있습니다.04:32
모델은 이제 에이전트 내의 구성 요소 중 하나가 되어가고 있습니다.04:39
메모리 도구, 브라우저, 코드 실행, 그리고 기업 시스템 접근 기능까지, 이것은 단순히 벤치마크 점수가 몇 점 더 높아지는 것 이상의 큰 변화입니다.04:46
전체 시스템을 어떻게 최적화할 수 있을지가 중요하다고 생각합니다.04:53
이 모든 것들이 함께 중요해지고 있습니다.04:59
네, 확실히 그렇습니다. 데스크톱 앱 버전들에서 작은 모델 선택기가 점점 더 혼란스러워지는 것 같아요.05:03
사용 가능한 모델이 여기 10개 있는데, 그중 일부는 이전 버전이고, 노력(effort)도 선택할 수 있습니다.05:09
정말 복잡해지고 있어요. 가브, 괜찮으시다면, 제가 생각하기에는...05:15
일단 편집적인 부분을 조금 연습해 보자는 취지에서, 제가 생각하기에 5.5 오푸스가 가장 흥미로운 모델이었던 것 같습니다.05:20
지금까지 출시된 모델들 중에서요.05:26
그리고 제가 말씀드린 것에 동의하시는지 안 하시든지 간에, 오푸스 5.5에 대해 조금 이야기 나눌 수 있다면 정말 좋겠습니다.05:28
아시다시피 제가 먼저 이야기하고 싶은 것은, 제 주변에서는 클로드 때문에 사람들이 실제로 짜증을 내기 시작했다는 점입니다.05:33
아이고, 클로드 같은 느낌이 너무 많이 들어서, 모델들에서 너무 많은 개성이 드러나는 것 같아요.05:40
반면에 많은 분들이 5.5 버전에서 Anthropic 쪽에서 모델을 좀 더 조심스럽게 다룬 것 같다고 이야기하고 있어요.05:46
조금 더 간결하고, 핵심을 찌르는 경향이 있습니다. 그리고 그 점이 흥미로운 건, 항상 이러한 모델에서 사람들이 어느 정도의 개성을 원하는지에 대한 논쟁이 있어 왔기 때문입니다.05:52
사람들이 실제로 이 모델에서 얼마나 많은 개성을 원하느냐에 대한 논쟁이죠.05:58
가브, 제가 그 부분에 대해 어떻게 생각하는지 궁금하네요. 단순히 과도하게 집중한 것인지, 아니면 사람들이 정말로 개성이 강한 모델을 원하지 않는 걸까요?06:01
둘 다 조금씩 있는 것 같아요. 어느 정도 그런 경향이 있는 것 같습니다.06:08
여기서 기업 브랜딩 차이가 있습니다. 클로드의 경우 업무 효율성을 중시하는 기업 브랜딩을 추구한다고 생각합니다.06:15
그리고 저는 OpenAI, 특히 채팅 인터페이스나 ChatGPT를 통해 더욱 목표를 달성하려 하는 것 같습니다.06:22
조금 더 개인적인 느낌을 주려고 하는 것 같아요.06:30
그래서 저는 클로드가 조금 다듬고, 명확하고 간결하게 유지하려는 것이 기업 브랜딩 전략에 부합한다고 생각합니다.06:31
이전에 말씀드린 내용과 관련해서 중요한 또 다른 점은 효율성이라고 할 수 있겠네요.06:39
사람처럼 들리도록 더 적은 단어를 사용하면, 여전히 일을 처리할 수 있고 토큰 비용도 줄일 수 있습니다.06:42
그러니까 아마 그것을 위해서도 그런 것일 겁니다.06:49
그리고 제가 봤을 때 이 모델들에 대한 가장 큰 주장은 토큰 효율성이 더 높다는 것이었습니다.06:52
흥미로운 차이점인데요, 반드시 컴퓨팅 효율성과 연관되는 것은 아닙니다.06:59
마틴 말씀에 조금 이의를 제기하고 싶습니다. 저 뒤에 보이는 기계들은 절대 모델을 실행하지 않습니다.07:06
그분들은 모델과 대화하는 에이전트를 실행하고 계세요. 그러니까, 토큰 비용이 저렴한 것보다 더 저렴한 게 뭔지 아시죠?07:12
실제로 뒤에 있는 기계에서 돌아가는 모델이죠.07:18
그래서, 이것이 새로운 모델들에 대해 공개되지 않은 흥미로운 점입니다.07:22
실제로 그 크기와 추론 시에 필요한 컴퓨팅 양이 얼마나 큰지가 중요한 부분입니다.07:26
그래서 이번 모델들을 보면서 제가 가장 궁금했던 점은 바로 이것입니다.07:32
가격대를 낮게 유지하면서 소비자 효율성을 분명히 목표하고 있는 것 같습니다.07:36
그리고 소비자가 작업을 완료하는 데 필요한 토큰 수를 최대한 줄이는 것이 중요합니다.07:41
그것은 정말 좋은 일입니다. 왜냐하면 그것 또한 추론 과정에서의 전체적인 토큰 효율성과 관련이 있기 때문입니다.07:46
사용자에게 서비스를 제공하기 위해 그렇게 많은 토큰을 실행할 필요가 없기 때문입니다.07:53
하지만 우리가 모르는 것은 그 승수가 얼마인지, 각 토큰을 실행하는 데 실제로 얼마나 드는지입니다.07:57
그리고 저희는 이러한 모델을 학습시키는 데 드는 비용에 대해 몇 가지 감이 잡혀 있습니다.08:05
그리고 이들의 크기와 아키텍처에 대한 소문들이 떠돌고 있다는 생각도 듭니다.08:09
하지만 아직 많은 세부 사항들이 숨겨져 있습니다.08:13
제가 여전히 정말 궁금한 부분은, 그리고 앞으로 며칠 또는 몇 주 안에 더 자세한 내용을 알게 될 거라고 생각합니다만, 그 비용이 얼마나 되는지 입니다.08:16
토큰 비용 측면에서 바닥으로 향하는 이러한 경쟁은 실제 컴퓨팅 비용 또한 바닥으로 향하게 하는 것과 관련이 있는 듯합니다.08:23
이러한 시스템을 실행하는 데 드는 실제 비용 차이가 기업이 모델을 운영하는 데 드는 비용과 얼마나 다른지, 최종적으로 드러날 때까지 기다리고 있는지 궁금합니다.08:30
저희에게 부과되는 비용이 어느 정도인지 궁금합니다.08:37
이 모든 모델들이 지원받고 있다는 우려가 오랫동안 있었습니다.08:38
벤처 캐피털이 이 회사들을 지원하고 있습니다.08:45
그리고 그들이 더 이상 사적으로 운영되지 않고 공개적으로 거래될 때, 비용 정산이 이루어질 겁니다.08:48
그래서 이번 라운드에서는 그에 대한 답을 얻지 못했다고 생각합니다.08:55
저희가 확실히 답을 얻은 것은 소비자 입장에서 가격 하락 압력이 분명히 존재한다는 점입니다.08:58
기술이 실제로 뒷받침하고 있는지, 아니면 단순히 증권시장 상장 연기를 통해 시간을 벌고 있는 건지 잘 모르겠습니다.09:04
IPO를 미루면서 충분한 시간이 있으니 보조금을 계속 지급하고 시장 점유율을 늘릴 수 있다고 말하는 것 같습니다.09:11
그래서 저희 모두 모델에서 저렴한 시장을 확보하려고 노력할 겁니다.09:18
그래서 어떻게 될지 지켜봐야 할 것 같습니다. 하지만 그 두 가지 사이의 간극에서 어떤 일이 벌어질지 정말 궁금하네요.09:22
네, 토큰의 효율성이 정말 중요하다고 생각해요. 옛날을 떠올리게 할 정도예요.09:27
아시다시피 구글은 항상 사이트 접속 시간을 최소화하는 것이 좋다고 말했었잖아요.09:31
그게 바로 찾고 싶었던 걸 찾았기 때문에 떠났다는 뜻이고, 혹시 그런 지표들이 인공지능 분야에서도 비슷하게 나타날지 궁금하네요.09:36
최소한의 숫자로 해결하는 것이 가장 좋다는 식으로요.09:40
토큰을 실제로 사용하는 것이 가장 좋습니다. 왜냐하면 문제를 해결했다는 의미이기 때문이죠. 네, 생각해보면 하드웨어적인 관점에서도 이와 같은 이유일 것 같습니다.09:45
다음 단계가 매우 흥미로울 것 같습니다.09:51
모델 아키텍처, 추론 소프트웨어, 그리고 가속기 설계와 같은 요소들도 효율성을 중심으로 수렴하고 있습니다.09:53
양자화, 스파티스, KV 캐시 관리, 추측 디코딩, 더 나은 배치 처리 등도 그렇습니다.10:00
데이터 흐름 가속기나 특수 목적 가속기도 더 이상 단순한 최적화가 아니에요.10:07
모델이 구축된 후에 제품을 경제적으로 배포할 수 있는지 여부를 결정하는 데 점점 더 중요한 역할을 합니다.10:15
그리고 저희가 지금까지 봐왔던 추세들을 살펴보면, 예를 들어 2023년에서 2024년 사이는 주로10:21
더 크고 큰 모델에 집중하는 시기였습니다. 2025년에는 더 나은 추론 능력이 중요한 방향을 제시할 것이라고 생각합니다.10:28
그리고 올해는 연산 비용 대비 더 나은 추론에 집중하는 경향이 있습니다.10:35
저도 모두가 말씀하시는 것처럼 효율성이 매우 중요해지고 있다는 점에 동의합니다.10:41
그리고 하드웨어 가속기 설계 분야에서도 몇 가지 변화가 있습니다.10:45
아직 우리가 해결해야 할 일들이 많습니다, 특히 효율성을 최대한으로 끌어올리는 측면에서요.10:50
효율성 목표를 달성하는 것은 여전히 매우 어렵습니다.10:55
네, 확실히 그렇습니다. 최고 수준을 이용하는데 비용이 상당히 많이 드는 것 같지만, 그래도 회사로부터 좋은 혜택을 받고 있습니다.10:59
아직 보조를 받고 있는 상황입니다.11:06
이제 다음 주제로 넘어가도록 하겠습니다. 최신 모델 출시 이야기는 그만하고, 다른 모델 출시 이야기를 해보려고 합니다.11:12
제가 다음에 다루고 싶었던 주제는 JEV입니다. 최근에 많은 관심을 받고 화제이기도 하네요.11:19
배경은 TypeSafe라는 회사인데, 이 회사는 'System 1 모델'이라고 불리는 새로운 종류의 모델을 개발했다고 발표했습니다.11:26
그리고 JEV는 코딩을 위한 그들의 첫 번째 공개 버전이라고 할 수 있습니다.11:33
그리고 데이비드, 그들이 하고 있는 일에 대해 정말 흥미로운 특징들이 많이 있습니다.11:37
먼저, 디오고 알메이다라는 전 OpenAI 엔지니어 또는 연구원에게서 나온 것입니다.11:42
알메이다는 ChatGPT나 OpenAI에서 초기에 활동했었으며, 공동으로 작성한...11:46
기본적인 인스트럭터 GPT 논문을 집필하신 분이시군요. 음, 저는 그분에 대해 잘 몰랐고, 제 관점에서는 조금 조용하게 활동하셨던 것 같아요.11:51
그런데 그는 이 모델을 공개했고, 그리고 이것은...11:57
갑자기 엄청나게 인기를 얻었죠. 팔로워가 1500명 정도였는데, 게시물이 4천만 회 조회수를 기록했어요.12:04
사람들이 JAV에 왜 그렇게 흥미를 느끼는지 생각해보면, 효율성이라는 주제와 연결되는 것 같아요.12:10
지금 말씀드리는 C에 대해서 말씀드리려고 하는데, 제이비(JEV)와 관련해서 제가 이야기하고 싶은 가치 제안이 한두 가지 정도 있습니다. 우선 목적에 맞는 모델이라는 점에 대해 말씀드릴게요.12:15
싶습니다. 첫 번째는 목적에 맞는 모델이라는 점인데요, 여러분도 아시는 것처럼...12:20
그러니까요, 맞죠? 제이비(JEV)의 주장은 이런 겁니다. 우리는 기본적으로 작가와 같은 LLM을 사용하고 있다는 거죠.12:27
맞아요. 그들은 인간이 읽기 쉽도록 글을 끊임없이 생성할 수 있습니다.12:34
그리고 에이전트 시대와 기업용 사례가 점점 더 중요해짐에 따라, 그런 방식으로12:39
알다시피, 기존 방식을 활용해서 단순하고 구조화된 의사 결정을 내리도록 억지로 만들고 있습니다.12:44
소프트웨어와 프로세스에서 종종 볼 수 있는 객관식 질문과 같은 것들을 말씀드리는 거겠죠.12:49
JEV는 제가 이해한 바로는, 최첨단 수준만큼 똑똑할 수도 있다고 주장하는 것 같습니다.12:55
모델이지만, 단어들을 렌더링해서 의사 결정을 내는 대신 훨씬 더 효율적으로 작동할 수 있습니다.13:01
알고 있죠, 일종의 제한된 값들의 타입 값을 갖는 집합 안에서 의사 결정하는 방식으로요.13:08
소프트웨어 용어에서 말씀하시는 것처럼, 바로 그 타입 값을 직접 출력해서 훨씬 더 효율적으로 처리할 수 있다는 거죠?13:14
칼타르 씨, 제가 이해한 게 맞을까요? 제대로 이해했는지 궁금합니다. 그리고 혹시 지금 여기에서 과장 광고라고 생각하세요?13:20
제프 릴리즈를 보셨을 때, 여러분과 같이 흥미롭게 느끼셨나요?13:26
네, 그들이 취하고 있는 방향이 매우 흥미롭다고 생각합니다. 그리고 물론, 그들의 주장은...13:30
그들이 주장하는 바는 매번 문자열이나 문장을 생성할 필요가 없다는 것입니다.13:35
특정 작업의 경우, 단순히 결정이나 점수 또는 예/아니오 답변만 필요한 경우가 특히 많습니다.13:40
소프트웨어가 이러한 LLM을 에이전트 작업 등에 활용할 때 매우 유용하게 사용될 것 같습니다.13:47
저는 전체 문장을 읽고 무슨 뜻인지 해석하려고 노력할 필요가 없을 거예요.13:53
그리고 그것을 결정이나 점수 등으로 변환할 수 있습니다. 만약 하드웨어 측면에서 본다면,13:57
제가 제프의 하드웨어적인 관점에서 흥미롭게 생각하는 부분은, 작업 부하가 바뀌고 있다는 점입니다.14:04
일반적인 언어 모델로는 자체적으로 처리하기 어렵고, 답변을 생성하기 시작하면 토큰 하나씩 생성합니다. 다음 토큰, 또 다음 토큰... 이런 식으로 진행되죠. 그래서 순차적인 디코딩 루프가 만들어지고, 매 단계마다14:09
다음 단계를 거쳐야 합니다.14:16
액셀러레이터로 돌아가서 모델 상태와 KV 캐시를 읽고 계산을 수행한 다음 다시 쓰기를 합니다. 그리고 이 과정을 반복하는데요, 비싼 자원을 효율적으로 사용하는 방법은 아닙니다.14:23
이것은 되돌아가서 모델 상태를 다시 읽고, KV 캐시를 사용해서 계산을 하고 결과를 다시 쓰는 과정을 반복하는 것이며, 이는 고가의 하드웨어를 효율적으로 활용하는 방식이라고 보기 어렵습니다.14:29
하드웨어는 특히 예/아니오와 같은 결정, 어떤 옵션을 선택해야 할지, 각 결과의 확률이 얼마인지 등을 원할 때 더욱 그렇습니다.14:35
제프가 이 자유 형식 텍스트를 제공해 주셨죠.14:41
이러한 작업량에 대한 생성 대신 구조화된 결정을 내는 방식으로 작동합니다.14:48
그리고 이러한 확률들을 병렬적으로 처리하기 때문에, 하드웨어 측면에서 봤을 때 매력적인 부분이라고 생각합니다.14:54
병렬 연산은 GPU나 AI 가속기가 정말 잘하는 부분입니다.15:01
그래서 순차적인 디코딩이 줄어들고, 출력 생성도 훨씬 적으며, 잠재적으로는...15:06
훨씬 적은 kV 캐시 트래픽이 발생합니다.15:14
그래서 저는 그들의 효율성 향상이 반드시 ~ 때문이라고 생각하지 않습니다.15:16
행렬 곱셈을 더 빠르게 만드는 마법 같은 방법을 발견했지만, 하드웨어에 요청하는 방식을 변경했어요.15:21
하지만 저는 여전히 그들의 주장에 대해 몇 가지 의구심이 들어요.15:27
특히 정확성 측면에서 말씀드리면, 그들은 여전히 모델에 의존해서 일부 점수를 생성하고 어떤 주장을 하고 있습니다. 그래서 저는 그 부분은 좀 주의 깊게 살펴봐야 한다고 생각합니다.15:35
그러니까, 여러분의 주장 중 일부는요. 저희가 조심해야 할 부분이 있다고 생각합니다.15:41
특히 그들이 언급한 교정이 중요합니다. 모델이 신뢰도 점수를 준다면,15:46
그 점수가 데이터가 변할 때에도 여전히 믿을 만한지 알아야 합니다.15:52
그러니까 자동화의 경우에는 그것이 매우 중요해진다고 생각합니다.15:59
아마 그들이 주장하는 지연 시간 수치보다 더 중요할 수도 있겠습니다.16:02
저도 한 말씀 드리겠습니다. 뒤쪽에 앉아 있는, 저처럼 기술적인 지식이 부족한 분들을 위한 정보를 얻는 데 항상 관심이 있었거든요.16:07
그리고 이번 주에 제가 배운 교정(calibration)이라는 주제에 대해 조금 이야기해 보고 싶습니다.16:12
자신감 점수와 교정(calibration)에 대해 언급하셨습니다.16:16
대략적으로 말씀드리지만, 제 이해로는 모델이 추측을 할 수 있다는 것이 일반적인가요?16:18
그것은 '저것은 정지 표지판 같아요'라고 말할 수 있습니다.16:25
그리고 그것은 맞을 수도 있고 틀릴 수도 있지만, 거의 똑같이 중요한 것은 과신하거나 자신감이 부족할 수도 있다는 점입니다.16:28
예측을 할 때 그렇죠? 그래서 '저것은 정지 표지판입니다.'라고 말하면서 90% 확신한다고 말할 수 있습니다.16:36
하지만 만약에, 그 추측과 신뢰도 점수를 냈을 때, 그것이 사실상...16:41
10% 정도의 경우 심각한 과신 문제를 가지고 있다고 말씀드릴 수 있는데, 이것을 저희는16:46
교정이라고 부릅니다. 음, 신뢰도 점수가 실제로...16:51
모델의 실제 성능을 반영해야 하는데, 수년 동안 환각하는 모델 때문에 정말 답답했습니다.16:57
매우 확신에 찬 태도로 터무니없는 헛소리를 늘어놓는 모델 말이죠. 그래서요, 이것은...17:02
이 모델은 환각 현상이 없다고 주장하는데, 아마 사실일 수도 있고 아닐 수도 있겠지만, 더 중요한 건 제가 이해하기로 그들이 최적화한 것은 바로 교정(calibration)을 제대로 하는 것이라는 점입니다.17:10
제가 정확히 이해한다면, 그들이 정말 중요하게 생각하는 것은 바로 이 교정을 맞추는 것 같아요.17:16
그 모델은 신뢰도 점수를 정확하게 맞추느냐 마느냐에 따라 생존이 결정될 수 있고, 제가 이해한 게 맞다면, 꼭 정지 표지판인지 아닌지를 정확히 판단하는 데 최고는 아닐 수도 있습니다.17:22
하지만 만약 그것이 정지 표지판이라고 말한다면...17:27
확실히 60이어야 합니다. 짧지도 길지도 않고 정확히 60이죠, 가브리엘.17:32
제 이해가 맞았나요? 교정(calibration)에 관해서요. 그리고 만약 그렇다면 왜 이것이 그렇게 중요할까요?17:39
어떤 점이 특히 기업 환경에서 활용될 때 가능해지는 걸까요? 모델의 확신도가 확실할 수 있을 때 말이죠.17:45
모델의 신뢰도를, 즉, 신뢰 점수가 쌓였을 때 어떤 믿음을 얻게 되는 걸까요?17:50
네, 맞아요. 말씀하신 신뢰도 점수는 정확히 맞으신 것 같아요.17:55
그리고 이 발표에서 제가 좋았던 점은, 아마 기본적으로 핵심을 제대로 건드렸다고 생각합니다.18:00
저의 소프트웨어 엔지니어로서의 역사적인 여정에서 매우 중요한 순간, 모든 측면에 걸쳐서요.18:06
그래서 이 모델에 대한 제 반응이 정말 많습니다.18:12
하지만 신뢰도 점수(confidence score)를 생각해보면, 제가 예전에 겪었던 문제들을 아주 직접적으로 떠올리게 되네요.18:15
생성형 AI 시대 이전, 분류기를 만들고 해당 분류기에 대한 REST API를 구축했던 때의 일입니다.18:22
그리고 저희가 출력 품질을 나타내기 위해 사용했던 필드 이름이 뭐라고 결정했었죠?18:28
확률이었나요, 아니면 신뢰도였나요?18:35
저희는 항상 확률보다는 신뢰도를 선택했는데요, 그 이유는 확률은 수학적인 정의가 있기 때문입니다. 확률은 분포에 대한 진술이지요. 신뢰도는 그냥 숫자일 뿐입니다.18:39
신뢰도는 단순히 저희가 임의로 정한 값입니다.18:44
신뢰도는 그냥, 우리가 임의로 정한 것입니다. 시그모이드 함수를 붙여서 봤을 때 마치 보기 좋은 종 모양 곡선처럼 보이게 만들었습니다.18:49
우리가 임의로 정해서 그렇게 만든 거죠. 시그모이드 함수를 씌워서 보면 마치 예쁜 종 모양 그래프처럼 보입니다.18:51
입력 분포에 따른 것이고요. 그리고 이건 저것보다 더 좋네요.18:56
그리고 이건 저것보다 숫자가 더 높아요. 그러니까 믿으세요.19:00
그러니까, 이 부분에 대해 지적하신 대로 정확합니다.19:03
왜냐하면 이 부분은 상당한 어려움을 드러내기 때문입니다.19:07
이런 불투명한 근사적인 수학을 사용하는 것이 실제로 엄밀한 수학적 정의를 가진 것들을 하기 위해 하는 일입니다.19:12
예를 들어 확률과 같은 것들이 있습니다.19:18
하지만 이 모든 것의 궁극적인 목표는 유용한 의사 결정을 내리는 것입니다.19:21
바로 그런 곳에서, 예를 들어 JEV 모델이나 심지어 저희의 사전 생성형 AI 분류기 같은 모델이 활용됩니다.19:27
일반적으로는 '사실, 신뢰도 괜찮습니다'라고 말하는 경향이 있었습니다.19:33
신뢰도가 괜찮은 이유는 점수들을 서로 비교할 수 있으면 되기 때문입니다.19:37
그리고 그 점수를 바탕으로 결정을 내리세요.19:42
따라서 JEV 결과물을 사용하는 최종 사용자는 그 신뢰도 분포를 받아들여서 말할 겁니다.19:45
네, 왼쪽인지 오른쪽인지 판단하는 기준점은 어디에 두어야 할까요?19:52
빨간색, 노란색, 초록색 중 어느 색으로 판단할 기준점은 어디에 두어야 할까요?19:56
그냥 숫자 하나를 선택해야 하고, 그건 경험적으로 해야 합니다.20:00
이 부분은 사용자에게 맡기도록 하겠습니다.20:04
그래서 교정은 중요하고, 그들이 이것이 적절한 확률 분포라고 주장하는지 잘 모르겠습니다.20:07
그것은 뒷받침하기 어려운 수학적인 주장이겠지만, 아마 최소한 그렇게 주장했을 겁니다.20:14
신뢰도 점수가 서로에 대해 정확하다고 주장하는 것 같습니다.20:20
이번 모델의 아주 다른 측면에 대해서 이야기해 보려고 합니다.20:24
제가 지금 발언 기회를 잡고 있는 동안 잠깐 빌려가서 말씀드릴게요. 정말 중요한 내용이라고 생각하거든요.20:27
다른 모델들과 비교해서 이 모델의 위치를 어떻게 설명할지가 중요하다고 생각합니다.20:31
그래서 저희는 이걸 기본적으로 분포 예측 모델이라고 말씀드렸고, 그리고20:37
다른 말로 표현하면 분류 모델입니다.20:46
분류 문제는 많은 면에서 NLP에서 가장 오래된 문제이거나, 심지어는 그보다 더 오래된 문제입니다.20:48
심지어 AI 전반에서도 그렇습니다.20:55
특징 벡터를 입력받아서, 특정 레이블 집합에 기반하여 해당 특징 벡터를 분류하려고 합니다.20:58
그것이 적용될 수 있습니다.21:05
많은 사람들이 자체 분류기 모델을 학습하는 것을 포기하게 된 이유가 있습니다. 그 모델은 분명히 LLM보다 훨씬 작고 효율적이며,21:07
실행 시간과 컴퓨팅 파워 측면에서도 더 적은 자원을 사용합니다.21:14
필요했습니다. (pil yoet seum ni da)21:21
그런 방식에서 모두가 벗어난 이유는, 예전에는 지도 학습 방식으로 직접 분류기를 훈련해야 했기 때문입니다. (geu reon bang sik e seo mo du ga beo eo nan i yu neun, ye jeon eneun ji do hak seup bang sik euro direct bun lyu gi gyeul hyeon hae haetgi taem eun im ni da).21:22
입력과 출력에 대한 예시를 가지고 있어야 했습니다.21:29
그리고 LLM은 이 방대한 지식을 가중치 뒤에 가지고 있어서 정말 그렇습니다.21:32
제로샷 분류 문제 해결에 능숙합니다요.21:37
몇 가지 예시를 제공하면, 그 예시가 분류 문제와 관련된 가중치 영역을 자극하는 것과 같습니다. 그리고...21:41
예를 들어서, 그 예시들을 이용해서 모델의 직관을 형성하고, 그런 다음 분류 결과를 보여주세요.21:48
이것에 대해서는 그렇게 해 주시면 감사하겠습니다. 하지만 Kautar가 정확하게 지적했듯이, 토큰을 생성하는 것은...21:53
제가 믿기로는 이 게 멈춤 표지판입니다. 그렇게 생각해요, 왜냐하면21:59
그럼 백엔드에서 정규 표현식을 작성해서, 음, 엄청난 양의 의미 없는 글자들이 있네요. 제가 그걸 받았어요.22:06
거기서 '정지 표지판'이라는 단어를 확인해야 하는데, 대소문자 구분 없이 확인해야 할까요? 중간에 이상한 공백이 있는지 살펴봐야 할까요?22:13
알다시피 소프트웨어 엔지니어링의 악몽과 같습니다.22:18
숫자 벡터를 추출해서, 예를 들어 첫 번째 항목은 '정지 표지판', 두 번째 항목은 '당신'과 같은 식으로 표현하는 거죠. 아시겠죠?22:22
그것이 훨씬 더 효율적입니다. 추론 측면에서도요.22:29
계산량 측면에서도 출력 추출에 필요한 엔지니어링 노력 측면에서도 그렇습니다.22:34
그 점에서는 이 모델은...22:38
정말 좋네요. 하지만 LLM은 분류 작업 말고도 훨씬 더 많은 일을 할 수 있습니다.22:39
그래서 어떤 방식으로 나타나는지...22:45
이 모델은 아주 구체적이고 중요한 문제를 해결하기 위해 설계되었는데요, 이는 LLM이 풀 수 있는 문제들의 일부에 해당합니다.22:47
LLM이 다룰 수 있는 문제의 한 부분이라고 할 수 있습니다.22:53
이제 제가 말씀드리고 싶은 부분은, 결정적인 결정을 내리거나, 적어도 결정적에 가까운 결정을 만드는 이 분야가22:55
저희 아이비엠에서 중요하게 생각하는 영역이라는 점입니다.23:01
저희 IBM은 인공지능 모델이 아닌 프로그래밍 모델을 통해 이 부분을 해결해 왔습니다. 그 모델의 이름은 말라야라고 합니다.23:07
이는 많은 사람들이 하는 방식, 즉 어떤 것을 설명하는 것과는 완전히 다른 접근 방식입니다.23:13
평범한 텍스트로 프로그램을 작성하고 모델이 말씀하신 단계를 실제로 실행하기를 바라는 것입니다.23:18
평범한 텍스트 설명에 담긴 단계들은 JEV와 같은 모델에게 매우 적합합니다.23:24
그래서 말라야와 같은 프로그래밍 모델은 제이비(JEV)와 같은 모델을 활용하여 명확한 의사 결정 지점이 있을 때 사용할 수 있습니다.23:29
명확한 의사 결정 지점을 활용할 수 있습니다.23:31
워크플로우 안에서 실제로 결정적인 프로그램, 즉 작은 비결정적 요소들을 포함하는 프로그램을 만들 수 있습니다.23:37
의사 결정을 내려야 하는 상황이 있는 거죠. 이런 모델의 진정한 힘은 여러분이 알고 있는 것을 활용할 수 있다는 점입니다.23:43
이는 명확하게 정의된 행동 경로를 의미합니다.23:49
그리고 중요한 지점에서 불확실한 입력을 받았을 때도 좋은 결정을 내릴 수 있습니다.23:53
올바른 길을 걸어갈 수 있도록요. 음, 제가 정말 흥미롭게 생각한 것들이 두 가지 있어요.23:58
하나는 이름인데요, 이게 시스템 원 모델이라고 하더라고요. 도대체 무슨 뜻일까요?24:03
음, 시스템 원 모델이라는 명칭은 다니엘 카너먼의 '생각에 관한 생각'에서 제시된 시스템 원과 시스템 두 사고방식을 지칭하는 것 같아요.24:06
저도 그 책을 가지고 있어서 그걸 보게 되니 정말 기뻤습니다.24:13
이것에 대해 읽은 적이 있는데, 종종 다시 찾아보게 되네요. 정말 자주 그렇습니다.24:18
그는 이 MOE 에피소드를 통해 이루어지는 모든 구매 건마다 수수료를 받습니다.24:22
네, 그렇습니다. 설명란에 제 제휴 링크를 클릭해주세요. 말씀하신 내용은 시스템 원 사고 방식이 일종의 자동적인 사고라는 것이었습니다.24:25
그냥 자연스럽게 일어나요. 의식적으로 생각할 필요가 없죠. 그리고 시스템 투 사고는 단계별로 좀 더 깊이 생각하는 것입니다.24:32
그리고 인공지능 모델, 특히 오늘날의 거대 언어 모델들을 생각해 볼 때, 이들은 연쇄적 사고 추론을 수행합니다.24:39
이러한 시스템 두 가지 사고방식은 Jev의 주장을 뒷받침하는 논거 중 하나입니다.24:47
이러한 결정들 중에는 단계별로 생각할 필요 없이 시스템을 사용할 수 있습니다. 저희가 사용해왔던 시스템 두를 활용하고 있는 상황입니다.24:53
단순히 분류 문제인 경우에는 시스템 원으로 충분했는데, 아까 말씀드린 것처럼요.24:59
가브가 언급했듯이, 답이 예스 또는 노거나 15개의 옵션 중 하나를 고르는 경우라면,25:04
큰 언어 모델을 사용해서 그 답을 찾아내는 것은 상당한 부담이 됩니다.25:10
그 답을 향해서, 그 답으로 몰아가는 것이 흥미로웠고, 제브가 어떻게 훈련받았는지 듣는 것도 다른 점이었습니다.25:17
대규모 언어 모델은 보통 주로 그렇게 훈련되니까요.25:22
챗봇들은 확실히 초기에는 그랬고, 인간 피드백에서 강화 학습을 사용합니다.25:28
우리는 인간에게 가장 만족스러운 답변을 얻으려고 노력하고 있고, 그런 다음 이러한 모델들은...25:33
이 모델들은 사고하는 모델로 발전했고, 이제 AI 에이전트 용도로도 더 많이 사용되고 있습니다.25:39
검증 가능한 보상을 통한 강화 학습이 있습니다. 즉, 제가 이 일을 해달라고 요청했을 때, 실제로 하셨는지 확인하는 것입니다.25:44
그리고 모델이 그렇게 했을 때 보상을 받습니다.25:51
하지만 JEV와 시스템 원 모델은 다른 강화 학습 방식으로 만들어졌습니다.25:52
이는 교정된 의사 결정을 위한 강화 학습 방식입니다. 즉, 사람에게 기분 좋게 하는 답을 내놓으려고 하는 것이 아니라 구조화되어 있습니다.25:58
그렇게 설계된 것입니다.26:04
그리고 보상을 얻기 위해 답을 만들어내려고 하는 것이 아니라, 단순히 이 답이 맞는지 아닌지를 판단하려고 합니다.26:08
데이비드 씨, 말씀하신 교정(calibration)은 모델의 종류에 따라 다릅니다. 이 모델은 답변과 함께 제공해 줍니다.26:15
기본적으로 답이 무엇인지 숫자로 표현하는 것과 비슷하다고 할 수 있겠죠. 물론 질문은 '답이 맞는지'입니다.26:21
답이 맞는지 확인하고, 추가적인 정보는 제공하지 않죠. 만약 제가 큰 규모의 질문을 한다면요.26:25
언어 모델에게 질문을 하면 답을 주기는 하지만, 왜 그렇게 생각하는지 설명해 줄 수도 있습니다.26:30
그 추론 과정, 즉 어떻게 그 답에 도달했는지 여부는 완전히...26:35
혹은 부분적으로 환각된 결과일 수도 있지만, 적어도 답변은 제공해 주죠.26:42
이 모델은 단순히 숫자만 제시할 뿐입니다. 그럼 어떻게 해서 그것이 맞는지 알 수 있을까요?26:45
음, JEV 팀에서 제시한 벤치마크 결과에 따르면, 최고 수준의 성능과 동일한 결론을 내릴 수 있습니다.26:49
최고 수준의 모델과 동일한 판단을 내릴 수 있다는 것을 보여줍니다.26:53
다른 모델들과 비교했을 때, 같은 질문을 아스트라나 페이블에 던졌을 때도 대부분 Jev가 동일한 답변을 내놓습니다. 하지만 훨씬 빠르고 토큰 비용도 적게 들죠.27:00
훨씬 빠르고 토큰 비용이 적게 듭니다.27:07
그래서 큰 언어 모델이 내놓을 만한 답안에 도달할 수 있습니다.27:10
하지만 실제 자료를 통해 검증된 것은 아직 아닙니다.27:15
진실입니다. 즉, 큰 언어 모델도 틀릴 수도 있습니다. 그래서 실제 생활에서 테스트되는 더 많은 벤치마크를 보게 될 것 같아요.27:20
몇 가지의 일부는...27:25
제공해주신 데모들을 보았는데, 제프가 둠을 플레이하는 데모가 있었어요. 거기서 공간에서 이동하는 방법과 악당을 쏘는 방법을 알아내요. 그리고 이래저래요. 음...27:31
그게 공간 안에서 움직이는 걸 만들어내고 있더라고요.27:38
계속해서 이런 판단을 내립니다. 예, 아니오 같은 결정이나 어디로 이동해야 할지, 왼쪽으로 이동할지, 오른쪽으로 이동할지, 예, 아니오와 같이 계속해서...27:44
그런 관점에서 어느 정도 작동하는 것 같습니다.27:49
나쁜 악당들을 찾아내는 데 꽤 정확했어요. 그리고 나서 다른 시연을 봤는데, 그게...27:54
뭔가 위키피디아 게임처럼 진행되더라고요. 아마 다들 해보셨을 거예요. 시작하면...27:59
한 페이지, 예를 들어 저는 영국 중세 시대에 대해 잘 모릅니다. 그리고 나서 완전히 다른 페이지로 넘어가야 해요, 예를 들어 비행 자동차나 케빈 베이컨 같은...28:05
또 다른 전혀 관련 없는 페이지로요. 비행 자동차처럼, 케빈 베이컨처럼... 네, 바로 그렇게 여러 개요.28:11
거기까지 가는 데 필요한 클릭 수를 말하는 거죠? 그리고 가장 좋은 LLM들은 종종28:16
주제 A에서 주제 B로 보통 다섯 번 정도의 클릭 안에 도달할 수 있었는데, 꽤 인상적이죠.28:23
하지만 제프는 그것을 다섯 번의 클릭으로도 할 수 있었어요. 그런데, 그게 아주 짧은 시간 안에 가능했고, 반면에28:29
대규모 언어 모델은 답을 얻기 위해 모든 추론 과정을 거쳐야 했고, 여러 초가 걸렸답니다.28:34
초기에 몇 가지 징후가 나타나고 있는데, 단순히 같은 답변을 내놓는 것뿐만 아니라28:39
그 답변들이 대체로 정확할 것이라는 점도 보여주고 있습니다.28:44
하지만 이 기술을 통해 더 많은 것을 볼 수 있을 것 같아요. 그래서 제프가 처음 발표했을 때,28:51
모두의 첫 번째 생각이었고, 적어도 저의 첫 번째 생각은 '또 다른 분류 모델이네, 정말 멋지다' 였습니다.28:56
이런 것들은 이미 오래전부터 있었는데요. 하지만 학습 과정과 강화 학습이라는 아이디어를 보면서,29:01
교정된 의사 결정을 내리고, 거대 언어 모델을 사용하는 최첨단 모델들과 얼마나 잘 비교되는지 보는 것은 인상적입니다.29:07
이런 점이 정말 흥미로운 기술이라 계속 지켜봐야 할 이유라고 생각합니다.29:13
정말 멋진 토론이었고, 설명자분을 모시고 와서 기쁩니다. 제가 말씀드리고 싶은데요.29:17
다시 한번 말씀드리지만, 제가 항상 중요하게 생각하는 부분은 여러모로 과장 광고를 넘어서서 실제 무슨 일이 일어나고 있는지 파악할 수 있다는 점입니다.29:22
그리고 내부 상황을 살펴볼 수 있어서 저희는...29:25
모델에 대해 더 이상 이야기하지 않으려고 합니다. 오늘 제가 정말 다루고 싶었던 마지막 하나가 제 눈길을 사로잡은 모델입니다.29:32
IBM과 NASA의 멋진 협업으로, 특히 달 표면에 특화된 일련의 모델이 공개되었습니다.29:40
탐사 관련 모델들입니다. 효과적으로 컴퓨터 비전 모델로서 달 표면의 특징을 잘 인식하고29:47
연구원들이 활용할 수 있도록 특징들을 식별하는 데 아주 유용합니다.29:54
그리고, 데이비드 씨, 저는 이 부분에 특히 감명받았어요. 왜냐하면 어느 면에서는 이게30:00
기계 학습이 어떻게 활용될 수 있는지 보여주는 정말 흥미로운 이야기라고 생각하거든요.30:04
이미 가지고 있는 데이터에서 더 많은 지식을 추출하는 것이라고 생각하는데요, 이 부분에 대해서는 이야기가 많이 오가지 않지만 정말 흥미로운 일이라고 생각합니다.30:09
네, 처음에는 마틴처럼 제 첫 번째 반응이 달과 아폴로 팬보이처럼 느꼈습니다.30:16
하지만 처음 이 내용을 읽었을 때, 정말 지루해서 눈물을 흘릴 것 같았어요. 왜냐하면,30:25
화성 표면의 운석구덩이 수를 더 빨리 세는 데 도움이 된다는 식으로 설명하더라고요. 그래서 제가 '왜 이런 걸 해야 하지?'라고 생각했어요.30:29
이런 일이 실제로 존재한다니, 사람 손으로 운석구덩이를 세다니 세상에서 제일 슬픈 직업 같네요.30:37
그런데 제가 알게 된 건, 사실 이게 매우 중요하다는 거에요. 만약 운석구덩이 개수를 셀 수 있다면...30:41
달 표면의 특정 지역에 있는 운석구덩이 수를 세면, 태양계의 나이나 연대와 관련된 여러 가지를 추론할 수 있습니다.30:46
사실 그 운석구덩이는 일종의 시계와 같아서, 얼마나 자주 충돌하는지를 나타내는 역할을 합니다.30:51
우주 전체에 영향을 미치죠. 왜냐하면 그것들은 외부 물질이 얼마나 자주 충돌하는지를 나타내기 때문입니다.30:55
달의 나이를 추정할 수 있고, 화성의 나이 같은 다양한 정보들을 얻을 수 있게 되어서 저는 정말 흥미롭게 생각하게 됐습니다.31:00
이 모델을 통해 과학 연구가 어떻게 가속화될 수 있는지 배우게 되어서 정말 기뻤습니다.31:05
개베님, 이 모델에 대해 어떤 점이 가장 흥미로우셨나요? 얼음 식별에도 도움이 된다는 것을 봤어요.31:10
알고 보니, 여러 매개변수를 가진 매우 어려운 문제였던 것 같습니다. 그리고...31:16
달 탐사 및 식민지화에 영향을 미칠 수 있습니다.31:23
이 모델에 흥분하게 된 건, 또 다시 '지식인을 위한 인공지능'이라는 점이었어요. 정말 멋지네요.31:27
인공지능은 원래 지식인이나 과학자, 그리고 그런 걸 좋아하는 사람들이 하는 분야였으니까요.31:33
대부분의 사람들이 보고 '왜 우리가 이걸 해야 하는 거지?'라고 생각할 만한 난해한 문제들에 대해 생각해 보는 거죠. 그리고 정확히 말씀하신 것처럼, 아니면 적어도 제가 바라는 건데,31:39
달 표면에 있는 운석구덩이를 세고 있다니요? 그리고 정확하게 지적하셨다시피, 아니면 최소한 제가 그렇기를 바라지만.31:44
제가 정확하다고 말씀드린 건, 제가 달 전문가가 아니기 때문입니다. 아마도 달 표면의 운석구덩이는 우주의 연대기를 이해하는 데 중요한 의미를 지니고 있고, 많은 것을 배울 수 있는 자료인 것 같습니다.31:48
바로 그런 곳이 괴짜들과 매니아들이 몰려드는 곳이죠.31:54
음, 마치 그렇게 사는 거죠. 아시겠지만, 지금은 인공지능이 단순한 흥미로운 기술을 넘어 사회적, 기술적인 문제로 매우 중요해지고 있는 시대에 살고 있습니다.31:59
저희는 이런 시대에 살아왔기 때문에...32:06
흥미로운 수학과 저희가 터미널에서 무엇을 할 수 있을지에 대해 열정적으로 이야기하는 것들로부터32:13
우리가 해결해야 할 매우 인간적인 문제들과 씨름하게 되기 시작했고, 그것은 중요한 일입니다.32:18
하지만 좀 불편하기도 하죠. 그래서, AI의 고전적인 활용 사례를 보는 건 정말 멋있어요.32:23
좋기 때문입니다.32:30
과학 문제의 본질에 대한 것이라서 저를 흥분하게 만들었고요, 물론 제가 좋아하는 부분도 있습니다.32:31
챗봇이나 코딩 에이전트가 아닌 다른 분야에서 AI가 활용되는 모습을 보는 것은 좋은 상기 계기가 됩니다.32:38
이 기반 기술은 소비자 사용 사례보다 훨씬 더 광범위하게 적용될 수 있습니다.32:45
우리가 보고 있는 경우들보다요.32:52
너무나 압도적이네요. 그리고 그런 이야기가 자주 잊혀지는 경우가 많다는 것을 알고 있어요, 우리가32:52
최신 버전으로 넘어가면서요.32:59
프론티어랩스에서 가져온 것들이죠. 하지만 이 모든 기술 뒤에 있는 핵심 기술로부터 우리가 얻을 수 있는 전체적인 지식과 인류의 상태에 대한 실제적인 이점도 분명히 있습니다.33:02
아마도 그럴 겁니다.33:08
효율성이나 토큰 효율성이 얼마나 중요한지와는 전혀 관련이 없어요, 아시다시피.33:13
가베 말씀에 저도 동의해요. 제가 이 프로젝트에서 정말 마음에 드는 점은...33:20
이 프로젝트에 대해 정말 흥미로운 점은, 기반 모델이 반드시 채팅봇일 필요가 없다는 것을 보여준다는 거예요.33:27
그리고 여기서의 가치는 재사용성이라고 할 수 있어요. 한 번 큰 규모의 달 데이터 세트를 학습시키면요.33:34
그러면 여러 과학적 질문에 맞춰 표현을 재사용할 수 있고, 매번 처음부터 시작하지 않아도 됩니다. 그게 정말 큰 가치입니다.33:41
그리고 제가 생각하기에 여기에서 가장 중요한 작업은...33:48
데이터 엔지니어링 또한 중요합니다. 모델 크기뿐만 아니라, 여기 센서들이 서로 다른...33:54
해상도와 다양한 관측 환경을 가지고 있습니다. 이러한 모든 측정값을 일치시키는 것이 필요합니다.34:00
그리고 데이터가 어떻게 수집되었는지 모델에게 알려주는 것도 중요합니다.34:06
더 많은 파라미터를 추가하는 것만큼 중요한 경우도 있습니다.34:10
여기서 배울 수 있는 흥미로운 엔지니어링 데이터 관련 문제들이 정말 많습니다.34:14
물론, 이러한 거대한 과학적 질문에 답할 수 있다는 것 자체가 큰 의미가 있습니다.34:20
인류에게 큰 가치를 지니고 있습니다, 물론이죠.34:27
제가 생각하기에 또 다른 흥미로운 점은 이것입니다.34:31
기초 모델이라고 생각할 때, 가장 먼저 떠오르는 것은 바로 텍스트 기반의 모델이라는 것입니다.34:34
텍스트를 입력하면, 그에 맞춰 텍스트가 출력되는 방식이죠.34:41
하지만 물론이죠, 이제 텍스트 외 다른 모달리티와도 원활하게 작동하는 다중모드 모델들이 있습니다.34:44
이미지 생성 모델은 이미 익숙하실 텐데요. 이미지 하나를 넣으면 또 다른 이미지가 나오는 방식이죠.34:50
그리고 작동 방식은 기본적으로 정보가 벡터의 형태로, 숫자들의 연속으로 표현될 수 있다면34:56
기초 모델에서 사용될 수 있습니다. 이런 식으로 다양한 분야로 확장되는 것을 보게 되어 기쁩니다.35:02
우주에서 찍은 사진들을 다시 벡터로 표현하고, 그런 정보를 나타낼 수 있죠.35:08
기본적으로 동일한 기반 모델을 활용해서 처리할 수 있습니다.35:14
텍스트를 다루는 것뿐만 아니라, 특정 각도에서 촬영된 이미지를 분석하는 것처럼 교묘한 작업도 할 수 있게 되었어요.35:18
태양이 특정한 각도로 위치하여 운석구덩이가 조금 가려져 있는 상황을 볼 수도 있죠.35:23
보이는 것을 조정하거나, 모델에서 사용되는 동일한 종류의 수학을 활용하는 것과 같습니다.35:28
텍스트 기반으로 시를 쓸 때와 같은 동일한 종류의 추론 방식이 사용되고 있습니다.35:34
거대 언어 모델도 활용해서, 정말 멋진 방법으로 기반 모델을 완전히 다른 분야에 적용하는 것이네요. 아주 좋네요.35:39
완전히 새로운 방식으로 마무리할 수 있어서 좋네요. 음, 이것으로 시간이 모두 끝났습니다.35:44
오늘 저희 게스트는 마틴 개버 카우터입니다. 항상 모시고 기쁘고요, 시청자분들 참여해주셔서 감사합니다.35:48
사실 이번 에피소드는 제가 미쉬너리 오브 엑스퍼츠 호스팅을 마지막으로 하는 편이 될 예정입니다.35:53
전문가분들께서는 데이비드와 함께 편안하게 맡겨주세요.35:57
만약 들으시는 분들이 계시다면, 애플 팟캐스트, 스포티파이, 그리고 팟캐스트에서 저희를 찾아주실 수 있습니다.36:02
다양한 플랫폼에서 들을 수 있습니다. 다음 주에 Mixture of Experts에서 다시 만나요.36:06
이것이 검열 대상인지 여부는 차치하고, 팀에게 좀 더 큰 작별 인사를 하고 싶습니다.36:13
그리고 이 내용이 검열을 통과하는지 확인할 수 있을 거예요.36:18
하지만 말씀드리자면, 저는 오랫동안 이 쇼의 팬이었답니다.36:22
팀, 저는 팀이 기술적인 주제들을 정말 쉽게 풀어내셨다고 생각합니다.36:25
음, 그리고 제...36:27
저희 두 살짜리 따님이 부모님의 신발을 신고 돌아다니는 걸 엄청 좋아해서, 방 안에서 비틀거리면서 다니거든요. 제가 발을 디딜 때마다...36:35
계속 넘어지는 것 같아요.36:36
정말 큰 발걸음을 따르는 입장이 되었네요. 제 딸처럼 자주 넘어지지 않도록 노력하겠습니다.36:42
하지만 네, 정말 책임감이 막중하다고 생각합니다.36:49
정말 감사드립니다, 하신 일에 대해서요.36:56
네, 감사합니다, 팀. 정말 관대하시네요. 행운을 빌겠습니다.36:59
팀 말씀에 동의합니다. 제가 가장 좋아하는 것 중 하나는 저희가 녹음한 에피소드를 항상 저 스스로 듣는 거예요.37:03
녹음할 때는 제가 이 주제에 대해 어떤 통찰력을 제시해야 할지 생각하는 모드에 들어가거든요.37:09
그리고 다시 들어봤을 때, 주제 전환하실 때마다”, 님께서 제시하시는 통찰력이 정말 멋지게 내용을 연결해 주시는구나 라는 걸 깨달았어요.37:14
항상 중요한 단서를 제공해서 자연스럽게 다음 주제로 이어지는 느낌이 들어요.37:18
그러니까, 아시다시피, 당신의 역할은 마치 공을 주고받는 것처럼 보이지만요,37:24
그런 방식으로 하시는 모습이 정말 자연스럽게 흐름을 조율하는 것 같아요.37:29
항상 감사하게 생각하고 있습니다. 감사합니다.37:32
감사합니다. 정말 그렇습니다. 왜냐하면, 음, 매우 쉬울 테니까요.37:36
다음 분께 질문하실 때, 마치 자연스럽게 그 분을 당황시키시는 것 같아요. 예상하지 못하게 하시는 거죠. 저희가 대본이 없기 때문에.37:39
정말 재밌는 순간이죠.37:44
어떤 내용이 나올지 알고 있는 상태인데, 주제만 가지고 계시잖아요. 그런데 항상 대화를 자연스럽게 다음 사람에게 이어지는 방식으로 이끌어내시는 것 같아요.37:48
그렇게 다음 사람에게 넘겨주실 때, 마치 눈에 띄게 명확하게 느껴지도록 만드시네요.37:52
저에게 말씀드리자면, 정말 대단한 재능이신 것 같아요. 네, 네, 네, 동감합니다. 하신 말씀에 전적으로 공감합니다.37:56
저희도 참여하면서 항상 긴장감을 놓을 수 없어요. 쇼를 계속 이렇게 흥미롭게 이끄시는 놀라운 능력입니다.38:03
저희도 참여하면서 보게 되는데, 항상 긴장감을 놓을 수가 없네요.38:09
다음에는 무슨 일이 벌어질지, 다음 질문은 무엇일까 궁금하죠?38:13
어떻게 준비해야 할까요? 그래서 정말 흥미롭고 자연스럽게 이어지는 것 같아요. 38:17
그리고 청취자분들의 참여도도 확인할 수 있는 것 같습니다.38:24
그러니 정말 감사합니다, 팀. 네, 정말 큰 칭찬이에요. 저희를 계속 긴장하게 만들었던 지난 두 해 동안요.38:27
정말 감사드립니다. 카타르님, 감사합니다.38:33
제 증거는 제가 불과 며칠 전에 스타트업에서 엔젤 투자자로 활동해 달라는 이메일을 받았다는 거예요.38:35
그들이 지난 해 미쉬처에 나왔던 제 발언을 들었다고 하더라고요.38:41
전문가들께서 저를 천사 투자자로서 투자를 할 준비가 된 사람이라고 생각하시는 것 같아요. 38:46
그러자 제가 되받아 물어봤어요, 얼마나 필요하신가요? 네, 제 지갑에 5달러짜리 지폐가 있어요.38:51
그러실래요?38:56
하지만 이 쇼에 정말 눈에 띄는 세련됨을 더해주셨습니다.38:58
IDM에서 소비자를 직접 대면하는 가치를 드물게 창출하는 빛이라고 할 수 있겠네요.39:05
AI Summary
인공지능 모델 효율성, 비용 절감, 그리고 TypeSafe의 JEV 모델에 대한 논의와 함께 IBM의 Malaya 프로그램, 시스템 원/시스템 투 사고 방식 등이 소개되었습니다. 특히 JEV는 특정 목적(코딩 등)에 최적화된 '목적에 맞는 모델'로서 주목받고 있으며, AI 기술이 과학적 문제 해결에도 기여할 수 있다는 점이 강조되었습니다. 또한 쇼 진행자의 능력과 참여자들의 경험을 통해 청취자 참여도 증가 및 개인의 평판 형상에도 긍정적인 영향을 미칠 수 있음을 보여주었습니다.
Key Highlights
- •JEV 모델은 특정 목적에 최적화된 '목적에 맞는 모델'로, 기존 LLM과는 차별점을 가집니다.
- •IBM의 Malaya 프로그램은 결정적인 의사 결정을 내리는 영역을 해결하기 위해 JEV와 같은 모델을 활용합니다.
- •시스템 원/시스템 투 사고는 AI 모델의 작동 방식을 이해하는 데 도움을 줍니다.
- •AI 기술은 달 표면 운석구덩이 분석 등 과학적 문제 해결에도 활용될 수 있습니다.
- •쇼 진행자의 능력은 청취자 참여도 증가 및 개인의 평판 형상에 긍정적인 영향을 미칩니다.


