Home

읽기 설정

자, 지난 2년 동안 최전선 연구소들이 뭘 하고 있는지 살펴보면 모두00:00

하나의 방향으로 향하고 있어요. 그들은 추론에 집중했고, 그 추론을 얻기 위해 주로00:07

더 긴 사고 과정과 사고 예산에 집중했어요.00:14

그 모델들은 훌륭하지만, 답을 돌려주기 전에 여러 분 동안 멈춰 있을 거예요.00:17

물론, 그 사고 과정을 보고 싶다면 최전선 연구소들은 돈을 내도 보여주지 않을 거예요.00:23

그래서 다니엘 카너먼의 책 '생각에 관한 생각'을 읽어보면 이 모든 종류의00:29

추론은 시스템 2 사고라는 걸 알 수 있어요. 느리고, 신중하며, 노력이 필요하지만, 시스템 1은00:34

반면에 빠르고 직관적이며, 거의 생각 없이 정말 빠르게 내리는 결정과 같아요.00:40

여기서 오늘 영상의 주제가 정말00:47

재미있다고 생각해요. 실제로 소프트웨어 안에 있는 대부분의 결정은 시스템 2 문제가 아니에요.00:50

대부분 단순한 분류 문제에 불과해요. 어떤 종류의 지원 티켓인가요?00:55

이 메시지가 긴급한가요? 에이전트의 결과물이 규칙을 위반했나요?01:00

그런 생각에는 30초도 필요 없을 거예요,01:04

게다가 어떤 모델들이 소요하는 몇 분이나 되는 시간을 감안할 필요는 없어요.01:08

이러한 추론 모델에 하나의 단어 답변을 요청하고 JSON으로 래핑할 수 있어서 좋긴 하지만,01:12

하나의 단어 레이블을 돌려받기 전에 모든 텍스트를 생성하는 데 엄청난 지연 비용을 치르고 있어요.01:18

그래서 이번 주에는 스텔스에서 벗어난 새로운 연구소가 추론 모델과는 완전히 다른 방향으로 움직였어요.01:25

아예 대화할 수 없는 모델을 만들었고, 오랜 시간 동안 추론하고 숙고하는 것은 더더욱 불가능해요.01:31

표준 오토 회귀 방식으로 텍스트를 생성하지 않아요.01:38

재밌는 점은 그것을 강제하는 것이 이 모델의 출력 토큰이 실제로 무료라는 사실이에요.01:41

그런데 실제로 왜 그 토큰이 무료인지 알아내는 것은01:47

이것이 어떻게 만들어졌는지에 대한 많은 정보를 알려주는 것일 수도 있어요. 그래서01:50

회사는 Type Safe AI이고 모델은 Jev라고 불리며, 창립자는 디오고 알메이다입니다. 그리고01:55

사실 그는 OpenAI에서 꽤 오랫동안 있었고, 재미있게도 최고의02:01

Instruct GPT 논문의 주요 저자 중 한 명이었습니다. 그 논문은 일종의 전체02:05

모델 명령어 튜닝으로 이어졌고, 이것이 현재의 추론02:10

모델로 발전해 왔습니다. 혹시 모르시는 분들을 위해 말씀드리면, 그 논문은 원본 언어 모델을 가져와서02:15

지금 우리가 기본 모델이라고 부르는 것을 기반으로 만들어서 명령어를 따르도록 했습니다.02:21

그리고 그 연구를 통해 ChatGPT가 탄생했습니다.02:26

따라서 그는 모델이 사람들과 대화하는 데 능숙해지도록 만드는 데 분명히 기여한 사람입니다.02:29

그가 지난 네 년 동안 계속 고민해 온 질문은02:33

모델이 채팅에서 인간을 초월할 정도로 발전하면서, 여기에는 자동화는 어디에 있나요?02:36

흥미롭게도 그는 채팅이 소프트웨어의 잘못된 인터페이스라고 말하고 있어요.02:42

소프트웨어는 단락을 원하지 않아요. 바로 사용할 수 있는 값을 원해요.02:46

지금, 디오고와 TypeSafe AI 팀의 다른 멤버들은02:51

지난 2년간 은밀하게 이 모델인 JEV를 개발해 왔어요.02:53

자, JEV는 무엇일까요? 그들은 이것을 시스템 원 모델이라고 구체적으로 표현하고 있어요.02:59

이것을 보는 가장 쉬운 방법은 함수 호출과 비슷하다고 할 수 있을 거예요.03:04

두 가지를 입력해요. 하나는 그들이 상태라고 부르는 것으로, 그냥 비정형 텍스트나 데이터예요.03:09

그것은 분류하고 싶은 어떤 것이든 될 수 있어요. 지원 티켓이거나 에이전트 추적이거나 로그 파일 등이 있을 수 있죠.03:15

그리고 두 번째로 전달하는 것은 유형화된 질문 세트예요.03:22

여기서 물어볼 수 있는 질문은 세 가지뿐이에요. 선택형인데, 옵션 목록을 줘서 하나를 고르게 하는 방식이죠.03:27

점수형이 있는데, 사용자가 정의한 척도에서 무언가를 평가하는 거예요.03:34

그리고 널(null)이라고 하는 질문이 있는데, 예/아니오 질문이고, 기본적으로 정답이 예일 확률을 알려줘요.03:38

정답이 예일 확률을 알려줘요. 여기 나오는 결과는 텍스트 없이03:43

정답을 전달해요. 선택형 질문에서는 선택한 옵션과 다른 모든 옵션의 확률도 함께 제공돼요.03:49

그리고 이것이 정말 흥미로운 부분이라고 생각해요. 왜냐하면03:54

저희 중 많은 사람들이 JSON을 이용해서 속이려 했던 것들 중 하나인데, 모델에게 어떤 일을 시키고 결과를 반환03:58

하지만 많은 면에서, 거기서 받는 숫자는 그냥 생성된 텍스트일 뿐이고, LLM을 심판으로 본다면,04:05

자주 그런 텍스트가 특정 방향으로 치우치는 것을 볼 수 있어요, 즉,04:12

그냥 모델이 0.9라는 문자를 쓰는 것일 뿐이고, 실제 확률을 나타내는 것은 아니에요.04:17

이 모델을 사용하는 방법은 마치 똑똑한 if문처럼 생각하는 거예요.04:24

하나의 큰 질문을 던지는 방식이 아니에요. 예를 들어, 이 스타트업 발표를 평가해 달라는 식으로요.04:29

작은 직관적인 질문들을 하는 거예요. 이것의 실현 가능성은 어느 정도인가?04:33

어떤 시장을 목표로 하고 있나요? 그리고 물론 선택형 질문을 한다면 실제로 옵션을 제공해야 해요.04:38

선택할 수 있는 옵션을 제공해야 합니다. 그러면 멋진 점은 모든 것을 여기에 통합할 수 있다는 거예요.04:44

일반적인 코드에 넣을 수 있어요. 그래서 무언가 변경되면 코드를 수정해서 숫자를 바꿀 수 있죠.04:49

프롬프트를 수정할 필요도 없어요. 자, 제가 기본적으로 코딩한 것은요...04:53

이것을 테스트해 볼 수 있는 간단한 데모 앱을 만들었어요.04:59

OpenRouter에서 이 모델을 사용하고 있어요. 정말 이상한 종류의...05:02

가격 모델이죠? 입력 토큰 1백만 개당 4.2센트, 출력 토큰 1백만 개당 0센트입니다.05:06

토큰을 지불하는 방식이에요. 여기 보시면 OpenAI API 엔드포인트를 이용해서 호출하는 방법을 코드로 보여주고 있어요.05:13

OpenAI API 엔드포인트를 사용하는 방법에 대한 코드도 있습니다.05:18

그래서 저희는 몇 시간 동안 다양한 데모를 만들고 여러 가지를 시도해 봤습니다.05:22

가장 중요한 점은 여기에서 할 수 있는 세 가지 종류의 작업이 있다는 것입니다, 그렇죠?05:27

그중 하나는 선택 기능입니다. 여기 보시면,05:31

텍스트를 입력하고 다섯 가지 다른 클래스 중에서 선택할 수 있습니다.05:34

이 중에서 올바른 것을 감지하는 데 아주 능숙합니다.05:40

여기 원본 출력을 보면 기본적으로 'choice'라는 유형을 가지고 있습니다.05:46

이번 경우에는 선택이 프랑스였고, 각 항목에 대한 확률과 신뢰도 점수를 알려줍니다.05:52

점수도 할 수 있다는 것을 알 수 있어요. 그리고 그게 빠르게 처리되는 것도 볼 수 있습니다. 제가 모델이 호스팅된 위치와 반대편에 있을 수도 있지만05:58

세상에 있는 것 같지만, 매우 빠르게 응답하는 것을 알 수 있습니다. 심지어 제가 태국어로 시도해보고 싶었을 때06:03

응답할 수 있어요. 태국어를 사용해서 태국 문자열로 시도했을 때조차도06:08

태국어라는 것을 바로 알아챌 거예요.06:15

그래서 제가 물어봤어요.06:18

기본적으로 그것을 로마자 버전으로 만들라고 했는데, 그조차도 문제가 없다는 것을 알 수 있습니다06:19

정확하게 처리할 수 있다는 것입니다. 두 번째로 할 수 있는 일은 점수를 얻을 수 있다는 것입니다.06:25

점수를 주는 것이죠. 여기서는 0부터 2까지 점수를 주고 있는데06:31

여기서는 감정을 분석하는 분류 작업을 하고 있습니다. 긍정적인 감정으로 가면06:37

2점 만점을 받습니다. 부정적으로 하면 0점이 되고, 혼합된 경우에는06:42

혼합으로 가면 그렇게 하는 데 능숙하고, 보시면 매번 이 비용이 저에게06:50

여기 0.0014센트 정도 든다는 것을 보실 수 있습니다.06:56

시도하는 작업을 여러 분류로 나누면07:03

정말 저렴한 비용으로 많은 작업을 할 수 있고, 보시면07:08

이 경우 중간보다 약간 더 긍정적으로 만들려고 했더니 변하는 것을 보실 수 있습니다.07:14

매번 돌아오면서 아직도 확률적 과정이 진행 중이고, 신뢰도는07:19

전에 비해 낮아지고, 매번 확인하면 조금씩 다른 결과를 얻지만 대체로07:25

비슷한 수준의 점수를 보입니다. 그 API를 살펴보면07:31

확률이 돌아오는 것을 볼 수 있습니다. 이 경우 스코어를 입력했죠.07:36

그 결과가 나오고, 스코어링 기능은 정말 유용하고, 마지막으로07:41

여기에는 참 또는 거짓, 또는 예/아니오와 같은 확률이 있습니다. 이 값은 널이고07:46

이제 간단한 질문을 하면 입력한 내용에 대한 확률을 반환하게 됩니다.07:53

예, 이 텍스트가 질문을 하는 것인가요? 답은 아니오입니다.07:58

여기서 볼 수 있듯이 예라고 할 확률이 2%이고, 기본적으로 아니오입니다. 어느 정도08:05

시그모이드 함수로 평탄화된 것으로 생각할 수 있습니다. 이 값은 0에서 1까지 나옵니다.08:10

심지어 질문이 있지만 물음표가 없는 경우에도08:15

물음표가 없어도 그것은 여전히 질문이라고 매우 확신합니다.08:20

그냥 물음표만 찾는 것이 아닙니다. 다양한 종류의 질문에 대해08:24

다른 응답을 얻을 수 있습니다. 흥미롭게도 제가 그냥 '도와주세요'라고 물어보면08:30

확실성이 훨씬 떨어집니다.08:34

구체적으로 요청하지 않았기 때문에 어려워하는데, 만약 제가 고양이 찾는 것을 도와주실 수 있나요라고 물어보면 9508:36

확신하고, 만약 거기에 단어 하나를 바꿔서 고양이에게 밥을 먹여줄 수 있나요라고 하면08:42

점수가 조금 떨어지는데, 실제로 이렇게 작동하는 방식이 흥미롭네요. 다시 한번 보더라도08:49

이는 여전히 확률적 과정이며, 매번 약간씩 다른 결과를 보여주지만 대체로08:55

일관성을 유지하며, 하나의 표현이나 다른 표현을 사용할 수 있습니다. 만약 제가09:01

단 두 단어를 제시하면 이 부분에 대한 확신이 없어지기 시작하네요. 제 생각에는09:06

입력하는 내용이 길수록 더 자신감 있는 답변을 내놓는 것 같아요.09:12

지금 여기에서 우리가 할 수 있는 좀 더 실용적인 몇 가지를 살펴보면 보실 수 있습니다09:19

주문이 두 번 청구되었으니 중복 결제를 환불해달라는 메시지를 입력할 수도 있습니다. 그러면09:23

어떤 팀에 전달해야 하는지 알아내게 됩니다. 여기서는 청구팀이 꽤 분명합니다.09:29

세일즈 원은 100% 세일즈로 분류되네요. 조금 더 모호한 걸 해보면 어떨까요?09:34

지금 보니까 확신이 없는 것 같아요. 클래스로 판단하기 어렵다고 다시 나오고 있지만, 아직09:39

기술적인 문제라고 생각하고 있어요. 그리고 실행할 때마다09:45

약간 다른 응답이 나오는 것을 볼 수 있어요.09:50

게다가 지금은 여러 가지를 동시에 처리하고 있어요.09:53

환불 요청에 대한 널 값이 있는 것도 확인할 수 있네요.09:57

이런 식으로라면 당연히 답은 예스겠죠. 시간 민감한 문제인가요?10:02

그렇죠? 여기서는 시간 민감도가 7%라고 하고 있어요. 이걸 '지금 중복 요금을 환불해 주세요'로 바꾸면10:08

지금 환불해 달라는 내용으로 변경하면 시간 민감도가 60~70% 정도로 급등하는 것을 볼 수 있어요.10:14

이런 식으로 60~70%까지 올라가네요. 거기에 다른 내용을 삽입해 볼 수도 있어요.10:19

누군가가 프롬프트 인젝션 같은 시도를 할 때 이런 종류의 작업을 하더라도,10:26

이것은 그런 종류의 일을 처리하는 데 꽤 잘 하는 것 같아요.10:31

신경 쓰이는 말투도 어느 정도는 괜찮게 처리하는 것 같네요.10:35

유머나 다른 종류의 콘텐츠에 대해서도 테스트해 보면 재미있을 것 같아요.10:40

그런 것들에 속지 않는 것도 좋네요. 보통은 속기 쉬운 것들에 대해서는요,10:43

이런 종류의 것에 쉽게 속곤 하거든요. 다른 작업으로는 코드 리뷰 같은 것들을 할 수 있어요.10:49

어떤 것이 안전한지, 안전하지 않은지를 물어볼 수 있는 거죠?10:54

그 점에서는 꽤 잘 하는 것 같아요. 다양한 콘텐츠 유형에 대한 분류 작업은10:58

정말 잘 되는 것 같습니다. 여기서는 개인 식별 정보인 PII 정보를 찾아낼 수 있어요.11:05

그런 종류의 작업도 꽤 잘 하는 것 같아요.11:10

스팸 필터링도 잘 하는 것 같아요.11:13

탐지 능력도 뛰어나서, 여기 네 번째 예시는 에이전트 도구 선택을 살펴보는 건데요. 이11:15

과거에 살펴봤던 앤캐릭터 모델과 조금 비슷한 점이 있는데, 일종의11:21

함수 호출을 하고 있지만, 여기서 중요한 건 실제로 어떤 것을 추출해서11:27

도구에 전달하는 게 아니라, 그냥 어떤 도구를 사용할지 알려주는 것과 같아요.11:32

도구에 전달할 올바른 인수를 가져오는 건 아니고요.11:39

그 점에서는 함수 호출 모델은 여전히 함수로 들어갈 입력을 생성할 수 있어요.11:43

마지막으로, 제가 테스트해 보면서 흥미롭게 생각했던 점은 액션을 연결하는 거였어요.11:50

우리가 기본적으로 무언가를 주고, 그다음에 여러 작업을11:56

이것에 대해 얼마나 걸리는지 보기 위해 실행하는 거였어요?12:01

실제로 어떻게12:07

이것들을 처리하는지, 여기 20가지 다른 작업들이 진행되는 것을 볼 수 있는데 정말 빠르게 진행되고 있어요12:07

저는12:14

최소한 일부 작업은 병렬로 처리할 수도 있었겠지만, 이렇게 진행해보니 모든 다른12:15

20가지 작업을 여기에서 완료하고 답을 얻고 결과를 돌려받았는데, 비용은 1센트의 20분의 1 조금 넘는 정도였어요12:22

1센트의 20분의 1 조금 넘는 비용이 들었네요. 정말 흥미로운 점을 발견할 수 있는 곳이라고 생각해요12:29

다양한 분류들을 연결해서 어떤 종류의 응답을 얻을 수 있을 때12:36

정말 빠르게 귀중한 결과를 얻을 수 있어요12:43

자, 그럼 이것들이 어떻게 작동하는 걸까요? 글쎄요, 여기서는 많은 정보를 알려주지 않네요12:47

논문도 없고 아키텍처 다이어그램도 없어요. 많은 정보를 제공하지 않아요.12:52

하지만 그들이 제공하는 세 가지는 새로운 모델이 있다는 점이에요.12:56

아키텍처, 병렬 샘플러, 그리고 아마도 가장 흥미로운 부분은 그들이 훈련을 하고 있다는 점입니다.13:01

RLCD라는 새로운 방법으로 훈련하고 있어요. 이것은 교정된 결정을 위한 강화 학습이에요.13:06

이제 RLCD가 어떻게 작동하는지 그들은 자세히 설명하지 않지만, 기존 LLM과 비교하고 있어요.13:13

RLHF, 즉 인간 피드백으로부터의 강화 학습과 함께 또 다른 강화 학습을 사용해서요.13:19

검증 가능한 보상으로부터의 학습, 즉 GRPO와 현대 모델들이 훈련되는 많은 방식이죠.13:25

현대적인 모델들이 현재 훈련되고 있는 방식이므로 제 생각에는 이것이 어떤 종류의13:30

트랜스포머일 가능성이 높지만, 어쩌면 사전 채우기 단계를 사용하여 계산을 하고 있을지도 모릅니다.13:35

헤드 등을 계산한 다음 예측을 수행하는데, 이는 분류 또는 회귀 작업에 따라 달라집니다.13:41

다양한 작업에 따라 속도가 확실히 빠르다는 점이 멋진 부분 중 하나입니다.13:46

토큰이 하나씩 생성되지 않기 때문에 모든 것이 한 번에 반환돼요13:51

패스되고, 그래서 약 70에서 500 밀리초 안에 완료될 수 있고, 기본적으로13:57

왕복 시간에도 여전히 이런 종류의 작업을 수행하는 데 매우 빠르죠14:03

이제 제가 흥미롭게 생각하는 것 중 하나는 그들이 환각을 할 수 없다고 주장한다는 거예요. 그리고14:08

말하려는 것은 주어진 스키마를 깨고14:14

무언가를 반환하지 않는다는 거예요. 예를 들어 깨진 JSON이 없고, 발명된 도구 이름도 없어요. 주어진 것만 처리할 수 있어요14:18

실제로 주신 것 외에 새로운 것을 생성하지 않아요14:24

하지만 여전히 잘못된 옵션을 선택할 수 있고, 잘못된 답변을 할 수도 있는 것 같아요14:27

정확한 유형의 질문은 받았지만 실제로는 잘못된 답변을 제공하는 경우도 있고, 보니까14:33

이 부분이 RLCD를 통해 고품질 답변을 반환하도록 의존하는 것 같아요. 자, 이제14:39

이것이 단순히 다른 방식으로 학습된 작은 LLM인지, 아니면 완전히 다른 아키텍처인지14:45

다른 아키텍처인지 잘 모르겠지만, 이런 일들을 할 수 있다는 건 정말 놀라운 것 같아요14:50

둠을 플레이하는 것처럼, 너무 빠르게 반응해서14:56

이러한 입력에 대응할 수 있다는 점이 흥미롭네요. 10개의 쿼리를 초당 실행하는 것과 같은 작업을 하면서15:03

초당 이렇게 빠른 속도로 처리하는데도 시간당 약 7달러밖에 들지 않으니, 전반적으로 말씀드리면15:08

BERT 모델과 같은 방식으로 어떤 종류의 분류 작업을 하고 있다면, 이건15:15

특정 사용 사례에 어떻게 적용되는지 확인하기 위해 꼭 시도해 볼 가치가 있을 것 같아요15:21

그리고 이것이 정말로 그들이 말하는 것처럼 성능을 내는지 궁금하네요15:26

정말로 그렇게 효과적인지 궁금하고, 이렇게 작은 BERT 모델을 미세 조정하는 시대가 끝날까요?15:28

BERT 모델을 순수한 분류 작업에 사용하던 시대가 끝날까요?15:34

어쨌든, 그들은 여기가 초반 단계이며, 어떤 종류의 결정을 자동화하는 데 집중하고 있다고 지적해요.15:37

자동화해야 한다고 말하고 있어요. 제 생각에는 아마도 이 오픈 소스 버전을 만들려고 많은 사람들이 시작했을 거예요.15:44

그러니까 앞으로 한 달 정도 지나면 정말 흥미로운15:50

이와 비슷한 아이디어를 가진 오픈 소스 모델들이 등장할 수 있을 거예요.15:54

어쨌든, 실제로 Jev를 사용해 보셨다면 댓글로 알려주세요. 어디에 이것을 사용할 수 있을지 궁금해요.15:58

실제로 테스트해 보고 특정 작업에는 효과가 없다고 생각하는 분들의 의견도 듣고 싶어요.16:03

어떤 사용 사례에서 작동하지 않았나요? 그리고 항상 그렇듯이, 이 영상이 유용하셨다면16:08

좋아요를 누르고 구독해주세요. 다음 영상에서 다시 만나요.16:13

지금은 안녕히 계세요.16:16

AI Summary

제공된 텍스트를 종합해 보면, 이 AI 모델은 스코어링, 문장 구조 이해, 구체적인 요청에 대한 높은 확신도 등 다양한 기능을 제공하며, 주문 중복 결제 환불 요청 분류, 세일즈 분류, PII 정보 탐지, 스팸 필터링, 코드 리뷰 등의 작업을 수행할 수 있습니다. 특히 RLCD라는 새로운 훈련 방법을 통해 답변 품질을 높이고, 병렬 작업 처리로 빠른 응답 속도와 비용 효율성을 확보했습니다. 현재 초기 단계이지만 의사 결정 자동화를 목표로 하며, 향후 오픈 소스 모델의 등장과 사용자 피드백을 통해 더욱 발전할 것으로 기대됩니다.

Key Highlights

  • •RLCD 기반의 고품질 답변 제공
  • •빠른 처리 속도와 저렴한 비용 (초당 10개 쿼리, 시간당 약 7달러)
  • •BERT 모델 대체 가능성 및 의사 결정 자동화 목표
  • •프롬프트 인젝션 방어 기능
  • •새로운 모델 아키텍처와 RLCD 훈련 방법 적용

Related Videos