읽기 설정
AI Summary
JEPA(정보 증류 및 파레토 최적화) 기술은 AI 시스템의 성능을 향상시키는 새로운 방법론으로, 프롬프트 공간 내에서 정보 증류를 통해 기존 방식보다 뛰어난 결과를 얻도록 합니다. 특히 OptimizeAnything API는 JEPA 기술을 확장하여 텍스트로 표현되고 점수를 매길 수 있는 모든 것을 최적화할 수 있도록 지원하며, 간단한 파이썬 코드를 활용하여 복잡한 작업을 해결하고 에이전트 개발 시간을 단축하는 등 다양한 분야에서 활용 가능합니다. RKGI 정확도 향상, GPT 모델 성능 개선, 비용 절감 효과와 더불어 OpenAI에서도 자체 학습 시스템 구축에 활용하며 광범위하게 적용되고 있습니다.
Key Highlights
- •JEPA는 AI 시스템의 성능을 향상시키는 새로운 방법론이며, 특히 수학 과제에서 GPT 4.1 미니의 성능을 GPT 4.1보다 뛰어넘게 만들었습니다.
- •OptimizeAnything API를 통해 텍스트로 표현되고 점수를 매길 수 있는 모든 것을 최적화할 수 있습니다.
- •간단한 파이썬 코드를 활용하여 복잡한 작업을 해결하고 에이전트 개발 시간을 단축할 수 있습니다.
- •RKGI 정확도를 제미니 플래시의 32.5%에서 89.5%로, GPT-5 미니 에이전트 성능을 24%에서 93%로 향상시켰습니다.
- •다양한 최적화 모드를 제공하며, 클라우드 스케줄링, 수학 프롬프트 최적화 등 광범위한 분야에 적용 가능합니다.
Related Videos
안녕하세요, 여러분.00:08
제 이름은 락샤 아입니다.00:13
아그라왈이고, 오늘 저는 매우 큰 노력의 일환으로, 반사적 최적화 문제에 대해 발표하게 되었습니다.00:15
텍스트 피드백을 통해 프롬프트, 에이전트 및 모델을 어떻게 스스로 개선할 수 있는지, 즉 자기 개선 최적화 방법에 대해 말씀드리겠습니다.00:22
우리가 시작하는 질문은 인공지능에게 새로운 작업을 어떻게 가르칠 수 있는가 하는 것입니다.00:28
새로운 작업들을 수행하도록 합니다. 일반적인 방법은 경사하강법을 사용하여 가중치를 업데이트하는 것입니다.00:33
사전 학습, 지도 미세 조정 또는 강화 학습 과정 동안에요.00:38
이 방법은 매우 효과적인 것으로 입증되었지만, 엄청난 수의 예시가 필요합니다.00:42
사전 학습에는 수조 개의 토큰이 필요하고, 지도 학습에는 수천 개의 레이블링된 예제가 필요하며, 강화 학습에는 수만 개의 시행이 필요합니다. (수학, 코딩 등 다양한 분야에서)00:48
예를 들어 수학이나 코딩과 같은 분야에서는 강화 학습에 수만 개의 시행 결과가 필요합니다.00:55
기타 등등의 데이터가 필요하지만, 대부분의 팀은 실제로 그렇게 많은 데이터나 컴퓨팅 자원을 가지고 있지 않습니다. 그리고 사실은...01:00
대부분의 팀은 그런 규모의 데이터나 컴퓨팅 자원을 확보하지 못하고 있습니다.01:03
지금 인공지능으로 해결하려고 하는 문제들이 샘플 효율성 때문에 어려움을 겪고 있습니다.01:08
무슨 뜻인지 궁금하시죠? 두 가지입니다. 첫째, 도메인 특화 지식 자원의 가용성이 낮습니다.01:14
지식 자원이 부족해서 오프라인 알고리즘을 수행하기에 데이터가 충분하지 않은 경우가 많습니다.01:21
우리가 인공지능을 적용하려는 분야는 점점 더 복잡해지고 있습니다.01:26
LLM 워크플로우 파이프라인이나 에이전트 기반 실행 과정이 매우 느리거나 비용이 많이 들거나, 또는 작업 지표 계산 자체가 매우 느린 상황을 의미합니다.01:31
실행 과정에 많은 비용이 발생하며, LLM 워크플로우 파이프라인이나 에이전트의 실행 자체가 매우 느리거나 비효율적일 수 있습니다. 또한, 작업 측정 기준을 평가하는 데에도 상당한 시간이 소요될 수 있습니다.01:36
실행하는 데 비용이 많이 들 수도 있습니다. 저희는 에이전트가 이제 몇 시간 동안 계속 작동할 수 있다는 것을 확인하고 있습니다.01:42
만약 온라인 학습 알고리즘을 이것에 적용한다면, 가능하지 않을 것입니다.01:47
수십만 번의 시행을 필요로 해서 실현 가능하지 않습니다. 그래서,01:52
이제 실제 제품 적용 분야에서 이러한 기능을 호출하는 에이전트 사용이 늘어나는 것을 보고 있습니다.01:56
샘플 효율성 문제를 더욱 악화시키는, 장시간 실행되는 도구들도 있습니다.02:02
현재 가장 일반적인 방식은 검증된 보상을 사용하는 강화 학습이며, 주어진 상황에 대해02:08
모델과 우리가 수행하는 작업에 대해 여러 개의 병렬 시뮬레이션을 진행하고, 마지막에 보상을 받습니다.02:13
마지막으로, GRPO와 같은 알고리즘은 이러한 보상을 받아 그래디언트로 변환하여 적용합니다.02:19
모델로 다시 연결되지만, 보시다시피 각 rollout마다 많은 정보가 있었습니다.02:25
하지만 우리는 오(O)의 단일 점수만을 학습하고 경사 하강법을 통해 전파했습니다.02:32
여기에는 생각의 흐름, 환경에 대한 도구 호출, 그리고 환경의 반응이 있다는 것을 알 수 있습니다.02:38
도구 호출에 대한 응답으로 잠재적으로 오류 메시지를 포함할 수도 있습니다.02:45
진단적인 가치를 제공했지만, 거기서 우리는 거의 아무것도 배우지 못했습니다.02:50
그래서 우리가 던지는 질문은, 이 나머지 매우 풍부한 정보를 활용할 수 있을까요?02:55
저희의 생각은03:00
텍스트 공간에서 반사적 최적화를 수행하는 것입니다. 여기서 대신03:02
제로 또는 원 보상 신호를 활용하여 언어 모델이나 에이전트가 가능합니다.03:08
모델은 전체 실행 과정을 추적하고 무엇이 효과적이었는지 되돌아볼 수 있습니다.03:13
어떤 점이 효과가 없었는지 파악하고, 이 반성을 통해 중간 결과물들을 모두 활용하거나03:19
잠재적으로 귀사의 지식 기반에서 검색하는 것과 같은 다른 도구 호출도 할 수 있습니다.03:25
기본 교재나 가이드라인 같은 것을 참고하라는 뜻입니다.03:29
그래서 이것이 첫 번째 핵심 아이디어입니다.03:33
두 번째는 작은 값으로 가중치를 업데이트하는 것 외에도,03:35
자연어 프롬프트 하나를 수정하여 시스템의 동작에 큰 변화를 줄 수 있다는 것입니다.03:41
간단한 예를 들어볼까요? 텍스트 요약 시스템을 만들라는 과제가 주어졌다고 가정해 봅시다. 그리고 그 프롬프트가03:46
“한 줄 요약을 생성하세요”라고 되어 있다고 해봅시다.03:53
만약 제가 프롬프트를 수정해서 열 줄 요약을 생성하도록 한다면, 모두 동의하실 겁니다.03:56
단 하나의 단어 변경으로 시스템의 동작 방식이 상당히 크게 바뀔 거라는 것을요.04:01
그리고 단 하나의 단어 변경만으로도 빠르게 저희의 행동을 되돌아보고04:06
무엇을 바꿔야 할지 파악할 수 있습니다. 만약 저희 AI 시스템에서 이와 비슷한 종류의 업데이트를 달성한다면,04:11
그렇게 행동을 업데이트하려면 수천 개의 아주 작은 그래디언트 업데이트를 순차적으로 적용해야 할 겁니다.04:18
바로 그 핵심 아이디어를 바탕으로, 저희는 JEPA라는 반사적 프롬프트 최적화 기법을 제안합니다.04:23
진화적 루프와 함께 새로운 패레토 기반 후보자 선택 방식을 사용하는데요, 나중에 자세히 설명드리겠습니다.04:30
이는 마치 기술 분야에서 강화 학습을 수행하는 것과 비슷합니다. 단순히 보상 점수를 받는 것이 아니라,04:36
실제로 점수와 함께 텍스트 피드백을 얻고 있습니다. 이는 매우 특정 도메인에 따라 달라질 수 있습니다.04:43
그리고 이를 통해 해당 도메인에 대해 모든 것을 배우게 됩니다.04:48
JEPA와 GRPO를 비교해 보겠습니다. GRPO는 선도적인 강화 학습 기술 중 하나입니다.04:52
x축은 훈련 단계 수를 나타내며, 이는 관찰된 데이터 샘플 수에 비례합니다.04:56
그리고 y축은 우리가 학습하는 영역에서의 성능을 나타냅니다.05:03
보시다시피, JEPA는 단 한 번의 반사 과정을 거치고 단 세 개의 데이터 포인트를 사용했을 뿐인데도05:08
제이파는 단 한 번의 반사 과정에서만 GRPO가 25,000번의 시행을 거친 후에 얻는 성능 향상치의 두 배에 달하는 결과를 보여줍니다.05:14
제이파를 몇 단계 더 진행하면 그 격차가 또 다른 두 배로 늘어납니다.05:22
여기서 모델인 QIN 3.8b가 스스로 최적화되고 있다는 점을 말씀드리고 싶습니다.05:28
외부 전문가의 도움은 전혀 개입되지 않았습니다.05:34
그리고 제파는 무엇을 배우게 되나요?05:38
이전의 프롬프트 최적화기들과 달리, 모델의 특이성을 활용하는 방식과는 다르게,05:41
만약 좋은 프롬프트를 생성하지 않으면 할머니께서 정말 화를 내실 거예요.05:48
여기서 JPAI은 실제로 문제에 대한 매우 상세한 설명을 제공하고 있는데, 그 안에는 어떻게 의미를 파악해야 하는지가 포함되어 있습니다.05:52
입력에 대해, 이 파이프라인의 특정 부분의 목적과 맥락은 무엇이며, 주요 관찰 사항과05:59
데이터에서 얻은 교훈은 무엇인가요.06:06
여기서 저희가 발견하고 있는 문제는 다중 홉 질문 응답 시스템의 두 번째 홉과 관련이 있습니다. 질문이 주어졌을 때, 그 질문에 잠재적으로 답할 수 있는 문서를 검색해야 합니다.06:07
그 문서들을 살펴보고 요약한 다음 최종적으로 질문에 답변하는 것입니다.06:14
여기서 저희가 확인한 것은 JEPA가 첫 번째 단계의 문서들이 주로 하나의 개체나 측면을 다룬다는 것을 찾아냈다는 것입니다.06:20
그리고 두 번째 단계는 실제로 그것과 관련된 문서를 복구해야 한다는 것을 알게 되었습니다.06:28
새로운 모델이 나올 때마다 인간 엔지니어링 팀은 수주 동안 일일이 직접 수정하면서 문제를 정의하려고 노력하는 것을 확인했습니다.06:33
단어 하나하나를 미세하게 조정하며 문제 사양을 파악하려 애쓰곤 합니다.06:40
이 전체 과정은 이제 제파(JEPA)를 통해 완전히 자동화되었습니다.06:45
실행하는 데 약 30분에서 1시간 정도 소요되며, 파이프라인에 따라 달라집니다.06:49
저희는 또한 JEPA를 선도적인 독점 모델에도 적용할 수 있습니다.06:56
간단한 예로, 여기서는 최적화가 가능했습니다.07:00
GPT 4.1 미니의 성능이 수학 과제에서 GPT 4.1보다 뛰어넘는 것을 확인할 수 있었습니다.07:03
프롬프트 공간 자체에서도 JEPA가 어떤 정보 증류를 수행했는지 알 수 있습니다.07:09
샘플 효율성 문제로 다시 돌아가면, AMD에서 새로운 하드웨어 가속기인 NPU-XDNA2를 개발했습니다.07:16
이것은 완전히 새로운 API를 사용하여 프로그래밍되었는데, 관련 정보가 거의 없었습니다.07:23
인터넷에 많이 퍼져 있었기 때문에, 당시 최고 성능을 보이던 모델들, GPT-40이었습니다.07:29
그렇게 실패하고 있었습니다. 저희는 기존 에이전트를 활용할 수 있었습니다.07:35
이 작업에서 4.25%의 정확도를 기록하고 있었는데, 에이전트에 다른 변경 없이 JEPA를 적용했습니다.07:41
이렇게 해서 프롬프트를 얻었고, 성능을 7배 향상시켜 30.52%까지 끌어올렸습니다.07:47
이것이 의미하는 바는 특정 분야에 대한 정보가 많이 있을 수 있다는 것입니다.07:52
만약 그러한 정보를 인공지능 시스템의 프롬프트에 포함시킨다면, 모델의 성능이 훨씬 더 향상될 수 있습니다.07:58
그리고 제파는 여러분이 완전히 자동으로 그것을 발견하도록 도와줄 수 있습니다.08:04
ADF.h를 포함하지 않도록 주의하라는 문장을 강조하고 싶습니다.08:07
흥미로운 점은 AMD에서 실제로 ADF.Edge라는 라이브러리를 NPU 프로그래밍을 위해 제공한다는 것입니다.08:11
하지만 저희가 작업했던 최신 하드웨어 세대에서는 제대로 작동하지 않았습니다.08:16
단 한 단계로 제포가 그걸 알아낼 수 있었습니다. 그래서 어떻게 작동하나요?08:21
매우 간단한 알고리즘으로, 어떤 에이전트로든 작성된 AI 파이프라인을 단순히 가져와서 사용합니다.08:27
어떤 기술 프레임워크든지, 혹은 직접적인 LLM 호출이라도 사용하셔도 괜찮습니다. 단순히 여러분의 시스템을 실행합니다.08:32
몇 가지 예시를 통해 실행하고, 도메인 특화 피드백을 수집합니다.08:37
환경에 포함된 모든 정보는 관찰됩니다. 그리고 LLM이나 에이전트를 활용하여 피드백을 읽고 더 나은 프롬프트를 제안합니다.08:40
그렇게 피드백을 읽고 더 나은 프롬프트를 제안하는 방식으로 작동합니다.08:47
마지막으로, 가장 중요한 점은 모든 후보들을 파레토 풀에 보관한다는 것입니다. 단 하나의 학습 예시에서도 이기는 모든 후보를 포함합니다.08:51
단순히 최고 점수를 받은 것뿐만 아니라요.08:56
질문이 있는데, 왜 파레토 풀을 유지해야 하는 걸까요? 이 질문을 정말 많이 받았어요.09:01
JEPA가 반복 루프 방식으로 모델을 실행하는 것보다 더 나은 걸까요?09:07
그래서 저희가 테스트해 봤는데, 루프는 가장 좋은 것만 유지하고 지역 최적점에 빠지게 됩니다.09:11
왼쪽에는 루프를 사용해서 LLM이 생성한 검색 트리가 보입니다.09:17
좌측 상단의 초기 프롬프트에서 시작해서, LLM에게 프롬프트를 개선하도록 요청했습니다.09:23
LLM이 프롬프트를 개선했고, 중간 노드를 생성하는 프롬프트를 만들어냈습니다.09:29
하지만 이 프롬프트는 지역 최적점에 빠졌고, 또다시 LLM에게 개선을 요청했을 때,09:34
개선을 시도했지만, 제안된 내용은 실제로는 더 나은 것이 아니었습니다.09:39
그래서 다시 돌아가서 개선하려고 시도했는데, 계속 반복하다 보니 탐색 예산을 모두 소진해 버렸습니다.09:42
반면에 오른쪽의 Jepa의 파레토 기반 후보 선택 전략은...09:48
검색 과정이 훨씬 균형 잡힌 상태를 유지하며, 결국 더 높은 점수에 도달하는 것을 확인할 수 있습니다.09:52
네 가지 벤치마크에서 테스트해 본 결과, JEPA를 통해 얻은 전체적인 성능 향상 중 절반 이상이 관찰되었습니다.09:58
실제로 이를 반영하면, 모델을 반복적으로 적용했을 때 얻을 수 있는 성능 향상보다 거의 두 배에 달하는 성과를 얻을 수 있습니다.10:04
JEPA는 다양한 벤치마크에서 뛰어난 성능을 보입니다. 여기서는 질문 관련 결과가 나와있습니다.10:10
질문 답변, 지시 따르기, 주장 검증, 그리고 수학까지 모두 포함해서요.10:16
최고의 선두 모델 회사들 역시 이미 많은 부분에서 모델을 최적화하고 있습니다.10:21
그리고 프롬프트를 최적화하는 것만으로도 플러스 10% 정도의 성능 향상을 얻을 수 있습니다.10:24
지금까지는 JEPA가 프롬프트 최적화에만 사용되었던 것으로 보입니다.10:30
하지만 JEPA는 프롬프트 그 이상으로 훨씬 더 나아갑니다. 그리고 프롬프트가 AI 시스템의 행동을 결정하는 단순한 텍스트 결과물이기 때문에,10:35
같은 알고리즘은 여러분이 할 수 있는 모든 것을 개선할 수 있습니다...10:41
텍스트 형태로 표현하고 점수를 매길 수 있습니다.10:44
예를 들어, 여러분의 전체 에이전트 하니스는 결국 파이썬이나 자바스크립트 파일로 구성되며, 여기에 적용할 수 있습니다.10:47
동일한 종류의 재귀적 최적화 과정을 전체 파일에 적용할 수 있으며, 이를 활용할 수 있습니다.10:54
따라서, 텍스트로 작성하고 점수를 매길 수 있다면 JEPA는 그것을 최적화할 수 있습니다.10:59
그러한 통찰력을 염두에 두고, 저희는 무엇이든 최적화할 수 있는 범용 API인 OptimizeAnything을 제안합니다.11:04
이는 어떤 텍스트 매개변이라도 최적화할 수 있는 보편적인 API입니다.11:07
어떤 분야든 상관없이, 예를 들어 CUDA 커널 코드 최적화와 같이 특정 코드를 최적화하고 싶다고 가정해 보겠습니다. 주어진 입력은 바로 그 CUDA 커널 코드이며, 평가기가 이 코드 조각을 검토합니다.11:12
입력은 단순히 해당 CUDA 커널 코드이고, 평가기가 이 코드 부분을 살펴봅니다.11:17
아마 컴파일을 하고, 프로파일링을 해서, 우리가 액션 가능한 사이드 정보라고 부르는 다양한 관련 정보를 생성합니다.11:23
그 정보는 LLM에게 제공되어 더 나은 후보를 제안하며, Sparito 풀을 유지합니다.11:30
그리고 이 과정을 수렴할 때까지 반복합니다.11:35
같은 방식으로 숫자 최적화에도 적용할 수 있는데, 숫자를 실제로 텍스트로 표현할 수도 있습니다.11:40
혹은 경도 최적화처럼, 전체 경도를 텍스트로 직렬화하거나, 심지어 클라우드 스케줄링 정책 최적화에도 적용할 수 있습니다.11:45
스케줄링 정책이나 휴리스틱 알고리즘을 텍스트 조각으로 표현할 수도 있습니다.11:52
평가 함수는 비용의 음수 값이나 정확도, 효율성을 측정하는 함수와 같은 것이 될 수 있습니다.11:57
실제 사이트 정보는 작업 추적 기록이나 SLA 위반 사항 등과 같은 것일 수도 있습니다.12:03
API 사용법은 정말 간단합니다요. 필요한 것은 해결하고 싶으신 문제들의 집합과 점수를 반환하는 평가 함수 또는 적합도 함수를 제공해 주시는 것뿐입니다.12:09
어떤 문제를 해결해야 하는지 알려주시고, 점수를 반환하는 평가 함수나 적합도 함수와 함께 제공해주시면 됩니다.12:14
관련된 도메인별 특화 사이트 정보가 있다면 함께 제공해 주세요.12:20
도메인이 전문가 피드백을 생성한다면, 그것을 반환해주세요. 만약 도메인이 컴파일러 오류 메시지를 생성한다면,12:24
프로파일러 메시지나 도구 호출 오류 메시지도 있다면 함께 반환해 주세요.12:30
혹시 작성된 문서가 있다면 그것도 반환해 주시면 됩니다.12:33
어떤 종류의 것이든 매우 개방적인 사전입니다. 문자 그대로 무엇이든 반환하실 수 있습니다.12:37
그리고 여러분이 하시는 일은 이 피트니스 함수와 문제 세트를 가지고 'Optimize Anything'를 호출하는 것뿐입니다.12:41
가지고 계신 자료가 있다면, Optimize Anything가 그걸 처리하고 최적화된 솔루션을 제공할 거예요.12:46
어플리케이션 예시를 한번 볼까요? 예를 들어서 3D 유니콘을 생성하는 임무를 받았다면요.12:52
이것이 작성해야 할 모든 코드입니다. 또는 이제 저희의 Optimize Anything 덕분에 에이전트가 코드를 작성할 수 있게 되었습니다.12:58
Optimize Anything은 CloudCode와 같은 선두 에이전트를 위한 사용하기 쉬운 API라는 것을 확인했습니다.13:04
따라서 여러분이 해야 할 일은 이 코드를 작성하는 것뿐입니다. 파이썬 프로그램을 최적화하여 3D 유니콘을 생성하도록 하는 코드이죠.13:08
그리고 후보는 PNG 렌더링 결과를 만들어내는 파이썬 스크립트가 됩니다, 어떤 것이든요.13:14
그리고 이것이 결과입니다. 왼쪽에는 클라우드 오퍼스 4.6을 볼 수 있습니다.13:18
이러한 작업을 주어졌을 때, 이와 같은 결과를 생성했습니다.13:23
오른쪽에는 Optimize Anything로 얻을 수 있는 유니콘이 있습니다.13:26
재미있네요, 하지만 특정 작업을 해결하기 위한 에이전트를 작성하라는 요청을 받았다고 가정해 봅시다.13:31
보통 팀에서는 에이전트를 조정하고, 도구를 만들고, 도구 설명을 작성하는 등 많은 시간을 보냅니다. 흐름을 신중하게 제어하기도 하죠.13:39
하지만 저희는 간단한 네 줄짜리 파이썬 프로그램으로 시작했습니다.13:46
그것은 단순히 모델의 체인 오브 소트를 호출해서 RKGI 문제를 해결하는 것이었습니다.13:52
단 16라운드의 성찰 과정만 거쳐서, OptimizeAnything 내의 Jepa는 다음을 찾아낼 수 있었습니다.13:57
이 정교한 여섯 단계 에이전트가 RKGI에서 RKGI 정확도를 향상시켰습니다.14:04
이 에이전트는 제미니 플래시의 RKGI 정확도를 32.5%에서 89.5%로 끌어올렸습니다.14:10
그리고 이 에이전트가 스스로 규칙 가설 유도와 코드 생성을 하고, 코드를 실행하고 추적하며, 자동으로 코드를 디버깅하는 것을 확인할 수 있습니다.14:16
코드를 실행하고 추적하며, 자동으로 이 코드를 디버깅합니다.14:21
이전 코드를 다시 검토하고 새로운 버전을 제안하며, 최종적으로 실제 테스트 입력에 실행하여 결과를 반환합니다.14:26
실행 가능한 예시입니다. 이 QR 코드에서 접속하셔서 바로 이 예시를 실행해 보실 수 있습니다.14:33
따라서, 동일한 접근 방식을 적용하여14:40
MAT500에 에이전트 활용법을 발견하는 데 사용했습니다.14:44
단순히 두 단계 에이전트를 만들었을 뿐인데 GPT 4.1 나노의 정확도를 20% 향상시킬 수 있었습니다.14:48
다시 한번 강조하지만, 저희가 한 일은 단순히 에이전트 파일을 최적화하도록 요청하는 것뿐이었습니다.14:54
그리고 복잡한 에이전트 아키텍처를 자동으로 발견했으며, 저희는 목표와 작업을 지정하는 것 외에는 아무것도 하지 않았습니다.15:01
결국 우리 모두가 코딩 에이전트를 사용하고 있습니다.15:10
클라우드 코드나 코덱스 같은 것들, 아니면 여러분이 가장 좋아하는 에이전트처럼, 에이전트 스킬은 굉장히 중요한 부분으로 자리 잡았습니다.15:14
거의 모든 코딩 에이전트가 스킬을 이해하는 생태계에서 매우 주도적인 역할을 하고 있습니다.15:21
특정 저장소에 맞게 스킬을 최적화하고 싶다고 가정해 보겠습니다.15:24
이 코드는 '스킬을 학습합니다'라고 말하는 코드입니다.15:29
경로입니다. 코딩 에이전트가 유사한 문제에 직면했을 때, 그 기술이 도움이 되어야 합니다.15:32
단순히 자연어 행동을 부여했고, 저희는 미니 수이 에이전트로 시작했습니다.15:37
예산 제약이 많았기 때문에 GPT-5 미니 에이전트를 사용했는데, 성능을 24%에서 93%로 끌어올렸습니다. 거의 세 배의 성능 향상입니다.15:43
Go 저장소 문제 해결 능력에서 거의 세 배나 증가했습니다.15:49
하지만 더욱 중요한 점은, GPT-5 미니 에이전트에 아주 저렴하게 최적화된 기술들을 활용하여,15:55
그것을 최신 클로드 소네트에 적용할 수 있었습니다.16:01
이것은 대략적으로 수행되었고,요16:04
클라우드 소네트 4.5에 적용하여 정확도를 100% 문제 해결 수준으로 끌어올렸습니다. 더욱 중요한 점은 이것을 줄이는 것이었습니다.16:06
실행 시간이나 문제 해결 시간을 거의 50%까지 줄일 수 있었습니다.16:14
거의 절반으로 줄였고, 덕분에 토큰 사용량도 줄었습니다. 왜냐하면 스킬은 저장소에 대한 정보를 담고 있기 때문입니다.16:19
저장소는 어떻게 구성되어 있는지, 테스트 케이스를 어떻게 호출하는지, 특정 기능이 어디에 구현되었는지,16:26
어떤 빌드 시스템을 사용하는지 등등 다양한 정보들을 알 수 있습니다.16:32
이것은 G-Skill이라는 기능인데, JEPA 저장소에서 찾아보실 수 있으며 완전한 오픈 소스입니다.16:36
그래서 어떤 것을 최적화하든 하나의 인터페이스를 통해 세 가지 최적화 모드를 제공합니다.16:42
만약 최적화하려는 단일 행렬 곱셈 커널과 같이 문제가 하나뿐이라면, 그렇게 사용하실 수 있습니다.16:47
혹시 최적화하려는 행렬 곱셈 커널과 같은 관련 문제들이 n개 있다면, 점곱 커널과 함께 최적화할 때 사용할 수 있습니다.16:53
그리고 이 두 가지 모드 사이에 정보 교환이 있을 수도 있는데, 저희가 멀티태스크 검색 모드라고 부르는 것을 활용하실 수 있습니다.16:59
마지막으로, 특정 문제 세트에 대해 최적화를 하고 싶지만 배포 과정에서...17:04
새로운 문제들을 많이 만들어낼 수도 있습니다.17:12
예를 들어 수학 프롬프트 최적화의 경우, 몇 가지 예시로 학습을 진행하지만,17:14
배포하면 완전히 새로운 종류의 쿼리를 받을 수 있습니다. 그래서 일반화 모드에 신경 써야 합니다.17:21
거기서 프롬프트 최적화, 에이전트 아키텍처 최적화 등 다양한 작업을 할 수 있습니다.17:25
그래서, 옵티마이즈 애니띵은 클라우드 스케줄링을 포함하여 다양한 분야에 활용될 수 있습니다.17:29
정책 최적화에서 전문가 휴리스틱과 비교했을 때 비용을 거의 40% 절감할 수 있었습니다. 작성해 보세요.17:36
옵티나보다도 더 뛰어넘는 맞춤형 솔버를 만들 수 있으며, 블랙박스 수학 최적화에서도 가능합니다.17:44
에이전트 스킬 생성, 프롬프트 최적화 등 다양한 작업을 수행할 수 있습니다.17:49
사용하기 너무 쉬워서 출시된 지 불과 20시간 만에 스노클(Snorkel) 직원들이 이미17:53
내부 벤치마크를 개선하고 트위터로 공유하는 모습을 보였습니다.17:58
그리고 제파는 멀티모달 VLM 모델의 성능도 향상시킵니다.18:03
여기서는 선두 모델들의 OCR 오류율을 거의 35%까지 줄일 수 있었습니다.18:06
그리고 이것은 외부에서 검증된 보고서입니다.18:11
마찬가지로, Databricks는 실제로 배포된 에이전트의 성능에서 90배나 되는 비용 절감을 달성했습니다.18:14
그리고 여기서 그들은 GPT OSS 120B를 조정하여 Claude Opus보다 뛰어넘는 성능을 달성했으며, 동시에 90배 더 저렴했습니다. 더욱 중요하게는, Claude Opus 위에 보이는 성능 향상 차이는 실제18:23
실제로 나타나는 결과입니다.18:30
오픈 소스 모델에서 보이는 것보다 더 큰 차이입니다. 어떤 분들이 저에게 물어보셨어요, '모델이 좋아지면 프롬프트 최적화의 중요성이 줄어들까요?' 저는 정반대로 주장합니다. 모델이 좋아질수록, 그만큼 더 좋아집니다.18:36
더욱 효과적으로 작동할 거예요.18:43
명령어 따르기에서요. 그리고 여러분의 작업에 대해 더 정확한 지시사항을 주실수록,18:49
모델이 여러분의 작업을 해결하는 데 훨씬 더 뛰어날 것입니다.18:54
그리고 이것이 바로 여기에서 일어나는 현상입니다. 지시사항이 더 좋을수록 클로드 오퍼스가 훨씬 더 높은 점수를 받았습니다.18:59
일부 사람들은 주관적이고 평가하기 어려운 과제가 있을 경우에 대한 질문을 하곤 합니다.19:07
JPA는 실제로 프로덕션 환경에서 여러분의 작업에 맞는 평가 기준을 학습할 수 있습니다.19:12
학습 방법은 에이전트로부터 많은 양의 프로덕션 추적 데이터를 수집하고, 사람에게서 얻는 것입니다.19:16
약 50개의 실행 경로에 대해 자세한 피드백을 제공할 수 있도록 사람에게 요청합니다.19:22
이 답변은 길고, 이 답변은 짧으며, 이 답변은 좋고, 이 용어를 사용했습니다. 뭐든지 간에요.19:26
그리고 사람의 주석을 받으시면, JPA를 사용하여 LLM을 판사 프롬프트로 최적화할 수 있습니다.19:32
그리고 그 LLM을 다시 판사 프롬프트로 사용하여 에이전트를 최적화할 수도 있습니다.19:37
에이전트를 배포하면 데이터 순환 고리가 형성되어 계속해서 개선할 수 있습니다.19:42
이는 일부 선도적인 팀들이 이미 실제 운영 환경에서 활용하고 있는 성공적인 패러다임입니다.19:47
그러면 저희에게 자주 받는 질문은 실제로 이 반사적 최적화를 활용해서 모델을 학습시킬 수 있느냐는 것입니다.19:52
최근에 '빠르게 그리고 느리게 학습'이라는 제목의 논문을 발표했는데, 그 안에서 이를 제안했습니다.19:56
저희는 모델 가중치와 프롬프트 하니스를 동시에 최적화할 수 있는 '빠른 학습, 느린 학습'이라는 논문을 발표했는데, 매우 강력한20:02
지속적인 학습 알고리즘에서 원하는 속성을 보여줍니다.20:08
자세하게 설명드릴 시간이 많지 않지만, 논문들을 참고해 주시면 감사하겠습니다.20:12
JEPA가 출시된 이후로 실제 운영 환경에서 사용되고 있습니다.20:17
이러한 회사들뿐만 아니라, 이 논문들에 제시된 주요 방법론에 의해서도 사용되고 있습니다.20:23
그리고 여기에는 드롭박스와 쇼피파이의 CEO가 JEPA를 사용하는 방법에 대해 이야기하고 있습니다.20:27
그리고 OpenAI에서도 JEPA를 사용하여 스스로 학습하는 인공지능 시스템을 구축하는 방법에 대한 블로그 게시글을 올렸습니다.20:32
그래서 시작하기가 매우 간단합니다요.20:38
어떤 프레임워크나 모델에도 연결할 수 있으며, 절대적인 하드 의존성은 없습니다.20:40
그래서 어떤 환경에서도 배포할 수 있습니다.20:46
그러니 기술 분야에서 최적화를 하는 것을 두려워하지 마세요. 많은 문제들을 최적화 문제로 표현할 수 있습니다.20:49
따라서, 실행 가능한 사이트 정보를 가져오시고, 최대한 도메인 특화된 정보를 최적화 엔진에 제공해 주세요.20:55
그리고 미래의 최적화 전문가분들은 이와 함께 작업하실 수 있을 겁니다.21:02
자, 확인해 보시고, 정말 감사합니다.21:06
AI Summary
JEPA(정보 증류 및 파레토 최적화) 기술은 AI 시스템의 성능을 향상시키는 새로운 방법론으로, 프롬프트 공간 내에서 정보 증류를 통해 기존 방식보다 뛰어난 결과를 얻도록 합니다. 특히 OptimizeAnything API는 JEPA 기술을 확장하여 텍스트로 표현되고 점수를 매길 수 있는 모든 것을 최적화할 수 있도록 지원하며, 간단한 파이썬 코드를 활용하여 복잡한 작업을 해결하고 에이전트 개발 시간을 단축하는 등 다양한 분야에서 활용 가능합니다. RKGI 정확도 향상, GPT 모델 성능 개선, 비용 절감 효과와 더불어 OpenAI에서도 자체 학습 시스템 구축에 활용하며 광범위하게 적용되고 있습니다.
Key Highlights
- •JEPA는 AI 시스템의 성능을 향상시키는 새로운 방법론이며, 특히 수학 과제에서 GPT 4.1 미니의 성능을 GPT 4.1보다 뛰어넘게 만들었습니다.
- •OptimizeAnything API를 통해 텍스트로 표현되고 점수를 매길 수 있는 모든 것을 최적화할 수 있습니다.
- •간단한 파이썬 코드를 활용하여 복잡한 작업을 해결하고 에이전트 개발 시간을 단축할 수 있습니다.
- •RKGI 정확도를 제미니 플래시의 32.5%에서 89.5%로, GPT-5 미니 에이전트 성능을 24%에서 93%로 향상시켰습니다.
- •다양한 최적화 모드를 제공하며, 클라우드 스케줄링, 수학 프롬프트 최적화 등 광범위한 분야에 적용 가능합니다.


