읽기 설정
AI Summary
오토 리서치 프레임워크를 활용하면 에이전트가 스스로 목표 해결책을 찾아 모델 속도를 향상시킬 수 있습니다. GPU 커널과의 호환성이 뛰어나 정확성과 속도 검증에 용이하며, 연산 및 메모리 병목 현상을 프로파일링하여 개선해야 합니다. 자동 연구는 인간의 아이디어를 바탕으로 파라미터 최적화 및 검증을 수행하며, 하드웨어 인지, 새로운 기술 적용, 리워드 해킹 방지 등의 고려 사항과 베어 메탈 접근 권한을 통한 하드웨어 레벨 조정도 중요합니다. 다만, 실패율이 높으므로 꾸준한 시도가 필요합니다.
Key Highlights
- •Auto-research 프레임워크를 활용한 모델 속도 향상
- •GPU 커널 호환성 및 병목 현상 프로파일링의 중요성
- •인간 아이디어 기반 파라미터 최적화 및 검증
- •하드웨어 인지, 리워드 해킹 방지 등 고려 사항
- •베어 메탈 접근 권한을 통한 하드웨어 레벨 조정 가능
Related Videos
안녕하세요 여러분. 저는 테자스입니다. 오토 리서치를 통해 모델을 세 배 더 빠르게 만드는 방법에 대해 설명해 드릴게요.00:12
이전에는 기숙사 방에서 1080 CI를 이용해서 GPU 채굴을 하기도 했고, 테슬라에서 일하게 되기 전까지 다양한 경험을 했습니다.00:19
테슬라 AI를 위한 추론 최적화를 했었습니다.00:26
하지만 먼저, 오토 리서치란 무엇일까요?00:30
그래서, 오토 리서치는 안드레 카파시가 만든 프레임워크인데, 에이전트가 목표를 향해 나아갈 수 있도록 기본적인 틀을 설정하는 방식입니다.00:32
그 목표는 사용자가 정의하게 됩니다.00:39
기본적으로 사용자가 원하는 바를 큰 틀에서 정의하면, 에이전트는 스스로 시도하며 목표를 향해 나아갑니다.00:40
실제로 보면, 그냥 while 루프일 뿐입니다.00:49
에이전트는 해결책을 제안합니다. 저희가 올바른 것을 정의하고 벤치마크할 수 있는 환경이 필요합니다.00:51
그리고 나서, 그 해결책을 유지하거나 되돌리고, 목표가 달성될 때까지 이 과정을 반복합니다.00:58
그래서 이것은 GPU 커널과 매우 잘 맞습니다. GPU 커널이 뭔지 모르신다면, 기본적으로 비디오 GPU 내의 저수준 연산자라고 할 수 있습니다.01:03
CUDA 커널이라고 불리는 이 연산자는 GPU가 작동하는 데 사용됩니다.01:08
평행적으로 수백만 번 반복될 수 있습니다. 예를 들어, 행렬 곱셈이나 전문가 연산 같은 것들이 있죠.01:14
왜 GPU가 자동 연구에 그렇게 적합할까요? 그건 검증하기 매우 쉽기 때문입니다. 여러분은...01:20
정확성과 속도를 검증할 수 있다는 것이 기본적인 자동 연구 프레임워크에 필요한 전부입니다.01:25
실제로 몇 가지 주의사항이 있습니다. 자동 연구 프레임워크는 정말 좋습니다.01:30
블록 크기나 아주 작은 파라미터를 선택하는 데는 좋지만, 높은 수준의 아이디어에는 여전히 정말 못 합니다.01:35
예를 들어 GPU를 사용하고 싶고 파이프라인으로 만들고 싶다는 아이디어를 떠올릴 수 없습니다. 획기적인 아이디어를 생각해 내지는 못하죠.01:39
사람이 직접 해야 하지만, 아이디어가 정리되면 실제 구현은 매우 간단합니다.01:45
여전히 당신의 역할입니다.01:51
좋은 아이디어를 가지는 것이 제가 말씀드리는 내용입니다. 그리고 실제 비법은 좋은 아이디어가 있고, 자동 연구가 파라미터를 선택하고01:53
모든 것을 검증하여 실제로 작동하는지 확인하며, X배 더 빠르면서도 정확하다는 검증 가능한 목표를 향해 나아갑니다.02:00
그걸 고객님이 가장 좋아하는 모델의 수십억 개의 토큰과 함께 혼합하면, 수동 튜닝을 능가하는 커널이 만들어집니다.02:08
그렇다면, 사용자 정의 커널을 작성하거나 에이전트가 사용자 정의 커널을 작성할 때 실제로 중요하게 생각하는 것들은 무엇인가요?02:12
그래서 주요하게 고려할 점 세 가지는 연산 병목 현상, 메모리 병목 현상, 또는 너무 많은 커널이 실행되면서 발생하는 과도한 오버헤드가 있을 수 있습니다.02:19
그런데 그렇게 할 수 있습니다.02:24
이러한 것들을 프로파일링을 통해, 예를 들어 ensys 같은 프로파일러를 사용해서 확인할 수 있습니다.02:28
비디오 프로파일러인데, 그래서 이 페이지는 정말...02:32
daunting 하지만, 기본적으로 휴머니스트의 역할은 여기 최상단 부분을 살펴보고02:37
이 방법은 어리석어요. 우리는 32k 청크를 컨텍스트에 로드하고 있는데...02:40
사실 이 깊이 있는 검색 어텐션에는 필요합니다. 예를 들어서, 32k마다 하는 것이 좋고, 큰 틀에서 여러분이 해야 할 일은02:46
오토리서치에게 이렇게 말하는 겁니다. '이 탑 메소드는 쓸모없어, 파이프라인으로 바꿔야 해.' 그리고 모든 것.02:52
그렇지 않으면, 예를 들어 크기 조절이나 청크 크기, 컨텍스트 청크 같은 것들은 모두 autoresearch가 결정해야 합니다.02:56
그래서 제 문제는 제가 저렴한 GPU를 정말 좋아한다는 거예요.03:03
예를 들어 NVLink가 없는 GPU처럼, 그런 GPU들은 좀 더 저렴하게 구할 수 있습니다.03:06
하지만 문제는 바로 사용할 수 있는 커널이 없다는 점입니다. 따라서 autoresearch 프레임워크와 사용자 정의 하니스를 모두 직접 개발해야 합니다.03:10
그래서 이 장치를 정말 좋게 만들기 위해 하니스에 무엇이 들어가나요?03:17
에이전트가 인지해야 할 중요한 것 중 하나는 하드웨어입니다.03:20
B200의 경우를 예로 들자면, 워프, TMM, TMA 같은 기능들을 인지하고 있는지 확인해야 합니다. 만약 이러한 용어들이 익숙하지 않으시다면,03:24
이것들은 특정 하드웨어에서 사용 가능한 저수준 연산자들입니다. 그리고 이것은 세대마다 변경됩니다.03:31
예를 들어 H200은 TMM을 가지고 있지 않습니다. TMM은 B200에 새롭게 추가된 기능인데, 이 점을 맥락으로 고려해야 합니다.03:38
이것은 기본적으로 MD 파일들을 제공해주면 됩니다. 그러면 맥락을 갖추게 되죠.03:45
에이전트가 모델의 맥락을 갖도록 하는 또 다른 중요한 점이 있습니다.03:49
새로운 모델마다, 예를 들어 DeepSeq Flash처럼 새로운 기술들이 계속 추가됩니다. DeepSeq Flash에는 DeepSeq에서 새롭게 공개한 두 가지 새로운 어텐션 방식이 포함되어 있습니다.03:53
V4는 압축된 희소 어텐션과 계층적 압축을 의미하는데, 이 작업을 수행하지 않으면 모델이 100% 환각을 일으킬 겁니다.04:01
실제 어텐션 메커니즘을 잘못 이해하게 되고 쓸모없는 커널만 얻게 될 거예요.04:08
가장 큰 문제는 이 작업을 수행할 때 리워드 해킹이 될 가능성이 높다는 것입니다. 만약 커널 엔지니어에게 말씀드리자면,04:13
동료로서, 이 GPU 커널을 더 빠르게 만들어야 합니다.04:18
물론 인간 동료가 직접 개입해서 전체적인 모델 추론 속도를 느리게 만드는 일을 하지는 않을 겁니다.04:23
하지만 에이전트는 인간이 아니기 때문에 CUDA 그래프를 비활성화하는 것처럼 속도를 늦추는 여러 가지 행동을 할 수 있습니다. CUDA 그래프를 비활성화하면 최대 20배나 느려질 수도 있죠.04:29
그리고 그들은 특정 커널을 더 빠르게 만들 수는 있겠지만, 전체적으로는 실행 가능하지 않은 커널이 되도록 만들 수도 있습니다. 여러 가지 속도 향상 기능을 비활성화하기 때문입니다.04:36
예를 들어 CUDA 그래프를 비활성화하거나 작은 컨텍스트 윈도우에서만 테스트하는 것과 같은 방식으로요. 따라서 이 모든 것은 무엇을 하지 말아야 하는지를 정의하는 것도 포함합니다.04:42
이것은 실제로 에이전트가 원샷으로 쉽게 수행할 수 있는 개척 연구를 할 때 매우 중요합니다.04:47
또 다른 보상 해킹 방법은 일부 모델이 커널을 작성하려고 할 때 필요한 귀여운 DSL을 실제로 생성하지 못한다는 것입니다.04:57
그리고 이것은 Anthropic 모델에서 흔히 발생하는 문제입니다. 네, Anthropic에서는 그들이 말하는 대로 말씀하시는 것 같습니다.05:02
모델 성능을 의도적으로 낮추는 것에 대해 말씀하시는데, 저는 다른 모델을 사용해 보시는 것을 추천드립니다.05:08
그리고 항상 모든 곳에서 더 빠른 것은 아니기도 합니다. 실제로, 개발하시는 커널이 특정 환경, 예를 들어 0부터 10만 정도의 범위에서만 잘 작동할 수도 있습니다.05:15
그리고 때로는 플래시 인퍼런스나 커틀리스에서 제공하는 기본 커널로 다시 돌아가야 할 필요도 있습니다.05:22
그리고 또 주의해야 할 점은 커널이 항상 모든 작업량에 대해 바로 적용될 수 있는 것은 아니라는 것입니다.05:27
하지만 좋은 점은 커널들이 서로 효과를 더할 수 있다는 것입니다. 예를 들어, DeepSeq을 위한 희소 MLA 커널을 만드신다면...05:34
예를 들어, 거기서 속도 향상을 얻을 수 있고, 그걸 계속 쌓아 올린 다음 NVFP4를 MOE에 추가하면 됩니다.05:39
NVLink가 없더라도 저희의 경우 계속해서 쌓고 쌓으면 결국 하드웨어 제한에 도달하게 됩니다.05:46
당신의 GPU를 말씀하시는 건데, 어떤 분들은 이걸 MFU라고 부르기도 합니다. GPU에서 얻을 수 있는 이론적인 최대 활용도를 의미하는 거죠.05:54
더 나아가서, 만약 베어 메탈 접근 권한이 있다면, 여러분의 자동 연구 프레임워크가 매우 해킹적인 방식으로 작동할 수도 있습니다.06:02
GPU를 해킹해본 경험이 있는 분들은 아마 이걸 좋아하실 거예요.06:08
BIOS 설정을 조정하거나, GPU 오버클럭을 하거나, PCIe 제약을 완화하는 등 작은 트윅들을 할 수 있습니다.06:10
예전 학교 해커들이 하던 방식과 비슷하다고 할 수 있습니다. 하지만 추론에도 도움이 될 수 있습니다.06:17
따라서 베어 메탈 환경에서의 최적화를 통해 클라우드 제공업체를 이용한 가상화 설정보다 대략 25% 정도 성능 향상을 얻을 수 있습니다.06:22
그래서 그걸 확보하시면, 작업하신 모든 커널과 하드웨어 레벨의 해킹들을 모두 결합하실 수 있습니다.06:32
3배 정도 속도 향상을 얻으실 수도 있죠. 제가 말씀드리는 게 다 꽃향기처럼 들릴 수도 있지만, 실제로는 그렇지 않습니다.06:36
오토 리서치가 하는 일 중 약 80%는 잘못된 결과일 가능성이 높습니다. 따라서 기억해야 할 점은,06:42
이 작업을 진행하면서 대부분의 시도가 좋지 않은 결과를 가져올 수 있다는 것입니다.06:46
계속해서 여러분을 속이려고 할 거예요. 하지만 결국에는 이걸 통해 정말 좋은 결과를 얻을 수 있습니다.06:50
요약하자면, 자동 연구를 사용하는 것보다 더 나은 아이디어를 가지는 것이 훨씬 간단합니다.06:57
그러다 보니 실제로 이걸 하면서 돈을 받을 수도 있더라고요. 이게 멋지다고 생각하신다면 저희와 함께하실 수 있습니다. 이메일로 연락 주시면 됩니다.07:04
감사합니다.07:11
AI Summary
오토 리서치 프레임워크를 활용하면 에이전트가 스스로 목표 해결책을 찾아 모델 속도를 향상시킬 수 있습니다. GPU 커널과의 호환성이 뛰어나 정확성과 속도 검증에 용이하며, 연산 및 메모리 병목 현상을 프로파일링하여 개선해야 합니다. 자동 연구는 인간의 아이디어를 바탕으로 파라미터 최적화 및 검증을 수행하며, 하드웨어 인지, 새로운 기술 적용, 리워드 해킹 방지 등의 고려 사항과 베어 메탈 접근 권한을 통한 하드웨어 레벨 조정도 중요합니다. 다만, 실패율이 높으므로 꾸준한 시도가 필요합니다.
Key Highlights
- •Auto-research 프레임워크를 활용한 모델 속도 향상
- •GPU 커널 호환성 및 병목 현상 프로파일링의 중요성
- •인간 아이디어 기반 파라미터 최적화 및 검증
- •하드웨어 인지, 리워드 해킹 방지 등 고려 사항
- •베어 메탈 접근 권한을 통한 하드웨어 레벨 조정 가능


