Home

읽기 설정

현재 최소 연간 5억 달러의 매출을 올리는 AI 스타트업 목록입니다. 큰 세 곳은 제외하고요.00:00

잘 살펴보면 상위 10개 중 5개가 모두 AI 모델 실행을 위한 일종의 추론 플랫폼이에요.00:06

어떻게 이렇게 많은 돈을 벌고 있는지 궁금해하실 수도 있을 거예요.00:12

Cursor와 같은 일부 AI 스타트업은 LLM 사용과 관련된 추가 가치를 창출하기 때문에 말이 돼요.00:16

하지만 이 회사들은 그냥 모델을 사람들에게 제공하는 데 집중하고 있어요.00:21

게다가 그들이 실행하는 모델은 대부분 오픈 웨이트예요.00:25

모델을 실제로 개발하는 연구소들이 시장에서 더 큰 우위를 가져야 하는 것 아닐까요?00:28

Moonshot AI와 같은 중국 AI 스타트업이 목록에 오르지 못했다는 걸 믿을 수 있나요?00:33

세계에서 세 번째로 좋은 모델을 만들 수 있음에도 불구하고요?00:37

ZAI는 최근에 연간 반복 수익(ARR) 10억 달러를 돌파했지만, 그래도 이것은00:41

이런 추론 회사들이 여전히 최첨단 AI 연구소를 이기고 있다는 사실이에요.00:46

오늘 영상에서는 이러한 회사들이 어떻게 운영되는지 자세히 알아볼게요.00:50

추론 서비스란 무엇이고, 이 회사들의 미래는 어떻게 될까요?00:53

자세히 알아보기 전에, AI 어시스턴트에게서 어떤 점이 부족하다고 생각하는지 아세요?00:58

실제 개인 비서와 비교했을 때요? 바로 전화 통화 기능을 할 수 있는 거죠.01:02

이메일이나 슬랙을 처리하는 건 좋지만, 전화를 사용할 수 있어야 AI 에이전트가 현실 세계와 연결되죠.01:06

에이전트를 현실 세계와 연결하는 거죠. 바로 오늘 영상의 스폰서인 텔녹스가 등장합니다.01:11

일반적으로 전화 에이전트 기능을 사용하려면 다섯 곳에서 소싱해야 해요.01:15

모델을 위한 곳, 음성 텍스트 변환을 위한 곳, 텍스트 음성 변환을 위한 곳, 번호를 위한 통신사, 그리고 이 모든 것을 연결해 줄 무언가가 필요하죠.01:19

텔녹스는 바로 그것들을 모두 제공합니다. 하나의 플랫폼, 하나의 빌드고요.01:25

추론 측면에서 볼 때, TelenX는 GPU를 소유하고 있어서 GLM 5.3 Flash와 같은 최신 모델들은01:29

DeepCV4 Flash는 클라우드 마크업이 없어요. 그래서 여러분의 일상적인 에이전트 호출을 이걸로 할 수 있고01:34

프론티어 모델 대신 사용하면 빌드는 보통 최대 75%까지 줄일 수 있어요.01:39

호환성도 좋아서, 이전으로 옮겨가는 건 베이스 URL과 모델 이름만 바꾸면 돼요.01:43

그리고 모든 것이 자체 네트워크에서 실행되기 때문에 사용자 발화와 에이전트 응답 사이의 홉 수가 적어요.01:48

그러니까 실제로 어시스턴트처럼 느껴지는 AI 에이전트를 만들고 싶다면01:54

설명란에 있는 링크를 통해 TelenX를 확인하고 bycloud25 코드를 사용해서01:57

빌드 크레딧 25달러를 받고, TelenX에게 이 영상 스폰서십에 감사드립니다.02:02

어쨌든 오픈 웨이트 모델을 실행하는 서비스를 제공하는 회사는 정말 많지만02:06

크게 네 가지 범주로 나눌 수 있어요. 하이퍼스케일러, 네오클라우드, 풀스택02:11

인퍼런스 플랫폼과 맞춤형 실리콘 인퍼런스 플랫폼이 있습니다.02:16

첫 번째 카테고리는 아마존, 마이크로소프트, 구글, 오라클 등과 같은 하이퍼스케일러입니다.02:19

그들은 이미 방대한 클라우드 인프라를 소유하고 기존 엔터프라이즈 고객을 가지고 있습니다.02:25

고객들이죠. 그래서 컴퓨팅, 스토리지 등 기업이 소프트웨어를 실행하는 데 필요한 모든 것을 판매하는 데 익숙합니다.02:29

즉, AI 분야가 폭발할 때 단순히 GPU를 추가하면 됩니다.02:34

이미 가지고 있는 클라우드 사업에 모델 서빙 API를 얹기만 하면 됩니다.02:39

그래서 오늘 그들에 대해 자세히 설명하지 않겠습니다. LLM을 서비스하는 것이 주된 사업이 아니기도 하니까요.02:43

두 번째 카테고리는 니비우스, 코어위브, 크루소와 같은 네오클라우드입니다.02:47

저는 이미 그들의 비즈니스 모델을 자세히 설명하는 영상을 가지고 있습니다. 간단히 말해서, 그들은 훈련을 위해 GPU 클러스터를 제공하는 데 더 집중합니다.02:51

인퍼런스에서 그들의 강점은 보통 저렴하게 많은 양의 GPU를 임대해 연구실이 사용하도록 하는 것입니다.02:57

쉽게 사용할 수 있도록 해줘요. 하지만 그들도 LLM을 제공하지만, 그것이 주요 사업 모델은 아니에요.03:03

하지만 후반 두 카테고리에서는 추론 서비스를 제공하는 것이03:09

주요 사업 모델이에요. 세 번째 카테고리는 풀스택 추론 플랫폼으로 회사들을 포함해요.03:13

Fireworks, Together AI, Base 10, Deep Infra, Novita와 같은 네 번째 카테고리를 포함하고요,03:18

맞춤형 실리콘 추론 플랫폼에는 Grock, Cerebra, Semba Nova와 같은 회사들이 있어요,03:23

그리고 Etched가 있습니다. 하지만 이 회사들의 사업은 처음에는 이상하게 들려요.03:28

자체 모델을 만들지 않기 때문에, 누구나 다운로드할 수 있는 모델을 제공하는 경우가 많아요.03:32

그럼에도 불구하고 그렇게 함으로써 막대한 수익을 창출할 수 있어요.03:37

그래서 시장 수요가 그만큼 크기 때문에 쉽게 돈을 많이 벌 수 있다는 생각은03:41

그들의 성공을 정당화하는 걸까요? 사실 그것보다 더 복잡해요.03:46

무엇을 하고 있는지 이해하려면 먼저 인퍼런스 어스 어 서비스가 무엇인지 알아야 해요.03:51

간단히 말해서, 인퍼런스는 모델이 이미 학습된 후에 일어나는 과정이에요.03:55

모델을 사용하는 과정인데, 챗지피티에 프롬프트를 보낼 때마다 모델이 인퍼런스를 수행해요. 그러면04:01

입력을 받아 뉴럴 네트워크를 거쳐 출력 토큰을 생성하는 거죠. 인퍼런스 어스 어 서비스는04:06

이 모든 과정을 회사에서 대신 처리해 주는 것을 말해요. 그래서 직접 할 필요 없이04:11

그쪽의 API를 호출하면 돼요. 그리고 LLM 인퍼런스는 모델이 크기 때문에 특히 어려워요.04:16

많은 고가의 GPU를 조정해야 하는데, 게다가 최적화하기도 어렵고요.04:21

속도를 내기도, 그리고 설정하기도 매우 어려워요. 따라서 인퍼런스를 제공하는 회사들은04:26

모델을 실행하는 데 드는 비용과 사용자에게 서비스를 제공함으로써 더해진 가치의 차이에서 돈을 벌어요.04:30

때로는 그 마진이 매우 얇아질 수 있어요. 공식 API와 경쟁해야 하기도 하고04:37

예를 들어, DeepSeek V4의 공식 API 가격은04:42

DeepSeek의 엄청난 추론 최적화 덕분에 이길 수 없을 정도로 높지만, 또한04:45

동일한 모델을 제공하는 다른 10개 사업체와 경쟁해야 해요.04:50

그렇다면 마진은 정말 얼마나 타이트할까요? DeepSeek V4 Pro를 서비스하는 예를 들어보죠.04:54

릴리즈된 DeepSeek V4 Pro 체크포인트는 대략04:59

무게가 FP4와 FP8의 혼합으로 저장되기 때문에 865기가바이트 정도예요.05:01

기술적으로 볼 때, 약 다섯 개의 B200이 모델 가중치를 저장할 수 있을 만큼 충분한 메모리를 가지고 있을 거예요.05:07

하지만 실제로 보면 KV 캐시, 런타임 버퍼, 배싱, 그리고 다른 오버헤드를 위한 추가 메모리가 필요할 거예요.05:11

또한 정확히 다섯 개의 GPU에 배포하는 경우는 흔치 않으므로, 가장 기본적인 실용적인05:17

구성은 단일 DGX B200과 같은 8개의 B200을 갖춘 서버 하나가 될 거예요.05:22

그리고 만약 각 B200이05:27

시간당 약 6달러에 임대된다고 가정하면, 8개의 B200은 시간당 대략 48달러가 들 거예요.05:29

CPU 저장 공간 네트워킹이나 회사가 부담해야 하는 다른 인건비도 고려하지 않은 금액이기도 하고, 그래서 4805:36

달러는 시간당 필요한 최소한의 비용일 뿐이고, 이제 우리는05:42

대략적인 비용을 알았으니, 수익을 내기 위해 얼마나 많은 수요가 필요할지 살펴보죠.05:46

Fireworks나 Together AI와 같은 일부 써드파티 추론 플랫폼에서는 DeepSeek V4 Pro가05:50

입력 토큰당 약 1.74달러, 출력 토큰당 3.48달러로 나열되어 있어요.05:54

그리고 고객이 하나의 출력 토큰을 받기 위해 약 두 개의 입력 토큰을 보낸다고 가정해 봅시다.06:00

그 비율은 사용 사례에 따라 크게 달라질 수 있으므로 항상 그런 것은 아닐 수도 있지만06:06

챗봇, 에이전트, 코딩 및 문서 작업 전반에 걸쳐 합리적인 추정치라고 가정해 봅시다.06:10

수익은 대략적으로 출력 토큰 1백만 개당 6.96달러 정도가 될 거예요06:15

기본적인 오픈 소스 VLM 배포는 AB200에서 시간당 약 900개의 출력 토큰을 생성할 수 있어요06:20

초당 출력 토큰을 생성하는데, 배치 작업에서는 여러 개의06:27

사용자 요청을 받아 일괄 처리하는 것을 말하며, 시간당 약 324만 개의 출력06:31

토큰에 6.96을 곱하면 시간당 약 22.55달러의 수익만 발생할 거예요06:37

시간당 48달러의 GPU 비용조차 충당하지 못해요.06:43

즉, 손익분기점을 넘기려면 배치 작업에서 초당 최소 2,000개의 토큰을 생성할 수 있는 서버를 구축해야 해요.06:47

게다가 수요가 일정하다고 가정하고 있으며, 다른 메모리 오버헤드나 인건비는 포함하지 않아요.06:54

따라서 수요가 수익을 창출하며, 일정한 수익을 창출하려면 수요를 유지해야 해요.07:00

하지만 이것이 돈을 버는 유일한 방법은 아니에요. 이전 계산에서 볼 수 있듯이 개선할 수 있는 측면이 많아요.07:05

더 많은 수익을 창출하는 방법은 물론, 추론 속도를 최적화하는 것이 가장 기본적인 부분이에요.07:11

큰 마진을 늘릴 수 있는 곳이죠. 2025년 2월에 있었던 DeepSeek의 오픈 소스 주간에서 그들은 어떻게07:17

초당 73,700개의 입력 토큰과 초당 14,800개의 출력 토큰을 달성할 수 있었다고 공유했어요.07:22

DeepSeek V3와 R1이 실행되는 H800 노드에서 545%의 마진을 제공했어요. 심지어07:29

입력당 0.55달러, 출력당 2.19달러의 저렴한 가격으로 제공하는 경우에도요.07:36

그리고 지금 DeepSea V4는 DeepSea Guard 1보다 약 2.6배 더 크기 때문에 비용이 최소한07:41

GPU 간 통신 및 저장을 위해 훨씬 더 많은 메모리가 필요하기 때문이에요.07:48

재미있는 점은 현재 API 비용이 실제로 저렴해져서 입력당 0.435달러, 출력당 0.87달러가 되었다는 거예요.07:52

누군가는 그들이 얼마나 잘07:59

최적화했는지에 따라 상당한 이익 마진을 제공할 수도 있을 거예요. Fireworks나 Together AI 같은 다른 업체들과 비교했을 때요.08:03

though fireworks and together ai might not be winning customers specifically for serving deep08:08

딥시크처럼 최적화하지 못해서 더 높은 가격을 부과해야 하는 시크 V4 때문이에요.08:12

GLM 5.2나 키미 K3처럼 그들이 서비스할 수 있는 다른 모델들도 많고, 만약08:17

최적화해서 공식 API와 비슷하거나 더 저렴한 가격을 제공한다면,08:22

더 일관적이거나 지연 시간이 낮으면 공식 API는 보통 트래픽이 많기 때문에,08:27

특히 현재 제한된 컴퓨팅 자원으로 키미가 사용자들을 모두 서비스하는 데 어려움을 겪고 있는 상황을 고려하면 수요를 더욱 늘릴 수 있을 거예요.08:32

하지만 제가 최적화라고 말할 때, 정확히 무엇이 최적화되는 걸까요?08:38

이것에 대해 이해하는 가장 쉬운 방법은 LLM 추론이 사실 두 가지 매우 다른 단계로 나뉜다는 것입니다. 사전 채우기와 디코딩이죠.08:42

프리필은 모델이 전체 입력을 읽고 처리하는 단계예요.08:49

입력 프롬프트를 읽고 처리하는 단계예요. 그래서 만약 1만 개의 입력 토큰을 보낸다면 모델은 많은 토큰을08:51

대규모 행렬 곱셈을 통해 병렬적으로 처리할 수 있어요. 매우 많은 연산 자원이 필요하지만08:57

이런 병렬 작업에는 GPU가 아주 좋아요. 디코드는 모델이 기본적으로09:02

응답을 한 토큰씩 생성할 때인데, 프리필과는 달리 출력 토큰은 모두09:07

병렬적으로 생성될 수 없어요. 왜냐하면 새로운 토큰마다 이전 토큰에 의존하기 때문이에요. 그래서 모델은09:12

반복해서 가중치를 불러오고, 기존 KV 캐시를 읽고, 한 개의 토큰을 생성한 다음09:17

전체 과정을 다시 반복해야 해요. 그래서 출력 토큰은 보통 입력 토큰보다 훨씬 비싸요.09:23

그리고 그 속도는 GPU가 가중치와 캐시 데이터를 얼마나 빠르게 이동시키느냐에 따라 종종 제한돼요.09:28

메모리를 통해 움직이는 것인데, 이제 첫 번째 주요 최적화인 캐싱에 대해 이야기해 볼게요. 모델이09:33

입력을 처리할 때마다 해당 토큰의 중간 어텐션 상태를 담은 KV 캐시를 생성해요. 서버가09:37

그 프롬프트 접두사를 이전에 처리한 적이 없다면, 이걸09:42

캐시 미스라고 하는데, 모델이 전체 접두사를 모든 레이어를 거쳐 실행하고 KV09:47

캐시를 처음부터 생성한 다음 디코딩 단계에서 저장해야 합니다. 하지만 다른 요청이 시작되면09:53

같은 접두사로 시작한다면 서버는 이미 생성한 KV 캐시를 재사용할 수 있는데, 이것을09:57

캐시 히트라고 합니다. 따라서 수십만 개의 토큰을 다시 처리하는 대신 서버는10:03

기존 캐시를 검색하고 프롬프트의 새로운 부분만 처리할 수 있습니다. 예를 들어 코딩10:08

에이전트는 시스템 프롬프트, 도구 정의, 저장소 컨텍스트와 같은 동일한 내용을 반복해서 보냅니다.10:13

캐싱하지 않으면 에이전트가 다음 단계를 수행할 때마다 모든 것을 다시 계산해야 합니다.10:18

하지만 캐시 히트를 사용하면 대부분의 이전 작업은10:25

건너뛸 수 있습니다. 그래서 Deepsea는 현재 V4 Pro에 대해 백만 개의 캐시 히트당 0.3625센트를 청구합니다.10:27

입력 토큰당 43.5센트에 비해 캐시 미스 토큰은 43.5센트입니다.10:34

And that is around 120 times cheaper. But of course, cash hits are not completely free.10:39

시스템은 여전히 캐시를 찾아야 하고, SSD나 메모리에서 읽어들여서, 올바른 기계로 전송하고, 캐시된 접두사 뒤에 추가된 새로운10:45

토큰을 처리해야 하지만, 그래도 모델 전체를 다시 실행하는 것보다 훨씬 저렴해요.10:52

그리고 이것 또한 DeepSeek의10:58

초당 7만 3천 7백 개의 입력 토큰을 처리한다는 이전 주장의 중요한 주의사항이기도 해요. 왜냐하면 입력11:01

토큰 중 약 56.3%가 캐시 히트였고, DeepSeek는 명시적으로 그11:08

캐시 히트가 처리량 수치에 포함되었어요. 그래서 초당 7만 3천7백 토큰은 완전히 새로운 프롬프트를 다시 계산하는 원시 속도가 아니었어요.11:13

완전히 새로운 프롬프트를 다시 계산하는 속도가 아니었어요. 그것은 실제 운영 환경에서의 작업량을 나타내는 것이었죠.11:19

입력의 절반 이상이 데스크탑 KV 캐시에서 재사용되고 있었던 환경이었어요.11:23

다음 주요 최적화는 배치 처리입니다. 만약 한 명만 모델을 사용한다면,11:28

모델을 하나만 사용한다면, 거대한 GPU 클러스터조차도 많은 시간을 활용하지 못할 수 있어요.11:32

특히 디코딩 과정에서 각 요청은 단계마다 하나의 토큰만 생성하면 돼요.11:37

하지만 수백 명의 사용자를 하나로 묶으면 GPU가 다음을11:41

모든 사용자에게 동시에 토큰을 생성할 수 있어요. 그래서 모델 가중치를 로드해서 시퀀스를 처리하는 대신,11:47

같은 가중치 로드를 여러 시퀀스에 사용할 수 있게 돼요.11:51

배치가 클수록 GPU는 더욱 효율적으로 작동할 거예요.11:55

그리고 최신 추론 엔진은 연속 배치라고 불리는 것을 사용해요. 고정된 요청 그룹이 완료될 때까지 기다리는 대신,11:58

서버는 완료된 요청을 계속 제거하고 새 요청을 배치에 삽입해요.12:06

이렇게 하면 모든 사용자의 프롬프트 길이가 다르고 생성하는 토큰 수도 다르더라도 GPU를 가동할 수 있어요.12:11

생성하는 토큰 수가 달라서 수요가 단순히 더 많은 수익을 창출하지 않아요.12:15

수요가 늘어날수록 제공자는 더 큰 배치로 만들 수 있고, 이는 토큰 하나당 서비스 비용을 낮출 수 있어요.12:19

그래서 수백만 건의 요청을 처리하는 회사는 종종 더 효율적이고12:25

소규모 사용자에게 동일한 모델을 실행하는 사람보다 훨씬 더 수익성이 높을 수 있어요.12:30

더 큰 배치를 만들기 위해 기다리는 시간을 늘리면 총 처리량을 늘릴 수 있지만,12:33

사용자는 요청 처리가 시작되기까지 더 오래 기다려야 할 수도 있어요.12:40

배치 크기가 클수록 KVCache 메모리도 더 많이 사용하기 때문에, 추론 제공업체들은12:44

처리량, 첫 번째 토큰까지의 시간, 출력 속도, 메모리 사용량, 그리고 대기열 지연을 계속해서 조정하고 있어요.12:49

하지만 또 다른 문제가 있어요. 프리필과 디코드는 동작 방식이 너무 달라서,12:55

같은 GPU에서 실행하는 것이 항상 이상적이지 않습니다. 프리필은 엄청난 양의 원시 연산을 필요로 하지만, 디코드는13:00

메모리 대역폭과 kvcache 용량, 그리고 더 많은 활성 사용자 수를 갖는 것을 훨씬 중요하게 생각해요.13:05

그래서 대규모 제공업체는 프리필 디코드를 분산 처리하는 방식을 자주 사용해요.13:10

모든 서버가 두 단계를 모두 처리하는 대신, GPU 그룹 하나는 입력 프롬프트를 처리하는 데 특화되고13:15

프롬프트를 처리하는 GPU 그룹과 출력 토큰을 생성하는 다른 GPU 그룹이 있어요.13:20

프리필 워커들이 프롬프트를 처리한 후, 완성된 KVCache를 디코더 워커들에게 고속 네트워크를 통해 전달해요.13:24

고속 네트워크를 통해 전달돼요. 이를 통해 회사에서는 두 단계를 독립적으로 확장할 수 있고,13:30

하나의 큰 사전 채우기 요청이 수백 명의 다른 사용자의 지연 시간에 민감한 디코딩을 방해하는 것을 막아주죠.13:34

키미 문쇼는 최근 프리필을 서비스로 제공하는 유사한 아이디어를 제안했어요.13:40

어 서비스로, 로컬 컨텍스트 프리필링을 별도의 데이터 센터에 선택적으로 오프로드하는 방식이에요,13:44

그 결과로 나온 KVCache를 디코딩 클러스터로 다시 보내요.13:49

이렇게 하면 첫 번째 토큰까지의 시간을 줄이고, 로컬 클러스터가 더 많은 하드웨어를 디코딩에 집중할 수 있어요.13:52

하지만 결국에는 사용자 정의 커널이 이러한 모델을 실행할 때 가져다주는 최적화를 따라올 수 없을 거예요.13:58

그런데 커널이란 무엇일까요? 여기서는 커널은 기본적으로 GPU에서 직접 실행되는 작은 프로그램이에요.14:04

참고로 이 용어는 운영체제 커널과는 전혀 관련이 없어요.14:11

GPU 커널은 단순히 수천 개의 GPU 스레드에게 정확히 어떤 연산을14:14

수행하고 데이터를 어떻게 이동할지 알려주는 함수예요. 그래서 PyTorch에서 간단한 코드를 작성할 때,14:20

두 개의 행렬을 곱하거나 활성화 함수를 적용하거나 은닉 상태를 정규화하는 것처럼14:24

PyTorch는 그 작업을 스스로 수행하지 않아요.14:29

대신 하나 이상의 GPU 커널을 실행해서14:32

실제로 작업을 수행해요. 그래서 순방향 패스마다 LM은 수천 개의14:34

행렬 곱셈, 어텐션, 정규화, 양자화와 같은 작업에 사용되는 커널을 실행할 수 있어요.14:39

전문가 라우팅 및 GPU 간 통신이 이루어집니다. 문제는 일반적인 프레임워크는 보통14:44

다양한 모델, 텐서 모양, 그리고 GPU에서 작동하도록 설계된 커널을 사용합니다.14:49

유연하지만, 특정 모델에 대해 항상 완벽하게 최적화되지는 않습니다.14:53

맞춤형 커널은 정확한 연산, 텐서 모양, 정밀도 형식에 맞춰 특별히 작성된 커널입니다.14:59

모델 아키텍처와 사용되는 하드웨어에 맞춰 쓰여요. 그리고 GPU에게 범용 구현을 실행하도록 요청하는 대신15:05

일반적인 구현을 실행하도록 요청하는 대신, 제공업체는 훨씬 더 특화된 프로그램을 작성해서15:10

같은 수학 연산을 더 효율적으로 수행하도록 만들어줘요.15:14

그리고 이 최적화의 많은 부분은 계산량을 줄이는 것이 아니라 얼마나 자주15:18

data has to move. Modern GPUs can perform an absurd number of calculations every second,15:24

하지만 HPM, 캐시, 공유 메모리, 그리고 GPU 코어 간에 데이터를 반복적으로 이동하는 것이 쉽게15:29

예를 들어 모델의 일부가 정규화에 적용되고,15:35

결과를 HPM에 다시 쓰고, 양자화를 위해 또 다른 커널을 실행하고, 결과를 다시 씁니다15:39

다시 쓰고, 행렬 곱셈을 위한 세 번째 커널을 실행합니다.15:45

각 작업은 빠를 수 있습니다15:48

개별적으로는 그렇지만, GPU는 세 개의 별도 커널을 실행하는 오버헤드를 지불하면서 계속해서 동일한 데이터를 읽고 씁니다.15:50

맞춤형 퓨즈드 커널은 세 작업을 하나로 결합할 수 있습니다15:57

데이터를 메모리에 다시 읽고 쓰는 시간을 완전히 절약합니다.16:01

모델이 거의 동일한 양의 수학 연산을 수행하지만, 중간 결과를 이동하는 데 훨씬 덜 걸립니다16:05

중간 결과들을 이동합니다. 이것을 커널 퓨전이라고 하며, 맞춤형 커널이 추론 속도를 향상시키는 가장 일반적인 방법 중 하나입니다.16:10

또 다른 주요 최적화는 타일링입니다. 큰 행렬은16:17

일반적으로 GPU의 가장 빠른 메모리에 한 번에 모두 담을 수 없기 때문에, 커널은 더 작은 블록인 타일로 나눕니다.16:20

잘 설계된 커널은 GPU의16:26

메모리 계층 구조와 텐서 코어에 맞춰 타일 크기를 선택하여 각 데이터 조각이16:30

버려지기 전에 여러 번 재사용될 수 있도록 합니다. 하지만 최적의 타일 크기는 정확한 GPU, 행렬 차원,16:35

배치 크기 및 정밀도에 따라 다릅니다. H100에서 잘 작동하는 구성이16:40

B200에서 훨씬 더 나빠질 수 있고, 큰 사전 채워진 배치에 최적화된 커널은16:46

단일 토큰 디코딩 중에 비효율적일 수 있습니다. 이것이 바로 사용자 정의 커널이 모델별 및 하드웨어별로 그렇게 특화될 수 있는 이유입니다.16:51

하지만 커널 엔지니어는 스레드가 할당되는 방식을 완전히 제어할 수 있습니다,16:56

메모리 액세스가 배열되는 방식과 인접한 스레드가 메모리의 인접한 위치를 읽는지 여부를16:59

제어할 수 있습니다. 좋은 예는 LM의 어텐션 메커니즘입니다. 단순한 어텐션 구현은17:04

어텐션 점수를 따로 계산하고, 거대한 점수 행렬을 HBM에 쓰고,17:08

소프트맥스를 적용하고, 행렬을 다시 읽어서 값 벡터와 곱합니다.17:13

플래시 어텐션17:17

대신, 사용자 정의 타일드 커널을 사용하여 더 작은 블록으로 어텐션을 계산하고 대부분의 중간 값을 GPU에서17:18

가장 빠른 메모리에 보관하여 전체 어텐션 행렬을 HBM에 구체화하지 않고도 동일한 어텐션 결과를 얻습니다.17:25

그리고 MOE와 같은 LLM 구성 요소의 복잡성이 증가함에 따라 엔지니어가 최적화할 수 있는 부분이 점점 더 많아지고 있습니다.17:31

모델 활용도를 높이기 위해17:39

이것 또한 첫 번째 파티 모델 개발자가 오픈 소스로 공개되더라도 서드파티 추론 제공자보다 엄청난 이점을 갖는 이유입니다.17:40

모델이 오픈 소스인 경우에도, 예를 들어 딥 시크는 모델 내부에 나타나는 정확한 모양을 알고17:47

얼마나 많은 전문가가 활성화되고 양자화가 어떻게 작동하며 통신이 어디에서 중단되는지17:53

발생하며 실제 운영 트래픽이 어떤지 파악하여 정확한 커널을 작성할 수 있어요.17:58

반면, 서드파티 제공업체는 이러한 병목 현상을 역설계해야 해요.18:03

모델을 자체 서비스 스택에 통합한 다음 여러 세대의 GPU에 걸쳐 최적화해야 해요.18:08

이 작업이 완료될 때까지 동일한 모델은 더 많은 GPU를 필요로 하거나,18:12

초당 토큰 수를 줄이거나 개발자의 자체 인프라보다 더 많은 전력을 소비할 수 있어요.18:18

게다가 서드파티 제공업체는 모델이 게시될 때까지 모델에 접근할 수 없어요.18:23

AI 랩은 최적화된 커널을 미리 준비할 수 있지만, 사용자 정의 커널은18:28

마법도 아니에요. 작성하기 어렵고 디버깅하기도 어려우며 종종 설계된 정확한 구성에서만 빠를 수 있어요.18:33

설계된 정확한 구성에 대해서만 빠르고요. 그리고 이것은 제가 말씀드린 서비스형 추론의 세 번째 범주인 소프트웨어 계층일 뿐이에요.18:38

최적화이며, 제가 이야기했던 서비스형 추론의 단지 세 번째 범주에 불과해요.18:43

그들은 마진을 늘리기 위해 다른 유사한 회사들과 동일한 일을 하면서 자체 최적화를 개발했어요.18:48

따라서 그들의 추론 서비스가 공식 API 및 다른 회사들보다 우위를 제공하지 못하면 거의 돈을 벌지 못할 거예요.18:55

하지만 네 번째 범주에서는 훨씬 더 과감한 방법을 택했어요. 토큰 처리량을 늘리기 위해 맞춤형 실리콘을 개발해요.19:02

토큰 수를 늘리기 위해 맞춤형 실리콘을 개발합니다. 그래서 Grok이나 Cerebras 같은 회사들은19:08

redesign the processor itself around AI inference. Grok call their chip the Language Processing Unit19:13

또는 LP유라고 합니다. 핵심 아이디어는 GPU처럼 작업을 동적으로 스케줄링하는 대신, Grok의 컴파일러가19:19

모델이 실행되기 전에 모든 연산과 데이터 전송을 계획해요.19:24

그들의 칩은 모델을 실행합니다.19:28

HPM을 반복적으로 기다리는 것을 피하기 위해 빠른 온칩 SRAM을 사용하는 정밀하게 시간 맞춰진 조립 라인과 같아요.19:29

GPT-OSS-120B에서 Grock은 초당 475개의 토큰을 생성할 수 있는데, 사용자 속도 기준이에요.19:35

전체 사용자 배치가 아니라서요. 불행히도 배치당 사용자 수가 정확히 얼마나 되는지 모르기 때문에.19:42

반면에, Cerebras는 완전히 다른 접근 방식을 취합니다. 수백 개의 작은 칩을 연결하는 대신19:48

수백 개의 작은 칩 대신 거의 전체 실리콘 웨이퍼를 커버하는 하나의 프로세서를 만듭니다.19:51

그들의 WSE319:56

900,000개의 AI 코어와 초당 약 21 페타바이트의 메모리 대역폭을 가진 44GB 온칩 SRAM을 포함하고 있습니다.19:58

이렇게 하면 데이터가 끊임없이 별도의 GPU와 서버 사이를 이동하는 대신 하나의 거대한 칩 전체로 이동할 수 있습니다.20:05

별도의 GPU와 서버 사이를 이동합니다. 이 웨이퍼 스케일 디자인을 통해 Cerebras는 놀라운20:09

GBT OSS 120B에서 초당 사용자당 1794개의 출력 토큰을 달성했습니다.20:16

이는 다른 카테고리 3 추론 제공업체보다 최소 세 배 빠른 속도입니다.20:21

하지만 모델 아키텍처가 복잡할 경우,20:25

너무 복잡해서, DeepSeek v4처럼, 바로 지원하지 못하거나 최소한 즉시 지원할 수 없어요.20:27

복잡한 커널이 너무 많아서 최적화되거나 단순히 작성되어야 하거든요.20:32

네, 이것이 서비스형 추론의 대략적인 경제 상황이에요.20:36

놀랍게도 현재 프론티어 AI 생태계는 이 비즈니스 모델을 더욱 중요하게 만들 수 있어요.20:40

오픈 소스 연구소는 모델 구축에 점점 특화되고, 별도의 회사는 서비스를 제공하는 데 특화되는 경향이 있어요.20:45

많은 연구소들은 프론티어 모델을 훈련하고 동시에 대규모 글로벌 추론 플랫폼을 운영할 만큼 충분한 컴퓨팅 자원이 없어요.20:52

일부 연구소는 제한된 자금이나 칩 접근성 때문에 그런 제약이 있어요.20:59

특히 중국 AI 연구소의 경우 수출 규제로 인해 고성능 GPU 용량을 확보하기가 훨씬 더 어려워요.21:02

하드웨어가 있다고 해도 추론에 사용되는 모든 GPU는 다음 훈련 실행을 위해 사용할 수 있는 GPU가 하나 적어요.21:08

현재의 경향은 10조 파라미터 모델을 누가 먼저 훈련시키느냐예요.21:14

가능한 한 빨리 진행되면서, 학습 계층과 추론 계층 간의 격차를 벌리게 될 거에요.21:18

연구소는 매우 뛰어난 모델을 출시할 수 있지만, 갑작스러운21:23

낮은 지연 시간과 안정적인 가용성을 갖춰서 전 세계 수요를 처리할 수 있는 인프라가 부족한데, 바로 추론21:27

제공업체가 들어맞는 곳이죠. 그리고 오픈 소스 모델이 ChatGPT나 Claude 같은 독점 모델보다 더 좋아질수록21:32

ChatGPT나 Claude보다 성능이 뛰어나면 서빙에 대한 수요가 폭발적으로 증가할 거에요.21:37

그게 바로 추론 서비스의 궁극적인 기회예요.21:41

댓글로 가장 좋아하는 추론 제공업체가 어디인지 알려주시고, 이런 설명 영상이 마음에 드는지, 그리고 오늘 프리필링과 디코딩에 대해 배우면서21:44

프리필링과 디코딩을 배우고 나서 LLM에 대해 더 깊이 알고 싶게 만드나요? 제 플랫폼인21:51

intuitiveai.academy가 시작하기에 완벽한 장소가 될 수도 있어요. 이 플랫폼은21:55

LLM의 핵심 개념을 직관적으로 이해하도록 돕는 데 중점을 두고, 기초부터 시작해서22:00

기본부터 혼합 전문가와 모델 최적화 같은 고급 주제까지 다루고, 수학 공식에 압도당하는 대신22:05

상위 레벨의 개념을 완전히 이해하도록 돕고 싶어서요.22:09

기술적인 세부 사항이 그 후에야 제대로 와닿도록 하려고 합니다. 게다가22:13

최근에는 매 챕터가 끝날 때마다 이해도를 테스트하는 새로운 퀴즈 시스템을 추가했고, 함께22:17

매주 순위표를 통해 학습 경쟁력을 높이고, 방금 새 챕터를 게시하기도 했습니다.22:22

선형 어텐션을 직관적으로 분석하는 새로운 챕터입니다. 최신 기술인22:26

kimike 3와 quen 모델의 기반이 되는 개념 중 하나를 다루고 있습니다. 직장에서 LLM을 사용하고 있거나22:31

이 분야로 전환하거나 LLM 연구에 참여하고 싶다면, 아래 링크를 통해 확인해 보세요.22:35

설명란의 링크를 사용해서 백 투 스쿨 프로모션 코드를 입력하면 연간 멤버십을 50% 할인받을 수 있고, 감사합니다.22:40

시청해 주셔서 감사하고, 스팸 매치 크리스 레듀 디건 로버트 자비아사 푸프 등에게 큰 박수를 보냅니다.22:45

이누 DX 연구 그룹, 알렉스 리오 할라와니 등 Patreon이나 유튜브를 통해 저를 지원해주시는 많은 분들22:52

트위터 팔로우 안 하셨다면 팔로우하시고 다음 영상에서 만나요.22:58

AI Summary

현재 오픈 소스 VLM 배포는 GPU 비용조차 충당하지 못할 정도로 수익성이 낮지만, 추론 속도 최적화, DeepSeek의 성공 사례 분석, 그리고 효율적인 기술 도입을 통해 충분히 개선될 수 있습니다. 특히 사전 채우기 단계 병렬 처리, KV 캐시를 활용한 캐싱 전략, 그리고 배치 처리를 통해 GPU 활용도를 높이는 것이 중요하며, 이를 통해 경쟁력 있는 가격으로 다른 모델들과 비교 가능한 서비스를 제공할 수 있을 것입니다. DeepSeek의 사례처럼 입력 토큰 중 상당 부분을 캐시 히트로 활용하는 것은 실제 운영 환경에서 효율성을 높이는 핵심 요소입니다.

Key Highlights

  • •현재 VLM 배포는 수익성이 낮아 GPU 비용조차 충당하지 못함
  • •DeepSeek는 초당 높은 토큰 처리량과 마진을 달성하여 성공적인 사례를 보여줌
  • •사전 채우기 병렬 처리, 캐싱(KV 캐시 활용), 배치 처리를 통한 효율성 증대가 중요함
  • •캐시 히트율을 높이는 것이 실제 운영 환경에서 효율성을 높이는 핵심 요소임
  • •최적화된 가격으로 경쟁 모델과 비교 가능한 서비스 제공 가능

Related Videos