읽기 설정
AI Summary
세르뷰 비전은 문서 지능 기술, 특히 OCR 분야에서 뛰어난 성과를 보여주고 있습니다. 데이터 엔진 구축의 어려움을 극복하기 위해 합성 데이터를 활용하고, 강화 학습 모델을 통해 OCR 정확도를 높이는 데 집중했습니다. 현재 글로벌 영어 벤치마크에서 최고 수준의 성능을 달성했으며, 인도어 분야에서는 압도적인 우위를 점하고 있습니다. 악샤르라는 에이전트 기반 작업대를 통해 인간 개입을 최소화한 디지털화를 지원하며, API, 온프레미스 환경, 에이전트 플랫폼으로 제공됩니다. 앞으로 범용 비전 언어 모델 출시와 인도어 벤치마크 공개를 계획하고 있으며, 데이터 품질 확보 및 인공지능 주권 확보의 중요성을 강조하며 지속적인 학습과 피드백 반영을 통해 모델 성능을 개선해 나갈 예정입니다.
Key Highlights
- •세르뷰 비전은 강화 학습 기반 OCR 기술로 글로벌 영어 벤치마크에서 최고 수준의 성능을 달성했습니다.
- •인도어 분야에서 압도적인 우위를 점하며 인도어권 디지털화 물결을 이끌 것으로 기대됩니다.
- •악샤르 에이전트 기반 작업대를 통해 인간 개입을 최소화한 디지털화를 지원합니다.
- •데이터 품질 확보와 인공지능 주권 확보가 모델 성능 향상에 결정적인 역할을 합니다.
- •출시 4개월 만에 3천 5백만 페이지를 디지털화하며 시장의 높은 수요를 확인했습니다.
Related Videos
네, 안녕하세요. 여러분, 좋은 오후입니다. 저는 세르보의 일반 매니저인 크리슈나입니다.00:16
오늘 저는 30억 개의 파라미터를 가진 모델이 어떻게 만들어졌는지 말씀드리겠습니다.00:23
단일 GPU에서 실행할 수 있을 만큼 작으면서 문서 인공지능 분야에서 최고 수준의 성능을 보여주고,00:28
크기가 100배 더 큰 모델들을 능가합니다.00:36
이 모델은 두 가지 면에서 조금 특이한 편입니다.00:40
첫째로 사용된 언어 모델은 일반적인 형태가 아닙니다.00:45
트랜스포머 모델이고요, 데이터에서 학습 및 연산에 이르기까지 전체 모델 구축 과정이00:48
종단 간으로 이루어졌습니다.00:55
인도에서요. 그리고 영어와 인도 공용어 22개에 대해서는, 제가 생각하기를 현재 전 세계적으로 가장 어려운 문서 지능 문제 중 하나라고 생각합니다.00:56
현재 전 세계적으로 가장 어려운 문서 지능 문제 중 하나입니다.01:03
이것이 저희가 처음부터 최고 수준으로 발전시킨 방법입니다.01:09
저희는 누구일까요? 저희는 인도에 기반을 둔, 자율적인 기초 모델 회사인 세르밤입니다.01:13
다양한 분야에서 활동하고 있습니다. 음성, 텍스트, 그리고 이미지 처리 분야요.01:20
음성 분야에서는 음성을 텍스트로 변환하는 모델을 가지고 있습니다.01:24
텍스트 음성 변환 모델도 가지고 있습니다. 텍스트 분야에서는 300억 개와 100억 개의 파라미터 모델을 보유하고 있습니다.01:28
그리고 비전 분야에는 문서 지능 모델이 있는데, 오늘 이 부분에 대해 말씀드리겠습니다.01:34
인도는 기계가 읽을 수 있는 세상에서 상당 부분 누락되어 있습니다.01:42
발표된 언어 분포 연구에 따르면, 1% 미만입니다.01:45
프론티어 모델이 학습된 Common Crawl 데이터 코퍼스에 인도어 표현이 있습니다.01:53
인도어 표현이 포함되어 있습니다.01:57
이제 여러 포럼에서 프론티어 랩스가 인도에 대해 이야기하는 것을 들어보셨을 수도 있습니다.02:01
인도가 그들의 주요하고 빠르게 성장하는 시장 중 하나라고 말합니다.02:04
시장도 그렇습니다. 그리고 그 점을 고려할 때, 인도에는 아직 데이터가 부족합니다.02:11
매일 여기에서 학습되는 프론티어 모델의 데이터는 아직 빠져 있습니다.02:17
여기요. 그런데 왜 그런 걸까요? 데이터 부족이나 지식이 없어서가 아니라, 디지털화된 적이 한 번도 없기 때문입니다.02:22
데이터가 디지털화되지 않았기 때문입니다.02:29
저희 Servum에서 그 문제를 해결하고 있습니다.02:32
인디 문서 지능이 어려운 이유는 무엇일까요? 첫째는 목표 자체가 지식과 관련되어 있기 때문입니다.02:38
단순히 텍스트 추출이 아니라, 정보 추출에 더 가깝습니다. 논리적인 일관성 없이 단순히 텍스트만 추출하는 것은 의미가 없습니다.02:45
두 번째로, 인도 문자에서는 단어의 모양이...02:51
그리고 우리가 보는 언어와 기계가 보는 언어가 매우 다릅니다.02:59
즉, 인도어는 복잡하게 결합된 유니코드 세트를 가지고 있습니다.03:03
언어 모델이 제대로 작동하려면 22개의 모든 언어에 능통해야 합니다.03:08
대부분의 인도어는 자료가 부족한 저자원 언어로 간주됩니다.03:13
현재 이 모델들을 학습시킬 수 있는 데이터가 많이 부족합니다.03:19
저희의 해답은 세르뷰 비전입니다. 인도 최초의 주권 기반 시각 언어 모델이죠.03:26
스테이트 스페이스 아키텍처를 활용한 30억 개의 파라미터를 가진 모델을 처음부터 구축했습니다.03:31
데이터, 컴퓨팅, 그리고 학습까지 모두 인도에서 진행되었습니다.03:38
저희가 2025년 말에 초기 작업을 시작했을 때에는,03:42
OCR 분야의 대부분의 VL 모델들이 통합형 VL 모델이었습니다.03:46
페이지 단위 광학 문자 인식(OCR)을 수행했는데, 당시 저희는 오히려 블록 단위 OCR에 집중하는 전략을 택했습니다. 모델 주위에 문서 난이도 요소를 추가했고요.03:51
모델 주위에 문서 난이도 요소를 추가하여 블록 단위 OCR에 집중했습니다.03:58
최근에 발표된 2026년 이후의 많은 모델들이 동일한 난이도 설정으로 수렴하고 있습니다.04:03
게다가 OCR을 위한 소형 모델 패러다임은 저희가 제시했던 방향에서 많은 가치를 보여주고 있습니다.04:11
특히 Servum Vision은 레이아웃과 읽기 각각에 대해 두 개의 하드니스 모듈을 가지고 있습니다.04:18
그리고 하드니스와 함께 블록 단위 광학 문자 인식을 위한 상태 기반 모델, 즉 VLM을 사용합니다.04:23
다시 한번 말씀드리지만, 오늘날 왜 스테이트 스페이스를 사용하고 트랜스포머는 사용하지 않나요?04:31
오늘날 대부분의 OCR 모델, 일반적인 VLM이나 Quen, Gemma 같은 오픈 소스 VLM들은요,04:37
대부분 트랜스포머 기반입니다. 저희는 SSM을 사용한 다른 접근 방식을 취했습니다.04:44
왜냐하면 트랜스포머와 SSM은 근본적으로 순차 모델이기 때문입니다.04:50
하지만 근본적인 작동 방식은 매우 다릅니다. 트랜스포머는 모든 토큰이 다른 모든 토큰을 살펴봅니다,04:55
계산량이 시퀀스 길이를 제곱에 비례하여 증가하는데요, 즉 L 곱하기 L 상호작용입니다.05:02
그리고 시퀀스가 길어질수록 메모리도 함께 증가합니다. 반면에, SSM은 단일 상태를 가지고 있습니다.05:11
그들은 시퀀스 전체에 걸쳐 단일 상태를 유지하며 토큰별로 업데이트합니다.05:18
이제 연산량이 시퀀스 길이에 대해 선형적으로 증가하고, SSM의 경우 메모리 사용량은 일정하게 유지됩니다.05:23
그럼, 왜 이것이 OCR에 적합한 아키텍처인가요?05:29
여기서의 균형을 잘 맞춰야 합니다.05:34
특히 긴 문서의 경우, 페이지당 시각적 토큰이 최대 5천에서 1만 개까지 나올 수 있습니다.05:37
그리고 연산 및 메모리의 이차 복잡도는 추론 과정에서 매우 비싸집니다.05:44
반면에, 어느 정도 손실이 발생하는 블록 단위 광학 문자 인식(OCR)을 수행하는 것은...05:52
SSM을 사용하는 것은 높은 컴퓨팅 비용을 피하기 위해 정당화될 수 있습니다.05:59
트랜스포머에서 발생하는 비용 부담을 줄일 수 있기 때문입니다.06:06
그래서 실제로 어떻게 학습시키는 걸까요? 저희는 단계별 교육 과정을 설계했는데, 총 네 단계를 거쳤습니다.06:09
각 단계가 이전 단계를 기반으로 구축되었습니다.06:14
텍스트만으로 사전 학습을 진행하며, 13조 개의 토큰을 사용합니다.06:18
영어, 인도어 텍스트, 수학 및 코드를 포함한 다양한 데이터를 활용합니다.06:22
이것은 30억 개의 파라미터로 이루어진 언어 기반을 구축합니다.06:26
그리고 강력한 언어 사전 지식이 바로 무엇이죠.06:31
모델이 흐릿하거나 모호한 텍스트도 해결할 수 있도록 합니다.06:34
당신이 반쯤 흐릿해진 단어도 읽을 수 있는 것처럼, 이미지에서 동일하게요.06:38
어떤 단어가 정확한 위치에 있어야 하는지 알고 있기 때문입니다.06:42
그래서 저희는 먼저 언어 모델의 역량을 키우는 데 집중했습니다.06:47
모델이 단 하나의 픽셀조차 보기도 전에요.06:51
두 번째 단계에서는 이미지와 텍스트 쌍 3억 개를 사용하여 지속적인 사전 학습을 진행합니다.06:55
이 과정을 통해 언어 모델은 일반적인 시각 능력을 학습하고, 어떻게 보고 픽셀을 해석하는지 등을 배웁니다.07:02
그 다음 단계 세 번째에서는 지도적 미세 조정을 1억 개의 OCR 데이터에 대해 수행했습니다.07:09
샘플들을 사용했고요.07:17
세 번째 단계는 주로 일반적인 VLM 모델이 광학 문자 인식(OCR)에 강점을 갖도록 하는 데 집중합니다.07:20
여기에는 22개 언어와 영어를 포함하여 다양한 데이터가 포함됩니다.07:28
그리고 표와 같은 모든 종류의 문서 구성 요소도 통합합니다.07:33
방정식이나 손글씨 문서 등 다양한 형태의 자료도 포함됩니다. 그리고 그 외에도...07:40
이제 네 번째 단계는 강화 학습입니다. 이를 통해 기존의 한계를 뛰어넘을 수 있습니다.07:46
지도 학습 미세 조정으로 달성할 수 있는 한계를 뛰어넘는 데 도움이 됩니다.07:51
여기서 이 방법이 표준적인 방식이라는 것을 보실 수 있습니다.07:55
하지만 여기서 중요한 부분은 아래에 있는 두 가지 요소입니다.07:58
데이터 레이어와 평가 레이어라고 할 수 있습니다.08:03
첫 번째는 데이터 엔진입니다. 대부분의 22개 언어에 대해서는 즉시 사용할 수 있는 레이블 데이터가 없습니다.08:07
레이블 데이터가 없을 때는요.08:13
레이블 데이터가 없을 경우, 데이터 엔진을 구축하는 것이 어려워지며, 저희는 이 부분을 상당히 많이 수행해 왔습니다.08:16
저희는 합성 데이터를 만들고 실제 문서에서 데이터를 추출하기 위한 파이프라인을 구축했으며, 또한 도움을 드렸습니다.08:22
학습에 사용되는 데이터를 지속적으로 개선하는 파이프라인을 구축합니다. 평가 성능을 기반으로,08:30
현재 적극적으로 검토하고 있습니다.08:37
저희는 강화 학습 모델의 패러다임을 살펴보고 에이전트 비전을 탐색하고 있습니다.08:41
향후 출시될 모델들의 기능과 관련된 능력을 평가하기 위해 이블(evals)이라는 두 번째 모드를 사용하고 있습니다.08:46
모델의 성능이 얼마나 잘 나오는지 측정할 수 없다면 최고 수준에 도달할 수 없습니다.08:52
저희는 측정하는 것이 정말로 의미 있는지 확인하기 위해 다양한 평가 지표들을 준비했습니다.08:59
그리고 최종 사용자에게 있어서 유용성 측면에서도 진정으로 의미가 있다는 점도 중요합니다.09:04
그래서 저희의 강화 학습 파이프라인 네 번째 단계에 대해 잠시 더 자세히 말씀드리고 싶습니다.09:10
강화 학습을 통해 많은 이득이 발생합니다, 기본적으로는요.09:17
OCR에서는 정확도가 기계가 읽을 수 있는 문제잖아요, 그렇죠?09:21
보상을 제공하고 모델을 평가할 수 있는 테스트를 많이 설정할 수 있습니다.09:25
만들어진 샘플들을 기준으로 모델을 평가할 수 있습니다.09:29
그리고 결정론적 광학 문자 인식(OCR)의 세계에서, 이 모든 것들은 기계적으로 검증 가능합니다.09:35
따라서 강화 학습은 저희에게 큰 도움을 줍니다. 샘플 그룹을 추출하여 단위 테스트로 점수를 매겨요.09:41
기준이 될 평균값을 강화하고, 이 과정을 반복하는 것입니다.09:48
그래서 RLVR을 OCR에 적용하면 매우 확장 가능합니다.09:54
이제 저희가 처음부터 학습을 진행하고 데이터를 구축하는 데 많은 노력을 기울인 결과, 두 개의 글로벌 영어 벤치마크에서 최고 수준의 성능을 달성할 수 있었습니다.09:59
두 개의 글로벌 영어 벤치마크에서 SOTA를 기록하게 되었습니다.10:06
하나는 올모 OCR 벤치이고 다른 하나는 오мни독 벤치입니다.10:10
출시 당시 올모 OCR에서 84.3점을, 그리고 오мни독 벤치에서는 93.2점을 기록했습니다.10:13
출시된 이후의 모델들은 상당 부분 성능을 향상시켰고, 곧 글로벌 리더보드에서도 더 강력한 모델이 나올 것으로 예상됩니다.10:20
모델들이 많이 발전하면서 전체적인 순위에도 큰 영향을 미쳤고, 조만간 글로벌 리더보드에서 더욱 강력한 모델을 선보일 수 있을 것 같습니다.10:23
두 번째로, 더 중요하게는 22개의 인도어에 대해 말씀드리면요,10:31
제미니와 같은 최첨단 모델과 비교해도 타의 추종을 불허하는 선두를 유지하고 있습니다.10:36
그리고 ChatGPT나 Opus 같은 모델들도 있고요. (Geurigo ChatGPT-na Opus gateun modeoldeuldo gotgo yo.)10:41
바로 이 부분에서 저희는 격차를 상당히 넓혔고, 새롭게 출시된 모든 모델들과 비교해도 여전히 강세를 유지하고 있습니다. (Baro i bubuneseo jeohuieun gyeochareul sanghaneu neolhyeotgo, saeropge chulse doen modeulladeul-gwa bigyohaedo yeojeonghi gangse-e uyuji itseumnida.)10:44
나중에 등장한 것들을 포함해서요.10:52
이제, 세르뷰 비전이 악샤르라고 불리는 저희 에이전트 기반 문서 지능 작업대를 구동합니다.10:53
여기서 저희는 인간 개입을 통한 에이전트 기반 디지털화를 가능하게 합니다.11:00
그리고 추출, 이후 다양한 문서 지능 문제 해결을 위한 데이터 수집 과정을 지원합니다.11:06
신뢰도 점수를 제공하며, 블록 단위의 근거를 가지고 있습니다.11:13
그리고 에이전트 기반 교정 기능 등도 지원합니다.11:18
물론, 벤치마크와 최첨단 기술은 또 다른 문제입니다.11:23
그것들은 그 나름의 가치를 지니죠. 오늘날, 보험에서 은행, 정부에 이르기까지 전 세계 최대 규모의 기업들께서도...11:28
보험에서 은행, 정부에 이르기까지 전 세계 최대 규모의 기업들 또한 역사 보존 단체에 이르기까지 세르보 비전을 활용하여11:34
영문과 22개의 인도어 언어로 총 3천5백만 페이지 이상을 디지털화하고 있습니다.11:40
이 모델은 API 형태로도, 온프레미스 환경에서도, 그리고 에이전트 플랫폼으로도 제공됩니다.11:46
정도로 말씀드릴 수 있습니다. 결론적으로, 4개월 전까지는 주권형 모델이 없었습니다.11:53
인도에서 왔습니다.12:00
오늘 저희는 처음부터 학습된 세르브엄 비전을 소개하게 되어 기쁩니다. 이 모델은 현재 최고 수준의 성능을 달성했습니다.12:01
가격대가 다른 솔루션들과 경쟁력 있게 매우 저렴합니다. 오픈 소스나 클로즈드 소스까지 포함해서요.12:08
우선, 인도에서 가장 어려운 문제들을 해결하는 것부터 시작했습니다.12:13
그리고 언어 문서 지능 문제를 해결했습니다. 곧 범용 비전 언어 모델(VLM)을 출시할 예정인데, 훨씬 더 다양한 시각적 기능을 수행할 수 있습니다.12:20
훨씬 더 많은 비전 기능들을 제공할 수 있는 모델들이죠.12:26
저희 모델을 사용해 보시는 여러분들을 기대하고 있습니다.12:29
감사합니다.12:34
궁금한 점이 있으시면 언제든지 질문해주세요, 네.12:39
네, 네, 물론입니다. 일반적으로 22개 언어의 언어 능력은...12:48
영어 능력을 상당히 향상시켜 줍니다.12:54
그리고 이것은 인도 저자원 언어뿐만 아니라 모든 저자원 언어에 적용 가능합니다.12:57
네, 이 모델은 그 방향으로 진행하지 않습니다. 왜냐하면 이것은 비전(시각)에 집중된 모델이기 때문입니다.13:27
여기서는 문서에서 정보나 지식을 추출하는 데 집중하고 있습니다.13:34
하지만 네, 일반적인 언어를 사용하는 모델을 돕는 데에도 일부 유사한 점이 있을 수 있습니다.13:38
코딩 속도를 높이는 데에도 도움이 될 수 있겠지만, 음, 그것은 이번 연구의 주요 관심사가 아닙니다.13:46
네, 맞습니다. 두 가지가 있습니다. 일반적인 추가 학습을 위해 인공 문서를 만듭니다. 합성 문서라고도 하죠.14:10
여기에는 SFD와 강화 학습(RL)이 포함됩니다.14:16
하지만, 강화 학습에 대한 구체적인 질문으로 넘어가서 말씀드리면, 그 부분에서도14:22
합성 데이터를 생성할 수 있습니다. 하지만 가장 좋은 방법은 실제 세계의 문서를 활용하는 것입니다.14:27
단위 테스트를 설정하거나 다양한 종류의 보상을 구성하는 데 충분히 복잡합니다, 그렇죠?14:33
예를 들어, 문자 비율에 기반한 보상이나 표 구조 또는 수학 방정식에 기반한 보상이 있을 수 있습니다.14:41
언어와 관련된, 예를 들어 문법 보상 같은 것들을 활용해서 모델을 돕고14:48
모델이 다양한 방식으로 생성할 수 있는 오류 제거를 기반으로 반복적으로 개선하도록 할 수 있습니다.14:55
설정입니다.15:02
잠시만요, 찬드라를 아주 좋아한다고 하셨나요? 네, 그건 다른 연구실에서 만든 거랍니다.15:21
저도 찬드라를 만든 연구실을 정말 좋아해요. 네, 말씀하신 인도 벤치마크 질문에 답하자면, 네,15:26
저희가 제작한 22개 언어용 세르움 인도 벤치마크를 공개할 예정이고, 그 범위는...15:33
1800년대부터 현대까지의 아주 긴 시간적 범위와 다양한 레이아웃, 그리고 다양한 종류의 문서들을 포함합니다. 인도어권에서는 산문, 시, 문학 작품 등 다양한 형태의 문서들을 상상할 수 있습니다.15:41
인도어권에서는 산문, 시, 문학 작품 등 다양한 형태의 문서들을 상상할 수 있습니다.15:47
표나 금융 관련 자료 등은 곧 저희가 공개적으로 벤치마크를 출시할 예정입니다.15:54
다시 한번 말씀드리지만, 여기에서는 전사(transliteration)가 직접적으로 관여하지 않습니다. 왜냐하면 OCR에서 중요하게 생각하는 것은 높은 충실도를 가진 추출이기 때문입니다.16:28
이미지에 오류가 있더라도, 그 오류를 정확하게 추출하고 싶습니다.16:35
모델이 WIM에서 변경을 가하지 않고 그대로 추출되기를 원합니다.16:39
따라서, 이것은 직접적으로는 적용되지 않습니다.16:43
하지만 네, 그렇습니다. 저희가 보는 것은 심지어 음역을 거치는 많은 데이터가 들어오고 있습니다.16:46
현재 OCR 학습을 진행하고 있는데, 그 데이터의 품질이 어느 정도인지 그리고 얼마나 유용한지는 아직 판단하기 어렵습니다.16:51
기타 등등입니다.16:58
몇 가지 고려해야 할 사항이 있습니다.17:28
가장 먼저 말씀드릴 건데요, 다른 모델들, 최첨단 비공개 소스 모델이나 공개 소스 모델 모두 해당되지 않습니다.17:30
복잡한 인도어 문서에도 모델이 잘 작동합니다.17:36
그래서 인구가 14억 명이 있는 나라에서는요...17:40
사람들의 일상생활에 필요한 문서 지능 문제를 해결할 수 있어야 합니다.17:46
인도에는 서류 작업이 정말 많으니까요, 그렇죠?17:52
떠오르는 나라입니다.17:56
지금도 계속 디지털화되고 있고, 대표성이나...17:58
나라 전체를 디지털화할 수 있는 역량이 먼저 존재해야 합니다. 그리고 두 번째로, 학습 측면에서 저희가 특별히 한 일은 데이터를 구축하는 것이었습니다.18:03
구체적으로 어떤 데이터를 만들었는지 말씀드리겠습니다.18:09
이는 인공지능이 우리 삶의 정규적인 부분으로 자리 잡는 아주 초기 단계에 해당합니다.18:16
데이터를 확보하여 시작해야 합니다.18:23
궁극적으로는 저희가 선호하는 언어로 개인화된 에이전트를 가질 수 있는 단계에 도달할 수 있도록 하는 것이 목표입니다.18:29
저희가 원하는 방식으로, 제가 선호하는 언어 등으로 가능하게끔 하는 것입니다.18:34
그런 모든 일을 하려면 어디서부터 시작해야 하고, 데이터가 만들어져야 합니다.18:40
데이터 품질이 좋으면 모델 학습에 도움이 됩니다.18:43
최첨단 기술로 발전하게 됩니다. 그리고 모델이 최첨단 기술이라면 보험 회사부터 정부 기관에 이르기까지,18:47
인공지능 주권을 중요하게 생각하는 다른 곳에도 영향을 미치겠죠?18:55
정부 기관으로서 저는 모델이 다른 곳에 배포될 수 없습니다.18:59
어디로 데이터가 전송되는지, 받아쓰기 작업에 사용되는지 알 수 없기 때문입니다.19:02
그래서 데이터가 어디로 보내지는지, 언제 사용되는지, 얼마나 사용되는지 등을 통제할 수 있어야 합니다.19:07
따라서 주권이 매우 중요해지고, 이 모델은 이제 마치... 이렇게 된 것 같습니다.19:13
출시된 지 네 달이 채 되지 않았는데 벌써 3천 5백만 페이지를 디지털화하고 있습니다. 시장이 기다리고 있었다는 것을 보여주는 거죠.19:20
그것은 시장이 이것을 기다리고 있었다는 것을 나타냅니다.19:23
이 분야에서 주권을 확보하는 것이 인공지능 디지털화 물결을 촉발할 수 있습니다. 네, 크게 세 가지 측면이 있습니다.19:27
첫 번째는 이것이고요.19:32
주권 문제, 다른 하나는 모델 자체의 성능이고, 세 번째는 데이터입니다.19:36
이러한 모델을 학습하는 데 필요한 것입니다.19:41
네, 40%가 인도어이고 나머지는 영어입니다.19:54
그리고 수학과 코드 등을 포함하고 있습니다.20:01
네, 알겠습니다.20:08
현재 이 모델로 배포한 것들은요...20:25
지역 언어를 디지털화하기 위해 다양한 상태로 진행하고 있습니다.20:30
영문 서류와 혼합 언어 서류들도 함께 처리하고 있습니다.20:35
그래서 곧 피드백을 받아서 학습시킬 수 있을 거예요.20:41
현재 배포를 통해 얻는 피드백으로 학습할 수 있게 될 겁니다.20:43
네, 그 파이프라인도 이미 시작했습니다.20:49
AI Summary
세르뷰 비전은 문서 지능 기술, 특히 OCR 분야에서 뛰어난 성과를 보여주고 있습니다. 데이터 엔진 구축의 어려움을 극복하기 위해 합성 데이터를 활용하고, 강화 학습 모델을 통해 OCR 정확도를 높이는 데 집중했습니다. 현재 글로벌 영어 벤치마크에서 최고 수준의 성능을 달성했으며, 인도어 분야에서는 압도적인 우위를 점하고 있습니다. 악샤르라는 에이전트 기반 작업대를 통해 인간 개입을 최소화한 디지털화를 지원하며, API, 온프레미스 환경, 에이전트 플랫폼으로 제공됩니다. 앞으로 범용 비전 언어 모델 출시와 인도어 벤치마크 공개를 계획하고 있으며, 데이터 품질 확보 및 인공지능 주권 확보의 중요성을 강조하며 지속적인 학습과 피드백 반영을 통해 모델 성능을 개선해 나갈 예정입니다.
Key Highlights
- •세르뷰 비전은 강화 학습 기반 OCR 기술로 글로벌 영어 벤치마크에서 최고 수준의 성능을 달성했습니다.
- •인도어 분야에서 압도적인 우위를 점하며 인도어권 디지털화 물결을 이끌 것으로 기대됩니다.
- •악샤르 에이전트 기반 작업대를 통해 인간 개입을 최소화한 디지털화를 지원합니다.
- •데이터 품질 확보와 인공지능 주권 확보가 모델 성능 향상에 결정적인 역할을 합니다.
- •출시 4개월 만에 3천 5백만 페이지를 디지털화하며 시장의 높은 수요를 확인했습니다.


