Home

읽기 설정

네, 최근에 구글이 LLM 쪽에서 조금 소홀했던 것 같습니다.00:00

제안되었던 제미니 3.5 프로는 나오지 않았지만, 부디 곧 상황이 많이 나아질 거라고 기대합니다.00:06

제미니 4 출시와 함께 상황이 좀 달라졌습니다만, 멀티모달 측면에서는 완전히 다른 이야기입니다.00:12

딥마인드 멀티모달 팀은 제미니를 기반으로 한 멀티모달 릴리즈에서 정말 좋은 성과를 보여주고 있습니다.00:17

제미니 플래시 모델들입니다. 오мни 1.1 플래시 업데이트도 있었습니다.00:23

음성 측면에서는 라이브...00:27

라이브 트랜슬레이트나 구독과 같은 기능이 탑재된 모델들이 있었고, 이제 새로운 두 가지 텍스트 음성 변환 모델이 출시되었습니다.00:29

모델은 제미니 3.8 플래시 TTS와 제미니 3.8 플래시 라이트 TTS입니다.00:34

지금 구글에서는 이 모델들이 지금까지 가장 풍부한 표현력을 가진 음성 모델이라고 홍보하고 있고, 여러 벤치마크에서 최고점을 기록했다고 합니다.00:40

물론 어느 정도는 사실이지만, 독립적인 평가를 보면 블로그 게시글에 나타난 것처럼 결과가 조금 더 복합적입니다.00:47

네, 우선 두 가지 모델이 있습니다. 이들은 서로 다른 용도로 설계되었어요. 플래시 TTS는 창의적인 작업에 적합합니다.00:54

캐릭터 목소리, 오디오북, 팟캐스트, 게임 등 다양한 분야에서 활용될 수 있습니다.01:00

반면에 플래시라이트 TTS는 볼륨 모델입니다.01:07

더빙, 대량 오디오 생성, 음성 에이전트 및 무엇보다 중요한 작업에 적합하도록 제작되었습니다.01:09

발화량을 많이 생성하고, 완벽하게 모든 미묘한 차이를 구현하는 것보다 비용이 더 중요할 때가 있습니다.01:16

여기 주요 기능은 바로 음성 디자인에 관한 것입니다.01:22

기존의 목록에서 고르는 대신,01:26

원하는 목소리를 평이한 언어로 설명하실 수 있습니다. 역할과 특징을 부여하여,01:28

억양과 목소리의 특징을 설정해서 백여 개 이상의 다양한 언어로 그 목소리를 만들어 줍니다. 다른 TTS 제공업체에서도 이와 같은 점을 볼 수 있지만,01:33

다른 TTS 제공업체에서도 비슷한 기능을 확인했습니다.01:39

오픈 모델에서도 마찬가지로 확인되지만, 확실히 구글이 이 개념 전체를 개선한 것 같습니다.01:44

TTS 모델에서 가장 답답했던 점 중 하나가 바로 이것입니다.01:49

물론, 기술이 엄청나게 발전하면서 정말 좋은 운율을 보여주는 모델들이 나타나고 있지만요01:55

종종 어려움에 직면하게 됩니다.02:00

테스트 음성을 들어보면, 아무것도 원하는 대로 딱 맞지 않는 경우가 많습니다.02:06

그래서 결국 목소리 복제(voice cloning)를 시도하게 되는데, 그 과정에서 법적인 문제 등 여러 어려움이 있을 수 있습니다.02:11

이 부분에 대해 정말 멋진 시도들을 많이 봤습니다.02:18

퀀 TTS 팀에서 만든 것들도 있었지만, 제가 최근에 살펴본 것들은 아무리...02:20

얼마나 노력해서 목소리를 설명하려 해도, 항상 약간 다른 방향으로 흘러가요.02:26

사실 제가 종종 하게 되는 일은 다양한 목소리들을 많이 생성하는 거예요.02:31

약간 다른 설명들이 있어서, 가장 좋은 것을 골라서 실제로 복제하는 과정을 거치게 되요.02:37

인공적으로 만들어진 목소리를 말이죠. 그리고 여기에는 음성 디자인 외에도 2천 개 이상의 라이브러리가 있어요.02:42

여기 다양한 목소리들이 있어요. 여러 지역 방언도 많이 가지고 있고, 그걸02:48

실제로 목소리를 가져다가 원하는 대로 조작하고 그 목소리를 저장할 수도 있습니다.02:52

앞으로 계속 사용하실 수 있습니다. 그리고 이건 정말 놀랍지도 않네요.02:57

구글은 이 기능을 꽤 오랫동안 테스트해 왔지만, 아직 공개하지 않았을 뿐입니다. 이게 바로...03:01

음성 복제 기능이 그렇습니다. 30초 분량의 샘플을 제공하면 그 목소리를 만들어냅니다.03:06

물론 다른 스타트업과 비교했을 때, 구글이 이런 일을 하면 훨씬 더 많은 관심을 받게 됩니다.03:11

문제가 생길 경우 어려움이 있을 수 있으니, 시간을 충분히 가지고 정말 신중하게 접근한 것 같습니다.03:16

누구의 목소리를 복제할지 결정하기 전에 안전장치를 마련하는 데 집중한 것으로 보입니다.03:21

만들어질 음성 데이터는 반드시 화자의 동의를 얻은 음성 클립을 거쳐야 하고, 그 클립이 기준 화자와 일치해야 합니다.03:26

물론, 안전 기능들도 꼼꼼하게 갖추고 있습니다.03:32

각 클립이 생성될 때마다 합성 ID로 워터마크가 표시되고, C2PA 자격 증명도 추가됩니다.03:37

또 다른 어려움은 많은 사람들이 직면하게 될 텐데...03:43

법적 요구 사항 때문에 AI 스튜디오에서 보이스 클로닝 기능이 많은 국가에서 사용 불가능합니다.03:47

심지어 미국 내 일부 주에서도 마찬가지입니다. 이 점이 얼마나 민감한 문제인지 보여주는 거죠.03:53

특히 구글과 같이 큰 회사에서 중요한 부분은 실제로 목소리를 확보한 후에, 03:59

다른 중요한 기능은 한 줄씩 무대 지시를 내릴 수 있다는 점입니다. 그렇게 하면요.04:04

이 부분은 속삭여야 하고, 이 부분은 빠르게 말해야 하며, 이 부분은 비꼬아 말해야 한다고 지정할 수 있습니다.04:08

등등, 그리고 제가 다른 예시에서 보여드린 것처럼 일종의 비언어적 태그를 추가할 수도 있습니다.04:12

한숨, 웃음, 숨소리 같은 것들을 위한 TTS 시스템 말이죠.04:18

또 다른 좋은 기능은 이 곳에서 단일 스크립트만으로도 두 명의 등장인물이 나오는 장면을 만들 수 있다는 점입니다.04:22

그리고 구글에서는 그것을 통해 음성을 몇 시간 동안의 긴 형식 오디오에서도 유지할 수 있다고 주장합니다. 음성이 약간씩 벗어나는 현상 없이요.04:29

실제로 그렇게 되는 것이 하나의 문제점입니다. 최근에 오픈 소스 TTS 시스템을 사용하면서 제가 겪은 바로는, 어느 정도 시간이 지나면 그래요.04:37

음성으로 시작해서 어느 정도 길이의 콘텐츠를 생성하기 시작하면, 음질이 점점 벗어나는 문제가 발생하죠.04:44

알겠습니다. 그럼 이제 벤치마크에 대해 조금 이야기해 볼까요? 왜냐하면 이 부분이 좀 흥미롭거든요.04:48

흥미롭긴 하지만, 일부 행동에 대해서는 조금 의구심이 드네요. 구글의 데이터는04:52

대부분 휴메 AI에서 나온 것이고, 플래시 TTS가 휴메의 음성 디자인 평가에서 1등이라고 이야기합니다.04:57

벤치마크 테스트에서 억양 부분에서 가장 좋은 성과를 보이고, 로건도 실제로 트윗으로 언급했죠.05:04

그런데 중요한 건, 블로그 게시글을 작성한 두 명의 인물 중 한 명이 알란 코헨이라는 점입니다.05:09

실제로 알란 코헨은 올해 1월까지 휴메의 CEO이자 수석 과학자셨습니다. 구글 딥마인드가 그들의 기술을 라이선스하고 해당 스타트업의 사람들을 많이 채용했죠.05:14

그때까지 휴메의 CEO이자 수석 과학자셨던 알란 코헨은, 구글 딥마인드에서 그들의 기술을 라이선스하고 직원들을 대거 영입했습니다.05:20

그들의 숫자가 틀렸다고 말하는 건 절대 아니에요. 하지만, 제가 직접 설계한 벤치마크의 숫자들을 인용하는 것이 이것을 평가하는 가장 좋은 방법인지 확신이 안 들어요.05:24

벤치마크 숫자를 가져와서 판단하는 것은 적절하지 않을 수 있습니다.05:29

다행히 인공지능 분석가들도 자체적으로 테스트를 진행했더라고요.05:33

그리고 저는 그 결과들이 비교적 독립적이라고 생각합니다. 사람들이 흔히 사용하는 선호도 ELO 점수를 보면요.05:38

이런 모델들을 테스트해 보면 제미니 3.8 플래시 TTS가 두 번째로 높은 점수를 받고 있습니다.05:43

그리고 플래시라이트 TTS는 여섯 번째이고, 플래시 모델은 아주 조금 앞서 있는 것을 확인할 수 있습니다.05:50

새로운 퀀 오디오 3 TTS 플러스는 제가 녹음할 당시에는 아직 오픈되지 않은 모델입니다.05:56

하지만 퀀이 그 모델의 가중치를 공개 모델로 배포한다면, 이전처럼요.06:03

그전에 퀀 TTS가 어떻게 될지 보는 것도 정말 흥미로울 것 같고, 제미니 모델이 실제로06:08

선두를 잡는 모습을 볼 수 있을지도 궁금하네요. 발음 관련 벤치마크 같은 것들도요.06:13

특히 플래시라이트 모델을 이용해서 여러 개의 오디오를 한 번에 생성할 때 정말 유용합니다. 말씀하시는 내용을06:17

예를 들어 숫자나 ID 같은, 사람들이 정확하게 처음부터 듣고 싶어하는 것들을 말이죠.06:23

이런 모델을 이용해서 음성 에이전트를 구축하신다면 정말 중요한 부분이라고 생각합니다.06:28

다른 언어에서 모델의 성능을 살펴보면 알 수 있는데, 저는 이 점이 중요하다고 말씀드리고 싶습니다.06:32

그게 구글의 강점이라고 봐야 할 것 같아요. 구글은 다양한 다국어 데이터를 정말 많이 가지고 있습니다.06:37

그리고 다른 제공업체와 비교했을 때, 여기에서 명확하게 확인할 수 있습니다.06:43

카르테시아와 11랩스가 다국어 TTS 시스템 분야에서 상당한 발전을 보이고 있습니다.06:48

다른 주요 데모는 가격인데, 구글은 중간 정도의 위치를 차지하고 있습니다.06:54

여기서 패킹을 봤는데, 카르테시아나 11랩스의 다른 제품들보다 훨씬 성능이 좋네요. 미니맥스 같은 곳들과 비교해도 그렇고요. 하지만 압도적으로 저렴한 편은 아니고요. 몇몇...06:59

그리고 확실히 미니맥스 등과는 차이가 있습니다만, 여기서 가장 저렴하지는 않다고 생각합니다.07:05

더 중요한 건 플래시라이트 모델이 자체 플래시 모델보다 훨씬 저렴하지 않다는 점입니다.07:10

텍스트 버전의 모델과 비교했을 때와는 확실히 차이가 있습니다.07:16

에이아이 스튜디오에서 한번 사용해보고, 두 가지 모델을 시험해 보겠습니다. 그리고 나서...07:20

콜라브에서도 이 모든 것을 시도해 볼 수 있습니다. 자, 음성(목소리)를 확인하고 싶으시다면...07:24

실제로 AI 스튜디오에 들어가서 여기서 보이는 음성 모델 중 하나를 선택하실 수 있습니다. 제가 Gemini 3.8 Flash TTS를 선택했습니다.07:30

그러면 API 키를 연결하도록 요청받으실 거예요.07:35

거기서부터는 다양한 모델들을 살펴볼 수 있습니다.07:41

모델을 가져와서 수정할 수도 있습니다.07:45

여기서 설명을 볼 수 있습니다. 그리고 멋진 점은 원하시면 음성 재작업 기능도 제공한다는 거예요.07:50

여기에 있습니다. 그래서 제가 이걸 클릭하면, 기본적으로 제미니를 이용해서 내용을 좀 더 풍부하게 만들거든요.07:55

제가 원하는 목소리의 스타일을 지정하는 프롬프트가 여기에 있습니다. 거기에서 확인하실 수 있을 거예요.08:00

세 가지 음성 옵션을 제공받아, 사람의 특징을 설명하는 모든 것을 활용할 수 있습니다.08:06

마이크를 잡고 있는 위치까지, 그들의 모습을 표현할 수 있습니다. 그런 점이08:12

아쉽게도 지금 녹화하는 동안 음성 생성에 실패하고 있는 것 같습니다.08:19

여기 있지만, 보통은 세 가지 목소리를 얻어서 그 목소리들을08:24

사용자님께서 직접 커스터마이징하시거나 다듬으실 수도 있고요. 여러 번 시도해서 이걸 만들어야 할 것 같은데, 그렇지 않은 것 같습니다.08:29

일부분 작동하고 있습니다. 이제 코드로 바로 들어가서 실제로 협업 기능을 사용해 보겠습니다.08:36

자, 한번 들어보겠습니다. 안녕하세요, 저는 샘입니다. 오늘 새롭게 출시된 것을 살펴볼 예정입니다.08:41

제미니 3.8 텍스트 음성 변환 모델입니다. 보시는 것처럼 기본 목소리는 꽤 잘 작동하는 것 같습니다.08:45

그리고 멋진 점은 표준 음성을 사용하고 싶다면 다양한 선택지가 있다는 것입니다.08:52

여기 안에 다양한 기능들이 있습니다. 플래시 모델과 플래쉬라이트 모델의 비교를 들어보도록 하겠습니다.08:57

모델입니다. 분기 실적이 발표되었습니다. 매출은 11% 증가했고, 이탈률은 지난 두 년 동안 가장 낮았습니다.09:03

년도입니다. 자, 이제 일반 플래시 TTS였습니다. 다음은 플래쉬라이트 모델을 들어보겠습니다.09:10

분기 실적이 나왔습니다.09:15

분기 실적이 나왔습니다. 매출은 11% 증가했고 이탈률은 2년 만에 가장 낮아졌습니다.09:16

두 년 만입니다. 자, 그럼...09:23

플래시 TTS에서 제가 자주 눈치채는 건, 조금 더 게으르게 들린다는 거예요.09:25

계속 이어질 수도 있고요.09:30

더 길어지는 경향이 있고요, 솔직히 말씀드리면 가격 차이가 크지 않다고 생각해요. 플래시09:32

TTS가 50달러 더 비싸더라도, 너무 길지 않은 작업이라면 그냥 사용했을 것 같아요.09:38

좋은 목소리를 선택해 보세요, 알겠습니다. 이제 스타일 컨트롤을 확인하실 수 있습니다. 이건 기본적으로09:43

우리가 원하는 방식으로 말하도록 지시할 수 있는 곳입니다.09:48

발음 같은 것들요. 방금 결과가 나왔고, 프로토타입이 실제로 작동했습니다.09:55

네, 그러니까 저건 확실히 평탄하고 지루하네요. 신나고 숨 막힐 듯한 목소리로 한번 해볼까요.10:02

결과가 나왔고 프로토타입이 실제로 작동하는 것을 확인했습니다.10:07

네, 그리고 지금은 긴장한 듯 거의 속삭이는 것 같아요. 결과가 나왔고...10:11

결과가 나왔고, 프로토타입이 실제로 작동하는 것을 확인했습니다.10:15

자, 세 가지 모두 확실히 매우 다르게 들리는 것을 들어보시면 알 수 있습니다. 그 단어가 완전히 똑같음에도 불구하고요.10:18

이 기능이 오디오 길이에 영향을 미치는 점이 마음에 드는 부분 중 하나입니다.10:24

일부 오픈 모델의 경우, 음성을 생성할 때 문장 길이가 일정하게 유지되려고 하는 어려움이 있습니다.10:31

요청하시는 스타일도 반영하고, 동시에 특정 시간 길이를 맞추려고 노력하는 방식이에요.10:38

여기서는 기본적으로 발화 스타일대로 시간 길이가 결정되도록 하는 것이죠.10:43

네, 여기서는 또 다른 방법이 있습니다. 원하시는 대본에 직접 이 인라인 태그들을 넣을 수 있습니다.10:49

실제로 말하게 하고 싶으신 부분에 이렇게 인라인 태그를 넣어주시면 됩니다.10:54

그래서 이런 것들이 속삭임이나 웃음, 한숨 같은 것들입니다.10:58

잠깐만요.11:02

복도에서 뭐 들리셨어요? 됐어요. 그냥 고양이였네요.11:03

얼굴을 보셨어야 했는데. 알겠습니다.11:07

그러니까 인라인 태그를 통해 그 소리를 들으실 수 있습니다. 분명히 그 기능이 거기에 있는 이유가...11:09

...속삭임이나 한숨, 웃음소리 같은 경우에 사용하기 위해서입니다.11:14

웃음소리도 스타일 지침에 따라 달라질 수 있습니다. 네, 다음으로 넘어가겠습니다. 음성 디자인에 대한 전체적인 아이디어입니다.11:17

이제 저희는 단순히... 전달하는 것이 아니라...11:23

대본과 함께 말하는 방식에 대한 지침을 제공하고, 실제로 목소리에 대한 설명을 하고 있습니다.11:30

이 목소리는 앞으로 모든 부분에 적용될 것입니다.11:37

말하는 방식에 대한 다른 설명도 제공하더라도요, 이렇게 진행되는 거죠. 바로 여기가11:43

사람의 출신지나 원하는 억양 같은 것들을 넣을 수 있는 곳입니다.11:50

여기서 나이 같은 정보들을 찾아보실 수 있습니다. 여기 캐릭터 하나를 넣어두었습니다.11:55

천문학자라고 이름 붙였는데, 60대 후반이고 부드러운 영국식 억양을 가지고 있습니다. 잠시 살펴보세요.11:59

토성의 반지들입니다.12:06

그 희미한 빛은 인류가 지구를 걷기 훨씬 이전부터 그 근원을 가지고 있었어요.12:07

그래서 보실 수 있는데, 12:14

거기서 다비드 애튼버러(David Attenborough)의 목소리와 비슷한 느낌이 좀 있어요. 하지만 실제로는 그렇지 않고요.12:16

그분을 직접적으로 언급하진 않지만, 목소리가 60대 후반보다는 훨씬 젊어 들리는 것 같아요. 여러분이 시도해 보시고 어떤 생각인지 댓글로 알려주세요.12:23

자, 이제 재미있는 기능으로 넘어가 보겠습니다.12:28

기본적으로 여러 명의 화자가 등장하는 대화들을 여기에 구현할 수 있습니다. 그래서 여기서는 두 개의 목소리로 하나의 API 호출을 사용하고 있습니다.12:33

각 차례마다 스타일을 설정할 수 있다는 아이디어가 있습니다. 즉, 각…12:40

캐릭터가 여기서 뭐라고 말하는지 보실 수 있습니다. 누가 말하는지 정의할 수도 있지만,12:46

각 대사 줄마다 스타일을 정의할 수도 있습니다.12:51

쇼에 다시 오신 것을 환영합니다.13:01

오늘, 새로운 제미니 음성들을 테스트해 보겠습니다. 초대해주셔서 감사합니다. 이전 버전보다 대화의 흐름이 훨씬 자연스럽네요.13:06

실시간 상담원에게도 충분할까요? 많은 사용 사례에 대해서는 저는 그렇게 생각합니다.13:13

많은 사용 사례 말이죠. 그건 확실히 의미 있는 일입니다.13:18

네, 들어보시면 알겠지만 노트 LM나 팟캐스트 같은 느낌이 많이 납니다.13:21

저에게는 잘 모르겠습니다. 아마 제가 이 소리에 너무 익숙해서 그런 걸 수도 있고요.13:28

지금 목소리들은 좀 가짜처럼 들리긴 하지만, 멋진 점은 다른 목소리로 바꿔서 사용할 수 있다는 거예요.13:33

직접 만들 수도 있고, 진행하면서 다양한 시도를 해볼 수 있죠. 마지막으로 음성 복제 기능이 있습니다.13:38

여기서 음성 복제는 코드로만 할 수 있습니다, 그렇죠? 여기 코드를 보시면,13:43

기본적으로 레퍼런스 오디오를 녹음할 수 있는 HTML 인터페이스를 만드는 것입니다.13:49

그래서 오디오가 어떻게 들리길 원하시는지 선택하실 수 있습니다.13:56

그리고 두 번째는, 동의 음성을 녹음할 수 있는 곳입니다. 저는 구글이 이 부분에서 매우 어려운 상황에 놓여 있다고 생각합니다.13:59

저희는 그들의 TTA 시스템이 꽤 여러 해 동안 이 작업을 수행할 수 있었다는 것을 알고 있습니다.14:05

이것은 'Soundstorm'이라는 논문으로 거슬러 올라갑니다. 당시에는 정말 놀라웠습니다.14:12

벌써 3년이 넘은 일이네요. 그런데도 이미 그때는 목소리를 거의 완벽하게 복제할 수 있었어요.14:17

그때 실제로 이 기술의 시연을 받았었는데, 정말 놀라울 정도로 누군가의 목소리를 얼마나 잘 흉내 내는지 알 수 있었습니다.14:23

그 당시에는 그랬습니다. 지금으로 와서 보면, 많은 오픈 모델들이 이미 이 부분을 해결해 놓았어요.14:29

그런데 구글이 실제로 사람들에게 이것을 공개한 것은 이번이 처음인 것 같습니다.14:35

그리고 구글이 이 기술의 파급 효과에 대해 매우 신중하게 생각하고 있다는 것은 분명해 보입니다. 그리고 사람들이14:39

이런 기술을 악한 목적으로 사용할 수도 있다는 점을 인지하고 있습니다.14:45

하지만 솔직히 말씀드리면, 어떤 면에서는14:49

구글 버전이 조금 단순화된 것인지 궁금하네요.14:51

제가 생각하기에는, 일부 공개 버전만큼 좋지 않은 것 같아요.14:57

기본적으로 이 HTML 인터페이스를 이용해서 레퍼런스 오디오를 녹음하실 수 있습니다.15:01

따라서 이것이 복제할 오디오이고, 동의 음성으로 녹음하실 수 있습니다.15:08

그리고 이것은 정말 중요한 부분입니다.15:12

기본적으로 구글에게 당신의 목소리를 기반으로 합성음을 만들 수 있는 권한을 부여하는 것입니다. 그리고 저희가 실제로 들어보면, 제가 여기에서 녹음했던 원본 부분을 들려드리겠습니다.15:15

제가 여기에서 녹음했던 원본 부분을 들려드리겠습니다.15:21

우주는 우리 안에 있습니다. 우리는 별의 물질로 만들어졌고, 우주가 자신을 인식하는 방법입니다.15:26

네, 자, 이제 제가 녹음했던 원래 버전을 한번 들어보고, 제 목소리의 복제본을 들어보겠습니다.15:33

이것은 완료되었고, 제 목소리 30초 분량의 샘플을 이용해서 생성되었습니다. 이제 여러분에게 맡기겠습니다.15:40

어떻게 생각하시는지 결정해주세요. 저는 상당히 다르다고 생각합니다. 아마 더 긴 참조 오디오를 업로드했더라면 어땠을까 싶네요.15:46

제 목소리의 더 좋은 버전을 얻을 수 있을 것 같아요. 제가 지금까지 본 모델 중에서는 가장 좋다고 생각합니다.15:51

이 오픈 와이즈는 제가 만들었던 텍스트 음성 변환 서비스였고, 출시했을 때 관련 영상을 따로 만들 정도였습니다. 아직도 그 점이 남아있습니다.15:56

그 모델이 목소리 복제하는 능력이 정말 뛰어나다고 생각합니다. 어느 면에서는 제가 말씀드리고 싶어요.16:02

과거에는 그게 강점이었습니다만, 설명에 있어서는 조금 약했을 수도 있습니다.16:08

목소리를 만들 때의 강점이라고 할 수 있고, 제미니는 거기서 그 강점을 가지고 있습니다. 이제 마무리 짓자면,16:13

확실히 확인해볼 가치가 있다고 말씀드리고 싶습니다. 요즘은 정말 쉽고 기본적인...16:18

예전에 정말 어려웠던 음성 관련 작업들이 이제는 매우 간단한 API로 제공되네요.16:24

전화해서 생각해보니, 아마도 자체 TTS 시스템을 실행할 하드웨어가 없는 분들에게는 유용할 것 같습니다.16:31

로컬에서 뭔가 해보시는 게 API를 호출해서 사용하시기에 상당히 괜찮을 것 같습니다.16:37

정말 멋진 운율과 사용자 지정 스타일까지 갖춘 고품질의 목소리를 얻으실 수 있을 거예요.16:43

직접 다 정의하실 수 있도록요. 하여튼, 댓글로 알려주세요. TTS 모델이 계속 나오고 있다는 건 알고 있습니다.16:49

저도 꾸준히 따라가려고 노력하지만, 놓친 것도 있을 거예요. 혹시 추천해주실 만한 게 있다면 알려주세요.16:54

제가 다뤄보면 좋을 만한 내용이 있다면 댓글로 알려주세요. 여러분의 의견을 듣고 싶습니다.16:59

자, 그럼 언제나처럼 영상이 도움이 되셨다면 좋아요와 구독 부탁드리고요, 다음 영상에서 또 만나요. 안녕히 계세요.17:03

AI Summary

이번 데모는 구글의 제미니 3.8 TTS 모델을 활용한 음성 에이전트 구축 방법을 소개하고, 다양한 기능을 직접 사용해 볼 수 있도록 안내하는 내용입니다. 다국어 지원, 가격 및 성능 비교, AI 스튜디오와 콜라브 활용법 등을 설명하며, 스타일 컨트롤과 인라인 태그를 통해 목소리 디자인을 세밀하게 조정할 수 있습니다. 특히 음성 복제 기능은 사용자가 자신의 목소리를 기반으로 합성음을 만들 수 있도록 지원하지만, 악용 가능성에 대한 우려도 제기되었습니다. 전반적으로 TTS 기술 발전으로 인해 과거에는 어려웠던 작업들이 API를 통해 간편해졌으며, 사용자들의 의견을 적극적으로 반영하여 모델 개선에 힘쓸 예정입니다.

Key Highlights

  • •Gemini 3.8 TTS 모델을 활용한 음성 에이전트 구축 방법 소개
  • •다국어 지원 및 스타일 컨트롤과 같은 다양한 기능 시연
  • •음성 복제 기능을 통해 사용자가 자신의 목소리를 기반으로 합성음을 만들 수 있음
  • •구글의 음성 복제 기술 공개와 관련된 악용 가능성에 대한 우려 제기
  • •TTS 기술 발전으로 API를 통한 간편한 작업 환경 제공

Related Videos