일 | 월 | 화 | 수 | 목 | 금 | 토 |
---|---|---|---|---|---|---|
1 | 2 | 3 | 4 | 5 | 6 | 7 |
8 | 9 | 10 | 11 | 12 | 13 | 14 |
15 | 16 | 17 | 18 | 19 | 20 | 21 |
22 | 23 | 24 | 25 | 26 | 27 | 28 |
29 | 30 | 31 |
- 일론 머스크
- 생성형 AI
- 딥마인드
- 오블완
- 가상환경
- 이미지 편집
- 뉴럴링크
- PYTHON
- AI 기술
- tts
- ChatGPT
- 트랜스포머
- 확산 모델
- 우분투
- 서보모터
- 인공지능
- 오픈AI
- 티스토리챌린지
- TRANSFORMER
- 멀티모달
- OpenAI
- AI
- ControlNet
- javascript
- ubuntu
- LLM
- 아두이노
- 시간적 일관성
- LORA
- 메타
- Today
- Total
목록음성합성 (3)
AI 탐구노트
1.OuteTTS란?OuteTTS는 다국어를 지원하는 텍스트-음성변환(TTS) 모델입니다. 현재 v0.2 버전이 출시되었는데 v0.1이 소개된 지 채 2주 정도 밖에 지나지 않은 것 같은데 발전 속도가 상당히 빠른 편입니다. 제일 주목되는 부분은 음성복제, 다국어지원, 엣지 지원 정도가 될 것 같네요. 2.OuteTTS v0.2 - 500M이번에 새롭게 공개된 QuteTTS 버전으로 세부 특징은 다음과 같습니다. 다국어 지원 : 영어, 중국어, 한국어 및 일본어llama.cpp를 사용한 크로스 플랫폼 추론제로샷 음성 복제향상된 정확도 : 광범위한 데이터셋 학습을 통해 자연스러운 음성 합성개선된 음성 복제 기능확장된 어휘 : 50억 개의 오디오 토큰으로 훈련됨Qwen 2.5 0.5B LLM 백본적은 리소..
최근에 새로 소개한 텍스트-음성 변환(TTS) 모델인 'Fish-Speech'를 로컬에서 테스트 해 보려고 합니다. 억양, 리듬이 적용되어 자연스런 음성을 만들 수 있다고 하기 때문입니다. 예전에 '책 읽어주는 부모' 였던가...AI로 부모의 목소리를 복제해서 아이에게 텍스트로 된 동화 책을 읽어주는 서비스가 있었던 걸로 압니다. 실제 그동안 다양한 음성복제(Voice Cloning) 모델이 나왔고 개중에는 상당히 괜찮은 것들도 있었죠.하지만, 시간도 장비도 없어서 해 볼 엄두를 못 내고 있었는데 이번에 시간이 좀 나서 해보려고 합니다. 환경구성저는 PC에서 우분투를 사용하고 있어서 바로 Conda를 이용해 환경 구성을 해 봤습니다. 환경 구성은 Fish-Speech의 깃헙에서 Local Infer..
FishAudio라는 업체에서 개발한 다국어를 지원하는 텍스트 음성변환(TTS) 모델입니다. 최신 버전인 Fish Speech V1.4의 경우, 다국어로 구성된 70만 시간 분량의 오디오 데이터를 사용해 훈련되었으며 초저지연 실시간 음성합성(TTS)과 음성 복제 기능을 제공합니다. 70만 시간 가운데 30만 시간이 영어, 중국어라고 하며 한국어는 2만 시간 정도가 포함되어 있다고 합니다. 미세조정에는 8GB, 추론에는 4GB 수준의 VRAM만 있으면 된다고 하는데, 4GB면 사양이 좀 낮은 GPU를 가지고도 음성을 만들고 테스트 하는데는 전혀 문제가 없다는 얘기가 됩니다. (CUDA를 사용해 추론 속도를 높이는 경우라고 생각하면 될 듯...) 데모로 공개되어 있는 FishAudio 사이트 에는 이미 만..