일 | 월 | 화 | 수 | 목 | 금 | 토 |
---|---|---|---|---|---|---|
1 | 2 | 3 | 4 | 5 | 6 | 7 |
8 | 9 | 10 | 11 | 12 | 13 | 14 |
15 | 16 | 17 | 18 | 19 | 20 | 21 |
22 | 23 | 24 | 25 | 26 | 27 | 28 |
29 | 30 |
- javascript
- 일론 머스크
- LORA
- 아두이노
- ControlNet
- 우분투
- ubuntu
- 인공지능
- 이미지 편집
- 멀티모달
- 오픈AI
- AI 기술
- 뉴럴링크
- 가상환경
- 오블완
- OpenAI
- 티스토리챌린지
- 서보모터
- ChatGPT
- PYTHON
- 딥마인드
- TRANSFORMER
- 생성형 AI
- 메타
- AI
- 시간적 일관성
- tts
- 확산 모델
- 트랜스포머
- LLM
- Today
- Total
목록2024/09/23 (2)
AI 탐구노트
최근에 새로 소개한 텍스트-음성 변환(TTS) 모델인 'Fish-Speech'를 로컬에서 테스트 해 보려고 합니다. 억양, 리듬이 적용되어 자연스런 음성을 만들 수 있다고 하기 때문입니다. 예전에 '책 읽어주는 부모' 였던가...AI로 부모의 목소리를 복제해서 아이에게 텍스트로 된 동화 책을 읽어주는 서비스가 있었던 걸로 압니다. 실제 그동안 다양한 음성복제(Voice Cloning) 모델이 나왔고 개중에는 상당히 괜찮은 것들도 있었죠.하지만, 시간도 장비도 없어서 해 볼 엄두를 못 내고 있었는데 이번에 시간이 좀 나서 해보려고 합니다. 환경구성저는 PC에서 우분투를 사용하고 있어서 바로 Conda를 이용해 환경 구성을 해 봤습니다. 환경 구성은 Fish-Speech의 깃헙에서 Local Infer..
FishAudio라는 업체에서 개발한 다국어를 지원하는 텍스트 음성변환(TTS) 모델입니다. 최신 버전인 Fish Speech V1.4의 경우, 다국어로 구성된 70만 시간 분량의 오디오 데이터를 사용해 훈련되었으며 초저지연 실시간 음성합성(TTS)과 음성 복제 기능을 제공합니다. 70만 시간 가운데 30만 시간이 영어, 중국어라고 하며 한국어는 2만 시간 정도가 포함되어 있다고 합니다. 미세조정에는 8GB, 추론에는 4GB 수준의 VRAM만 있으면 된다고 하는데, 4GB면 사양이 좀 낮은 GPU를 가지고도 음성을 만들고 테스트 하는데는 전혀 문제가 없다는 얘기가 됩니다. (CUDA를 사용해 추론 속도를 높이는 경우라고 생각하면 될 듯...) 데모로 공개되어 있는 FishAudio 사이트 에는 이미 만..