일 | 월 | 화 | 수 | 목 | 금 | 토 |
---|---|---|---|---|---|---|
1 | 2 | 3 | 4 | 5 | 6 | 7 |
8 | 9 | 10 | 11 | 12 | 13 | 14 |
15 | 16 | 17 | 18 | 19 | 20 | 21 |
22 | 23 | 24 | 25 | 26 | 27 | 28 |
29 | 30 | 31 |
- 오픈AI
- 티스토리챌린지
- PYTHON
- 이미지 편집
- 인공지능
- AI 기술
- 오블완
- ubuntu
- 일론 머스크
- ControlNet
- 멀티모달
- tts
- ChatGPT
- 시간적 일관성
- LLM
- 가상환경
- LORA
- TRANSFORMER
- 아두이노
- 딥러닝
- 트랜스포머
- AI
- OpenAI
- 생성형 AI
- 딥마인드
- 메타
- 확산 모델
- 서보모터
- 뉴럴링크
- 우분투
- Today
- Total
목록tts (5)
AI 탐구노트
1.OuteTTS란?OuteTTS는 다국어를 지원하는 텍스트-음성변환(TTS) 모델입니다. 현재 v0.2 버전이 출시되었는데 v0.1이 소개된 지 채 2주 정도 밖에 지나지 않은 것 같은데 발전 속도가 상당히 빠른 편입니다. 제일 주목되는 부분은 음성복제, 다국어지원, 엣지 지원 정도가 될 것 같네요. 2.OuteTTS v0.2 - 500M이번에 새롭게 공개된 QuteTTS 버전으로 세부 특징은 다음과 같습니다. 다국어 지원 : 영어, 중국어, 한국어 및 일본어llama.cpp를 사용한 크로스 플랫폼 추론제로샷 음성 복제향상된 정확도 : 광범위한 데이터셋 학습을 통해 자연스러운 음성 합성개선된 음성 복제 기능확장된 어휘 : 50억 개의 오디오 토큰으로 훈련됨Qwen 2.5 0.5B LLM 백본적은 리소..
F5-TTS는 빠르고 자연스러운 음성을 만들어 내는 텍스트-음성 변환 (TTS) 모델입니다. 이를 위해 흐름 매칭을 기반으로 빠르고 정확한 비자기회귀 방식을 적용하고 있습니다. 기존의 TTS(텍스트-음성 변환) 모델들은 텍스트와 음성을 연결하기 위해 발음의 길이(지속 시간)를 예측하거나, 음소(소리의 기본 단위)를 하나하나 정렬하는 복잡한 과정이 필요했고, 이런 과정들은 모델을 느리게 만들고, 오류가 발생할 가능성도 높였습니다. F5-TTS 이전에 공개된 E2-TTS 모델의 경우, 복잡한 구조를 없애고 단순한 설계를 적용했지만, 텍스트와 음성을 정확하게 맞추지 못해 음성 품질이 떨어지는 문제가 있었습니다. F5-TTS는 ConvNeXt라는 기술을 사용해 텍스트와 음성을 더 쉽게 맞추고, 새로운 샘플링..
Voice-Pro는 AI 기반 음성 인식, 번역, 자막 생성, 보컬 제거 등을 통합 제공하는 그라디오 웹 UI 솔루션입니다. Voice-Pro가 제공하는 주요 기능은 다음과 같습니다. YouTube 동영상 다운로드 및 오디오 변환보컬 제거 및 잡음 제거다국어 자막 생성 및 번역 (100개 이상의 언어 지원)음성 합성(TTS) 기능으로 다국어 음성 생성실시간 음성 인식 및 번역배치 처리를 통해 대용량 파일 처리사용자 맞춤형 TTS 속도, 음량, 음정 조절MIT 라이선스 위에 소개한 기능들을 보면 오디오, 특히 음성 오디오 처리에서 꼭 필요하다 싶은 것들을 다 나열하고 있는 것 같습니다. 어떻게 이런 기능들을 다 구현했을까 의아했는데 뒤에 설명된 내용을 보고 고개를 끄덕일 수 있었습니다. 이미 있는..
최근에 새로 소개한 텍스트-음성 변환(TTS) 모델인 'Fish-Speech'를 로컬에서 테스트 해 보려고 합니다. 억양, 리듬이 적용되어 자연스런 음성을 만들 수 있다고 하기 때문입니다. 예전에 '책 읽어주는 부모' 였던가...AI로 부모의 목소리를 복제해서 아이에게 텍스트로 된 동화 책을 읽어주는 서비스가 있었던 걸로 압니다. 실제 그동안 다양한 음성복제(Voice Cloning) 모델이 나왔고 개중에는 상당히 괜찮은 것들도 있었죠.하지만, 시간도 장비도 없어서 해 볼 엄두를 못 내고 있었는데 이번에 시간이 좀 나서 해보려고 합니다. 환경구성저는 PC에서 우분투를 사용하고 있어서 바로 Conda를 이용해 환경 구성을 해 봤습니다. 환경 구성은 Fish-Speech의 깃헙에서 Local Infer..
FishAudio라는 업체에서 개발한 다국어를 지원하는 텍스트 음성변환(TTS) 모델입니다. 최신 버전인 Fish Speech V1.4의 경우, 다국어로 구성된 70만 시간 분량의 오디오 데이터를 사용해 훈련되었으며 초저지연 실시간 음성합성(TTS)과 음성 복제 기능을 제공합니다. 70만 시간 가운데 30만 시간이 영어, 중국어라고 하며 한국어는 2만 시간 정도가 포함되어 있다고 합니다. 미세조정에는 8GB, 추론에는 4GB 수준의 VRAM만 있으면 된다고 하는데, 4GB면 사양이 좀 낮은 GPU를 가지고도 음성을 만들고 테스트 하는데는 전혀 문제가 없다는 얘기가 됩니다. (CUDA를 사용해 추론 속도를 높이는 경우라고 생각하면 될 듯...) 데모로 공개되어 있는 FishAudio 사이트 에는 이미 만..