核心技术特性零样本克隆仅需5秒参考音频,即可复刻目标音色,微调模式下仅需10分钟人声数据,音色相似度可达99%。支持中英文混合语音克隆,针对中文多音字、生僻字做了专门优化,避免出现发音错误。可独立调整语音情感、语速,修改参数不会破坏克隆出的目标音色,生成语音自然度MOS值可达4.2,接近真人录音水平。硬件适配要求最低仅需2GB显存即可运行基础克隆功能,6-8GB显存的普通显卡可流畅生成48...
? 项目亮点? 高质量语音生成生成接近真人发音的语音支持多种语言和口音能够处理情感表达和语调变化?️ 先进的模型架构基于 Transformer 的端到端架构结合了最新的语音合成技术支持长文本合成?️ 功能丰富语音克隆:通过少量样本克隆特定声音多说话人支持背景音乐生成情感控制? 技术特点? 模型结构使用类似 GPT 的自回归架构软件结合声学模型和声码器支持条件生成(说话人、情感等)? 训练数据使用...
N卡也可以运行
它能在 5 秒内克隆你的声音并生成任意语音内容,支持中文普通话拟声,并且在多个中文数据集进行了测试,支持在 Windows、Linux、Mac 操作系统使用,基于 B/S 架构交互,简单收集声音,生成拟声。注:win10以上系统可用,显卡或电脑配置不高的不要下载