Retrieval-based-Voice-Conve.../Changelog_CN.md

3.4 KiB
Raw Blame History

20230513更新

  • 清除一键包内部老版本runtime内残留的infer_pack和uvr5_pack
  • 修复训练集预处理伪多进程的bug
  • 增加harvest识别音高可选通过中值滤波削弱哑音现象可调整中值滤波半径
  • 导出音频增加后处理重采样
  • 训练n_cpu进程数从"仅调整f0提取"改为"调整数据预处理和f0提取"
  • 自动检测logs文件夹下的index路径提供下拉列表功能
  • tab页增加"常见问题解答"也可参考github-rvc-wiki
  • 相同路径的输入音频推理增加了音高缓存用途使用harvest音高提取整个pipeline会经历漫长且重复的音高提取过程如果不使用缓存实验不同音色、索引、音高中值滤波半径参数的用户在第一次测试后的等待结果会非常痛苦

20230514更新

  • 音量包络对齐输入混合可以缓解“输入静音输出小幅度噪声”的问题。如果输入音频背景底噪大则不建议开启默认不开启值为1可视为不开启
  • 支持按照指定频率保存提取的小模型假如你想尝试不同epoch下的推理效果但是不想保存所有大checkpoint并且每次都要ckpt手工处理提取小模型这项功能会非常实用
  • 通过设置环境变量解决服务端开了系统全局代理导致浏览器连接错误的问题
  • 支持v2预训练模型目前只公开了40k版本进行测试另外2个采样率还没有训练完全
  • 推理前限制超过1的过大音量
  • 微调数据预处理参数

待完成:

  • 推理音量预处理归一化
  • 增加crepe音高提取支持

20230409更新

  • 修正训练参数提升显卡平均利用率A100最高从25%提升至90%左右V100:50%->90%左右2060S:60%->85%左右P40:25%->95%左右,训练速度显著提升
  • 修正参数总batch_size改为每张卡的batch_size
  • 修正total_epoch最大限制100解锁至1000默认10提升至默认20
  • 修复ckpt提取识别是否带音高错误导致推理异常的问题
  • 修复分布式训练每个rank都保存一次ckpt的问题
  • 特征提取进行nan特征过滤
  • 修复静音输入输出随机辅音or噪声的问题老版模型需要重做训练集重训

20230416更新

  • 新增本地实时变声迷你GUI双击go-realtime-gui.bat启动
  • 训练推理均对<50Hz的频段进行滤波过滤
  • 训练推理音高提取pyworld最低音高从默认80下降至50,50-80hz间的男声低音不会哑
  • WebUI支持根据系统区域变更语言现支持en_USja_JPzh_CNzh_HKzh_SGzh_TW不支持的默认en_US
  • 修正部分显卡识别例如V100-16G识别失败P4识别失败

20230428更新

  • 升级faiss索引设置速度更快质量更高
  • 取消total_npy依赖后续分享模型不再需要填写total_npy
  • 解锁16系限制。4G显存GPU给到4G的推理设置。
  • 修复部分音频格式下UVR5人声伴奏分离的bug
  • 实时变声迷你gui增加对非40k与不懈怠音高模型的支持

后续计划:

功能:

  • 增加选项:每次epoch保存的小模型均进行提取
  • 增加选项:推理额外导出mp3至填写的路径批量推理
  • 支持多人训练选项卡至多4人

底模:

  • 收集呼吸wav加入训练集修正呼吸变声电音的问题
  • 我们正在训练增加了歌声训练集的底模,未来会公开
  • 升级鉴别器尝试MRD
  • 升级自监督特征结构