最近好多人问我声音克隆到底怎么弄,说自己也想克隆一个声音玩玩,但一看那些教程就头大。其实真没那么复杂,我前阵子用声音克隆大师试了一下,前后也就花了十来分钟,三步就搞定了。今天就把我自己的操作过程写出来,尽量说人话,不整那些虚的。不管你是想做短视频配音,还是想留个声音当纪念,跟着走一遍基本都能学会。

很多人上来就急着打开软件,结果录出来的声音全是杂音,后面怎么调都不像。我一开始也踩过这个坑,在客厅录的,楼下装修电钻声全进去了,白折腾半小时。
正确的做法是先找个安静的小房间,关上门窗,手机开飞行模式。然后用手机自带的录音机就行,不用买什么专业麦克风。录的内容也有讲究,声音克隆大师一般会给你一段参考文本,照着念就行,大概三到五分钟的量。语速正常一点,别刻意装播音腔,平时怎么说话就怎么念。我念的时候还打了个磕巴,其实没关系,后期软件会自动处理掉一些瑕疵。
录完记得回放听一遍,确认没有明显的电流声或者爆音。如果有,重录比后面修更省事。这一步看着简单,但真的决定了最后克隆出来的声音像不像你。

打开声音克隆大师,找到声音克隆或者音色训练的入口,把你刚才录好的音频传上去。有些版本会要求你填一个名字,随便起个就行,比如“我的声音一号”。
然后就是等。这个等待时间跟你录的长度和电脑配置有关系,我那次大概等了七八分钟。期间软件会自己分析你的音色、语调、节奏这些特征。说实话我也看不懂它后台在干嘛,反正进度条走完就行了。
这里有个小提醒:如果你用的是手机版,别切到后台去刷视频,容易中断。我朋友就是切出去回了个微信,结果训练失败,又重来一遍。另外,声音克隆大师对干音的质量还是有点要求的,太短或者太嘈杂的素材,出来的效果会明显差一截。

训练完成后,就可以进入生成环节了。你输入任意文字,软件就会用你刚才克隆的音色读出来。我第一次试的时候输入了一句“今天天气不错”,播放出来那一刻还真有点恍惚,确实像自己声音,但又有那么一点点怪。
别急,大部分工具都提供了微调选项。声音克隆大师里面可以调语速、音调、情感强度这些参数。我建议先默认跑一遍,然后根据感觉稍微动一动。比如把语速降一点点,听起来会更自然。如果觉得太机械,就把情感强度拉高一些。
还有个小技巧,生成的句子不要太长,短句效果通常更好。你要是拿它来读长篇文章,中间最好手动断句。我试过直接丢一大段进去,结果中间换气的地方怪怪的,后来改成一句一句生成再拼接,顺耳多了。
最后导出的时候选个常用格式就行,mp3或者wav都可以。到这一步,你的声音克隆就算完成了。整个过程说白了就是录、传、调三步,声音克隆大师把中间那些复杂的算法都藏起来了,咱们普通人只管用就行。
当然,克隆出来的声音别拿去干坏事,这个就不多说了。自己玩玩、做做视频配音、给家里人留个声音纪念,都挺有意思的。你要是还没试过,找个周末下午捣鼓一下,比想象中简单。