首页 > 教程攻略 > ai资讯 >讯飞智作声音复刻录音开头话术录制要求

讯飞智作声音复刻录音开头话术录制要求

来源:互联网 时间:2026-08-26 08:40:32

录音开头话术需含声母、韵母、声调、轻声词和儿化音;禁用专业术语;手机直录禁用降噪,USB麦需Audacity降噪后导出16/48kHz WA V;发声须坐直、语速3~4字/秒、停顿2秒、重复3遍。

用讯飞智作做声音复刻时,录音开头那几秒的话术内容和录制质量,直接决定AI能否准确提取你的声纹特征——录错一句,模型就可能把“啊”听成“呃”,把降调当成升调,后续所有配音都会失真。

话术内容必须包含的三类语音元素

第一句必须是完整、自然的普通话短句,例如:“今天天气不错,我们开始录制声音。”

【不能只念单字、拼音或数字】

这句话要同时覆盖:声母(如“天”“不”)、韵母(如“气”“始”)、声调(四声全有)、轻声词(如“我们”里的“们”)和常见儿化音(如“一会儿”)。缺一类,AI建模时就会在对应发音环节掉精度。

避免使用专业术语、英文缩写、生僻字。讯飞智作当前版本对“GDP”“iOS”“熵”等词的音素切分仍不稳定,容易导致声学特征提取断裂。

录音环境与设备实操要点

方法一:手机自带录音App直录
打开手机「备忘录」或「语音备忘录」,选“高质量”模式(iOS需开启“高保真录音”,安卓部分品牌需进设置→录音质量→选“48kHz/24bit”)。

【禁用降噪模式】

——讯飞智作的声纹建模依赖原始呼吸声、轻微气流声等副特征,主动降噪会抹掉这些关键线索。

方法二:USB电容麦+Audacity精修
首先录制30秒的环境底噪(其中空录5秒),接着录制话术。将录制好的音频导入Audacity后,通过“效果→噪声抑制”功能,仅对底噪进行处理,同时保留人声本底的动态。最后将处理后的音频导出为WA V格式,采样率需设置为16kHz或48kHz,若设置为其他值,上传后系统会报错并拒绝识别。

真人发声动作规范

首先,要坐直身体,微微收起下巴,让口腔保持自然张开的状态,切记不要刻意去放大口型哦。
其次,语速要控制在每秒3~4个字,比平时说话慢15%左右,这样才能确保每个字的韵尾,像“好”字的“o”、“去”字的“u”等,都能充分地释放出来。
然后,说完话后要停顿2秒再结束录音,这是为了给AI留下一段静音段,作为声学边界的参考呢。
最后,同一句话要重复录制3遍,系统会自动进行比对,然后选取最优的片段来建模。要是这3遍中有一遍出现了明显的吞音、破音或者突然咳嗽的情况,那么这一次的整条录音就会被弃用哦。