AIGC-声音
一、定义
音色要求: - WAV/MP3,3-10秒,≤20MB - 44.1kHz/16-bit单声道 - 干声(无混响、无 BGM、无环境噪音),信噪比≥45dB - 峰值≤-1dBTP,集成响度 - 14 LUFS,避免削波失真 - 清晰无含混,每个音节可被 AI 识别为独立音素,语速控制在 120-180 词 / 分钟
二、核心内容
(一)台词
你好,很高兴与你分享这些想法,希望能为你带来启发和温暖,让我们一起探索更多可能性。
(二)音色生成
音色生成公式
角色身份(年龄/性别+核心身份)+情感(情绪倾向+人格特质)+声音特质(音高/音质特殊细节/语调)+语速(基础语速+功能性停顿)
1. 角色身份(你是谁)
写清楚 3-5 个关键信息即可: - 年龄段:比如 16-22岁 / 20多岁 / 30+ / 中年 - 性别气质:偏女性/男性/少女感/成熟感(不需要太严谨) - 角色设定:学生/上班族/主播/恋爱脑/冷淡人设/江湖气等 - 人物氛围:柔和 / 清冷 / 甜酷 / 烟火气 / 有距离感 -(可选)形象关键词:比如“甜美”“干练”“慵懒”“张扬”
情绪表达(你在什么状态下说) 把“情绪”和“说话方式”一起写: - 情绪基底:温柔、期待、撒娇、委屈、克制、冷幽默、坚定、心虚等 - 情绪强度:轻微/明显/带点/很强烈 - 语气倾向:温柔娇嗔 / 轻声安抚 / 兴奋上扬 / 冷淡压低 -(可选)说话目的:安慰、邀约、质问、吐槽、旁白推进等
声音特质(声音长什么样) 是“听起来像谁”的核心,建议写到音色与表现: - 音色描述:柔和清甜 / 浑厚有底气 / 灵动带气声 / 低沉磁性 / 轻飘 - 声线质感:清亮 / 沙沙感 / 有颗粒感 / 气声明显(看你要的风格) - 发声风格:更“轻”还是更“厚”;更“松弛”还是更“有劲” - 口音/地方特色:河南、陕西、川渝、台湾、闽南等 -(可选)表达方式:带笑/带哭腔感/带神秘感/有舞台感
语速节奏(怎么把话说出来) 不仅是“快慢”,还包括“节拍怎么走” - 基础语速:语速适中 / 中等偏慢 / 语速快还是慢 - 停顿方式:多停顿 / 少停顿 / 句末收得干净 / 断句明显 - 重音安排:强调某些词(比如“你”“现在”“别”那种重点) - 语调走向:微微上扬 / 拉长尾音 / 语调更平稳 / 有层次起伏 -(可选)节奏感:更有戏剧张力 / 更像口播推进 / 更像旁白沉浸
或者直接让ai生成
你是一个AI提示词生成大师,善于将角色的音色转换为AI音色平台能识别的AI指令,请将《舌尖上的中国》配音老师的音色转换为AI指令,我将用你给出的指令在AI平台生成这个音色。指令要含以下内容:角色身份(年龄/性别+核心身份)+情感(情绪倾向+人格特质)+声音特质(音高/音质特殊细节/语调)+语速(基础语速+功能性停顿)
生成的:
角色身份:中年男性,资深纪录片配音师,文化底蕴深厚的人文解说者情感:情绪沉稳庄重、温和真挚,人格特质儒雅内敛、富有共情力,自带对美食与人文的敬畏感
声音特质:中音区音高,音质醇厚饱满、温润磁性,胸腔共鸣明显,语调平缓舒展、庄重大气,无尖锐起伏,咬字清晰厚重,自带叙事感与岁月沉淀感
语速:基础语速偏舒缓沉稳,句间有自然留白式功能性停顿,段落间停顿稍长,节奏从容不迫。贴合纪录片叙事节奉
短句版:
中年男性资深纪录片配音,情绪沉稳庄重、儒雅内敛有共情力;中音区,音质醇厚磁性、胸腔共鸣强,语调平缓舒展、咬字厚重;语速舒缓,句间有自然留白停顿,叙事感强
(四)Minimax
- Minimax-speech-2.8-hd
- 网址: https://www.minimaxi.com/audio/text-to-speech
- 每个月有:1w点,大概12分钟到免费额度
- 位置:音色设计
(三)剪映
手机app中的,文本朗读 > AI音色 > 创建音色