SoulX-Podcast亲测体验:10分钟做出带方言味的多说话人播客

发布时间:2026/8/18 16:57:43
SoulX-Podcast亲测体验:10分钟做出带方言味的多说话人播客 SoulX-Podcast亲测体验10分钟做出带方言味的多说话人播客【免费下载链接】SoulX-PodcastSoulX-Podcast is an inference codebase by the Soul AI team for generating high-fidelity podcasts from text.项目地址: https://gitcode.com/gh_mirrors/so/SoulX-Podcast凌晨一点做自媒体的阿凯盯着屏幕上第五遍返工的口播稿发呆客户要四川话版、河南话版还得两个角色你来我往地聊可请配音演员的成本高得吓人。你是不是也被人声这道坎卡住过想批量出音频内容却总在录音、配音、剪辑上反复栽跟头今天聊的开源项目 SoulX-Podcast就是专门来拆掉这堵墙的——它能把一段文字直接变成高保真、带方言、支持多角色对话的播客语音而你需要准备的只是几段参考音频和一个脚本文件。这篇文章是我站在普通使用者视角的体验记录不堆术语、不讲论文只讲它到底怎么帮我干活、哪里好用、哪里容易翻车。别被名字吓到它其实就是个声音翻译官一句话概括你把台词和人设声音交给它它还给你一段像模像样的真人播客录音。你可以把 SoulX-Podcast 想象成一位既会普通话、又会英语还精通四川话、河南话、粤语的译制片导演你给它两段参考音频比如一段女声、一段男声它记住这两位演员的音色你给它一份写好的对话稿标好谁在第几句开口它按照稿子让两位演员一唱一和地把整期节目录完还能在指定位置笑一笑、叹口气。整个过程不需要麦克风、不需要录音棚、不需要约配音老师的档期。听起来有点玄往下看你就会发现上手比你想的简单得多。凭什么让我换掉收藏夹里的旧工具过去做一档多方言、多角色的音频内容通常要走这条路找配音演员 → 分别录制各版本 → 后期剪辑拼贴 → 反复返工。而 SoulX-Podcast 把这条路压缩成了写稿 跑一次命令。一张表看明白差异你原本的路径换成 SoulX-Podcast 之后各地方言要找对应的母语者录一段普通话参考音频直接跨方言克隆音色多角色对话要分开录、手动剪脚本里排好轮次一次生成整段多轮对话情绪表达全靠演员临场发挥在文本里插入语气标签精确控制笑声、叹息一段参考只能出一个人的声音支持多人、多说话人随时切换演员拆开看真正让它拉开差距的是这三个能力1. 跨方言零样本克隆 这是最让人哇一下的点。你不用为每种方言重新录音只要有一份 1-2 分钟、发音清晰的参考音频普通话也行它就能学习说话人的音色再生成四川话、河南话或粤语版本。声音还是那个声音腔调却变了——对做地方内容的人来说这相当于白送一套多语言声优。2. 多说话人、多轮对话 传统语音合成大多是一个人的独白听着像机器朗读。SoulX-Podcast 从骨子里就是按播客场景设计的多人轮流发言、上下文衔接自然长篇幅内容也能连续生成不用你一段段拼接。3. 副语言标签给声音加表情 ✅真实的对话里人不会干巴巴只念词。它内置了几种语气控制符你往台词里一插效果立竿见影标签效果适合用在哪|laughter|笑声吐槽、轻松桥段|sigh|叹气无奈、感慨|breathing|呼吸声让停顿更真实|coughing|咳嗽模拟生活场景|throat_clearing|清嗓子发言前的自然过渡有了这些生成的语音就不再是念稿而是真的在说话。最快上手路径先跑起来再研究原理别急着搞懂内部机制先花几分钟把它跑通。整个过程大概四步。第一步拉代码、建环境约2分钟git clone https://gitcode.com/gh_mirrors/so/SoulX-Podcast cd SoulX-Podcast conda create -n soulxpodcast python3.11 -y conda activate soulxpodcast pip install -r requirements.txt逐行看git clone把项目拉到本地conda create建一个独立的 Python 3.11 环境避免污染系统pip install装齐全部依赖。第二步下载模型约2分钟视网速而定pip install -U huggingface_hub huggingface-cli download --resume-download Soul-AILab/SoulX-Podcast-1.7B --local-dir pretrained_models/SoulX-Podcast-1.7B如果你之后想玩方言再补一条把方言模型Soul-AILab/SoulX-Podcast-1.7B-dialect下载到pretrained_models/SoulX-Podcast-1.7B-dialect即可。第三步启动网页界面约1分钟python webui.py --model_path pretrained_models/SoulX-Podcast-1.7B浏览器打开http://localhost:7860一个可视化的操作面板就出现在眼前了。选参考音频、填台词、点生成剩下的交给它。第四步验证一下项目自带了两段示例音频一男一女都在example/audios/目录可以直接拿来当人设声音。台词就先抄项目里现成的对话稿跑通了再改自己的内容。如果你更喜欢命令行项目也给了现成脚本bash example/infer_dialogue.sh一条命令生成一期双人播客。把脚本写成剧本进阶玩法从这里开始网页界面适合体验但想真正掌控效果建议学会写播客脚本 JSON。它其实就两部分说话人信息和台词轮次。最小示例长这样{ speakers: { S1: { prompt_audio: example/audios/female_mandarin.wav, prompt_text: 第一段参考音频对应的文字内容 }, S2: { prompt_audio: example/audios/male_mandarin.wav, prompt_text: 第二段参考音频对应的文字内容 } }, text: [ [S1, 大家好欢迎收听新一期节目|laughter|这期聊聊AI。], [S2, 哎我正好最近也研究这个你先说说你的看法] ] }要点就三行speakers里登记每位演员prompt_audio指向参考音频prompt_text填这段音频对应的文字——这一对组合决定了音色和口吻text是排好顺序的台词表每一条是[谁, 说什么]按顺序执行就是一场对话想换方言就在某个说话人下面加一行dialect_prompt比如dialect_prompt: |Henan|...这句提示词会引导模型用河南腔说话。项目example/podcast_script/里准备了普通话、四川话、河南话、粤语等多个现成脚本直接打开对照着改比看十篇文档都管用。新手最容易踩的3个坑我已经替你踩过了坑一模型选错了。普通话和英语用基础模型没问题但你要四川话、河南话、粤语必须换成SoulX-Podcast-1.7B-dialect方言模型。用错模型方言提示词会被无视你还会以为自己写错了代码。坑二参考音频脏。参考音频里如果有环境噪音、多人说话声克隆出来的音色会跟着糊。尽量挑一段安静环境、吐字清晰的单人录音1-2 分钟就够不是越长越好。坑三脚本一口气写太长。多轮对话虽强但单次生成的内容量有上限配置里的max_turn_size默认是 10 轮左右。长篇节目最好切成几段脚本分批生成最后再拼接比一次憋个大长句更稳、更不容易出错。另外提一句显存紧张的同学可以在推理时开启fp16_flow能明显降低显存占用。两类人已经悄悄用上了故事一县城中学的语文老师王芳王老师想给学生们做一档用家乡话讲家乡文化的播客但自己普通话都带口音更别说找人说河南话。她用一段自己上课的录音当参考把介绍洛阳、开封的稿子用 SoulX-Podcast 生成河南话版本再配上个普通话的主持人角色做对谈。一节课的素材一个晚上就做好了学生反响出奇地好——原来课本里的东西用家乡话讲出来这么亲切。故事二美食自媒体博主小鹿小鹿做探店视频账号粉丝一半在广东。她以前会把每期文案额外找粤语配音一条视频多花好几百块。现在她把同一个文案丢给 SoulX-Podcast普通话和粤语版本各生成一份再手动混剪成本几乎为零。她最常用的操作是在文案里插|laughter|——评论区总有人说这笑声太真实了。拆开看看它内部到底在忙什么用大白话打个比方SoulX-Podcast 像一条流水线先是读稿员1.7B 参数的 Transformer 语言模型把文字台词翻译成一串串语音编码然后是上色师傅流模型 声码器把这些编码还原成 24kHz 的波形。整条流水线同时处理谁在说、用什么语气说、说哪种方言这几件事所以才能实现多人对话、跨方言、带情绪。它到底像不像空口无凭项目仓库里这张性能对比图最有说服力图中红色线条是 SoulX-Podcast对比的是几个市面上的主流语音合成模型。可以看到在说话人相似度和语音质量这类像不像的指标上它处在领先位置而在可懂度这类听得清不清的指标上同样没有掉队——这也是为什么它生成的音频能直接当节目用而不是只能当玩具。开源协议、社区与路线图开源协议Apache 2.0个人玩、商业用、改代码都允许对创作者非常友好技术报告团队在 arXiv 发表了配套论文《SoulX-Podcast: Towards Realistic Long-form Podcasts with Dialectal and Paralinguistic Diversity》想深入了解原理的可以翻一翻模型与在线体验基础模型和方言模型都已开放下载官方还部署了在线 Demo不装环境也能先听效果工程配套项目支持 WebUI 可视化操作也提供了基于 vLLM 的 Docker 镜像runtime/vllm/方便服务化部署已完成 进行中命令行推理、WebUI、在线 Demo、Docker 加速都已完成路线图上的下一站是流式推理——也就是边说边出结果进一步压缩等待时间。想进交流群和开发者、其他玩家直接聊扫描下方二维码就能加入常见疑问速答Q我的电脑带得动吗A最低 4 核 CPU、16GB 内存推荐带 8GB 以上显存的 NVIDIA 显卡。显存紧张就开fp16_flow能把占用压下来不少。Q生成一段10分钟的播客要等多久A在 RTX 3060 这类主流显卡上大约是播放时长的 1.5-2 倍。也就是说 10 分钟的节目大概等 15-20 分钟去吃个饭回来刚好。Q能自己定义新方言吗A当前开箱即用的是四川话、河南话、粤语三种。想扩展新方言需要额外训练数据暂时没法无中生有得等团队后续的工具。Q生成的声音能商用吗A可以项目采用 Apache 2.0 协议。但注意如果参考音频用的是别人的声音请务必先拿到对方授权。Q怎么让生成效果更好A记住四件事——参考音频选清晰干净的、语气标签适当用、采样参数温度、top_p多试几组、长内容分段生成。就这四个点够用很久。结尾今晚就动手吧从想做一个播客到真的听到一段像样的双人对话我用 SoulX-Podcast 只花了一个晚上而且大部分时间都耗在下模型上真正改脚本只用了十分钟。最省事的开始方式就三条命令git clone拉代码、pip install装依赖、python webui.py起界面。然后把你脑子里那个要是能用家乡话聊点什么就好了的想法写进台词里点一下生成。声音不该是内容创作的瓶颈。无论你是想做一档多方言的科普节目、给企业的培训材料换换口音还是单纯想听听自己说河南话是什么感觉——SoulX-Podcast 都能让你绕开配音、录音这些老门槛把精力放回内容本身。你的第一个播客就差一次动手的距离。【免费下载链接】SoulX-PodcastSoulX-Podcast is an inference codebase by the Soul AI team for generating high-fidelity podcasts from text.项目地址: https://gitcode.com/gh_mirrors/so/SoulX-Podcast创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考