跳到正文
10月5日周一
  1. Production Expert69

    Limited Edition Audio 发布 Pro Tools AI 人声分离插件 VoxSplit Pro

    Limited Edition Audio 发布 VoxSplit Pro,一款可将同一轨道中的两名说话者分离为不同人声的 AI 插件,重点解决传统工具通常只能分离人声与背景、难以处理人声与人声的问题。插件由声音指导剪辑师兼终混师 Frédéric Le Louët 根据其制作工作中的反复需求开发,全部处理均在本机完成,不会向云服务上传音频,因此可用于受 NDA 约束的素材。 VoxSplit Pro 提供 Standard、Precision 和 Rescue 三种处理配置,可按素材难度逐级加强处理;另有可选的 finishing 阶段,用于让分离后的人声在混音中更突出。应用场景包括修复困难的现场对白、从混合母版中移除背景音乐或环境声、从完成的混音中提取旁白,以及为播客或访谈分离录在同一轨道上的两名说话者。用户可在提交处理前试听分离结果并与源文件比较,再将结果送回 Pro Tools 时间线或导出为文件。 插件在 Pro Tools 中以 AAX AudioSuite 运行,同时提供 VST3 和 Standalone 版本;支持 macOS,并针对 Apple Silicon 优化。产品通过 iLok 账户激活,提供覆盖三种格式及三种处理配置的 7 天全功能试用。现已上市,首发价为 €199,常规价格为 €249,价格包含欧盟增值税;采用一次性永久许可证,不设订阅。

10月2日周五
  1. Production Expert75

    如何用 MVSEP 将《A Day in the Life》的 4 轨录音分离为 38 轨

    John “Wheels” Hurlbut 以亲自进行的音乐修复与 Dolby Atmos 混音为例,说明如何用 Steinberg SpectraLayers 和 MVSEP.com 从单声道、立体声或少量多轨录音中分离乐器、人声及环境声;其中,他把 The Beatles 的《A Day in the Life》4 轨录音拆成 38 轨,分离与混音约耗时 30 小时。 Hurlbut 最初在专业项目中使用 SpectraLayers。为《The Lake》处理 Bryan Adams 的《Run To You》时,他先移除副歌前的人声,再将音乐上混至 5.1;在修复 The Leslie Spit Treeo 等 EMI Canada 档案录音时,他用 De-Noise 模块采样并去除模拟多轨中的磁带底噪,还把原始发行版从 Tidal 录入 DAW、分离为鼓、贝斯和吉他等参考 stem,再通过 Nuendo Control Room 在参考 stem 与新混音之间 A/B,对照还原原始平衡,之后转入 Dolby Atmos 混音。 分离工具也用于补回多轨中缺失的内容。处理 Tom Cochrane 的《Boy Inside The Man》时,他从原始混音的鼓 stem 中寻找底鼓和军鼓采样,以 Nuendo Hitpoints 生成 MIDI,再用 Groove Agent 触发;Glass Tiger 的《The Thin Red Line》缺少开头群体音效,他用 SpectraLayers 的 Unmix Crowd 从立体声混音中提取;Queensrÿche 的《Suite Sister Mary》多轨缺少哥特式合唱,他先分离人声,再用 Unmix Chorus 拆分主唱与背景人声。对于现场录音中的串音和吉他指滑噪声,他分别使用 Unmix Song 或频谱绘制处理。 作者随后测试 MVSEP.com,认为它提供的乐器与人声分离算法比 SpectraLayers 更细,同时还包含 audio-to-MIDI、修复和声音克隆等功能。注册账户的大多数分离可免费使用,但音频格式受限;Premium 单次分离通常消耗 1–4 credits,ensemble separation 可超过 20 credits,600 credits 售价为 10 美元,并支持一次批量上传最多 40 个文件。在 Rush 的《The Spirit of Radio》立体声版本上,他不仅分出了吉他 stem,还进一步拆出主音、节奏部分及副歌中的人声效果。 处理《A Day in the Life》时,他从原始 4 轨出发,将鼓拆成底鼓、军鼓、踩镲、Ride Cymbal 和三个手动划分的 Tom 轨,并分出贝斯、钢琴、木吉他、沙锤、康加鼓、John 与 Paul 的人声。人声中的合唱段通过 Choir 算法拆成女高音、女低音、男高音和男中音;单声道管弦乐轨又被分成小提琴、大提琴、Arco Basses、长笛、单簧管、双簧管、小号、圆号、大号、定音鼓和打击乐。加上从原始混音提取的前接人群与音乐、结尾钢琴或管风琴、18K 正弦波及内圈音频,共得到 38 轨。作者称这些轨道没有可闻伪影,但这一判断来自其个人测试。 MVSEP 由 Roman Solovyev 和 Olimjon Elmurodov运营。Solovyev 表示,模型使用 Python、PyTorch 和其开源训练框架开发,当前常用架构为 BSRoformer;许多模型可通过 MSST 仓库或 Ultimate Vocal Remover 在本地运行,包括 53-stem Mega model。平台约有 20 台 GPU 服务器,平均每天处理约 25,000 首音轨;Premium 用户优先,免费用户有时需要排队,计算量较大的 124-band BS Roformer 偶尔仅向 Premium 用户开放。团队还在开发用于众包盲测分离算法的 Music Arena,并计划增加面向罕见乐器的专用模型。

9月23日周三
  1. Mix Online72

    AudioShake 发布对话分离工具 Multi-Speaker 2.0

    AudioShake 发布 Multi-Speaker 2.0,更新其对话分离工具,可将一段混合对话中的不同人声拆分为独立、干净的音轨,并针对笑声盖过对白、相邻领夹麦串音及多人重叠说话等 Crosstalk 场景隔离声音,同时尽量保留自然表达。 编辑可通过 AudioShake Studio 或 API 上传混合文件,导出与源素材采样率匹配的独立说话人音轨,以及包含房间声、交通声和背景噪声的独立环境声轨,用于压低、修饰或重建声场。系统还会提供定向置信度标记,把低置信度片段定位到 20 毫秒帧,便于编辑直接检查可能需要人工复听的位置。 报道称,2.0 版在嘈杂环境中的隔离更清晰,与 1.0 相比串音减少 32%,并提供 8 kHz 至 48 kHz 的全频段覆盖。AudioShake 称其采用纯声学模型而非预测式语言模型,以保留带口音的表达、多语言对话和重叠发声,避免产生臆造式编辑。Multi-Speaker 2.0 已在 AudioShake Studio 提供。