跳到正文
10月2日周五
  1. Production Expert75

    如何用 MVSEP 将《A Day in the Life》的 4 轨录音分离为 38 轨

    John “Wheels” Hurlbut 以亲自进行的音乐修复与 Dolby Atmos 混音为例,说明如何用 Steinberg SpectraLayers 和 MVSEP.com 从单声道、立体声或少量多轨录音中分离乐器、人声及环境声;其中,他把 The Beatles 的《A Day in the Life》4 轨录音拆成 38 轨,分离与混音约耗时 30 小时。 Hurlbut 最初在专业项目中使用 SpectraLayers。为《The Lake》处理 Bryan Adams 的《Run To You》时,他先移除副歌前的人声,再将音乐上混至 5.1;在修复 The Leslie Spit Treeo 等 EMI Canada 档案录音时,他用 De-Noise 模块采样并去除模拟多轨中的磁带底噪,还把原始发行版从 Tidal 录入 DAW、分离为鼓、贝斯和吉他等参考 stem,再通过 Nuendo Control Room 在参考 stem 与新混音之间 A/B,对照还原原始平衡,之后转入 Dolby Atmos 混音。 分离工具也用于补回多轨中缺失的内容。处理 Tom Cochrane 的《Boy Inside The Man》时,他从原始混音的鼓 stem 中寻找底鼓和军鼓采样,以 Nuendo Hitpoints 生成 MIDI,再用 Groove Agent 触发;Glass Tiger 的《The Thin Red Line》缺少开头群体音效,他用 SpectraLayers 的 Unmix Crowd 从立体声混音中提取;Queensrÿche 的《Suite Sister Mary》多轨缺少哥特式合唱,他先分离人声,再用 Unmix Chorus 拆分主唱与背景人声。对于现场录音中的串音和吉他指滑噪声,他分别使用 Unmix Song 或频谱绘制处理。 作者随后测试 MVSEP.com,认为它提供的乐器与人声分离算法比 SpectraLayers 更细,同时还包含 audio-to-MIDI、修复和声音克隆等功能。注册账户的大多数分离可免费使用,但音频格式受限;Premium 单次分离通常消耗 1–4 credits,ensemble separation 可超过 20 credits,600 credits 售价为 10 美元,并支持一次批量上传最多 40 个文件。在 Rush 的《The Spirit of Radio》立体声版本上,他不仅分出了吉他 stem,还进一步拆出主音、节奏部分及副歌中的人声效果。 处理《A Day in the Life》时,他从原始 4 轨出发,将鼓拆成底鼓、军鼓、踩镲、Ride Cymbal 和三个手动划分的 Tom 轨,并分出贝斯、钢琴、木吉他、沙锤、康加鼓、John 与 Paul 的人声。人声中的合唱段通过 Choir 算法拆成女高音、女低音、男高音和男中音;单声道管弦乐轨又被分成小提琴、大提琴、Arco Basses、长笛、单簧管、双簧管、小号、圆号、大号、定音鼓和打击乐。加上从原始混音提取的前接人群与音乐、结尾钢琴或管风琴、18K 正弦波及内圈音频,共得到 38 轨。作者称这些轨道没有可闻伪影,但这一判断来自其个人测试。 MVSEP 由 Roman Solovyev 和 Olimjon Elmurodov运营。Solovyev 表示,模型使用 Python、PyTorch 和其开源训练框架开发,当前常用架构为 BSRoformer;许多模型可通过 MSST 仓库或 Ultimate Vocal Remover 在本地运行,包括 53-stem Mega model。平台约有 20 台 GPU 服务器,平均每天处理约 25,000 首音轨;Premium 用户优先,免费用户有时需要排队,计算量较大的 124-band BS Roformer 偶尔仅向 Premium 用户开放。团队还在开发用于众包盲测分离算法的 Music Arena,并计划增加面向罕见乐器的专用模型。

9月30日周三
  1. ProVideo Coalition48

    《Remembering》:首部以作者本人克隆声音朗读的有声书

    TecnoTur 为 Anna Pittman 的首部著作《Remembering: Wholeness and Awakening through the Twelve Steps》制作并发行多个版本,其中英文有声书采用作者本人的克隆声音朗读。全书定稿为 308 页、63,325 词;考虑到真人配音需要投入大量录制、补录和编辑时间,且 Anna 希望保留自己的声音,团队基于制作周期和预算选择了声音克隆方案。用于克隆的真人录音来自 Ernesto Morales-Ramos 此前为 Anna 的音频冥想项目所做的录制,使用 MXL 770 电容麦克风。 在比较 FlexClip、ElevenLabs、Descript、DaVinci Resolve Studio 等方案后,作者为本项目选用 ElevenLabs Pro 计划。导入书籍的 ePUB 版本后,ElevenLabs 分析了全部 63,325 词,列出其无法确定读音的术语和人名,允许制作人员试听系统的初步发音,并在需要时以注音方式输入正确读法。文章作者将其称为“主动式配音词汇表”;该功能可为制作提供起点,但不能替代人工逐章、逐节试听,以及对生成语音进行必要的手动修改。 互动有声书采用支持章节和段落导航的 M4B 格式,主要通过 Remembering.info 直接销售,同时提供 ePUB 版本;网站另设 M4B 与 ePUB 使用说明页面,并将链接加入页脚及购买后的自动邮件收据。有声书也可通过 Spotify 获取,但作者所得版税较低。纸质书在文章发布时已面向阿根廷、澳大利亚、智利、哥伦比亚、厄瓜多尔、墨西哥、波多黎各、西班牙、乌拉圭、英国和美国销售,各地区页面以当地货币显示价格。