跳到正文
9月24日周四
  1. THR Business49

    YouTube 押注一系列 AI 功能以维持视频平台主导地位

    Google 旗下 YouTube 在本周于纽约举行的年度 Made on YouTube 活动上,公布面向观众与创作者的一系列 AI 功能,希望加快内容制作,并帮助观众更精准地找到所需视频。CEO Neal Mohan 表示,平台自年初以来已推出超过 3,000 项产品更新与改进,并称其 AI 策略是以负责任的方式增强人类创造力。 面向观众,主要变化是 Custom Feeds:用户可用文字描述兴趣或需求,例如寻找新的 DIY 创作者或适合 30 分钟通勤收听的机智播客,平台据此生成相应标签页,并持续刷新相关内容。Ask YouTube 也将增加追问能力和更具体的搜索功能。 面向创作者,YouTube Studio 现可为视频节奏和结构提出建议,并协助自动进行缩略图 A/B 测试;未来还将支持视频 A/B 测试,使不同受众看到不同内容版本。平台也在推出可通过自然语言提示词操作的对话式剪辑助手。此外,需主动选择启用的 AI 评论审核功能正在开发中,新的语音检测工具也将加入现有的形象检测计划。

  2. Advanced Television43

    影视制作 AI 平台 CineMe 将于 10 月 1 日上线

    由电影制作人 Dan Hartley 与前 Prime Video UK 董事总经理 Chris Bird 创立的影视制作 AI 平台 CineMe 将于 10 月 1 日上线,并提供多个订阅层级。曾任 Sky 原创电影总监、现负责 Studio TF1 国际电影战略的 Julia Stuart 已加入 CineMe 顾问委员会。 据创始人介绍,CineMe 可将剧本转化为照片级写实图像和视频,并在同一协作工作空间内继续处理预算、排期和融资。平台面向电影制作人与内容创作者,可用于制作故事板、预演和提案材料,帮助项目争取融资、吸引演员,并协调创意与制片团队。Hartley 将其定位为低成本制作电影原型、提高创作目标并降低财务风险的生产级工具中心;这些效果与定位均为创始人的表述,正文未提供独立测试结果或具体订阅价格。 未来数月,Hartley 与 Bird 还将规划 CineMe 5% Fund,兑现把公司 5% 股份置于慈善信托的创立承诺,目标是让影视行业从业者获得企业级人工智能工具。Hartley 表示,该计划也意在回应疫情和罢工后自由职业者面临的财务压力,并为英国影视制作行业当前及未来的人才建立技术应用与培养路径。

  3. Variety19

    原版《Willy Wonka & the Chocolate Factory》Oompa-Loompa 演员 Rusty Goffe 听到 AI 重现 Gene Wilder 声音后落泪:“再次听到它很美好”

    据 Variety 标题,曾在 1971 年版《Willy Wonka & the Chocolate Factory》中与 Gene Wilder 合作、饰演 Oompa-Loompa 的 Rusty Goffe,听到 AI 重现的 Wilder 声音后“流下了一滴眼泪”,并表示再次听到这个声音“很美好”。 正文仅取得开头且在提到 Netflix 的收购事项时截断。已提供部分还写到,Goffe 本月早些时候接受 Zoom 采访,结束通话时以影片风格的用语“Have a scrumdiddlyumptious day!”道别;除此之外,材料未提供 AI 声音重现的制作方法、使用场景或 Netflix 所收购对象等完整信息。

  4. postPerspective72

    Beeble 发布 SwitchX 2.0,支持原生 4K、20 秒片段与增强运动保真度

    Beeble 发布视频转视频模型 SwitchX 2.0,可在保留原始主体和表演的同时修改灯光、背景、道具等元素;新版支持原生 4K 输出、最长 20 秒的 24fps 片段和 10-bit 色深,并改进摄像机跟踪、快速运动处理、运动保真度与 lipsync。 新的 Up-rez 高分辨率完成工作流允许创作者先以 720p 进行更快、消耗更少 credits 的迭代,再回到原始源素材生成最高 4K 的最终结果,以保留源素材已有细节。Beeble 近期还推出由 World Labs 驱动的 3D Scene Generator,可从文本、图像、视频或全景图生成 Gaussian splat 环境,供用户在三维空间中探索并捕捉最高 4K 的镜头。 其他更新包括 Seedance 2.5 集成、将 SDR 素材转换为 16-bit HDR EXR 的 SwitchHDR,以及扩展的图像、视频和 upscaling 工具。这些能力接入 Beeble 的节点式合成环境 Canvas,将生成、VFX 与完成工具连接在同一工作流中。SwitchX 2.0 已在 Beeble 平台提供。

9月23日周三
  1. RedShark News74

    Evoto 8.0 发布视频修图工具、Asset Hub 与新版定价

    Evoto AI 于 9 月 22 日在纽约发布 Evoto 8.0,新增人像修图、视频插件、故事化批量筛片、移动端联机拍摄和 Asset Hub,现已可用,价格从每月 7.99 美元起。公司称,Evoto 已处理超过 12 亿张照片,服务 120 万名专业摄影师和 6 万家工作室。 Evoto Desktop 8.0 新增雀斑与痤疮精细修饰、面部阴影去除、服装摩尔纹去除、液化背景修复、汗渍去除及 Generative Expand,并改进背景提取,加入可识别画面方向的 AI Crop。重新设计的首页整合 Create Project、Tethered Shooting、Workflow 和 Asset Hub;内置助手 Evobot 可用自然语言回答问题并链接到相关控件。 核心人像修图现可直接在 DaVinci Resolve 时间线上处理片段中的面部和皮肤,插件支持 macOS、Windows 上的 DaVinci Resolve Studio 19 及以上版本,以及 Adobe Premiere Pro 25.6 及以上版本。Evoto Video 新增随面部运动跟踪的 Hair Shine、牙齿美白和 Facial Fullness;Match Color 可用静态图片作为参考匹配一个片段,再将该方向应用到其他片段。插件可导入 MP4、MOV、M4V,导出 MP4、MOV;导入支持 H.264 和 H.265/HEVC,导出支持 H.264。 Storyline Mode 可按摄影师指定的章节整理照片,不明确属于某章的画面会保持未分配;General Mode 则按主体、布置或场景归类相似照片,面向学校摄影、产品拍摄、房地产和活动等批量工作。Workflow 可保存从导入到交付的制作路径以供复用;Evoto SDK 能连接桌面应用并编写导入、应用预设和导出等重复步骤,但目前仅向企业客户提供。移动端新增联机拍摄、Hot Presets、人像修图、Match Color、完整色彩控制、Motion Blur 和 Relight。 Asset Hub 内置官方及创作者制作的预设、AI Looks、AI background fusions、背景和天空素材,截至 9 月 21 日上线超过 400 项精选资产;用户可在自己的图片上试用,导出时才检查购买权限。配套 Creator Program 设有 500,000 美元奖励池,创作者获得净销售额的 60%,无需上架费,并保留资产所有权及在其他平台非独家销售的权利。创作者可为预设设定 8至30 美元、AI Looks 49至199 美元、背景和天空 2至8 美元的价格;AI Background Fusion 暂不接受创作者投稿。桌面版可在 macOS 和 Windows 免费下载,移动应用可从 Apple App Store 和 Google Play Store 获取。

  2. Mix Online72

    AudioShake 发布对话分离工具 Multi-Speaker 2.0

    AudioShake 发布 Multi-Speaker 2.0,更新其对话分离工具,可将一段混合对话中的不同人声拆分为独立、干净的音轨,并针对笑声盖过对白、相邻领夹麦串音及多人重叠说话等 Crosstalk 场景隔离声音,同时尽量保留自然表达。 编辑可通过 AudioShake Studio 或 API 上传混合文件,导出与源素材采样率匹配的独立说话人音轨,以及包含房间声、交通声和背景噪声的独立环境声轨,用于压低、修饰或重建声场。系统还会提供定向置信度标记,把低置信度片段定位到 20 毫秒帧,便于编辑直接检查可能需要人工复听的位置。 报道称,2.0 版在嘈杂环境中的隔离更清晰,与 1.0 相比串音减少 32%,并提供 8 kHz 至 48 kHz 的全频段覆盖。AudioShake 称其采用纯声学模型而非预测式语言模型,以保留带口音的表达、多语言对话和重叠发声,避免产生臆造式编辑。Multi-Speaker 2.0 已在 AudioShake Studio 提供。

  3. postPerspective67

    CaptionX 推出 Clips,将长视频和播客转成可发布短片

    CaptionX 推出 Clips,可从最长三小时的视频或播客中提取完整、可独立发布的短片,并按相对质量排序。该功能仅依据带逐词时间戳的转录文本判断内容,不分析视频画面或音频波形;生成和预览免费,用户只为最终保留的短片付费。Clips 现已在 Adobe Premiere 内及浏览器中提供。 系统首先以规则将转录文本划分为完整句子,终止标点、约 0.75 秒的停顿或长度上限均可触发分句,同时标记因说话者换气而形成的虚假结尾。模型接收编号句子列表,为每段候选短片返回连续的起止句及一个承载吸引点的“峰值”句,而不直接返回时间戳;随后由独立的确定性引擎校验边界,拒绝从半句开始或以无实质内容的“yeah”结束,最后才从所选词语的真实时间戳换算成秒。 候选短片按吸引点、回报感、独立完整性、情绪、可引用性和节奏六个维度评分,再由代码确定排序。CaptionX 将分数定义为同一视频内的相对质量指标,而非播放量或传播潜力预测。 处理长文件时,浏览器分片读取文件,仅提取压缩音频并在本地重新编码为较小的语音级文件;两小时视频约生成 30MB 音频。转录文本按相互重叠的 10 分钟窗口分析,每隔八分钟滑动一次并行运行,因此厂商称三小时播客可在数十秒内完成。公司表示,生成的短片通常有 20%至40%会被用户舍弃。

9月22日周二
  1. CineD76

    Eddie AI v4 技术解析:新增视觉 B-roll 剪辑、参考样片与 NLE 协作 Agent

    Eddie AI v4 将基于提示词的辅助剪辑从依赖转录的粗剪扩展到视觉工作,可制作 B-roll 序列、蒙太奇及按音乐节拍剪辑的内容;CineD 在 IBC 2026 采访了联合创始人兼 CEO Shamir Allibhai,并观看了 Mac 应用演示。用户仍可导入最多 100 小时素材,由系统完成记录、片段同步、multicam 分组以及采访与视觉镜头分类,再以自然语言生成和修改剪辑。新版可使用用户提供或生成的音乐,按节拍剪辑、进行一次调色处理,并将结果发送至 NLE 或渲染为 MP4;Allibhai 称成片可继续推进至精剪,但也承认其“能力提升 10 倍”的说法可能有所夸张。 应用界面左侧管理 edits 和 media,右侧输入提示词,中间显示结果与选择逻辑。演示中的声画剪辑分别置于 V1 和 V2,导出支持范围现已包括 Avid Media Composer。Allibhai 表示,更好的视觉理解让系统能够更准确地安排 B-roll;Eddie AI 会连接 ChatGPT 和 Claude,并叠加公司自身技术与微调,其中说话者识别结合音频和视觉线索判断发言人。Backgrounder 在原有的人脸和行业词典上下文之外,新增导入视频文件或 XML 参考剪辑的能力,可读取宽景、近景及返回宽景等结构,并把该模式应用于新剪辑。 分析并非在本地完成。Eddie AI 会转码并上传低分辨率代理文件供服务器分析,全分辨率媒体保留在原位置;云同步使同一剪辑可在 Mac、PC、网页和 iPhone 应用中访问,也可从 ChatGPT 或 Claude 内驱动。Allibhai 称服务符合 SOC 2 Type II,且不会使用客户数据训练模型。 新版还提供可在剪辑中标记的专家 Agent,例如 MrBeastMethod Agent 可先评议时间线,再由 Eddie AI 执行修改。公司页面说明,这些 Agent 根据电影工作者的公开演讲及相关文章训练,相关人士未必给予认可;任何执行剪辑的 Agent 都会新建版本,不覆盖用户原有剪辑。另一项功能允许 Eddie AI 作为额外编辑加入 Blackmagic Cloud、Premiere Pro Productions 或其他团队协作项目,与人类实时工作;据 Allibhai 描述,该 Agent 会直接操作 NLE 图形界面,包括移动光标和点击。 Eddie AI v4 已可使用,并以按需购买的 credits 取代订阅。导入每小时源素材最多收费 2.50 美元,购买较大额度包时费用更低;提示词按工作量扣费,采访素材记录较便宜,生成 B-roll 较贵。额度包从 10 美元购买 1,000 credits 起,新账户获赠 1,000 credits,且 credits 不会过期;原有订阅用户已转换至新的额度体系。

    推荐理由:文章结合现场演示与创始人访谈,具体拆解视觉剪辑、参考样片复用和协作型 Agent 的工作方式与数据边界。

  2. Newsshooter61

    shortshort 将长视频自动制作成带逐字字幕的 9:16 竖屏短片

    shortshort 可从一段最长 3 小时或 2GB 的上传视频中选取独立段落,制作带逐字字幕的 9:16 竖屏短片,面向需要将访谈、座谈、会议和活动素材转为社交媒体内容的用户。系统先生成逐字转录文本,再由 AI 寻找语义完整且在句末结束的段落;为保持句子完整,成片时长可能比指定长度短或长最多 25%。 画面重构会跟踪屏幕中的人脸,每个镜头采用一个缩放级别,并将强调性推进限制在 x1.0 至 x1.6;宽景、双人镜头、幻灯片和屏幕共享会保持完整画面,不强行裁切到人脸。渲染前可以修改构图、关键帧、字幕样式和标题,手动编辑器及 MP4 导出无需账号。输出上限为 MP4、1080×1920、30 fps,不提供配音、自动发布或添加 B-roll。 服务按源素材分钟数而非生成片段数计费,同一小时素材生成 3 条或 20 条短片的成本相同。注册可免费获得 60 分钟额度且无需银行卡;免费方案每段视频最多生成 3 条并带水印,Starter 为每月 €12、240 credits、4 小时视频且每段最多 5 条,Creator 为每月 €29、800 credits、13 小时 20 分钟且每段最多 10 条,Studio 为每月 €79、3,000 credits、50 小时且每段最多 20 条。作者认为其定价相对于已有 NLE 工具提供的能力偏高,并对 AI 工具可能影响创意与岗位表达了担忧。

8月28日周五
  1. fxguide80

    本地部署开放权重模型可提升生成式媒体工作流的稳定性与可控性

    fxguide刊载GenAI工作流与色彩科学顾问JD Vandenberg的分析,认为在自有基础设施上部署开放权重模型,能为媒体与娱乐制作提供更稳定的版本、更可控的数据安全与成本,并更深入地接入既有后期管线;代价是团队需要相应的技术能力和自带基础设施。文章同时提醒,开放插件生态本身可能引入恶意代码,ComfyUI等工具及艺术家自行下载的软件会给内部网络带来审计压力,因此可信的本地方案仍需经过严格的软件审查。 在稳定性方面,托管模型可能在缺少完整变更记录的情况下更新,相同输入与seed未必继续产生相同结果,服务也可能停止。文中以Critterz为例称,OpenAI于3月关闭Sora应用和网页服务后,该项目错过原定的戛纳亮相并更换AI合作方,现计划于2027年初发布。本地保存并固定模型权重,则有助于维持制作期间的版本一致性。 在安全与成本方面,制作网络通常依照MPA和TPN内容安全要求限制数据外传,而调用托管模型会让尚未发布的素材穿过外部服务。文章认为,本地模型可以在完全隔离的网络内运行,不向第三方传输数据。生成式媒体又需要大量迭代,Shy Kids制作约90秒的Air Head成片时进行了数百次、每次10至20秒的生成;Patrick Cederberg粗略估计素材与成片比例约为300:1,即使按保守方式理解也超过80:1。按2026年8月约每秒0.05至0.75美元的API价格,成片成本还要乘以难以预估的生成比例。本地部署并不会让生成变得便宜,但可把成本约束在预先购置和运营的硬件范围内。 格式也是现有服务与专业后期之间的障碍。文中称,多数生成视频工具输出H.264、8-bit、4:2:0且为显示参照格式,缺少alpha、深度、cryptomatte和场景线性数据;Air Head的素材以480p生成后再由外部工具放大。相比之下,VFX交付常使用EXR,一个4K、三通道、half-float的未压缩帧约53MB,多层EXR达到每帧200MB并不罕见。本地模型可以直接置于团队的色彩管理和文件管线中,输出后续环节实际需要的格式,也可从Nuke节点或Resolve插件调用,通过既有渲染管理器排队,并沿用OCIO、ACES及资产版本管理体系。 硬件方面,Vandenberg称多数当前开放权重视频模型的量化或蒸馏版本可在单张RTX 5090的32GB VRAM上运行;RTX PRO 6000 Blackwell配有96GB VRAM,零售价约13,250美元。现有渲染农场、高端GPU工作站,以及运行FilmLight Baselight或Blackmagic DaVinci Resolve的多GPU调色系统,也可能在闲置时承担推理任务。 文章最后区分开放权重与开源。可下载模型参数并不自动授予微调、再分发或商业交付权利;不同模型可能采用Apache 2.0、带使用限制的社区许可、非商业许可,或要求另签商业协议。因此,团队需要在建立管线前核查具体许可,并归档制作实际使用的权重。文章并未主张全面取代网页或API服务,而是认为本地开放权重模型更适合重视版本固定、内容安全、成本边界和深度管线集成的制作环境。

    推荐理由:文章从稳定性、安全、成本、格式与管线集成五方面比较本地开放权重模型和托管服务,为VFX团队评估部署路径提供框架。

8月24日周一
  1. fxguide73

    Nikola Todorovic 详解 Autodesk Flow Studio 新 3D Editor 与 Canvas 工作流

    Autodesk Flow Studio 通过新的 3D Editor 与 Canvas 工作流,把可交互的三维场景调度和生成式二维视频模型结合起来,让电影制作者先控制表演、场面调度、构图与摄影机运动,再生成和细化最终画面。fxguide 采访 Wonder Dynamics 联合创始人、现任 Autodesk 成员 Nikola Todorovic;他强调该系统并非用单条 Prompt“制作一部电影”,而是把 AI 纳入可指导、可修改的制作流程。 3D Editor 可使用角色、动画、动作捕捉数据、摄影机轨迹和生成环境组装镜头。表演与摄影机运动可以分别取自不同参考视频,摄影机也可直接设置关键帧;包括由 World Labs Marble 创建的 Gaussian splat 世界在内,具备空间一致性的环境可用于 blocking、布局与摄影机设计。随后,艺术家可进入基于节点的二维环境 Canvas 生成和调整画面,由当前 AI 视频模型处理灯光融合、氛围、模拟效果和电影化收尾。三维场景不一定直接输出最终像素,而是为生成结果提供表演、调度、构图和摄影机运动约束;追求速度时也可只使用 Canvas。 Todorovic 将 Prompt 工作流的问题概括为“80/20 规则”:AI 能很快生成图像的前 80%,但在移动物体、修改表演或细化摄影机路径且保留已有成果时,最后 20% 容易变得不可预测。Flow Studio 试图借助三维指导和二维生成的组合,使这类迭代更可控,并减少模型给出统计上安全但缺乏创作特异性的结果。 该流程优先使用录制的人类表演。视频和音频可驱动角色,在生成模型改变最终外观前保留表演者的节奏与意图;Todorovic 认为,仅靠音频或描述表演的 Prompt 难以稳定地产生鲜明表演,音频驱动动画也常出现泛化的手势和表情。音频整合仍在演进,目前视频模型可在收尾阶段生成声音,Autodesk 正在探索让更多源表演音频贯穿整体流程。 Flow Studio 基于云端,3D Editor 以保持高交互性为设计目标;Canvas 的生成时间取决于所选模型、镜头长度与分辨率,世界生成目前需要数分钟。平台面向个人制作者、3至5人的团队以及更大规模的工作室。Todorovic 将 3D Editor 视为原 Wonder Dynamics 平台的下一步,后者曾组合约 25 个机器学习、计算机视觉与生成系统,将 CG 角色置入实拍素材;新编辑器则把这些原本分离的输出集中到更易使用的导演环境中。

8月11日周二
  1. fxguide61

    Impossible Objects 如何用 HP ZGX Nano 上的 AI 模型增强 VFX 制作

    洛杉矶 VFX 公司 Impossible Objects 通过本地运行的定制 AI 模型与传统 CG、2D 合成相结合,扩展广告及影视项目的制作能力;本文由 HP 赞助,相关性能与工作流效果主要来自公司成员的介绍。团队在 ComfyUI 中建立面向制作的定制流程,使用内部拍摄素材微调开源模型,并以 Foundry Nuke、Adobe After Effects、SideFX Houdini 等工具完成传统 CG 和合成。 AI 负责人 Nhan Le 表示,通用 AI 视频模型尚不能满足汽车广告对写实度的要求,完全生成的镜头也受分辨率和色彩限制,因此团队不会直接向客户交付全生成镜头,而是提取生成式 AI 的可用部分并交由传统 2D 合成控制最终效果。内部模块可根据原始镜头随时间变化的灯光生成匹配结果,减少逐帧调整;针对汽车项目,团队还会持续调整模型对素材细节的记忆,以维持镜头中的细小特征一致性。 为满足本地计算与素材安全需求,工作室新增两台集成 NVIDIA GB10 Grace Blackwell Superchip 的 HP ZGX Nano G1n。团队使用 ZGX Toolkit 将 ComfyUI 任务发送到设备,并通过背部的 200 Gbps ConnectX-7 端口连接第二台设备;据 Le 介绍,这可增加可用内存,以加载更高分辨率模型和更长的 4K 视频片段,集成后吞吐量很快提升至原来的两到三倍。本地部署也让涉及品牌 IP 和专有设计的素材不必上传至云端模型,并可从内部拍摄到模型训练全过程追踪资产来源与所有权。 在虚拟制作方面,Impossible Objects 称其方法可从 LED volume 拍摄素材中推断和计算跟踪信息,用于场景延伸及 LED 画面清理,减少过去手工提取和重新应用跟踪数据的工作。公司未来计划把多台 HP ZGX Nano 组成统一集群,连接自有 NAS,并探索由多 Agent LLM 管理内部渲染农场;这部分仍处于搭建计划阶段。

7月10日周五
  1. fxguide73

    Beeble 发布 SwitchHDR,以 AI 将 SDR 视频重建为场景线性 HDR 素材

    Beeble 发布 AI 模型 SwitchHDR,用于从常规 SDR 视频推断 HDR 表示,并输出采用 AP0 色彩原色、符合 ACES2065-1 的场景线性 16-bit EXR 序列,面向电影、广告、修复、VFX 与其他专业后期流程。该模型已通过 Beeble 网页应用提供;fxguide 对其进行了测试,并采访了 Beeble 创始人兼 CEO Hoon Kim。 Beeble 称,SwitchHDR 使用真实 HDR 素材训练,目标不是把 SDR 信号简单扩展或映射到 HDR 容器,而是根据训练所得推断合理的 HDR 表示。文章同时强调这种重建无法找回画面中实际未被编码的信息,所得数值也未必在物理或数学上精确;其用途是为调色、合成以及将旧素材、档案影像、素材库内容、纪录片来源或旧 plates 纳入 HDR 母版提供更可信的处理余量。 SwitchHDR 支持由艺术家控制重建区域。用户可用亮度遮罩指定高光和阴影区域,再分别通过文本提示词引导重建;AI 处理可以只作用于选定区域,其余画面直接保留。这让创作者可以决定是否重建过曝窗口等区域,而不是完全依赖一键式黑箱转换。 fxguide 认为其结果优于许多自动 SDR-to-HDR 工具,但测试也发现,复杂纹理中的时间一致性仍有轻微问题。Kim 表示产品从后期需求出发,重点包括完整序列的时间一致性、ACES2065-1 16-bit EXR 输出,以及让艺术家通过遮罩和提示词决定在何处重建;仍然存在细节的区域由模型恢复,完全剪切的区域则交由艺术家控制重建方式。