北京青年报
谷歌新技术可用AI模型为无声视频配音
第一财经 2024-06-20 10:37

谷歌DeepMind 近日公布了一项利用 AI 为无声视频生成背景音乐的“video-to-audio”技术。

当前 DeepMind 这款 AI 模型依然存在局限性,需要开发者使用提示词为模型预先“介绍”视频可能的声音,暂时不能直接根据视频画面添加具体音效。

据悉,该模型首先会将用户输入的视频进行拆解,此后结合用户的用户文字提示,利用扩散模型反复运算,最终以生成与视频画面协调的背景声音,例如输入一条“在黑暗中行走”的无声视频,再添加“电影、恐怖片、音乐、紧张、混凝土上的脚步声”等文字提示,相关模型就能生成恐怖风格的背景音效。

DeepMind 同时表示,该“video-to-audio”模型可以为任何视频生成无限数量的音轨,还能够通过提示词内容判断生成的音频“正向性”或“反向性”,从而令生成的声音更贴近某些特定场景。

编辑/范辉

相关阅读
PK Sora Runway发布新一代视频生成模型
第一财经 2024-06-18
智源推出大模型全家桶及全栈开源技术基座新版图
北京青年报客户端 2024-06-14
腾讯文生文模型将开源 下一代视频模型时长将超30秒
第一财经 2024-05-21
全面叫板OpenAI!谷歌发布多模态大模型全家桶:从AI助手到文生视频模型
澎湃新闻 2024-05-15
谷歌回击OpenAI:提了121次AI AI搜索、智能对话、视频生成来了
第一财经 2024-05-15
最新评论