谷歌新技术可用AI模型为无声视频配音
第一财经 2024-06-20 10:37

谷歌DeepMind 近日公布了一项利用 AI 为无声视频生成背景音乐的“video-to-audio”技术。

当前 DeepMind 这款 AI 模型依然存在局限性,需要开发者使用提示词为模型预先“介绍”视频可能的声音,暂时不能直接根据视频画面添加具体音效。

据悉,该模型首先会将用户输入的视频进行拆解,此后结合用户的用户文字提示,利用扩散模型反复运算,最终以生成与视频画面协调的背景声音,例如输入一条“在黑暗中行走”的无声视频,再添加“电影、恐怖片、音乐、紧张、混凝土上的脚步声”等文字提示,相关模型就能生成恐怖风格的背景音效。

DeepMind 同时表示,该“video-to-audio”模型可以为任何视频生成无限数量的音轨,还能够通过提示词内容判断生成的音频“正向性”或“反向性”,从而令生成的声音更贴近某些特定场景。

编辑/范辉

相关阅读
Meta炸场!发布类Sora视频生成模型,股价再创新高
​第一财经 2024-10-05
OpenAI又失大将!Sora研发负责人跳槽谷歌
澎湃新闻 2024-10-05
OpenAI又失一员猛将!Sora负责人之一宣布跳槽谷歌Deepmind
财联社 2024-10-05
豆包视频生成大模型正式发布,首次突破多主体互动难关
北京青年报客户端 2024-09-24
MiniMax加入视频生成混战 大模型的尽头是做视频?
第一财经 2024-09-02
黄仁勋预言步入现实 谷歌展示实时游戏生成AI模型GameNGen
财联社 2024-08-30
文生音乐:AI成为下一代音乐家的合作伙伴
澎湃新闻 2024-07-06
PK Sora Runway发布新一代视频生成模型
第一财经 2024-06-18
最新评论