微软亚洲研究院推出NUWA-XL超长视频生成模型

来源：站长之家时间：2023-04-20 15:18:31

(资料图)

编程客栈（）4月20日消息:你相信吗?只要php输入16句简单描述，AI就能生成11分钟的动画了。

近日，微软亚洲研究院推出了NUWA-XL超长视频生成模型，采用创新的Diffusion over DiffusionjOjoKmg架构，通过「从粗到细」的生成过程，可以并行生成高质量的超长视频，为多模态大模型提供了新的解题思路。

论文地址:https://arxiv.org/abs/2303.12346

NUWA-XL「从粗到细」的生成方法具有三个优势:

分层结构使模型能够直接在长视频上进行训练，python从而消除了训练和推理之间的差距。

模型包含多个局部扩散模型，自然支持并行推理，可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下，当生android成1024帧时，NUWA-XL 使平均推理时间从7.55分钟减少到26秒，速度提升了94.26%。

由于视频的长度可以相对于深度 m 呈指数级扩展，因此模型可以很容易地扩展出更长的视频。

目前，长视频生成的多数方法是采用「Autoregressive over X」架构，这种方法存在训练-推理差距的问题，导致不真实的、扭曲的镜头变化。

NUWA-XL的推出填补了长视频生成领域的空白，为人工智能在视频jOjoKmg生成方面的应用提供了新的可能性。

微软亚洲研究院首席研究员段楠表示，目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息，但仅限于图片，输出依旧是文字或代码。因此，当前和未来的研究方向非常明确，就是将语言和视觉的理解和生成融入到一个基础大模型中，以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法，使人工智能模型更加通用。

关键词：

微软亚洲研究院推出NUWA-XL超长视频生成模型

: 编程客栈（）4月20日消息:你相信吗?只要php输入16句简单描述，AI就能生成11分钟的动画了。近日，微软亚洲研究院推出了NUWA-XL超长视频生成模型，采

站长之家 2023-04-20

职工医保缴费年限新规2023年职工医保缴费需要注意什么？

: 职工医保缴费年限新规是男性要缴满25-30年，接下来跟社保网小编一起来看看职工医保缴费年限新规是什么？职工医保缴费要注意什么？工医保缴费年

律法网 2023-04-20

10岁男孩打赏主播 10天花掉30000多元_世界热资讯

: 10岁男孩打赏主播10天花掉30000多元

浙江电视台《小强热线》栏目 2023-04-20

看热讯：dnf超越巅峰称号怎么得（dnf超越极限者称号怎么得）

: DNF超越巅峰称号的属性非常不错，地下城金币量+10%，实在是搬砖党的利器。那怎么获得呢？获得超越巅峰称号非常简单，只要登记到85级，系统会自

互联网 2023-04-20

天天看点：兰州大学2023年强基计划公布 4月20日起报名

: 兰州大学2023年强基计划公布4月20日起报名,强基,兰州大学,高考,研究生,校考

央广网 2023-04-20

X 关闭

科技

数码

more+

产品

more+

X 关闭

众测

more+

: 京张高铁每日开行17对冬奥列车

　　京张高铁每日开行17对冬奥列车　　预计冬奥服务保障期运送运动员、技术官员、持票观众等20万人次　　2月6日，2022北京新闻中心举行“北

: 北京冬奥会开幕式上小学生朱德恩深情演绎《我和我的祖国》

　　北京冬奥会开幕式上小学生朱德恩深情演绎《我和我的祖国》　　9岁小号手苦练悬臂吹响颂歌　　2月4日晚，在北京冬奥会开幕式上，9岁的

: 2022北京冬奥会开幕式这19首乐曲串烧不简单

　　多名指挥家列曲目单再由作曲家重新编曲本报专访冬奥开幕式音乐总监赵麟　　开幕式这19首乐曲串烧不简单　　“二十四节气”倒计时、

: “一墩难求” 冰墩墩引爆购买潮

设计师：没想到冰墩墩成爆款一墩难求冰墩墩引爆购买潮北京冬奥组委：会源源不断供货北京冬奥会吉祥物冰墩墩近日引爆购买潮，导致一墩难求

排行

more+