DataLearner 标志
VI

VideoBooth

视觉大模型

VideoBooth

发布时间: 2023-12-01更新于: 2023-12-05浏览量: 573
在线体验GitHubHugging Face对比
模型参数
30亿
上下文长度
2K
多语言支持
暂无数据
推理能力
暂无数据

VideoBooth 是由 上海人工智能实验室 发布的 AI 模型,发布时间为 2023-12-01,定位为 视觉大模型,参数规模约为 30亿,上下文长度为 2K,模型文件大小约 10.04GB,采用 Apache 2.0 许可。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

VideoBooth

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
2K tokens
最大输出长度
暂无数据
模型类型
视觉大模型
输入/输出模态
暂无数据
发布时间
2023-12-01
模型文件大小
10.04GB
MoE架构
否
总参数 / 激活参数
30亿 / 不适用
知识截止
暂无数据
VideoBooth

开源和体验地址

代码开源状态
预训练权重开源
Apache 2.0- 免费商用授权
Hugging Face
暂无
在线体验
暂无
VideoBooth

官方介绍与博客

VideoBooth

API接口信息

接口速度
暂无数据
暂无公开的 API 定价信息。
VideoBooth

发布机构

上海人工智能实验室
上海人工智能实验室
查看发布机构详情
VideoBooth

模型解读

LaVie团队最新的作品,基于图片prompt生成视频的大模型。这个模型最大的特点是提出了一个新的任务,即将文本生成视频的任务变成文本+图片一起生成新视频。

这个任务的目标是生成不仅与文本描述相匹配,而且还符合图像提示中指定的视觉属性的视频。

为了实现这一目标,模型采用了两阶段方法:

通过图像编码器进行粗略的视觉嵌入:使用图像编码器从图像提示中提取视觉特征。然后,这些视觉特征被映射到文本嵌入空间,并与文本嵌入连接起来。这提供了图像提示的视觉外观的粗略编码。

通过注意力注入进行精细的视觉嵌入:将图像提示直接注入到文本到视频模型的跨帧注意力模块的不同层中。这是通过将图像提示的潜在表示作为额外的键和值附加到注意力模块来实现的。

这种粗到细的方法具有以下好处:

图像编码器提供了图像提示的全局表示,而注意力注入提供了细粒度的细节。

通过将图像提示注入到注意力模块中,模型可以直接从图像提示中借用视觉线索,以细化生成帧中的合成细节。

在不同层注入图像提示,使模型能够使用具有空间细节的多尺度特征来控制精细视觉特性的生成。

总结来说,这个模型提出了一种两阶段方法,首先使用图像编码器嵌入粗略的视觉信息,然后通过将图像提示直接注入到文本到视频模型的注意力模块中来进一步细化生成的视频。这种粗到细的方法帮助模型捕捉并反映在生成的视频中图像提示指定的视觉属性。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码