成都汇阳投资关于Sora 正式上线,多模态模型的里程碑
12月10日,OpenAl正式上线 Sora,并向包括美国在内的多数国家用户开放,用户可在OpenAI官网上体验Sora。同时,Sora 被包含在ChatGPT Plus 和ChatGPT Pro 的会员订阅方案中, 用户无需额外付费。 其中,订阅Plus方案的用户可使用 Sora 生成最多50个分辨率达720p、时长为5秒的高级视频而Pro方案能生成最多500个分辨率达1080p、时长为20秒的高级视频,并且提供去水印功能。
新 Sora 视频再创作能力大幅提升
相较于 OpenAI2 月份发布的版本, 此次上线的新 Sora 新增 Storyboard、Remix、Re-cut 等功能 ,视频再创作能力大幅提升 ,并且优化了视频生成速度及生成方式。新 Sora 的新功能包括 1)Storyboard:类似于电影里的分镜,即用户只需借助文字设计几段视频帧或直接上传图片作为静态视频帧, 并在视频帧之间预留一些时间供Sora 发挥,Sora 便能自动把这些视频帧串联起来形成一段完整的视频:2)Remix:通过不同的文字描述对视频中的元素进行替换、删除或重构, 比如可以把图书馆变成宇宙飞船:3)Re-cut:智能识别并剪切出视频中的最佳帧,并将其导入 Storyboard 中 ,拓展该视频帧:4)Loop:用于创建无限循环的视频:5)Blend:将两个视频无合并为一个视频:6)Style presets:为视频预设风格 , 比如黑白电影、纸片人等。 此外,借助 Sora Turbo,新Sora 的视频生成速度显著提升, 同时,新 Sora 将视频生成方式扩展为文/文+图/文+视频生成视频。
国内企业开始加速研发并选代A I 视频生成产品
今年以来 , 国内企业开始加速研发并选代 AI 视频生成产品 ,产品能力不断提升 ,应用场景持续拓宽。1)今年6月,快手 AI 团 队发布可灵 AI 视频生成大模型 ,可生成长达 2 分钟 、分辨率达 1080p 的视频 ,可灵 AI 主要功能包括文生视频 、 图生视频 、 视频续写等;2)今年 7 月 ,智谱 AI 上线视频生成产品智谱清影 ,并在 11 月 进行全新升级 ,支持生成时长为 10 秒的 4K 超高清视频 ,除常规的文生视频和图生视频功能外 ,智谱清影引 入 CogSound 模型 , 可以对为 生成的视频添加背景音乐:3)今年 8 月 , 字节推出即梦 AI 一站式创作平台, 随后在 11 月 宣布即梦 AI 两大视频模型 S2.0 Pro 和 P2.0 Pro 正式全量上线,其中, S2.0Pro 在图生视频场景具有较高的首一致性,能够保持视频与用户输入图像的 色彩 、 风格等保持一致 ,P2.0Pro 具有极高提示词遵循能力, 能够在一句提示词内实现多个镜头切换及多镜头组合, 同时保持视频内形象主体、 风格和氛围的一致性 。此外 ,Minimax、 阿里云等初创企业及大模型厂商也在布局 AI 视频生成赛道, 整体来看,视频生成工具今年以来, 国内企业开始加速研发并选代 AI 视频生成产品,产品能力不断提升 ,应用场景持续拓宽 。 1)今年 6 月 ,快手 AI 团队发布可灵 AI 视频生成大模型, 可生成长达 2 分钟、分辨率达 1080p 的视频,可灵 AI 主要功能包括文生视频、 图生视频、 视频续写等;2)今年 7月,智谱AI 上线视频生成产品智谱清影 ,并在11 月进行全新升级 ,支持生成时长为 10 秒的 4K 超高清视频 , 除常规的文生视频和图生视频功能外,智谱清影引 入 CogSound 模型 , 可以对为生成的视频添加背景音乐:3)今年8月, 字节推出即梦AI 一站式创作平台, 随后在 11 月宣布即梦 AI 两大视频模型 S2.0 Pro 和 P2.0 Pro 正式全量上线 , 其中 ,S2.0Pro 在图生视频场景具有较高的首一致性 , 能够保持视频与用户输入图像的色彩 、 风格等保持一致 ,P2.0Pro 具有极高提示词遵循能力, 能够在一句提示词内实现多个镜头切换及多镜头组合 , 同时保持视频内形象主体、风格和氛围的一致性。此外 ,Minimax、 阿里云等初创企业及大模型厂商也在布局 AI 视频生成赛道 , 整体来看 ,视频生成工具的能力不断提升 , 未来有望渗透更多应用场景。
相关公司
三六零 (601360) : 目前360搜索是中国搜索引擎的 Top2 , 市场份额为 35%,公司的人工智能研究院从 2020 年开始一直在包括类 ChatGPT 技术在内的 AIGC 技术上有持续性的投入 ,但截至目前仅作为内部业务自用的生产力工具使用 ,且投资规模及技术水平与当前的 ChatGPT3 相比还有较大差距 , 各项技术指标只能做到略强于 ChatGPT2 。 由于训练数据源及应用方向的原因 ,在中文环境下的实际效果强于 ChatGPT2 。360 在数据资源端有丰富的多模态大数据积累和相关语料 、尤其是中文语料 ,相较于国外同行落后的是预训练大模型和有效的多模态数据清洗与融合技术 。公司有充足的资金储备可用于购买大规模算力 ,在继续深入自行研发的同时 ,不排除寻找强有力的合作伙伴 , 以开放的心态搭建多方共享平台 、补足短板 ,快速缩小差距 。公司也计划尽快推出类 ChatGPT 技 术的 demo 版产品 。
中科曙光 (603019):伴随宁夏 “ 算力交 易平台 ” 的上线 , “ 东数西算 ” 工程迎来重要里程碑 。2月24日 ,由宁夏回族自治区联合中科曙光 、中国电信宁夏公司 、北京国际大数据交易所等打造的国内首个一体化算力交易调度平台——东数西算一体化算力服务平台正式上线 。该平台上线后将整合宁夏地区零散算力资源 ,解决算力输出、应用 、交易等难题 ,赋能宁夏“ 六新六 特 ”等产业数字转型升级。
参考资料:20241212- 山西证券-计算机行业点评: Sora正式上线, 多模态模型的里程碑
免责声明:以上信息出自汇阳研究部,内容不做具体操作指导,客户亦不应将其作为投资决策的唯一参考因素。据此买入,责任自负,股市有风险,投资需谨慎。