产品派
返回

阿里巴巴发布多模态模型家族 涵盖图像音乐及长视频创作引擎

AIInfoQ 中文站2026/9/22 21:11:38
AI 导读

在云栖大会现场,导演陆川展示了利用阿里巴巴多模态模型制作的历史短片,过去需要数月且耗资千万的明代历史场景复原,在 AI 协助下仅用 5 天便告完成,展现出多模态技术进入专业内容生产工作流的实际效能。

当前多模态技术正经历从单模态向融合生成、从离线内容向实时流式体验的演进。为此,阿里巴巴集中更新了多模态模型矩阵,推出图像生成模型 Qwen-Image-3.1、音乐模型 Happy Shrimp 1.1 与面向长视频的 Agentic PE 智能体创作引擎,并计划于 11 月推出新一代视频生成模型,未来三年还将推进原生全模态统一模型的研发。

在图像生产维度,工业级场景正从单纯追求画质转向确定性与高可控性。面向科研制图、电商营销及影视分镜等专业诉求,Qwen-Image-3.1 强化了对专业知识结构与排版层级的理解能力,降低随机抽卡带来的不确定性。

例如在科研制图领域,模型能够先理解复杂的科学原理,再准确呈现微观结构与逻辑流程,避免解剖结构与学术标注出现失真;在电商营销场景中,模型能够协同组织中文标题、小字细节与图示,排布出清晰的视觉层级。

在影视前期筹备环节,模型可以依据文字剧情描述,批量生成包含动作、对白与镜头语言的分镜脚本,为后续长镜头和视频资产构建提供明确的视觉基准。

此外,Qwen-Image-3.1 引入了像素锚定、结构勾勒、版面构建、角色塑造与世界营造等五维编辑能力,通过多层次推理支持创作者提取结构并重新生成视觉内容。

在音频与视频领域,Happy Shrimp 1.1 通过引入音乐审美建模与强化学习,强化旋律记忆点与人声唱法表现,支持百余种曲风及局部音轨编辑;阿里巴巴下一代视频模型则聚焦更长、更可控、更完整与更智能四个维度,探索通过运动轨迹、3D 白模等多元控制信号,推动 AI 从生成素材走向全流程叙事创作。

阿里巴巴多模态大模型生成式AI视频生成内容生产

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文