阿里巴巴(Alibaba)今日正式发布全新一代视觉生成模型 Wan2.6 系列,主打 “人人都能成为视频主角”,让创作者可将自己直接融入 AI 生成的视频中,并保留原本的外貌与声音,进一步提升 AI 视频内容在专业制作与叙事层面的表现。
Wan2.6 系列最大亮点在于全新推出的 参考生成视频模型 Wan2.6-R2V(Reference-to-Video)。用户只需上传一段包含人物外貌与声音的参考视频,再配合文字指令,即可生成由同一角色 “主演” 的全新场景视频。该模型不仅适用于人物,也可用于动物、物体,甚至支持多主体同框生成,并在视觉与声音上保持高度一致性。
阿里巴巴指出,Wan2.6-R2V 是中国首个实现 “参考视频生成视频” 的模型,能够让用户或指定角色自然地置入 AI 场景中,改变短剧创作与视频内容生产的方式,同时大幅简化制作流程。
除了全新 R2V 模型,Wan2.6 系列也对多项既有模型进行全面升级,包括 文字生成视频(Wan2.6-T2V)、图片生成视频(Wan2.6-I2V) 以及两款图像生成模型 Wan2.6-image 与 Wan2.6-T2I。
新一代模型引入智能多镜头叙事能力,支持更连贯、具表现力的剧情发展,同时在画面一致性、视听同步及音频生成方面均有所提升,使生成的视频在真实感与沉浸感上更进一步。
在创作时长方面,Wan2.6 系列支持最长 15 秒 的视频输出,为创作者提供更充裕的叙事空间。结合更高的指令理解精准度与画面品质提升,整体生成效果更贴近电影级与专业级制作水准。
在图像生成方面,Wan2.6 系列支持文字与图像交错输出,并具备更强的逻辑推理能力,有助于构建连贯的视觉故事。同时,新模型在艺术风格控制、写实人像生成及图像编辑方面表现突出,能够精准呈现创作者的艺术意图,并深度理解中英文长文本指令。
用户目前可通过 阿里云 Model Studio 及 Wan 官方网站使用与部署相关模型,未来也将整合至阿里巴巴旗下旗舰 AI 应用 Qwen App。
阿里巴巴表示,自今年初首次推出 Wan 系列以来,该系列持续迭代升级,展现公司在 AI 多媒体技术领域的研发实力与创新布局。




