万相 3.0 正式上线:AI 视频开始从“写提示词”走向“读方案”
当 PPT、文档、参考图和音频都能进入同一条生成链路,视频创作的门槛正在从“会不会剪”,变成“能不能把需求说清楚”。

AI 视频的竞争,正从“单次画面惊艳”,转向“能否理解并执行一整套创作资料”。
这次更新,重要的不只是 30 秒
8 月 24 日,阿里云视频生成模型万相 Wan3.0 正式公开上线。按照官方记录,它把文生视频、首帧或首尾帧生视频、参考生视频放进同一套模型,支持图片、视频、音频、文件和网页等素材,最长可生成 30 秒、30fps 的视频,最高可选 1080P。
数字很醒目,但更值得关注的是“文件也能成为输入”。过去做 AI 视频,常见方式是写提示词、抽结果,再凭感觉修改;现在,策划案、产品资料和参考素材开始进入同一条生成链路。模型面对的不再只是一句话,而是一整套创作约束。
这不意味着上传 PPT 就能自动得到成片。输入形式和生成长度变了,角色稳定、事实准确、镜头节奏仍要人工验收。真正的变化,是团队可以把散落在群聊、脚本和素材盘里的信息,整理成模型更容易执行的工作包。
AI 视频正在告别“抽卡式创作”

文档越长,未必越有帮助。型号、价格、旧版口径和内部备注混在一起,模型也会继承这种含糊。最稳妥的做法,是把原始资料先压成一页创作简报,再拆成镜头卡:每个镜头只写主体、动作、环境、机位、声音和硬性限制。先定义什么不能错,再讨论画面够不够惊艳。
一套普通团队也能执行的样片流程
第一次不要挑战完整广告片。选一个 10—15 秒、目标单一的片段,用它验证人物、商品、场景和节奏是否可控。只要这一段跑顺,后续扩展到 30 秒才有意义。
确定唯一目标|只选产品展示、氛围建立或动作演示中的一个,不要让第一条样片同时承担全部信息。
整理一页简报|写清受众、比例、时长、三个核心信息、视觉风格和禁止内容;旧参数与内部备注直接删除。
拆成三到五个镜头|每个镜头描述主体、动作、环境、机位和声音,明确开头与结尾,避免一段话塞进多条叙事线。
准备参考素材|商品用清晰多角度图片,人物用统一造型,动作可附参考视频,音乐与旁白分开准备。
先低成本跑样片|先用较短时长或较低分辨率验证构图与一致性,方向正确后再提高画质和长度。
按清单验收并后期|保留失败原因,用超分、插帧、降噪等工具处理可修复问题;事实或主体错误则回到生成环节。
示例:把产品 PPT 变成 12 秒预热视频
假设要为一款户外电源制作短视频。先从 PPT 中只保留已经确认的外观图、使用场景和三个卖点,把未经核实的续航数字删掉。镜头可以拆成三段:清晨露营地建立环境;人物接上咖啡机;最后给产品和品牌留出干净定格。
提示词示例|制作一条 16:9、12 秒的写实产品预热视频。场景为清晨露营地,暖色阳光,轻微手持跟拍。镜头一展示帐篷与桌面;镜头二人物将咖啡机接入参考图中的户外电源;镜头三缓慢推进产品正面并停留。保持产品外观、接口位置和颜色一致;不要新增屏幕参数,不要出现夸张电弧,不要生成字幕。
生成后不要只问“好不好看”,而要逐项检查:商品是否变形,人物动作是否合理,镜头衔接是否跳跃,声音是否抢戏,画面有没有擅自添加卖点。标准越具体,下一轮修改越快。
一张够用的样片验收表
|
检查项 |
要问的问题 |
通过标准 |
|
主体一致 |
商品外观、人物服装是否变化 |
关键帧逐一比对 |
|
事实边界 |
是否擅自增加参数或功能 |
未经确认的信息不出现 |
|
镜头连续 |
动作、视线和空间关系是否跳变 |
转场自然、方向一致 |
|
声音可用 |
对白、音乐、环境声是否互相遮挡 |
关键信息清楚可辨 |
在算家云,把视频生成拆成可控环节

一条 AI 视频的质量,往往不只由主模型决定。参考图需要生成或抠图,原视频可能要抽帧,成片还要放大、补帧、降噪、换背景或对口型。这些环节都需要 GPU,也适合放进 ComfyUI 或开源模型工作流中反复调试。
算家云镜像社区提供图像、视频、音频和大模型等现成环境,热门镜像可以一键启动,并按需使用 GPU。团队可以把它当作视频实验台:生成参考素材、测试开源视频模型,再完成超分、插帧和后期处理,不必从本地驱动和权重下载开始折腾。
下一阶段,拼的是“需求表达能力”
Wan3.0 的上线给国内 AI 视频行业释放了一个清晰信号:创作入口正在从一句提示词,升级为文档、素材和镜头语言共同驱动的生产流程。模型会继续变强,但结果是否可用,越来越取决于团队有没有把目标、事实和边界整理清楚。
如果你正在做产品视频、课程演示或短剧样片,可以先去算家云镜像社区搭一条最小工作流:一份创作简报、一组参考素材、一个短镜头和一张验收表。先得到可控的 12 秒,再考虑更长的故事。
从 12 秒可控样片开始,搭建你的 AI 视频工作流
更多推荐



所有评论(0)