阿里云Wan3.0视频大模型上线:单次生成30秒还能读文档
·
8月24日,阿里云视频生成大模型 Wan3.0 正式上线。据多家媒体报道,它单次可生成最长 30 秒视频,最大的变化是首次支持文档格式输入:doc、xls、ppt、pdf、md 直接当素材用,"把 PPT 变成讲解视频"这类需求,模型自己就能干了。据报道 API 价格 0.3 元/秒起,限时 7 折。距 8 月初开启公测(据报道)约两周,这次算是正式面向开发者开放。
技术本质:全能参考视频生成
Wan3.0 官方定位是"全能参考视频生成模型",统一支持文生视频、图生视频(首帧/首尾帧)和参考生视频。和上一代万相模型相比,核心变化在输入侧:
- 多模态参考:参考图像最多 10 张,参考视频、音频各最多 5 段,还能直接传文件(100MB 以内、50 页以内)和网页链接。
-
- 素材可指代:提示词里可以用"图1""视频1""音频1"指代素材,多个素材按剧本协同出场。
-
- 时长升级:单次生成 2-30 秒、30 帧每秒,从"生成一个镜头"走向"讲一段完整的故事"。
文档输入这件事值得多说两句。以前视频生成只能吃文本和图片,想根据一份 PPT 出片,得先把内容提炼成脚本,再逐段生成。现在模型直接读文件,产品参数、表格数据、页面结构这些信息不需要人来转述,理论上视频内容和原始资料的对齐程度会更高。当然"理论上"三个字很重要,实际效果取决于模型对长文档的理解能力,该验证的还得验证。
- 时长升级:单次生成 2-30 秒、30 帧每秒,从"生成一个镜头"走向"讲一段完整的故事"。
变了什么、没变什么
变的地方有三点:输入从"一句话、一张图"扩展到"一份完整资料",文档转视频的中间环节被砍掉一大截;时长从几秒拉到 30 秒,还支持智能时长模式;价格下探,0.3 元/秒起配合 7 折活动(据报道),批量生成成为可能。
没变的地方同样关键:视频生成是"生成式"不是"事实还原",数字、文字、流程依然可能出错;生成耗时仍是分钟级(官方文档说通常 1-5 分钟),所以 API 是异步的,流程还是"创建任务、轮询获取"。对做集成的团队来说,异步模式要提前设计好任务管理和结果回调,不能按同步接口的思路写代码。
开发者怎么接入
模型名是 wan3.0-video(标准版)和 wan3.0-video-prime(高速版,据报道能力对齐标准版、速度显著提升)。官方 API 参考(北京地域)示例如下:
curl 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"wan3.0-video","input":{"prompt":"把这份产品文档做成30秒宣传视频","media":[{"type":"file","url":"https://example.com/product.pptx"}]}}'
```
返回 task_id 后轮询查询,官方建议间隔约 15 秒;任务成功后视频链接 24 小时内有效,记得及时转存。三个坑:
- 地域一致性:模型、接口地址、密钥必须同一地域,跨地域直接失败。
- - 参数互斥:首尾帧和参考素材两类输入不能混用,混用会报错。
- - 素材限制:参考视频、音频单段 1-15 秒、总时长不超 15 秒;文件不超 100MB、50 页。
## 实际怎么用
典型场景:产品宣传片初稿、文档转讲解视频、多素材混剪。建议先小批量试:
1. 先跑通异步流程再谈批量:创建任务、轮询、结果转存先封装成小工具。
2. 2. 商用必须人工审片:文字、数字、品牌元素容易错,发布前逐帧检查。
3. 3. 算清成本:按秒计费,30 秒一条、一天几十条的成本先估算。
4. 4. 素材版权自查:参考素材要确保有使用权。
另外提一句提示词:文档输入模式下,把文档里要重点突出的内容在提示词里点明,比全靠模型自己理解更稳,生成的镜头也更贴资料。
适合谁用:做内容工具、营销中台、培训材料的团队,能把"文档出片"直接接进现有流程。不适合谁用:对画面内容精确性要求极高的场景,比如带大量公式、精确数字的严肃内容,现阶段还是人工制作更稳。对普通开发者来说,这类模型把"文档到视频"的链路压成一次 API 调用,视频不再只是剪辑岗位的产出,业务团队自己就能出初稿。但能生成不等于能用:出片质量、合规审核、素材版权这些环节不会消失,只是换了个位置,接手的还是干活的人。
## 结尾
当视频生成开始"读文档",内容生产的流水线又短了一截。如果给你一个能读 PPT 和表格的视频模型,你会拿它做什么?你怎么看,评论区聊聊。
更多推荐
所有评论(0)