行业新闻

阿里视频大模型 Wan 3.0 公测,支持文档转视频

Wan 3.0 将视频生成从单镜头推向完整叙事,并首次支持文档输入,降低视频创作门槛,是生产力工具升级的重要信号。

阿里视频生成大模型 Wan 3.0 开启公测,单次可生成 30 秒连贯视频,支持文本、图片、音频、视频及 doc、xls、ppt 等文档输入,能自动生成课件、演示和汇报。模型强调真实感,人像千人千面,并提升视频编辑能力。API 按分辨率计价,最高 1.2 元/秒。

正文摘录

8月6日,阿里巴巴视频生成大模型 Wan 3.0 开启公测,在生成时长、万能创作、全能参考以及真实世界还原等维度全面升级:单次可生成30秒视频,完整表达创作意图;在文本、图片、音频、视频四种基础模态之外,首次支持 doc、xls、ppt、pdf、md 等文档格式输入;力求准确还原真实世界——人物千人千面,每一帧画面既真实、又可信。 生成时长的延展是 Wan3.0 最直观的升级。单段30秒生成让叙事节奏更游刃有余,连续运镜、一镜到底等复杂镜头语言得以充分表达,AI 视频从“生成一个镜头”走向“讲述一段完整的故事”。Wan3.0 还有智能时长功能,可根据提示词自动推荐合适时长。 Wan3.0 正从视频生成模型跃迁为信息的表达载体,不仅能以文本、图片、音频、视频作为全能参考,还能读取文档、ppt 等结构化信息,搭配提示词即可生成教学课件、产品演示、业务汇报等内容。支持格式覆盖 doc、xls、ppt、pdf、md 等,单个文件或链接不超过100MB、50页。比如上传一个智能眼镜产品的 ppt,配上提示词,就能得到一个完整的形象片。 这背后,是模型强大的提示词工程与指令遵循能力,将提示词转化为调度输入、控制表达的中枢。 视频生成模型正从内容生成升级为生产力工具,用户对画面的要求不止于清晰,更要真实。无论是现实场景还是数字化信息,Wan3.0 都力求精准地复刻与呈现。生成视频中的人像力求“千人千面”,更敏锐地刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作彼此联动。全能参考任务中,角色、道具、声音、空间关系、风格等细粒度维度均可稳定保持。数字化信息的画面审美也同步提升,让图表、数据与界面内容同样拥有质感。 此外,Wan3.0 的视频编辑能力也有大幅提升,支持修改画面、剧情与台词。Wan3.0 在声音质感与文字准确度方面仍有进步空间。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-08-07原文

相关内容