Wan 2.5 是阿里的开源视频生成模型。它支持文生视频和图生视频,输出 5 或 10 秒的片段,480p 或 1080p,而且——这一点常被低估——在同一次生成里出音频,且已经和画面对齐。
如果你有一块够强的显卡,可以自己跑。这个页面是给其他人准备的。
Wan 迭代很快:2.2、2.5、2.6,现在到了 2.7。但大多数人说"Wan"时指的仍然是 2.5,这有个很现实的原因——它卡在了画质与成本的甜蜜点上。更新的版本增加了分辨率和时长,也相应地更贵。
| 版本 | 新增了什么 | 什么时候值得用 |
|---|---|---|
| Wan 2.2 | 让它火起来的那一版 | 你要最便宜的选项 |
| Wan 2.5 | 原生音频、1080p、更稳的运动 | 大多数工作 |
| Wan 2.6 | 多模态输入,最长 15 秒 | 你需要更长片段或参考图控制 |
| Wan 2.7 | 下一代画质 | 你追求极致保真度且不在意花钱 |
大多数视频模型丢给你一段无声片段,然后让你自己去找配乐。Wan 2.5 把声音作为同一次生成的一部分产出——脚落地时脚步声就到,说话时口型对得上,环境音也贴合场景。
这件事比多一档分辨率重要得多。事后对音频是做短视频里最慢的一环,而且一旦做得不好,AI 片段的"塑料感"立刻就露出来了。
这一点我们直说,因为它能解释包括本站在内的每一个"免费" AI 视频网站:
通过托管 API,Wan 2.5 大约是 480p 每秒 $0.05、1080p 每秒 $0.15。所以一段 5 秒的 1080p 片段,真实成本约 $0.75——这还没有任何人赚到一分钱。
这就是为什么没有一个诚实的网站会提供无限免费高清视频。我们的做法是:注册赠送起步额度,免费生成走轻量模型,Wan 2.5 完整画质在付费档。如果某个站承诺无限免费的 Wan 2.5,先看看它上线多久了。
写运动,别写描述。 提示词该说的是什么在变,而不是画面里有什么。
只留一个主体。 相比三件事同时发生的拥挤画面,Wan 2.5 处理单一清晰主体的能力强得多。
用 480p 反复调。 同样的提示词、同样的种子行为,成本只有三分之一。等运动对了再上 1080p。
让音频参与叙事。 把你想要的声音写出来——"雨打在铁皮屋顶上""她轻声说你好"——而不是听天由命。
模型权重是开放的,所以——在你自己的硬件上跑就是免费的。替你跑要花 GPU 时间,所以托管访问按额度计费。在这里你可以先拿到起步额度,不用付钱。
可以,通过 ComfyUI。你需要一块显存充足的现代显卡,生成速度会比托管推理慢。如果你持续大量生成且拥有硬件,这是个真实可行的选项。
需要超过 10 秒的片段或参考图控制,选 2.6;其他情况选 2.5——更便宜,而且画质差距比版本号看起来的要小。
Sora 和 Veo 在提示词理解和长镜头连贯性上通常更强。Wan 2.5 成本只有它们的零头且开放权重,这就是它出现在如此多工具里的原因。对短片段来说,实际差距比价格差距小。
都支持。文生视频从零构建画面;图生视频保住你的原图并添加运动。图生视频对结果的控制力强得多。
480p 或 1080p,5 秒或 10 秒,支持 16:9、9:16、1:1。