Wan 3.0 教學:30 秒 AI 影片、6 個官方案例、價格與 Prompt
Wan 3.0 怎麼用?從 6 支官方影片拆解純文字、多圖參考、動作、多語言、UGC 與文件轉影片,附價格與可直接套用的 Prompt。
Wan 3.0 是阿里巴巴最新一代 AI 影片生成模型。它能用文字、圖片、影片、音訊、文件與公開網頁產生影片,單次最長 30 秒,並可輸出 480P、720P 或 1080P。
本文除了介紹功能與價格,也會整理 Prompt 的寫法。Prompt 就是你交給模型的生成指令,用來說明主體、場景、動作、鏡頭與聲音。
真正值得注意的不是把原本的短片硬拉長,而是創作者終於能把人物照、商品圖、配音、動作參考和企劃文件一起交給模型。過去需要分別處理的文生影片、圖生影片與參考生影片,現在被整合進同一個入口。
Wan 3.0 適合拿來做社群短片、商品廣告、教學摘要與概念影片。不過它還不是「上傳企劃書就能直接交件」的全自動剪輯師。官方也承認音訊質感與畫面文字準確度仍在改善,因此字幕、品牌名稱、產品細節與對白都要人工檢查。
Wan 3.0 正式上線,跟公測有什麼不同?
Wan 3.0 在 2026 年 8 月初先開放測試。到了 8 月 24 日,Alibaba Cloud Model Studio 官方發表頁已改為 Generally Available,代表一般開發者不必再提出邀測申請,就能在體驗中心使用模型,或透過 API 讓自己的程式自動呼叫模型。
你在部分舊文件裡仍可能看到「邀測」字樣,那是文件更新時間不同造成的落差。以目前官方發表頁的狀態來看,Wan 3.0 已進入正式可用階段。
這次同時有兩個版本:
| 模型 | 定位 | 適合誰 |
|---|---|---|
wan3.0-video |
Standard 標準版,價格較低 | 個人創作者、測試概念、一般內容製作 |
wan3.0-video-prime |
Prime 優速版,生成速度較快、價格較高 | 在意等待時間與大量產出的團隊 |
第一次使用建議先選 Standard。當工作量大到等待時間真的影響交付,再考慮 Prime,比一開始就為速度多付費更實際。
Wan 3.0 有哪些新功能?
1. 單次最長生成 30 秒
過去許多 AI 影片模型一次只產生數秒到 15 秒的片段,創作者必須反覆延長、剪接,人物和場景也容易在接點改變。Wan 3.0 把單次生成上限提高到 30 秒,並提供智慧時長,讓模型依內容建議長度。
30 秒真正帶來的價值,是能容納開場、發展與收尾。產品廣告可以先建立情境,再展示細節,最後回到品牌畫面;教學短片也能在同一段影片中完成問題、步驟與結果。
但長度越長,需要模型同時維持的人物、道具與鏡頭關係也越多。新手不必每次都選 30 秒,先用 5 至 10 秒確認風格,通常比較省錢,也更容易修改。
2. 文字、圖片、影片、音訊與文件都能變成影片
Wan 3.0 的「全能參考」是這次最有實用價值的升級。依官方 API 文件,參考模式最多可放入 10 張圖片、5 段影片與 5 段音訊。文件則支援 docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers 與 md。
這代表你可以把商品不同角度的照片、演員外型、運鏡參考與聲音素材放在同一個任務裡,再用提示詞說明各素材的角色。模型不只看「畫面長什麼樣」,也會理解它們之間的關係。
文件轉影片更適合做內容初稿。例如把產品簡報轉成介紹短片、把課程講義轉成教學摘要,或把報表內容轉成動態說明。單一文件上限為 100 MB,PDF、Word、PowerPoint、Keynote 與 Pages 等格式最多 50 頁;公開網頁也能直接當輸入,但必須是不需登入即可讀取的頁面。
3. 角色、商品與空間一致性更受重視
AI 影片常見的問題不是單張畫面不夠漂亮,而是人物換個角度就變臉、商品結構在鏡頭之間改變。Wan 3.0 將人物五官、髮型、服裝、商品材質、Logo、角色站位與攝影機視角都列為一致性控制重點。
這項升級對廣告與連續敘事比「更電影感」更重要,因為觀眾一旦看到商品按鍵位置改變,或主角在第二個鏡頭突然換人,影片就很難直接使用。只是官方展示代表模型的目標能力,不等於所有素材都能一次成功,產出仍要逐鏡檢查。

4. 生成後可以繼續編輯
Wan 3.0 延續 Wan 2.7 的影片編輯能力,可依指令修改畫面、劇情與對白,不必每次都從零生成。對創作者來說,這讓工作流程比較接近「先出初剪,再局部修改」,而不是每次抽一支全新的影片。
實務上仍建議先把最容易出錯的項目固定下來,例如角色、商品外型、長寬比和核心動作。若連這些都持續更換,後續編輯仍可能變成反覆重做。
Wan 3.0 價格多少?
Wan 3.0 Standard 採影片秒數計費。官方國際版牌價如下:
| 解析度 | 每秒牌價 | 生成 10 秒 | 生成 30 秒 |
|---|---|---|---|
| 480P | US$0.05 | US$0.50 | US$1.50 |
| 720P | US$0.10 | US$1.00 | US$3.00 |
| 1080P | US$0.20 | US$2.00 | US$6.00 |
截至 2026 年 8 月 25 日,官方頁面顯示 Standard 在 2026 年 9 月 24 日 00:00(UTC+8)前有 30% off,折後每秒為 US$0.035、US$0.07 與 US$0.14。實際扣款、地區稅費與活動資格仍以 Model Studio 控制台帳單為準。
最省成本的做法,是用 480P 或 720P 測試構圖與動作,確認提示詞後再用 1080P 產出需要交付的版本。直接用 1080P 反覆抽片,成本很快就會放大。
Wan 3.0 使用教學:完成第一支 AI 影片
以下使用 Alibaba Cloud 國際版 Model Studio 示範。台灣使用者可選 Singapore 地區,畫面可能以英文顯示。
步驟一:進入 Wan 3.0 體驗中心
開啟Wan 3.0 官方體驗入口,登入 Alibaba Cloud 帳號。台灣使用者可從 Singapore 地區進入,頁面會直接開啟 Wan3.0 體驗中心。
如果只是想先了解功能,可以從官方發表頁點選 Try now;需要串接產品時,再進入 Start building 查看 API。
步驟二:先選對生成方式
目前體驗頁主要顯示 All-Purpose Reference 與 First & Last Frame。不要急著上傳所有素材,先依你手上的資料選擇對應用法:
| 你手上的素材 | 建議模式 | 適合用途 |
|---|---|---|
| 只有一段文字想法 | Text to Video | 概念短片、氣氛鏡頭 |
| 一張主視覺或人物照 | First Frame/Image to Video | 讓靜態圖片動起來 |
| 已經設計好開頭與結尾 | First and Last Frames | 控制轉場與畫面落點 |
| 多張人物、商品、場景圖 | Reference to Video | 維持角色與商品一致性 |
| 簡報、報告或公開網頁 | File/Link | 教學摘要、產品說明、動態報告 |
如果主體外型不能改,例如真實商品或固定角色,優先使用參考素材,不要只靠文字描述。若你更在意畫面怎麼動,而不是外型細節,單張首幀就已經夠用。
步驟三:上傳素材並清楚編號
參考模式會依上傳順序把素材編成 Image 1、Image 2、Video 1。提示詞裡要直接使用這些編號,模型才知道每個素材扮演什麼角色。
例如你上傳一張人物照、一張商品照與一張咖啡店場景,可以寫:
Image 1 的人物坐在 Image 3 的咖啡店窗邊,拿起 Image 2 的保溫杯喝水。保留人物五官、髮型、服裝與保溫杯的 Logo、瓶蓋結構和霧面金屬材質。
素材不是越多越好。兩張用途重複、角度衝突的人物照,反而可能讓模型不知道該以哪張為準。每個素材都應該有明確用途。
步驟四:用結構化 Prompt 描述影片
官方 Prompt 指南的基礎公式是「主體+場景+運動」。想提高控制力,再加入鏡頭、光線、風格與聲音。
我建議新手直接使用下面這個結構:
影片目的:這支影片要讓觀眾理解什麼?
主體:人物或商品是誰?哪些特徵不能改?
場景:時間、地點、前景與背景。
動作:主體先做什麼,接著做什麼?
鏡頭:景別、角度、運鏡與轉場。
聲音:對白、環境音、音效、背景音樂;不需要就寫清楚。
限制:不要新增人物、不要改變 Logo、不要出現字幕等。
以 10 秒直式咖啡廣告為例:
製作一支 10 秒、9:16 的精品咖啡社群廣告。清晨自然光,一名穿著米色襯衫的年輕女性坐在木質咖啡吧台前。鏡頭 1[0–3 秒]中景緩慢推進,她拿起霧面黑色手沖壺。鏡頭 2[3–7 秒]特寫熱水繞圈注入濾杯,咖啡粉膨脹,蒸氣在逆光中清楚可見。鏡頭 3[7–10 秒]咖啡滴入玻璃杯,鏡頭停在杯身與晨光反射。暖色、寫實攝影、自然景深。只有水流、咖啡滴落與清晨店內環境音,無台詞、無背景音樂、不要生成字幕或 Logo。
時間戳不是保證模型會逐秒照做,但能把 30 秒的模糊故事拆成可理解的鏡頭任務,通常比一整段形容詞更容易控制。
步驟五:設定解析度、比例、長度與聲音
第一次測試可使用以下設定:
Resolution:先選 480P 或 720P。Ratio:YouTube 橫式選 16:9,Reels、TikTok、Shorts 選 9:16;不確定時選 Adaptive。Duration:先選 5 至 10 秒,確認效果後再增加。Audio:需要環境音、對白或配樂時開啟;只想後製配音則關閉。
Wan 3.0 支援 2 至 30 秒。若參考素材包含影片,輸入影片與輸出影片的總長度不能超過 30 秒。聲音開關不影響 API 計價,因此是否開啟應以作品需求決定,而不是為了省費用。
步驟六:生成後先檢查,再決定要重抽或編輯
拿到影片後,先不要只看第一印象。至少檢查以下項目:
- 人物五官、手指、服裝與髮型有沒有跨鏡頭改變。
- 商品的比例、按鍵、Logo 與材質是否穩定。
- 鏡頭方向與人物站位有沒有突然跳動。
- 對白、口型、環境音和動作是否同步。
- 畫面文字、圖表與介面內容是否正確。
如果錯誤集中在局部,優先使用影片編輯功能修改;如果主角、場景或整體鏡頭方向都錯,回到 Prompt 與參考素材重新整理,通常比一直補限制詞更有效。
6 個 Wan 3.0 官方案例:看影片學 Prompt 怎麼寫
下面不是單純的作品展示。我把官方案例拆成「用了什麼素材、Prompt 怎麼安排、你可以怎麼套用」,讓你直接對照自己的需求。
官方的完整 Prompt 很長,最重要的共通點其實只有三個:先替每個參考素材指定唯一用途,再用時間軸安排鏡頭,最後寫清楚哪些人物、商品或聲音不能改。新手不必一開始就複製數千字的導演 Prompt,先把這三層寫對,通常更容易修改。
案例一:只靠文字做出 30 秒完整故事
純文字生成 30 秒東方奇幻故事,展示時間軸、運鏡與原生聲音。 影片來源:Wan 3.0 官方發表頁。
官方的「雲端盛宴」案例沒有上傳參考圖,直接用文字生成一支 30 秒、16:9、720P、含原生聲音的東方奇幻短片。Prompt 將 9 個鏡頭依時間排列,並分別寫出人物動作、場景變化、攝影機運動與音效。
這種方法適合沒有固定角色或商品,只想快速測試故事與視覺風格的人。寫法可以縮成:
生成一支 30 秒、16:9 的奇幻短片,分成 6 個鏡頭。每個鏡頭標示起訖秒數、主體動作、景別與運鏡。全片保持相同色調與世界觀,使用環境音和動作音效,不要字幕、Logo 或水印。最後 3 秒完成故事收尾,不要停在未完成的動作。
重點不是把形容詞寫得華麗,而是先確認 30 秒內到底有幾個鏡頭,以及每個鏡頭只推進哪一件事。
案例二:三張圖固定角色與場景
以三張圖固定兩名角色與道場,生成 24 秒日系科幻開場。 影片來源:Wan 3.0 官方發表頁。
「現實與模擬碰撞」使用 3 張參考圖,分別指定男性角色、女性角色與道場環境,再生成 24 秒、1080P、16:9 的日系科幻開場。Prompt 甚至逐項限制護目鏡、髮型、面罩、服裝與建築生成順序,並指定兩名角色各自的日語台詞。
你可以套用這個骨架:
Image 1 是男性角色唯一外觀參考。Image 2 是女性角色唯一外觀參考。Image 3 是場景、材質與光線參考。全片不得互換角色特徵或改變服裝。0–6 秒建立環境,6–14 秒讓兩人觀察並對話,14–20 秒完成對峙動作,20–24 秒收尾。只讓當前鏡頭中的角色說話,台詞前後保留自然停頓,口型同步,不要字幕或 UI。
「唯一參考」這四個字很有用。它能減少模型在多張圖之間混合人物、服裝和空間特徵。
案例三:雙角色高速動作與一致性
用兩張角色圖生成 30 秒雙角色動作片,維持造型、武器與空間方向。 影片來源:Wan 3.0 官方發表頁。
「遺跡對練」以狸花貓與灰狼兩張角色圖,生成 30 秒、1080P 的雙角色動作片。官方 Prompt 不只描述打鬥,還鎖定兩把劍要全程入鞘、角色只有兩名、空間方向保持連續,並把唯一一次慢動作放在 15 至 17 秒。
動作片最容易失敗的原因,是每一秒都塞入新招式。比較穩定的寫法是:
Image 1 與 Image 2 是全片唯二角色。兩人只進行徒手對練,背後武器全程入鞘。把 30 秒拆成進場、近身攻防、移動追逐、一次慢動作、危機與合作收尾。每個動作都有清楚的起勢與收勢,站位和移動方向連續。不要新增人物、武器或台詞。
先限制角色、武器與動作類型,再描述華麗運鏡,比只寫「高速電影級打鬥」更可控。
案例四:同一角色切換 8 種語言演唱
同一主唱在 24 秒音樂影片中切換八種語言,並維持聲線、人物與舞台一致。 影片來源:Wan 3.0 官方發表頁。
「Eight languages, one beat」使用團體陣容、主唱造型與屋頂舞台 3 張圖,生成 24 秒、1080P 的音樂影片。主唱依序切換 8 種語言,但人物、聲線、節拍與舞台站位保持一致。
如果你要做多語言內容,Prompt 至少要寫清楚:
Image 1 固定四人陣容,Image 2 固定主唱臉部與服裝,Image 3 固定舞台。主唱在同一首歌中依序切換指定語言,聲線、身份與節拍保持一致。每句歌詞安排獨立時間段,只讓主唱開口;其他人閉嘴並做自然表演。每次語言切換使用硬切或動作接點,不得換人、換裝或改變場景。
多語言案例仍需人工聽寫驗收。畫面看起來對嘴,不代表每種語言的發音與語意都正確。
案例五:兩張圖做 30 秒直式 UGC 廣告
兩張參考圖生成 30 秒直式 UGC 商品廣告,交錯 A-roll 與 B-roll。 影片來源:Wan 3.0 官方發表頁。
官方的果汁機案例只用兩張圖:一張固定商品與廚房,一張固定人物與服裝,就生成 30 秒、9:16 的英文 UGC 廣告。片中交錯使用對鏡頭說話的 A-roll,以及加水果、按按鍵、攪打與倒入玻璃杯的 B-roll。
商品廣告的 Prompt 可以這樣寫:
Image 1 是商品與廚房唯一參考,Image 2 是人物與穿搭唯一參考。生成 30 秒、9:16 的自然 UGC 廣告。A-roll 由人物對鏡頭說明使用情境,B-roll 依序拍攝放入材料、操作按鍵、商品運作與完成結果。商品的形狀、按鍵、背帶、杯身與顏色全程一致。每句台詞寫入對應時間段,不要字幕、浮水印或額外人物。
這類影片最適合先做 MVP,因為結構清楚、鏡頭少,也容易把錯誤集中在商品細節和對白兩個驗收項目。

案例六:UI 與資訊畫面也能轉成影片
UI 與資訊畫面生成案例;需要逐字正確的文字仍建議後製。 影片來源:Wan 3.0 官方發表頁。
官方也展示了資訊介面生成案例,這正是文件與公開網頁輸入最值得注意的用途。實務上可以先讓模型把簡報或產品頁整理成視覺流程,再由後製補上真正的數字、按鈕名稱與字幕。
根據上傳文件製作一支 15 秒、16:9 的產品流程影片。只使用文件中已提供的事實,依序呈現輸入資料、系統處理、輸出結果三個步驟。介面視覺保持一致,鏡頭緩慢推進,不自行增加客戶名稱、數字或成效。所有需要逐字正確的文字以空白區塊保留,交由後製加入。
如果畫面上的文字必須完全正確,不要把最終排版交給模型。先生成乾淨的動態背景或介面動線,再用剪輯工具疊字,是目前更可靠的工作流程。
文件轉影片怎麼寫 Prompt?
把簡報或 PDF 上傳後,只寫「幫我做成影片」通常不夠。模型雖然能讀文件,卻不知道哪些資訊重要、觀眾是誰,也不知道該用講解、廣告還是新聞摘要的方式呈現。
可以改成:
把這份產品簡報改編成一支 20 秒、16:9 的產品介紹影片,目標觀眾是第一次接觸產品的中小企業主管。只保留三個重點:主要痛點、核心功能、使用後的工作流程。鏡頭 1[0–5 秒]用辦公室情境呈現人工整理報表耗時。鏡頭 2[5–14 秒]以清楚的 UI 動畫示範資料匯入、分析與產出摘要。鏡頭 3[14–20 秒]回到使用者查看結果的畫面。旁白使用自然的台灣繁體中文,語速適中。不要自行增加文件沒有提供的數字、客戶名稱或成效保證。畫面不要生成大段文字,只保留短標題。
這種寫法先指定觀眾與目的,再限制內容來源,可以降低模型把文件每一頁平均塞進影片,或自行補出不存在數字的機率。
Wan 3.0 API 怎麼呼叫?
不需要把 Wan 3.0 接進產品的讀者可以跳過這一節。開發者要注意,模型、Endpoint URL 與 API Key 必須屬於同一地區,跨區設定會失敗。
下面是精簡的文字生成影片請求。請把 {WorkspaceId} 換成 Model Studio 工作空間 ID,並將 API Key 放進環境變數,不要直接寫在程式碼裡。
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "A cinematic close-up of a red paper airplane gliding through a quiet library at sunrise."
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 5,
"audio": false
}
}'
影片生成採非同步流程。第一次請求會回傳 task_id,接著再查詢任務狀態。官方建議約每 15 秒輪詢一次;成功後的影片連結只保留 24 小時,應立即下載到自己的儲存空間。
Wan 3.0 的限制與使用建議
畫面文字不能當成最終文案
官方展示強調 UI、圖表與文字呈現能力,但官方產品文章同時說明,畫面文字準確度仍在改善。兩者並不矛盾:模型可以比以前更會處理資訊畫面,但仍不適合把品牌標語、價格、法規文字或完整字幕交給它一次生成。
商業影片最穩定的做法,是讓 Wan 3.0 生成乾淨畫面,再到剪輯軟體加入字幕、價格與 CTA。
30 秒不是每次都比較好
長片能講完整故事,也會放大角色漂移、物件變形與節奏鬆散。若目的是單一商品動作、社群轉場或短情境,5 至 10 秒通常更有效。需要 30 秒時,先用時間戳拆成 3 至 5 個鏡頭,並限制每個鏡頭只推進一件事。
參考素材涉及權利與隱私
不要上傳沒有授權的人像、聲音、品牌素材或未公開文件。模型能複製外型與音色,不代表使用者自動取得肖像、著作權或商標使用權。企業文件若含客戶資料、內部數據或商業機密,也不應直接送入一般線上生成流程。
Wan 3.0 值得用嗎?
如果你已經有商品圖、人物設定、簡報或短片腳本,Wan 3.0 值得試。它最大的價值是減少素材在多個工具之間搬運,並讓 15 至 30 秒的敘事有機會在一次生成中完成。
如果你的要求是逐字正確的字幕、完全不變形的商品細節、長篇對話或一次生成即可交付,我的判斷仍然偏保守。先把 Wan 3.0 當成能產生高完成度初剪的工具,再用人工後製完成文字、品牌與聲音品質,會比追求一次生成更實際。
Wan 3.0 常見問題
Wan 3.0 最長可以生成幾秒?
單次最長 30 秒,最短可設為 2 秒,也能使用智慧時長讓模型依內容建議長度。新手建議先用 5 至 10 秒測試,再決定是否延長。
Wan 3.0 可以上傳哪些文件?
支援 docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers 與 md。單一文件不得超過 100 MB,部分文件格式最多 50 頁。
Wan 3.0 可以用繁體中文 Prompt 嗎?
官方 API 支援中文與英文 Prompt。若要產生台灣中文旁白,應在 Prompt 裡寫明「台灣繁體中文、自然口語、語速適中」,不要只寫「中文」。
Wan 3.0 是開源模型嗎?
截至 2026 年 8 月 25 日,官方提供的是 Alibaba Cloud Model Studio 雲端服務,也就是影片在阿里雲端生成,而不是把模型下載到自己的電腦。官方並未在官方 Wan GitHub公開 Wan 3.0 模型權重,也就是可下載到本機執行的核心檔案。網路上的第三方 Wan 3.0 API 或 GitHub 專案,不等於官方可下載模型。
Wan 3.0 生成影片要多少錢?
Standard 國際版牌價依解析度為每秒 US$0.05、US$0.10 與 US$0.20。生成 30 秒影片的牌價約為 US$1.50、US$3 與 US$6;活動折扣與實際扣款以 Model Studio 控制台為準。
結論
Wan 3.0 把 AI 影片從「輸入一句話抽一個鏡頭」,往真正的內容製作流程推進了一步。30 秒是最醒目的規格,但多素材參考與文件轉影片,才是它對創作者與企業更實際的價值。
第一次使用時,先選 Standard、5 至 10 秒、480P 或 720P,用結構化 Prompt 測試人物、商品與鏡頭。確認方向後再加長、提高解析度,並把字幕與關鍵品牌資訊留給後製。這樣最省成本,也最接近能落地的工作流程。