Wan 3.0 教學:30 秒 AI 影片、6 個官方案例、價格與 Prompt

Wan 3.0 怎麼用?從 6 支官方影片拆解純文字、多圖參考、動作、多語言、UGC 與文件轉影片,附價格與可直接套用的 Prompt。

Share
Wan 3.0 官方多素材參考影片中的雙角色道場場景
Wan 3.0 可用不同參考圖分別固定角色與空間,再生成一段連續影片。 圖片來源:https://modelstudio.console.alibabacloud.com/model-releases/wan3.0-video

Wan 3.0 是阿里巴巴最新一代 AI 影片生成模型。它能用文字、圖片、影片、音訊、文件與公開網頁產生影片,單次最長 30 秒,並可輸出 480P、720P 或 1080P。

本文除了介紹功能與價格,也會整理 Prompt 的寫法。Prompt 就是你交給模型的生成指令,用來說明主體、場景、動作、鏡頭與聲音。

真正值得注意的不是把原本的短片硬拉長,而是創作者終於能把人物照、商品圖、配音、動作參考和企劃文件一起交給模型。過去需要分別處理的文生影片、圖生影片與參考生影片,現在被整合進同一個入口。

Wan 3.0 適合拿來做社群短片、商品廣告、教學摘要與概念影片。不過它還不是「上傳企劃書就能直接交件」的全自動剪輯師。官方也承認音訊質感與畫面文字準確度仍在改善,因此字幕、品牌名稱、產品細節與對白都要人工檢查。

Wan 3.0 正式上線,跟公測有什麼不同?

Wan 3.0 在 2026 年 8 月初先開放測試。到了 8 月 24 日,Alibaba Cloud Model Studio 官方發表頁已改為 Generally Available,代表一般開發者不必再提出邀測申請,就能在體驗中心使用模型,或透過 API 讓自己的程式自動呼叫模型。

你在部分舊文件裡仍可能看到「邀測」字樣,那是文件更新時間不同造成的落差。以目前官方發表頁的狀態來看,Wan 3.0 已進入正式可用階段。

這次同時有兩個版本:

模型 定位 適合誰
wan3.0-video Standard 標準版,價格較低 個人創作者、測試概念、一般內容製作
wan3.0-video-prime Prime 優速版,生成速度較快、價格較高 在意等待時間與大量產出的團隊

第一次使用建議先選 Standard。當工作量大到等待時間真的影響交付,再考慮 Prime,比一開始就為速度多付費更實際。

Wan 3.0 有哪些新功能?

1. 單次最長生成 30 秒

過去許多 AI 影片模型一次只產生數秒到 15 秒的片段,創作者必須反覆延長、剪接,人物和場景也容易在接點改變。Wan 3.0 把單次生成上限提高到 30 秒,並提供智慧時長,讓模型依內容建議長度。

30 秒真正帶來的價值,是能容納開場、發展與收尾。產品廣告可以先建立情境,再展示細節,最後回到品牌畫面;教學短片也能在同一段影片中完成問題、步驟與結果。

但長度越長,需要模型同時維持的人物、道具與鏡頭關係也越多。新手不必每次都選 30 秒,先用 5 至 10 秒確認風格,通常比較省錢,也更容易修改。

2. 文字、圖片、影片、音訊與文件都能變成影片

Wan 3.0 的「全能參考」是這次最有實用價值的升級。依官方 API 文件,參考模式最多可放入 10 張圖片、5 段影片與 5 段音訊。文件則支援 docxdocxlsxxlspptxpptpdftxtkeypagesnumbersmd

這代表你可以把商品不同角度的照片、演員外型、運鏡參考與聲音素材放在同一個任務裡,再用提示詞說明各素材的角色。模型不只看「畫面長什麼樣」,也會理解它們之間的關係。

文件轉影片更適合做內容初稿。例如把產品簡報轉成介紹短片、把課程講義轉成教學摘要,或把報表內容轉成動態說明。單一文件上限為 100 MB,PDF、Word、PowerPoint、Keynote 與 Pages 等格式最多 50 頁;公開網頁也能直接當輸入,但必須是不需登入即可讀取的頁面。

3. 角色、商品與空間一致性更受重視

AI 影片常見的問題不是單張畫面不夠漂亮,而是人物換個角度就變臉、商品結構在鏡頭之間改變。Wan 3.0 將人物五官、髮型、服裝、商品材質、Logo、角色站位與攝影機視角都列為一致性控制重點。

這項升級對廣告與連續敘事比「更電影感」更重要,因為觀眾一旦看到商品按鍵位置改變,或主角在第二個鏡頭突然換人,影片就很難直接使用。只是官方展示代表模型的目標能力,不等於所有素材都能一次成功,產出仍要逐鏡檢查。

Wan 3.0 官方 UI 與資訊畫面生成影片案例
Wan 3.0 也能把文件、公開網頁與 UI 參考轉成影片,但關鍵文字與數字仍需人工核對。 圖片來源:Alibaba Cloud Model Studio

4. 生成後可以繼續編輯

Wan 3.0 延續 Wan 2.7 的影片編輯能力,可依指令修改畫面、劇情與對白,不必每次都從零生成。對創作者來說,這讓工作流程比較接近「先出初剪,再局部修改」,而不是每次抽一支全新的影片。

實務上仍建議先把最容易出錯的項目固定下來,例如角色、商品外型、長寬比和核心動作。若連這些都持續更換,後續編輯仍可能變成反覆重做。

Wan 3.0 價格多少?

Wan 3.0 Standard 採影片秒數計費。官方國際版牌價如下:

解析度 每秒牌價 生成 10 秒 生成 30 秒
480P US$0.05 US$0.50 US$1.50
720P US$0.10 US$1.00 US$3.00
1080P US$0.20 US$2.00 US$6.00

截至 2026 年 8 月 25 日,官方頁面顯示 Standard 在 2026 年 9 月 24 日 00:00(UTC+8)前有 30% off,折後每秒為 US$0.035、US$0.07 與 US$0.14。實際扣款、地區稅費與活動資格仍以 Model Studio 控制台帳單為準。

最省成本的做法,是用 480P 或 720P 測試構圖與動作,確認提示詞後再用 1080P 產出需要交付的版本。直接用 1080P 反覆抽片,成本很快就會放大。

Wan 3.0 使用教學:完成第一支 AI 影片

以下使用 Alibaba Cloud 國際版 Model Studio 示範。台灣使用者可選 Singapore 地區,畫面可能以英文顯示。

步驟一:進入 Wan 3.0 體驗中心

開啟Wan 3.0 官方體驗入口,登入 Alibaba Cloud 帳號。台灣使用者可從 Singapore 地區進入,頁面會直接開啟 Wan3.0 體驗中心。

如果只是想先了解功能,可以從官方發表頁點選 Try now;需要串接產品時,再進入 Start building 查看 API。

步驟二:先選對生成方式

目前體驗頁主要顯示 All-Purpose ReferenceFirst & Last Frame。不要急著上傳所有素材,先依你手上的資料選擇對應用法:

你手上的素材 建議模式 適合用途
只有一段文字想法 Text to Video 概念短片、氣氛鏡頭
一張主視覺或人物照 First Frame/Image to Video 讓靜態圖片動起來
已經設計好開頭與結尾 First and Last Frames 控制轉場與畫面落點
多張人物、商品、場景圖 Reference to Video 維持角色與商品一致性
簡報、報告或公開網頁 File/Link 教學摘要、產品說明、動態報告

如果主體外型不能改,例如真實商品或固定角色,優先使用參考素材,不要只靠文字描述。若你更在意畫面怎麼動,而不是外型細節,單張首幀就已經夠用。

步驟三:上傳素材並清楚編號

參考模式會依上傳順序把素材編成 Image 1Image 2Video 1。提示詞裡要直接使用這些編號,模型才知道每個素材扮演什麼角色。

例如你上傳一張人物照、一張商品照與一張咖啡店場景,可以寫:

Image 1 的人物坐在 Image 3 的咖啡店窗邊,拿起 Image 2 的保溫杯喝水。保留人物五官、髮型、服裝與保溫杯的 Logo、瓶蓋結構和霧面金屬材質。

素材不是越多越好。兩張用途重複、角度衝突的人物照,反而可能讓模型不知道該以哪張為準。每個素材都應該有明確用途。

步驟四:用結構化 Prompt 描述影片

官方 Prompt 指南的基礎公式是「主體+場景+運動」。想提高控制力,再加入鏡頭、光線、風格與聲音。

我建議新手直接使用下面這個結構:

影片目的:這支影片要讓觀眾理解什麼?
主體:人物或商品是誰?哪些特徵不能改?
場景:時間、地點、前景與背景。
動作:主體先做什麼,接著做什麼?
鏡頭:景別、角度、運鏡與轉場。
聲音:對白、環境音、音效、背景音樂;不需要就寫清楚。
限制:不要新增人物、不要改變 Logo、不要出現字幕等。

以 10 秒直式咖啡廣告為例:

製作一支 10 秒、9:16 的精品咖啡社群廣告。清晨自然光,一名穿著米色襯衫的年輕女性坐在木質咖啡吧台前。鏡頭 1[0–3 秒]中景緩慢推進,她拿起霧面黑色手沖壺。鏡頭 2[3–7 秒]特寫熱水繞圈注入濾杯,咖啡粉膨脹,蒸氣在逆光中清楚可見。鏡頭 3[7–10 秒]咖啡滴入玻璃杯,鏡頭停在杯身與晨光反射。暖色、寫實攝影、自然景深。只有水流、咖啡滴落與清晨店內環境音,無台詞、無背景音樂、不要生成字幕或 Logo。

時間戳不是保證模型會逐秒照做,但能把 30 秒的模糊故事拆成可理解的鏡頭任務,通常比一整段形容詞更容易控制。

步驟五:設定解析度、比例、長度與聲音

第一次測試可使用以下設定:

  • Resolution:先選 480P 或 720P。
  • Ratio:YouTube 橫式選 16:9,Reels、TikTok、Shorts 選 9:16;不確定時選 Adaptive。
  • Duration:先選 5 至 10 秒,確認效果後再增加。
  • Audio:需要環境音、對白或配樂時開啟;只想後製配音則關閉。

Wan 3.0 支援 2 至 30 秒。若參考素材包含影片,輸入影片與輸出影片的總長度不能超過 30 秒。聲音開關不影響 API 計價,因此是否開啟應以作品需求決定,而不是為了省費用。

步驟六:生成後先檢查,再決定要重抽或編輯

拿到影片後,先不要只看第一印象。至少檢查以下項目:

  1. 人物五官、手指、服裝與髮型有沒有跨鏡頭改變。
  2. 商品的比例、按鍵、Logo 與材質是否穩定。
  3. 鏡頭方向與人物站位有沒有突然跳動。
  4. 對白、口型、環境音和動作是否同步。
  5. 畫面文字、圖表與介面內容是否正確。

如果錯誤集中在局部,優先使用影片編輯功能修改;如果主角、場景或整體鏡頭方向都錯,回到 Prompt 與參考素材重新整理,通常比一直補限制詞更有效。

6 個 Wan 3.0 官方案例:看影片學 Prompt 怎麼寫

下面不是單純的作品展示。我把官方案例拆成「用了什麼素材、Prompt 怎麼安排、你可以怎麼套用」,讓你直接對照自己的需求。

官方的完整 Prompt 很長,最重要的共通點其實只有三個:先替每個參考素材指定唯一用途,再用時間軸安排鏡頭,最後寫清楚哪些人物、商品或聲音不能改。新手不必一開始就複製數千字的導演 Prompt,先把這三層寫對,通常更容易修改。

案例一:只靠文字做出 30 秒完整故事

純文字生成 30 秒東方奇幻故事,展示時間軸、運鏡與原生聲音。 影片來源:Wan 3.0 官方發表頁

官方的「雲端盛宴」案例沒有上傳參考圖,直接用文字生成一支 30 秒、16:9、720P、含原生聲音的東方奇幻短片。Prompt 將 9 個鏡頭依時間排列,並分別寫出人物動作、場景變化、攝影機運動與音效。

這種方法適合沒有固定角色或商品,只想快速測試故事與視覺風格的人。寫法可以縮成:

生成一支 30 秒、16:9 的奇幻短片,分成 6 個鏡頭。每個鏡頭標示起訖秒數、主體動作、景別與運鏡。全片保持相同色調與世界觀,使用環境音和動作音效,不要字幕、Logo 或水印。最後 3 秒完成故事收尾,不要停在未完成的動作。

重點不是把形容詞寫得華麗,而是先確認 30 秒內到底有幾個鏡頭,以及每個鏡頭只推進哪一件事。

案例二:三張圖固定角色與場景

以三張圖固定兩名角色與道場,生成 24 秒日系科幻開場。 影片來源:Wan 3.0 官方發表頁

「現實與模擬碰撞」使用 3 張參考圖,分別指定男性角色、女性角色與道場環境,再生成 24 秒、1080P、16:9 的日系科幻開場。Prompt 甚至逐項限制護目鏡、髮型、面罩、服裝與建築生成順序,並指定兩名角色各自的日語台詞。

你可以套用這個骨架:

Image 1 是男性角色唯一外觀參考。Image 2 是女性角色唯一外觀參考。Image 3 是場景、材質與光線參考。全片不得互換角色特徵或改變服裝。0–6 秒建立環境,6–14 秒讓兩人觀察並對話,14–20 秒完成對峙動作,20–24 秒收尾。只讓當前鏡頭中的角色說話,台詞前後保留自然停頓,口型同步,不要字幕或 UI。

「唯一參考」這四個字很有用。它能減少模型在多張圖之間混合人物、服裝和空間特徵。

案例三:雙角色高速動作與一致性

用兩張角色圖生成 30 秒雙角色動作片,維持造型、武器與空間方向。 影片來源:Wan 3.0 官方發表頁

「遺跡對練」以狸花貓與灰狼兩張角色圖,生成 30 秒、1080P 的雙角色動作片。官方 Prompt 不只描述打鬥,還鎖定兩把劍要全程入鞘、角色只有兩名、空間方向保持連續,並把唯一一次慢動作放在 15 至 17 秒。

動作片最容易失敗的原因,是每一秒都塞入新招式。比較穩定的寫法是:

Image 1 與 Image 2 是全片唯二角色。兩人只進行徒手對練,背後武器全程入鞘。把 30 秒拆成進場、近身攻防、移動追逐、一次慢動作、危機與合作收尾。每個動作都有清楚的起勢與收勢,站位和移動方向連續。不要新增人物、武器或台詞。

先限制角色、武器與動作類型,再描述華麗運鏡,比只寫「高速電影級打鬥」更可控。

案例四:同一角色切換 8 種語言演唱

同一主唱在 24 秒音樂影片中切換八種語言,並維持聲線、人物與舞台一致。 影片來源:Wan 3.0 官方發表頁

「Eight languages, one beat」使用團體陣容、主唱造型與屋頂舞台 3 張圖,生成 24 秒、1080P 的音樂影片。主唱依序切換 8 種語言,但人物、聲線、節拍與舞台站位保持一致。

如果你要做多語言內容,Prompt 至少要寫清楚:

Image 1 固定四人陣容,Image 2 固定主唱臉部與服裝,Image 3 固定舞台。主唱在同一首歌中依序切換指定語言,聲線、身份與節拍保持一致。每句歌詞安排獨立時間段,只讓主唱開口;其他人閉嘴並做自然表演。每次語言切換使用硬切或動作接點,不得換人、換裝或改變場景。

多語言案例仍需人工聽寫驗收。畫面看起來對嘴,不代表每種語言的發音與語意都正確。

案例五:兩張圖做 30 秒直式 UGC 廣告

兩張參考圖生成 30 秒直式 UGC 商品廣告,交錯 A-roll 與 B-roll。 影片來源:Wan 3.0 官方發表頁

官方的果汁機案例只用兩張圖:一張固定商品與廚房,一張固定人物與服裝,就生成 30 秒、9:16 的英文 UGC 廣告。片中交錯使用對鏡頭說話的 A-roll,以及加水果、按按鍵、攪打與倒入玻璃杯的 B-roll。

商品廣告的 Prompt 可以這樣寫:

Image 1 是商品與廚房唯一參考,Image 2 是人物與穿搭唯一參考。生成 30 秒、9:16 的自然 UGC 廣告。A-roll 由人物對鏡頭說明使用情境,B-roll 依序拍攝放入材料、操作按鍵、商品運作與完成結果。商品的形狀、按鍵、背帶、杯身與顏色全程一致。每句台詞寫入對應時間段,不要字幕、浮水印或額外人物。

這類影片最適合先做 MVP,因為結構清楚、鏡頭少,也容易把錯誤集中在商品細節和對白兩個驗收項目。

Wan 3.0 官方直式果汁機 UGC 廣告案例
兩張參考圖就能同時固定商品、場景、人物與穿搭,適合製作直式 UGC 廣告初稿。 圖片來源:Alibaba Cloud Model Studio

案例六:UI 與資訊畫面也能轉成影片

UI 與資訊畫面生成案例;需要逐字正確的文字仍建議後製。 影片來源:Wan 3.0 官方發表頁

官方也展示了資訊介面生成案例,這正是文件與公開網頁輸入最值得注意的用途。實務上可以先讓模型把簡報或產品頁整理成視覺流程,再由後製補上真正的數字、按鈕名稱與字幕。

根據上傳文件製作一支 15 秒、16:9 的產品流程影片。只使用文件中已提供的事實,依序呈現輸入資料、系統處理、輸出結果三個步驟。介面視覺保持一致,鏡頭緩慢推進,不自行增加客戶名稱、數字或成效。所有需要逐字正確的文字以空白區塊保留,交由後製加入。

如果畫面上的文字必須完全正確,不要把最終排版交給模型。先生成乾淨的動態背景或介面動線,再用剪輯工具疊字,是目前更可靠的工作流程。

文件轉影片怎麼寫 Prompt?

把簡報或 PDF 上傳後,只寫「幫我做成影片」通常不夠。模型雖然能讀文件,卻不知道哪些資訊重要、觀眾是誰,也不知道該用講解、廣告還是新聞摘要的方式呈現。

可以改成:

把這份產品簡報改編成一支 20 秒、16:9 的產品介紹影片,目標觀眾是第一次接觸產品的中小企業主管。只保留三個重點:主要痛點、核心功能、使用後的工作流程。鏡頭 1[0–5 秒]用辦公室情境呈現人工整理報表耗時。鏡頭 2[5–14 秒]以清楚的 UI 動畫示範資料匯入、分析與產出摘要。鏡頭 3[14–20 秒]回到使用者查看結果的畫面。旁白使用自然的台灣繁體中文,語速適中。不要自行增加文件沒有提供的數字、客戶名稱或成效保證。畫面不要生成大段文字,只保留短標題。

這種寫法先指定觀眾與目的,再限制內容來源,可以降低模型把文件每一頁平均塞進影片,或自行補出不存在數字的機率。

Wan 3.0 API 怎麼呼叫?

不需要把 Wan 3.0 接進產品的讀者可以跳過這一節。開發者要注意,模型、Endpoint URL 與 API Key 必須屬於同一地區,跨區設定會失敗。

下面是精簡的文字生成影片請求。請把 {WorkspaceId} 換成 Model Studio 工作空間 ID,並將 API Key 放進環境變數,不要直接寫在程式碼裡。

curl --location \
  'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
  -H 'X-DashScope-Async: enable' \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "wan3.0-video",
    "input": {
      "prompt": "A cinematic close-up of a red paper airplane gliding through a quiet library at sunrise."
    },
    "parameters": {
      "resolution": "720P",
      "ratio": "16:9",
      "duration": 5,
      "audio": false
    }
  }'

影片生成採非同步流程。第一次請求會回傳 task_id,接著再查詢任務狀態。官方建議約每 15 秒輪詢一次;成功後的影片連結只保留 24 小時,應立即下載到自己的儲存空間。

Wan 3.0 的限制與使用建議

畫面文字不能當成最終文案

官方展示強調 UI、圖表與文字呈現能力,但官方產品文章同時說明,畫面文字準確度仍在改善。兩者並不矛盾:模型可以比以前更會處理資訊畫面,但仍不適合把品牌標語、價格、法規文字或完整字幕交給它一次生成。

商業影片最穩定的做法,是讓 Wan 3.0 生成乾淨畫面,再到剪輯軟體加入字幕、價格與 CTA。

30 秒不是每次都比較好

長片能講完整故事,也會放大角色漂移、物件變形與節奏鬆散。若目的是單一商品動作、社群轉場或短情境,5 至 10 秒通常更有效。需要 30 秒時,先用時間戳拆成 3 至 5 個鏡頭,並限制每個鏡頭只推進一件事。

參考素材涉及權利與隱私

不要上傳沒有授權的人像、聲音、品牌素材或未公開文件。模型能複製外型與音色,不代表使用者自動取得肖像、著作權或商標使用權。企業文件若含客戶資料、內部數據或商業機密,也不應直接送入一般線上生成流程。

Wan 3.0 值得用嗎?

如果你已經有商品圖、人物設定、簡報或短片腳本,Wan 3.0 值得試。它最大的價值是減少素材在多個工具之間搬運,並讓 15 至 30 秒的敘事有機會在一次生成中完成。

如果你的要求是逐字正確的字幕、完全不變形的商品細節、長篇對話或一次生成即可交付,我的判斷仍然偏保守。先把 Wan 3.0 當成能產生高完成度初剪的工具,再用人工後製完成文字、品牌與聲音品質,會比追求一次生成更實際。

Wan 3.0 常見問題

Wan 3.0 最長可以生成幾秒?

單次最長 30 秒,最短可設為 2 秒,也能使用智慧時長讓模型依內容建議長度。新手建議先用 5 至 10 秒測試,再決定是否延長。

Wan 3.0 可以上傳哪些文件?

支援 docxdocxlsxxlspptxpptpdftxtkeypagesnumbersmd。單一文件不得超過 100 MB,部分文件格式最多 50 頁。

Wan 3.0 可以用繁體中文 Prompt 嗎?

官方 API 支援中文與英文 Prompt。若要產生台灣中文旁白,應在 Prompt 裡寫明「台灣繁體中文、自然口語、語速適中」,不要只寫「中文」。

Wan 3.0 是開源模型嗎?

截至 2026 年 8 月 25 日,官方提供的是 Alibaba Cloud Model Studio 雲端服務,也就是影片在阿里雲端生成,而不是把模型下載到自己的電腦。官方並未在官方 Wan GitHub公開 Wan 3.0 模型權重,也就是可下載到本機執行的核心檔案。網路上的第三方 Wan 3.0 API 或 GitHub 專案,不等於官方可下載模型。

Wan 3.0 生成影片要多少錢?

Standard 國際版牌價依解析度為每秒 US$0.05、US$0.10 與 US$0.20。生成 30 秒影片的牌價約為 US$1.50、US$3 與 US$6;活動折扣與實際扣款以 Model Studio 控制台為準。

結論

Wan 3.0 把 AI 影片從「輸入一句話抽一個鏡頭」,往真正的內容製作流程推進了一步。30 秒是最醒目的規格,但多素材參考與文件轉影片,才是它對創作者與企業更實際的價值。

第一次使用時,先選 Standard、5 至 10 秒、480P 或 720P,用結構化 Prompt 測試人物、商品與鏡頭。確認方向後再加長、提高解析度,並把字幕與關鍵品牌資訊留給後製。這樣最省成本,也最接近能落地的工作流程。

資料來源