TimesFM-3 是什麼?Google 多變量時間序列 AI 模型、用途與限制完整解析

TimesFM-3 原生支援多變量時間序列預測,可整合促銷、天氣與流量等條件。本文解析功能、benchmark、應用與商用限制。

Share
TimesFM-3 同時分析時間變化與不同序列關係的官方架構圖
TimesFM-3 交替分析同一序列的時間變化,以及不同序列在相同時間點的關係。 圖片來源:Google Research 官方文章(https://research.google/blog/timesfm-3-a-zero-shot-foundation-model-for-multivariate-forecasting/)

企業每天都在預測未來:下週要準備多少庫存、尖峰時段需要多少伺服器、促銷活動會增加多少訂單,以及一間工廠何時可能出現異常。

這些問題都有時間順序,卻很少只受一個數字影響。冰淇淋銷量除了跟過去賣多少有關,也會受到氣溫、假日、門市人流和促銷排程影響。傳統模型若只看歷史銷量,很容易錯過真正造成變化的原因。

Google Research 在 2026 年 8 月 31 日發表 TimesFM-3,將原本偏重單一序列的 TimesFM,升級成原生支援多變量預測的時間序列基礎模型。它可以把多組互相影響的資料一起送進模型,並在一次運算中輸出整段未來結果。

我對 TimesFM-3 的技術方向持正面看法。它處理的是企業真正在意的多變量預測,也降低了每個任務重新訓練模型的門檻。但現階段不適合直接放進商業產品:除了實際資料仍要自行驗證,Google 釋出的 3.0 預訓練權重目前只允許非商業、非正式生產用途。

TimesFM-3 是什麼?

TimesFM-3 是 Google Research 開發的時間序列基礎模型。時間序列是按照時間排列的資料,例如每日銷量、每小時用電量、每分鐘網站流量,或每秒感測器讀數。模型的工作,是從過去的變化規律推測未來可能出現的數值。

「基礎模型」代表它先用大量不同領域的資料完成預訓練,再拿去處理新的預測任務。Google 表示,TimesFM-3 擁有 3.3 億個參數,預訓練資料超過 1 兆個時間點,來源包含真實資料與合成資料。

這種做法不必替每一家店、每一台機器各訓練一個模型。同一套模型會先學會通用的時間變化模式,使用者提供新資料後,就能直接產生預測。

這就是零樣本預測(zero-shot forecasting):模型沒有針對眼前這一項任務重新訓練,也能根據輸入的歷史資料推測未來。它能加快測試速度,但不代表結果不需要驗證。產業規則、資料品質與突發事件,仍可能讓通用模型失準。

Google Research 的文章稱它為 TimesFM-3,GitHub 與 Hugging Face 上的模型則標為 TimesFM 3.0,兩者指的是同一代模型。

TimesFM-3 和 TimesFM-2.5 有什麼不同?

TimesFM-2.5 的主要能力是單變量預測,也就是一次根據一條序列的歷史判斷未來。即使後來可透過額外方法加入其他變數,它的核心模型仍不是為多組序列共同運作而設計。

TimesFM-3 把多變量能力放進預訓練與模型架構。它不只看目標本身,也能同時理解相關序列與外部條件。

比較項目 TimesFM-2.5 TimesFM-3
主要預測方式 以單一時間序列為核心 原生支援單變量與多變量
參數量 2 億 3.3 億
相關序列 可透過額外方法加入變數 可直接共同預測多個目標
未來已知條件 不是核心原生設計 可輸入假日、天氣預報、促銷排程等資料
輸出方式 逐段產生預測 一次輸出完整預測範圍
預訓練權重授權 2.5 以前維持 Apache 2.0 3.0 權重限非商業、非正式生產用途

真正影響使用者的是資料之間的關係終於成為模型原生能力,參數從 2 億增加到 3.3 億反而不是重點。對零售、製造、能源與系統監控來說,這比單純把模型做大更實用。

TimesFM-3 如何進行多變量時間序列預測?

TimesFM-3 可以接收三類資料。第一類是要預測的目標,例如不同門市或不同商品的銷量。第二類是只知道過去數值的相關變數,例如已發生的來客數。第三類是連未來都已經知道的動態條件,例如促銷日期、假日或天氣預報。

模型會把連續 32 個時間點組成一個資料區塊,再交給 Transformer 處理。Transformer 是一種能找出資料關係的神經網路架構,ChatGPT 等語言模型也使用相近概念,但 TimesFM-3 處理的是數值隨時間變化的規律,而不是文字。

在模型內部,兩種注意力機制會交替運作:

  1. 時間注意力沿著同一條序列查看過去,避免偷看到未知的未來資料。
  2. 變量注意力在相同時間點比較不同序列,學習商品、門市、天氣與活動之間的關係。

如果促銷排程已知,模型可以把未來的促銷日期保留在輸入中,同時遮住未知的未來銷量。接著,它在一次 forward pass,也就是一次完整模型運算中,填入整段預測結果。

這和逐步預測明天、再把明天的結果拿去預測後天不同。一次完成整段預測,可以減少反覆運算的延遲,也避免前一步錯誤持續累積到後面。

一次輸出完整結果,還能看見預測的不確定性

TimesFM-3 不只輸出一條最可能的數值,也會提供從第 10 百分位到第 90 百分位的 9 組分位數預測。分位數可以把它理解成不同可能情境下的預測邊界。

例如,模型預測下週銷量最可能是 1,000 件,但第 10 到第 90 百分位落在 780 到 1,260 件。負責補貨的人不必把 1,000 當成一定會發生的答案,而是能依缺貨成本、庫存成本與風險容忍度做準備。

這項設計對商業決策很重要。企業除了想知道「會是多少」,也需要知道「最壞與較好情況可能差多少」。預測區間仍不等於保證,但比只給一個看似精準的數字更誠實。

TimesFM-3 的實際應用有哪些?

TimesFM-3 最適合資料會互相影響,而且未來已有部分條件可知的場景。

零售與電商:把促銷、天氣和商品一起納入需求預測

Google 用冰淇淋銷量做示範。只看歷史銷量的模型會延續原本的週期,卻不知道下個月哪幾天安排促銷。TimesFM-3 可把促銷日期當成未來已知條件,再從過往資料學習促銷與銷量之間的關係。

官方示意圖中,多變量模式預測促銷日會出現約 20% 的銷量提升。這個數字是教學案例,不代表每一間店都能獲得同樣效果。它真正說明的是:模型能讓已排定的活動直接影響預測,而不是事後才解釋銷量為何改變。

TimesFM-3 根據已知促銷日期預測冰淇淋銷量上升
加入促銷排程後,多變量模式會在促銷日提高預測值。圖中的約 20% 提升是官方示意案例,不代表一般商店的固定成效。 圖片來源:Google Research 官方文章

製造與設備維運:同時查看多個感測器

機器故障通常不會只反映在一個讀數上。溫度、壓力、振動與耗電量可能一起改變。多變量模型若能找到這些訊號的共同變化,就有機會更早發現異常,協助安排維修與備料。

不過,異常偵測與故障預測涉及安全和停機成本,不能只因通用 benchmark(基準測試)成績領先就直接上線。企業仍要用自家設備、故障紀錄與極端案例驗證誤報率和漏報率。

網站與雲端系統:預估流量與資源需求

網站請求量、CPU 使用率、記憶體、延遲與錯誤率彼此相關。若又知道即將進行大型活動或版本更新,就能把這些未來事件一起納入容量預測。

這類用途的價值在於提早配置資源,而不是等到系統過載才擴容。TimesFM-3 的單次輸出方式也有利於長預測範圍,但實際延遲、硬體需求與成本,仍要依資料規模測量。

能源與自然科學:整合需求、氣候與環境變數

電力需求會受到氣溫、時間、假日與產業活動影響。環境觀測也常同時包含氣壓、降雨、風速與其他感測資料。這些原本就是多變量問題,與 TimesFM-3 的設計方向相符。

但模型不是因果分析工具。它能找出資料關聯,不代表已經證明某個變數造成另一個結果。若決策牽涉公共安全、醫療或關鍵基礎設施,仍需搭配領域模型、專業審查與風險控管。

TimesFM-3 的 benchmark 表現有多好?

Google 在 GIFT-Eval、FEV-Bench 與 TIME 三套公開測試中評估 TimesFM-3。官方公布的平均排名圖顯示,它在點預測準確度與機率預測品質上,都領先參與比較的其他預訓練基礎模型,其中包括 Amazon 的 Chronos-2、Toto 2.0 與 TimesFM-2.5。

即使關閉多變量資訊,把 TimesFM-3 當作單變量模型使用,它在官方結果中仍能追平或超越多數比較對象。加入相關序列與外部條件後,平均排名再進一步改善。

這些結果證明 TimesFM-3 值得測試,卻還不能證明它在每一家公司都會比較準。官方文章呈現的是跨任務平均排名,不是所有資料集的逐項勝負,也沒有取代企業自己的回測。模型剛發布,外部團隊對 3.0 版本的獨立重現仍有限。

我的判斷是,benchmark 足以讓 TimesFM-3 進入概念驗證名單,但不足以直接決定生產環境選型。真正合理的比較方式,是用相同資料切分,讓它和現有統計模型、企業現行模型及簡單基準線一起回測,並同時衡量誤差、推論速度與維護成本。

TimesFM-3 與其他時間序列基礎模型在 GIFT-Eval 的平均排名比較
GIFT-Eval 的數值越低代表平均排名越好。結果來自 Google Research 公布的評估,仍需搭配外部重現與自家資料回測。 圖片來源:Google Research 官方文章
TimesFM-3 與其他時間序列基礎模型在 FEV-Bench 的平均排名比較
FEV-Bench 涵蓋多變量預測任務。圖中為 Google Research 公布的平均排名,不代表 TimesFM-3 在每一項企業資料都會勝出。 圖片來源:Google Research 官方文章
TimesFM-3 與其他時間序列基礎模型在 TIME benchmark 的平均排名比較
TIME benchmark 比較不同預測範圍下的表現與效率。這是官方測試結果,正式選型仍需使用自己的資料驗證。 圖片來源:Google Research 官方文章

TimesFM-3 可以拿來預測股價嗎?

技術上,股票價格與成交量都是時間序列,TimesFM-3 也能接收多組相關資料。但「模型可以輸入金融資料」和「模型能穩定賺錢」是兩回事。

金融市場會受到政策、財報、突發新聞、交易制度與投資人行為影響,資料分布也會持續改變。歷史相關性可能在行情切換後失效,交易成本與滑價還會吃掉回測中的微小優勢。

Google 公布的 TimesFM-3 benchmark 是通用時間序列預測測試,不是投資績效或實盤交易驗證。因此,我不會把這次發布解讀成一套可直接使用的 AI 選股工具。若要研究金融用途,至少要採用嚴格的時間切分,避免未來資料洩漏,並把手續費、滑價與極端行情納入回測。

TimesFM-3 可以免費商用嗎?

目前不行,這也是評估 TimesFM-3 時最容易被忽略的限制。

模型權重是模型訓練後學到的參數檔,也是實際產生預測的核心。Google 的 GitHub 原始碼採 Apache 2.0 授權,TimesFM 2.5 以前的模型權重也維持 Apache 2.0。但 TimesFM 3.0 的預訓練權重改用 TimesFM Non-Commercial License v1.0,只允許非商業、非正式生產用途。官方 README 明確寫出,預設權重不能用於商業或 production 環境。

這代表開發者可以研究架構、閱讀程式碼與進行符合授權的測試,但不能因為 GitHub 顯示 Apache 2.0,就推定下載的 3.0 權重也能放進收費產品。程式碼與模型權重是兩個不同的授權層級。

此外,Google 也把目前開放的版本描述為「非官方支援的 Google 產品」。如果企業需要服務等級承諾、資安審查、穩定更新與商用授權,現階段仍要等待 Google 提供更明確的正式方案。

如何試用 TimesFM-3?

TimesFM-3 的程式碼已放在 GitHub,官方 PyTorch 版本權重則可從 Hugging Face 下載。PyTorch 是開發與執行 AI 模型的常用框架,因此這比較適合具備 Python 與機器學習環境的開發者,不是打開網頁就能操作的一般消費型工具。

BigQuery 是 Google Cloud 用來儲存、查詢與分析大量資料的服務。Google 已在官方文章中預告 TimesFM-3 的 BigQuery 整合將於接下來數週推出,但截至 2026 年 9 月 1 日尚未正式提供。想先熟悉 SQL 預測流程的使用者,可以在 BigQuery 使用既有的 TimesFM-2.5 AI.FORECAST 功能。

如果要評估導入,我建議先做一個範圍明確的 MVP:

  1. 選擇一個有清楚商業指標的任務,例如 30 天商品需求預測。
  2. 整理目標序列、歷史相關變數與未來已知條件,並檢查缺值與時間對齊。
  3. 保留最新一段真實資料做回測,不讓模型在輸入中看到答案。
  4. 同時比較簡單季節性基準、現有模型與 TimesFM-3。
  5. 除了準確率,也記錄推論時間、硬體成本、預測區間品質與維護難度。

這種做法比一開始重建整套預測系統更實際。若 TimesFM-3 沒有穩定贏過簡單基準,就沒有必要因為模型較新而增加部署成本。

TimesFM-3 有哪些限制?

第一,模型仍依賴輸入資料。錯誤的促銷日期、沒有對齊的時間頻率,或大量缺失感測資料,都可能讓結果失去意義。多變量資料越多,不代表預測一定越好。無關或品質差的變數也會製造雜訊。

第二,零樣本不等於免驗證。模型省下的是每個任務從頭訓練的起步成本,不是資料治理、回測與監控工作。當市場制度、商品策略或設備狀態改變時,原本有效的關係仍可能失效。

第三,公開資訊仍不完整。Google 已公開模型權重、使用程式碼與 benchmark 結果,但目前的 Hugging Face 模型卡仍引用早期 TimesFM 論文,沒有提供一篇完整對應 TimesFM-3 架構、訓練流程與消融實驗的新論文。想深入審查方法的人,現階段主要只能依官方技術文章、程式碼與模型卡交叉確認。

第四,授權阻擋了最直接的商業落地。即使企業測試結果良好,也不能直接把 3.0 預訓練權重放進正式產品。除非 Google 更新授權或另行提供商業方案,否則這個限制就足以讓多數企業停在研究與概念驗證階段。

TimesFM-3 值得使用嗎?

如果你是資料科學、需求規劃、系統維運或製造分析團隊,TimesFM-3 值得加入測試清單。它原生處理多組序列、可接受未來已知條件,又能一次產生完整預測範圍,方向比只看單一歷史數字更貼近真實工作。

但如果目標是立刻部署商業服務,我目前的答案是不值得直接採用。3.0 權重的非商業、非 production 授權才是最大障礙,模型能力反而排在後面。新版本也仍缺少足夠的外部實務驗證。

我的建議很明確:研究團隊可以用真實資料做小型回測,確認它是否能勝過現行方法。產品團隊則先不要把 TimesFM-3 寫進正式上線承諾。若 Google 開放商用授權,且獨立測試顯示它在不同產業仍能維持優勢,我才會把評價提高到適合生產導入。

TimesFM-3 常見問題

TimesFM-3 是生成式 AI 嗎?

TimesFM-3 會生成未來數值,但它不是用來寫文章或生成圖片的大型語言模型。它專門處理按照時間排列的數值資料,目標是預測銷量、需求、流量與感測器讀數等未來變化。

TimesFM-3 一定比傳統預測模型準嗎?

不一定。Google 公布的三套 benchmark 中,TimesFM-3 平均排名領先其他預訓練模型,但特定企業的資料可能由簡單季節性模型或專門訓練的模型勝出。正式選型前仍需使用自己的歷史資料回測。

TimesFM-3 需要重新訓練嗎?

它主打零樣本使用,不需先針對每個新任務重新訓練。但這只代表可以快速建立基準,不代表所有場景都不需要調整資料、比較模型或設計後續適配方法。

TimesFM-3 能同時預測多個商品嗎?

可以。TimesFM-3 能共同預測多個相關目標,也能加入歷史人流、未來促銷與天氣預報等變數。共同輸入是否真的提升準確度,仍取決於資料之間是否有穩定關係。

TimesFM-3 是開源模型嗎?

程式碼公開且採 Apache 2.0,但 3.0 預訓練權重使用獨立的非商業授權,不能直接用於商業或正式生產環境。把它簡稱為「可自由商用的開源模型」會忽略關鍵限制。

TimesFM-3 已經能在 BigQuery 使用嗎?

截至 2026 年 9 月 1 日,Google 表示 TimesFM-3 的 BigQuery 整合會在接下來數週推出,目前可直接使用的是整合 TimesFM-2.5 的 AI.FORECAST 功能。

結論:TimesFM-3 把 AI 預測帶回真實世界,但還沒跨過商用門檻

TimesFM-3 最有價值的地方,不是再做一個更大的 Transformer,而是承認真實世界的預測幾乎都是多變量問題。銷量會受到促銷與天氣影響,系統流量會受到活動與版本更新影響,設備狀態也要同時觀察多個感測器。

它用共同建模、未來已知條件與單次完整輸出,降低了處理這類問題的技術門檻。官方 benchmark 也顯示,它已經是目前最值得測試的通用時間序列基礎模型之一。

不過,技術領先不等於可以直接上線。資料品質、領域驗證、獨立重現與持續監控都不能省略,3.0 權重的非商業授權更是明確的產品限制。

現階段最合理的定位,是把 TimesFM-3 當成研究與概念驗證工具。先用自己的資料確認它是否真的更準、更快、更省維護成本,再等待商用授權與 BigQuery 等正式服務補齊。這比看到「預測未來」四個字,就把它誤認成萬用決策引擎更務實。

資料來源