企業為何轉向 Open-Weight AI?AT&T 每天 450 億 Tokens 的成本算盤
AT&T 每天處理 450 億 AI tokens,靠 router 將工作送到不同模型。本文拆解 open-weight、TCO、OTel 2.0 與中國模型的企業風險。
企業導入生成式 AI 的第一年,常把焦點放在「哪個模型最強」。進入大規模使用後,問題很快變成「哪些工作真的需要最強模型」。每一封摘要、每一次分類、每一段客服草稿都呼叫 frontier model,單價差異會被數十億 tokens 放大。
2026 年 9 月,Financial Times 報導美國企業正測試更便宜的 open-weight models,包含來自中國公司的選項。X 上的討論引用 AT&T 作為代表:它希望把更多 AI workloads 移到 open models,同時保留 OpenAI、Anthropic 等 frontier models 處理困難任務。
AT&T 官方資料提供了更清楚的尺度:公司平均每天處理 450 億 AI tokens,並用 cache-aware router 為每次請求選擇兼顧品質、速度和成本的模型。AT&T 自述,這套方法最高可降低 90% AI 成本,已節省數百萬美元。
真正的趨勢是企業從單一供應商轉向 model portfolio,並非單純讓 open model 取代 closed model。模型像雲端運算資源一樣被分級、路由和治理。
Open-Weight 和 Open-Source 有什麼不同?
Open-weight 通常表示模型訓練完成後的核心參數,也就是 weights,可以下載或在自己的基礎設施執行。Open-source 的要求更高,可能包含訓練程式、資料來源、完整授權與可重現方法。
一個模型公開 weights,不代表訓練資料公開,也不代表任何用途都可商用。不同 license 可能限制競爭用途、使用規模、衍生模型或特定地區。
企業評估時應逐項拆開:weights 是否可下載、code 是否公開、training data provenance 是否可查、license 是否允許商用、是否能在指定 cloud 或 on-premises 部署。
「open-source AI」在新聞與廠商文章中常被寬鬆使用。本文採較精確的 open-weight,避免把可取得 weights 誤寫成整個研發流程完全開放。
為什麼 Token 規模會改變採購決策?
Token 是模型讀寫文字的計費單位。中文一個字不一定剛好等於一個 token,程式碼、JSON 與長 context 也會讓用量快速增加。
AT&T 官方稱平均每天處理 450 億 tokens。即使每百萬 tokens 只差 1 美元,理論上的每日差額也可達 45,000 美元。實際帳單還要區分 input/output、cache discounts、batch pricing、合約折扣與 self-hosting costs,但規模效果已很清楚。
Frontier model 可能在複雜推理、程式設計或高風險決策更準。問題在於,多數企業流量是摘要、分類、欄位抽取、FAQ、搜尋改寫等固定任務。若較小模型已達品質門檻,繼續使用最貴模型不一定增加商業價值。
AT&T 的 AI Gateway 怎麼分流?
AT&T 的 AI Gateway 不是只按固定規則選模型。公司描述它會在每一輪對話評估 speed、cost 和 expected output quality,再把 prompt 路由到合適模型。
Gateway 具備 cache awareness。若先前計算結果能重用,路由器會把 cache 命中與價格一起考慮。它甚至能在 multi-turn session 中途換模型,不必整段對話綁定同一供應商。
| 工作類型 | 優先模型 | 主要原因 |
|---|---|---|
| 分類、摘要、欄位抽取 | 小型或 open-weight model | 高量、規則明確、容易驗證 |
| Telco 規格與網路故障 | Domain-specific OTel | 專業語彙與標準比通用知識重要 |
| 複雜推理、陌生案例 | Frontier model | 需要較強 reasoning 與泛化 |
| 高風險決策 | Frontier model + human review | 錯誤成本高,不能只看 token 價 |
這種架構的重點是先定義 task-level quality threshold,再比較成本。若沒有 golden set、error budget 和人工抽查,路由器可能只是把錯誤變便宜,而非把服務變有效率。
最高省 90% 應如何解讀?
AT&T 官方寫的是「reducing AI costs as much as 90%, already saving millions」。as much as 代表某些場景最高值,不是所有 workload 的平均節省率。
這也是公司自述,沒有公開完整成本基準、期間、模型組合與獨立 audit。文章可以引用,不能把它寫成每家企業部署 router 都會固定省 90%。
更合理的驗證方式是每個 use case 同時記錄 cost per successful task、latency、fallback rate、人工修正率與業務 KPI。只看 per-token price,可能選到需要重試更多次的便宜模型,最後總成本反而上升。
OTel 2.0 為何比通用 Frontier Model 更適合電信?
電信工作包含 3GPP standards、network telemetry、configuration、fault diagnosis 等專業內容。通用模型即使參數更大,也可能因訓練資料裡缺少 domain knowledge 而表現不穩。
GSMA 表示,OTel 2.0 是以 Gemma 4 31B-IT 為基礎 post-training 的 telco model。AT&T 處理超過 1 兆 tokens,形成約 4,000 億至 4,400 億 training tokens。AT&T 官方頁面寫 over 400 billion,Dell 資料則寫 roughly 440 billion,兩者應視為不同精度的描述。
GSMA 的 Open Telco AI leaderboard 前三名都是 domain-adapted models,OTel 2.0 排名第一。這支持「專門訓練的小模型可在特定領域勝過通用模型」,但不代表它在寫作、程式或一般推理也更強。

開放資料為什麼比模型名稱更重要?
GSMA 與 Pleias 建立 Telco Common Corpus,包含超過 100 億 tokens 的 open、license-verified telecom data。資料來源涵蓋 3GPP、ETSI、GSMA、ITU、O-RAN 等標準組織。

企業自建 open-weight system 時,最大的隱形風險常在訓練與 fine-tuning data 的權利不清,未必是模型本身。若採購、稽核或訴訟要求證明 provenance,能追溯每份文件的 right-to-use 會比 benchmark 多幾分更重要。
AT&T 也強調 OTel 模型可在 right-sized hardware 上運行,部署位置可為 cloud 或 on-premises。資料主權、延遲與治理因此成為 open-weight adoption 的另一個動機,不只為了省錢。
中國 Open-Weight Models 為何受到企業注意?
FT 報導與 X 討論指出,中國模型的價格與能力正在迫使企業重新評估「每個任務都用美國 frontier model」的做法。Open weights 可由企業自行下載,在美國或其他地區的 cloud 執行,資料不一定要送到原始模型公司的應用程式介面(API)。
但模型來源與部署位置是兩回事。企業仍需檢查 license、dependency supply chain、model artifacts、content filters、geopolitical policy、出口管制與資料處理規範。
中國模型也不一定每項工作都更便宜。若需要昂貴 GPU、低利用率 cluster、額外安全審查或大量 prompt adaptation,self-hosted total cost 可能高於便宜的 closed API。
最務實的策略是用相同 golden set 評測 accuracy、latency、throughput 和 total cost per accepted result,而不是按國別或單一 benchmark 做採購。
Self-Hosting 真的比較省嗎?
Open weights 沒有 API output-token bill,不代表推論免費。企業仍要支付 GPU 或 CPU、機房或 cloud、storage、network、monitoring、patching、on-call staff 與 capacity buffer。
高且穩定的流量比較容易攤平 hardware cost。流量低、尖峰不規則或模型更新頻繁時,managed API 的彈性反而可能便宜。
還要看 quantization、batching、cache hit rate 與 context length。模型標價便宜,若生成速度慢、占用更多顯存或需要更多重試,unit economics 會改變。
因此企業應比較 TCO,也就是總持有成本,而非只比較每百萬 tokens 的公開牌價。
企業可怎麼開始 Model Routing?
第一步是盤點 workload,不是先買 GPU。把請求分成可程式驗證、需 domain knowledge、需複雜 reasoning 和高風險四類。
第二步建立 golden set,包含正常、edge cases、敏感資料與 adversarial prompts。每個候選模型都用相同資料測 quality、latency、cost 和 failure mode。
第三步設定 routing 與 fallback。低成本模型先處理容易任務,低 confidence、格式失敗或高風險內容升級到 frontier model,必要時交給人。
第四步持續觀察 drift。模型版本、價格、prompt 和使用者行為改變後,原本的最佳路由可能失效。Router 本身也需要版本控制、audit log 與 rollback。
企業 Open-Weight AI 常見問題
Open-weight 一定比 Closed API 便宜嗎?
不一定。高穩定流量、自有硬體與合適量化時較可能便宜。低流量、需要大量維運或頻繁換模型時,API 可能更划算。
AT&T 每天真的使用 450 億 tokens 嗎?
是 AT&T Chief Data and AI Officer 在官方文章中的數字,表述為平均 45 billion tokens per day。
AT&T 的 90% 是全部 AI 成本嗎?
不是。官方用 as much as 90%,代表最高可達的場景,未公開公司整體平均。
Open-weight 是否等於資料更安全?
Self-hosting 可讓資料留在企業控制環境,但安全仍取決於 artifact provenance、access control、logging、patching 與供應鏈管理。
Frontier models 會被淘汰嗎?
目前證據更支持分工。Frontier models 留在高複雜度與高風險工作,open/domain/smaller models 承接大量例行流量。
結語:企業 AI 的下一場競爭是 Tokenomics
AT&T 每天 450 億 tokens 的案例顯示,模型能力只是一半,如何把每個請求送到「剛好夠好」的模型才是大規模營運關鍵。
Open-weight models、domain models 和 frontier APIs 不需要互相排斥。AI Gateway 可以讓它們成為同一個 portfolio:容易任務追求成本與速度,困難任務追求能力,高風險任務加上人工治理。
企業真正要問的是哪個模型能以最低 total cost 穩定完成這一類工作,而非只追逐最強模型。當 AI 從實驗進入每天數百億 tokens 的基礎設施,model routing、資料 provenance、license 與 governance 會和 benchmark 一樣重要。