Step 5 Preview 是什麼?100 萬上下文的新模型,怎麼看懂 Vals 第 7 名?
Step 5 Preview 支援百萬 token 上下文與圖片、影片輸入,近期登上 Vals 排行榜。本文解析官方規格、榜單第七的分類與模型接入,說明長上下文、多模態和開放權重不能混為一談。
StepFun 的 Step 5 Preview 近期因 Vals 排行榜訊息在 X 被分享。評測方的貼文把它列在開放權重模型分類第七名,也展示每項任務的估計成本。對讀者而言,這是一個值得追蹤的新選項,但排名、使用條件與權重取得,需要分開看。
官方接入檔案介紹的 Step 5 Preview,支援一百萬 token 上下文,能接受文字、圖片與影片,輸出則以文字為主。它面向程式與知識工作,也能配合應用提供的工具處理多步任務。這些規格描述能做哪些輸入與工作,不等於每一次回答都能完整理解百萬 token。
本文會先整理官方檔案確認的能力,再拆解 Vals 第七名的意思。最後用跨檔案研究與影片摘要的情境,說明如何評估長上下文模型,避免把最大容量、榜單名次或 Preview 名稱當成唯一選擇依據。

Step 5 Preview 的官方規格有哪些?
依照StepFun 官方檔案,模型識別名稱為 step-5-preview,上下文視窗是一百萬 token,最大輸出為六萬四千 token。token 是模型處理文字與其他資訊的計量單位,不能直接按一比一換算成中文字數。
API 是讓程式與模型服務交換請求及結果的介面,開發者可以藉此把模型接入自己的應用。官方文件提供這條使用路線,使用者仍需要帳號、憑證與符合需求的程式。
上下文可以理解為模型一次工作時能處理的資訊範圍,包含輸入與相關對話。容量較大,讓使用者有機會放入更多檔案、程式碼或背景資料。它解決的是容納能力的一部分,是否能正確使用每個細節,仍需要測試。
模型原生支援文字、圖片與影片輸入,並提供工具呼叫、串流與結構化輸出等功能。工具呼叫是讓模型提出要使用哪個工具及引數,真正執行仍由應用安排。模型本身不會因為支援工具,就自動取得你的本機檔案與外部服務許可權。
| 專案 | 官方檔案列示 | 怎麼理解 |
|---|---|---|
| 模型名稱 | step-5-preview | API 使用的識別名稱 |
| 上下文視窗 | 1M token | 可以處理較大量輸入資訊 |
| 輸入 | 文字、圖片、影片 | 能結合多種資料形式 |
| 輸出 | 文字 | 不是文字生影片功能 |
| 最大輸出 | 64K token | 實際回覆仍依任務與設定 |
| 推理強度 | low、medium、high | 運算與等待需要一起衡量 |
官方也提供 JSON Mode 與 JSON Schema 等結構化輸出方式。可以理解為讓結果更符合預先指定的資料格式,例如包含固定欄位的物件。格式符合不等於內容正確,使用者仍要驗證數字、來源與必填條件。
百萬上下文,為什麼不等於 AI 一定讀懂所有檔案?
把資料放進視窗,只是第一步。模型還需要定位相關內容、區分版本、理解矛盾並形成結論。十份檔案如果有五份過期,大容量可能讓舊資料也一起進入判斷。真正的工作品質,取決於如何提供與核對資訊。
假設你要比較十份產品規格,最重要的是最新版本、各欄位差異與來源。這是本文的示意情境。長上下文能讓資料放在同一次任務裡,仍應要求模型列出對應檔案與證據,不要只交出一份沒有引用的總結。
程式工作也類似。整個儲存庫能放進模型,不代表每個檔案都需要讀取,或模型已理解執行環境。錯誤日誌、受影響模組與相關測試可能更重要。容量提供彈性,輸入範圍仍應按照任務選擇,避免資料很多卻沒有清楚目標。
更長輸入也可能增加費用與等待。即使服務支援提示快取,第一次處理與後續複用的成本也可能不同。評估時可以比較「整份資料一次放入」與「先定位相關片段」的完整成果與費用,找出適合自己工作的方式。
Vals 第七名,先看它是哪一張排行榜
Vals AI 的官方 X 貼文介紹 Step 5 Preview 進入該次排行榜,並在開放權重模型分類排名第七,列出每任務約 2.54 美元的估計成本。這是該次評估快照,排名會隨著新模型與測試更新而改變。
分類是理解名次的重要條件。第七是某個榜單與類別中的位置,不是全世界所有模型、所有用途的共同排名。模型可能在某類程式任務表現較好,在影像細節、長檔案定位或中文寫作又有不同結果。一個總分無法取代自己的任務測試。
每任務成本也與評測流程有關。它可能包含多次模型呼叫與不同長度輸出,不能直接當成一次聊天的價格。正式使用應檢視供應商當前計價,並量測自己的輸入、輸出與工具成本,而不是把評測方的平均值照搬到預算表。
| 榜單資訊 | 能說明什麼 | 不能直接推出什麼 |
|---|---|---|
| 分類排名 | 在指定評估中的相對位置 | 所有任務都更好 |
| 綜合得分 | 測試集合上的整體觀察 | 每個領域能力一致 |
| 每任務估計成本 | 評測流程中的消耗量級 | 任意聊天的固定費用 |
| 公開快照 | 某個時間點的比較 | 排名永久不變 |
因此,榜單最適合用來縮小候選範圍。把有興趣的模型選出來,再用自己的案例比較正確率、延遲與成本,會比直接採用最高名次更穩妥。對有固定工作流程的團隊,這種小規模測試也更容易解釋選擇原因。
榜單寫開放權重,為什麼還要核對下載狀態?
開放權重通常表示使用者可以取得模型引數,在符合授權的條件下自行執行。API 服務則是通過遠端介面使用模型。兩種形式可以同時存在,也可能在不同時間提供,不能僅憑榜單分類就認定目前已經有可下載的完整檔案。
本文核對到的 StepFun 官方接入檔案,提供 API 使用路線與相關功能。想自行部署的人,還應另外確認官方權重發布頁面、模型檔案與授權條款。Preview 是產品階段名稱,也不能直接證明它完全開放或完全關閉。
這個區別會影響實際選擇。API 適合快速接入,由供應商處理模型執行。自行部署需要硬體、維護與許可權設計,但也可能提供不同控制方式。是否適合,取決於工作需求與實際提供的條件,而不是開源或閉源標籤本身。
對於新聞閱讀,這也是一個基本習慣:評測方可以說明自己的分類與成績,供應商則負責說明產品如何取得與使用。把這兩種來源放在一起看,才能避免把後續計劃寫成已經完成的釋出。
圖片與影片輸入,能做哪些工作?
官方檔案列出圖片格式、數量與細節等級,也提供影片輸入方式。模型可以分析截圖、圖表與影片內容,適合把視覺資料與文字問題結合。這裡討論的是理解輸入內容,不是生成新圖片或新影片。
以影片摘要為例,使用者可以要求整理主要事件、時間順序與相關畫面證據。不同影片長度與輸入方式有不同限制,官方對 URL 影片列出檔案大小與建議時長。把一段長影片放進去之前,應先確認路徑與條件,而不是隻看上下文容量。
圖表分析則應檢查數值與視覺證據。模型可能正確理解整體趨勢,卻誤讀小字或圖例。可以要求它先列出看到的標籤與數值,再說明結論,讓使用者更容易發現讀取錯誤。這個流程是一般使用建議,不是官方保證準確率的方法。
對截圖問答,圖片清晰度與裁切也會影響效果。原圖中的重要文字若很小,模型未必能可靠辨識。需要精確文字或數字的工作,應保留原始資料並核對,不能讓一段流暢分析取代來源檢查。
多步代理能力,真正由應用提供哪些部分?
官方檔案明確說明,搜尋、程式碼執行與工具能力由接入應用提供。模型可以幫助拆解任務與提出呼叫,應用則負責工具連線、實際執行與結果回傳。這個分工決定了它能訪問什麼,以及操作會產生哪些外部影響。
假設一個研究助理有搜尋與試算表工具,模型可以根據問題決定查資料或計算。若應用沒有接入搜尋,模型不會僅因規格寫多步代理就自動瀏覽最新網頁。新聞介紹應該把模型能力與完整產品功能區分,避免給使用者錯誤期待。
外部寫入也需要應用控制。能夠提出更新表格的引數,不等於應該直接獲得所有資料的修改權。開發者應鎖定必要物件與欄位,並在操作後讀回結果。這個原則與模型名次無關,是建立可驗證工作流程的一部分。
對使用者而言,選擇模型時也要看使用介面提供什麼工具。相同模型接入不同應用,實際能做的工作可能差很多。模型規格是基礎,工具、許可權與驗收才組成最終體驗。
如何做一份與自己有關的模型比較?
先選三類真實任務,例如跨檔案問答、程式錯誤排查與圖表讀取。每類保留幾個未提前調過提示的案例,寫清楚正確結果與需要的證據。這樣能避免模型只是熟悉演示題目,也能看出不同任務的差異。
再固定輸入與輸出要求。比較雙方使用同一份檔案、相同工具與同樣的長度限制。若一個模型可以調用搜索,另一個不能,最終差異就不只來自模型。把條件儲存下來,才能讓結果有解釋力。
接著記錄正確率、等待與費用。長上下文與較高推理強度可能幫助某些任務,也可能增加成本。可以分別測試中等與較高配置,看收益是否符合實際需求。不要只比較最快一次或最好一次,重複觀察會更容易發現不穩定。
最後檢查錯誤型別。遺漏引用、誤讀圖表、使用舊資料與工具呼叫錯誤,需要不同解決方式。模型平均分數較好,卻在關鍵業務條件上經常出錯,可能仍不適合使用。選型應跟著任務,而不是跟著榜單宣傳。
常見問題:Step 5 Preview 適合一般使用者嗎?
百萬上下文可以一次放多少中文字?
token 與中文字沒有固定一比一關係,圖片與影片也有自己的計量方式。官方容量描述輸入範圍,實際可放多少資料應以介面與用量結果確認。對重要工作,先用代表性資料測試,比用簡單字數換算更可靠。
支援影片輸入,就能生成影片嗎?
官方檔案列出的輸出型別是文字。模型可以理解影片並回答問題,與生成新影片是不同能力。使用時應依據實際介面,不要把多模態輸入誤讀成所有形式都能輸出。
第七名代表比其他模型都便宜嗎?
排名與成本是不同維度,每任務估計也來自指定評測。自己的費用由輸入、輸出、快取與呼叫方式決定。應同時比較可用結果與總消耗,不能只根據名次或單一成本快照判斷。
結語:長上下文與榜單,都要放回實際任務
Step 5 Preview 提供百萬上下文、多模態輸入與工具接入能力,Vals 快照則提供一個外部評估線索。它們讓使用者有機會比較新的模型選擇,仍需要把產品取得方式、測試條件與實際任務分開理解。
如果你需要處理大量檔案,可以先用自己的案例做小測試,要求來源與可核對結果,再量測等待與費用。這樣,榜單訊息才能轉成有依據的工具決定,而不是隻多記住一個熱門名字。