V-Rubrics 是什麼?AI 看圖答對也可能看錯,用細項評分檢查視覺推理

V-Rubrics 把視覺依據、推理一致與指令遵循拆成細項回饋,改善多模態 AI 訓練。本文用圖表與票據示例解釋答案分數的盲點,整理官方資料集與實驗,說明評分表如何對準真正證據。

Share
V-Rubrics 用原子評分項目檢查視覺與推理的範例
官方範例把視覺依據、推理與指令遵循分開評分。圖/V-Rubrics 團隊 圖片來源:https://shulin16.github.io/v-rubrics/

AI 看圖回答得很流暢,甚至選到正確答案,仍可能讀錯圖表或編出不存在的物體。V-Rubrics 研究把這個問題放進訓練回饋:不要只評最後答案,也要檢查用到的視覺事實、推理步驟與指令條件是否成立。

這篇八月公開的論文,近期在 X 的 AI 社群被分享。方法把參考回答拆成小而可檢查的專案,讓模型知道哪個部分有依據、哪個部分缺少證據。它針對的是多模態模型的後續訓練,不是一般使用者加一段提示詞就能取得的固定能力。

對用 AI 看圖表、讀票據或回答幾何問題的人,這個方向很實際。本文會先解釋為什麼只看答案不足,再拆解三種評分維度與訓練方式,最後用具體示例說明,如何把「好像合理」變成「每個關鍵結論都有依據」。

V-Rubrics 用原子評分項目檢查視覺與推理的範例
官方範例把視覺依據、推理與指令遵循分開評分。圖/V-Rubrics 團隊 圖片來源:V-Rubrics 研究團隊。

看圖答對,為什麼仍可能有問題?

選擇題只看最後選項,很容易漏掉中間錯誤。模型可能把一條線看成另一條,使用錯誤數字,最後卻剛好選到正確答案。這種結果可以通過答案評分,卻不能證明它真正理解視覺資料。

開放問題也有相似情況。模型可能正確說出趨勢,卻同時編出圖中沒有的數值。若評分只要求主結論相近,錯誤細節就可能沒有受到處罰。訓練若反覆接受這種回饋,模型未必學會把每個判斷都連到畫面證據。

這與文字流暢度不同。多模態模型是能處理文字與影像等多種形式的模型,它需要把看到的內容轉成可用資訊。回答自然,只說明表達能力,視覺事實是否正確仍是獨立問題。

V-Rubrics 希望讓獎勵更具體。獎勵是訓練用來判斷行為好壞的回饋,如果只給一個總分,模型不容易知道究竟哪裡出錯。拆成細項,就有機會把回饋對準真正需要改善的部分。

三個維度:視覺依據、推理一致、遵守指令

依照原始論文,方法使用 Visual Faithfulness、Reasoning Consistency 與 Instruction Following 三類專案。本文分別稱為視覺忠實、推理一致與指令遵循,讓評估涵蓋看見什麼、如何推論,以及是否符合要求。

視覺忠實檢查畫面事實,例如物體、屬性、關係、數量、可見文字與圖表數值。它要求主張有可檢查的視覺依據。若圖片裡沒有某個物體,模型不能因為語境合理就自行加入。

推理一致檢查事實之間的論證。模型可能讀對兩個數值,卻用錯比較或計算。例如看到某項從十增加到十五,寫成增加一倍,這就是推理問題。把它與讀圖錯誤分開,才能知道訓練應該改善哪一層。

指令遵循檢查任務條件。使用者可能要求只回答數值、列出依據或按指定格式輸出。即使內容正確,沒有遵守關鍵要求也會影響可用性。這一維度讓評估不只關注知識,還能對齊交付條件。

維度 要檢查什麼 示意問題
視覺忠實 主張是否符合畫面 數值、標籤與物體是否讀對
推理一致 步驟是否合理 比較、運算與結論是否成立
指令遵循 是否完成要求 格式、範圍與必要證據是否符合

三者並非完全獨立。讀錯數值可能造成後續推理錯誤,遺漏指令也可能讓答案沒有證據。分開評分的價值,是讓回饋更有定位能力,不是讓所有複雜錯誤都能簡單歸成一個標籤。

原子評分項,如何讓回饋更精確?

原子專案可以理解為足夠小、能夠單獨判斷的條件。與其寫「分析正確」,可以拆成「讀出橫軸年份」「讀出最高柱的標籤」「用正確數值計算差異」。每一項有明確目標,檢查者就不需要猜總體好不好。

官方研究網站展示了這種拆分方式,把一個視覺問答連到多項依據與推理。資料中的評分專案要求可檢查、具體與自包含,降低過度籠統的回饋。自包含表示條件本身能說明要檢查什麼。

拆得太細也可能有成本。若每個問題都有大量重複要求,評分會變慢,也可能讓重要條件被淹沒。好的細項應對準答案真正依賴的事實,而不是把所有可能細節都列上去。

細項之間也應避免矛盾。例如一項要求簡短回答,另一項要求解釋所有步驟,可能使模型難以同時滿足。建立評分表時,需要讓條件反映同一個任務目標,不能只增加數量就期待更可靠。

V-Rubrics 用原子評分項目檢查視覺與推理的範例
官方範例把視覺依據、推理與指令遵循分開評分。圖/V-Rubrics 團隊 圖片來源:V-Rubrics 研究團隊。

用營收圖表示範:總分為什麼看不出原因?

假設一張圖比較四個季度營收,使用者問最高季度比最低季度多多少。這是本文的示意情境。一個完整答案需要正確讀出季度標籤、兩個數值與單位,再進行減法,並按要求回答。

視覺項可以檢查最高與最低位置、標籤與數值。推理項檢查減法與單位是否一致,指令項則檢查是否只回答所需差異或附上必要依據。這樣即使最終數字錯誤,也能知道問題發生在讀取還是計算。

如果模型把座標單位「萬元」漏掉,最後結果就可能差很多。若只比較答案文字與參考相似程度,這類錯誤可能不容易被正確區分。細項評分讓單位成為明確條件,回饋也更容易對準。

另一種情況是答對差異,卻引用錯誤季度。總答案可以通過,視覺與理由卻不可靠。對需要解釋與複核的工作,這仍然是問題。V-Rubrics 的方向,就是讓訓練看到這些被單一答案分數隱藏的錯誤。

票據與幾何,評分條件也會不同

票據讀取可能重視品項、數量、單價與合計。某個數字不清楚時,應保留不確定,而不是按常見價格補齊。這是應用上的一般原則,評分項應對應原始可見內容,讓模型知道猜測與讀取不是同樣的成果。

幾何問題則需要檢查圖形關係。模型可能看見兩條線,卻誤認它們平行。後續推導即使形式完整,起點仍然錯誤。將視覺關係與數學推理分開,有助於發現這種問題。

科學圖表還有圖例、座標、誤差與實驗條件。只讀出趨勢,可能不足以支援因果結論。評分表應要求與問題相關的證據,也應限制沒有資料支援的推論。不同領域的細項需要由任務設計,不能用一份通用表涵蓋所有情況。

因此,rubric 可以理解為評分準則,而不只是一個格式模板。它把何謂完成寫清楚,讓訓練與檢查共同使用。準則質量會影響結果,錯誤準則也可能訓練出更穩定的錯誤行為。

研究建立了什麼資料與模型?

論文以 Qwen3-VL-8B-Instruct 為基礎,先進行監督式微調,再比較不同強化學習回饋方式。監督式微調是用示例讓模型學習對應輸出,強化學習則根據結果評分調整行為。兩階段承擔不同角色。

研究建立 V-Rubrics 50K,包含約五萬條樣本,來自十七種視覺相關來源,並形成約三十五萬條細項評分。註釋過程使用模型輔助,經過研究設計的過濾與結構化步驟。資料數量提供規模,也需要看評分項是否可靠。

研究組成 作用 需要注意
共享微調起點 讓比較方法從相同基礎開始 避免起點不同影響結果
V-Rubrics 50K 提供視覺問題與細項 來源與標註質量
細項強化學習 以結構化回饋訓練 獎勵是否對準證據
未見測試 比較後續任務表現 泛化與領域差異

研究使用 GRPO 等強化學習安排,並把部分回饋定位到對應證據與字首範圍。字首是生成內容中截至某個位置的部分,定位的目的在於更具體分配信用,而不是隻在最後一句給總獎懲。

這些訓練方法需要模型、資料與評估程式,不等於把三維表貼進聊天框就能重現。一般使用者可以借用評分思路,研究者若要重現,則應使用官方程式與對應資料說明。

實驗改善說明什麼,又不說明什麼?

論文比較共享監督微調基礎、只看答案的強化學習,以及細項回饋方法,在知識、視覺數學、圖表與推理測試中觀察差異。它提供證據支援更具體的回饋有用,收益仍隨任務而變。

不同表格的平均分數,也有不同組成。知識測試與視覺數學指標不能隨意混在一起,某個平均值更不能讀成所有真實圖片都相同準確。看結果時應先確認包含哪些任務,再判斷與自己的使用需求是否相關。

實驗也不能證明評分模型完全正確。模型輔助標註可能引入偏差,驗證者可能漏看細節。更結構化的回饋改善了定位方式,仍需要抽查原始畫面與評分項,避免自動流程把錯誤條件固定下來。

對實際應用,最有用的是建立自己的證據鏈。輸入圖片、讀取結果、計算與結論分別儲存,方便複核。研究成績提供方法線索,真正任務仍要由原始資料與可驗證結果支援。

如何把細項評分快速用於工作?

先選一項明確任務,例如從票據抽取日期與金額。寫出少量關鍵條件:只讀可見文字、保留單位、合計可重算、不清楚處不補猜。條件應與成果相關,避免列入無關的寫作偏好。

再把讀取與推理分開。原始數值應有圖片依據,計算則可以用確定性工具重做。確定性工具按明確規則計算,結果較容易比較。讓視覺模型負責讀取、工具負責運算,有時比要求模型在同一句話裡完成全部更好檢查。

接著儲存失敗原因。讀錯、算錯與格式不符需要不同修正。只記一個總分,會讓後續提示修改失去方向。少量穩定分類,就能幫助團隊知道問題集中在哪一層。

最後留一批沒有參與調整的案例。評分表如果只圍繞熟悉圖片,很可能無法處理新的版面與圖表型別。未見案例能檢驗是否真正改善,也幫助決定準則是否過度依賴某種格式。

自動評分也需要被檢查

可以先由熟悉任務的人抽查評分結果,比較自動判斷與原始圖片。尤其是細字、模糊區域與複雜關係,不能只因為評分器寫得肯定就接受。評估工具本身的準確性,也是系統的一部分。

評分條件還應隨任務變化更新。新增欄位、改變輸出格式或切換圖片來源,都可能讓舊準則不適用。儲存準則版本與對應任務,能避免新舊標準混用,也讓結果更容易解釋。

對重要資料,可以把自動評分當成篩選與定位,再由原始來源決定爭議內容。細項讓問題更容易找到,最終事實仍來自圖片與檔案,而不是評分文字。這是把研究方向轉成可靠工作的關鍵。

常見問題:V-Rubrics 能讓 AI 看圖零錯誤嗎?

最後答案正確,還需要看理由嗎?

需要,尤其當答案會被用於計算、報告或後續決策。理由可能暴露錯誤讀取與未經支援的推論。細項評估讓這些問題有機會被發現,但是否可靠仍要與原始圖片核對。

可以直接把三個維度放進提示詞嗎?

可以用來組織檢查,但不能宣稱因此重現論文訓練結果。提示使用與模型訓練是不同層次。若借用思路,應以自己的案例比較,看讀取、推理與格式是否真的改善。

細項越多,評估就越好嗎?

不一定。重複、矛盾或無關條件會增加成本,也可能使目標不清楚。應優先選擇影響正確成果的關鍵條件,再根據實際失敗補充。具體與可靠比數量更重要。

結語:讓 AI 的答案,每一步都能找到依據

V-Rubrics 把視覺問答的回饋從單一結果拆成可檢查專案,關注看見什麼、如何推論與是否遵守要求。它提供了一條改善多模態後續訓練的研究路線,也讓實際工作更容易理解錯誤來源。

對使用者,最容易開始的是把事實與推理分開核對。對團隊,則是建立明確準則、儲存來源與檢查評分器。當每個關鍵結論都有證據,流暢回答才更有機會變成可信成果。

官方資料來源