pplx-embed-v2-late 是什麼?文字、圖片與 PDF 頁面搜尋,如何保留檢索證據?

pplx-embed-v2-late 提供 0.6b 與 9b 多模態檢索模型,讓文字、圖片與頁面共用嵌入空間。從客服手冊範例說明多段表示、頁碼版本、官方載入方法、權限與檢索驗收,避免把找得到當成答得對。

Share
Perplexity 官方發布的多模態檢索比較圖;圖中數字對應特定評測指標
Perplexity 官方發布的多模態檢索比較圖;圖中數字對應特定評測指標。 圖片來源:Perplexity。

pplx-embed-v2-late 是 Perplexity 新發布的檢索模型,可以把文字、圖片與頁面內容轉成便於比對的數值表示,幫系統找相關資料。

假設客服要回答「帳號鎖住之後按哪個按鈕」,手冊裡的答案可能只有一張操作截圖。只搜尋段落文字,就容易漏掉這頁。

這次模型把文字與視覺文件放進共用空間,文字問題因此能用來搜尋圖片內容,讓圖中的操作步驟也有機會成為檢索結果。

截至 2026 年 10 月 10 日,官方 Hugging Face 提供零點六十億與九十億兩個版本,名稱分別以 0.6b 和 9b 結尾。

對團隊而言,值得先做的不是替全部文件換模型,而是拿一本頁碼清楚的手冊,測試能否找對頁面,再核對回答是否有證據。

搜尋找到一頁資料,還不代表答案正確。來源、版本與使用者可讀範圍,都要和模型結果一起保留。

Perplexity 官方發布的多模態檢索比較圖;圖中數字對應特定評測指標
Perplexity 官方發布的多模態檢索比較圖;圖中數字對應特定評測指標。 圖片來源:Perplexity。

pplx-embed-v2-late 怎麼找文字和圖片

嵌入就是把內容轉成數值表示,用來計算問題和資料的相關程度。你可以把它想成文件搜尋的比較方式,不是另一篇生成的文章。

多模態指能處理不只一種資料類型。這次模型除了文字,也處理圖片和視覺文件,像是保留圖表和版面的手冊頁面。

多段表示保留頁面裡的細節

晚期互動會保留多個局部表示,再於查詢時比較細節。它和把整頁壓成單一向量的方式不同,因此儲存與查詢也要重新估算。

向量是用來表達內容特徵的一組數值。官方模型為每個文字單位產生一組一百二十八維向量,查詢與文件再依這些表示比對。

這樣的設計能保留較多局部訊息,但不是免費增加容量。索引裡保存的資料量和查詢耗時,應以實際文件測量。

索引是事先整理好的搜尋資料庫。手冊更新時,不只原檔要換,索引內對應的內容與版本也需要一起處理。

小模型可以搜尋大模型建立的索引

官方說兩個版本共用嵌入空間,零點六十億版本可以查詢九十億版本建立的索引,讓建索引與接收問題可以採不同配置。

這項相容能力提供了試點方向,卻沒有替你保證延遲或費用。要比較配置,仍需用同一批文件、同一批問題與相同驗收標準。

模型卡的圖片與文字文件評分,對應特定檢索評測和排名指標。它們不是客服回答的總正確率,不能拿來保證公司的回答品質。

先理解模型負責的是找到相關內容,後面的答案生成和引用核對,才會各自有清楚的責任。

先整理一本能回查的客服手冊

以下假設要處理一本帳號設定手冊,內容有文字說明、按鈕截圖和權限表。這是原創教學情境,不是本文已執行的系統測試。

初次測試只放一本已核准的手冊,能讓每個問題都有範圍。若一開始混入多個年度版本,就容易把版本差異誤當成模型錯誤。

頁面資料不要只存圖片

每頁至少保存文件名稱、版本、頁碼、頁面識別碼與取得日期。頁面識別碼是讓程式能準確指向同一頁的固定標記。

檢索結果回來時,這些欄位要跟著一起回傳。若只留下圖片而沒有文件資訊,同事即使看懂內容,也不知道應引用哪一版。

文件印刷頁碼和 PDF 的頁面序號有時不同。封面、目錄可能佔了前幾頁,應同時記錄兩者,避免讀者跳到錯誤位置。

頁面若含截圖,保留原頁面圖,讓人能看到按鈕在什麼位置。另有文字抽取結果時,也保留和圖片對應的關係。

先列出人已知道答案的問題

準備一組問題,例如如何解除鎖定、在哪裡改通知,以及哪個角色可以新增成員。人工先標記答案所在的頁面與版本。

有些問題需要兩頁才能回答,就把兩頁都列成標準答案。只找到其中一頁,不能因為看起來相關就直接算完整命中。

也要安排手冊沒有答案的問題。若系統仍自信指向某頁,這會提醒你需要處理「沒有足夠資料」的情況。

問題可以用同事實際會說的句子,例如「收不到信要去哪裡開」,不要全都照抄章節標題,否則測試可能過於容易。

先有這份問題與頁面對照表,下一節的程式範例才有可以驗收的標準。

延伸閱讀:Perplexity 發布上下文嵌入模型:檔案切成段落後,搜尋如何保留前後意思

依官方模型卡建立最小檢索範例

官方使用 Sentence Transformers 的多向量編碼器。編碼器是把查詢或文件轉成模型表示的程式入口,這次應採多向量方式。

文件要求套件版本至少六點零,以及 Transformers 至少五點四。先記錄實際安裝版本,之後比較結果才能重跑同一環境。

文字查詢和頁面圖分開處理

官方說文字批次與圖片批次要分開呼叫,同一批混合文字和圖片不受支援。共用嵌入空間,不等於所有輸入都可以混著傳。

以下依官方範例整理載入順序,用文字搜尋手冊頁面圖。完整程式可見文末官方模型卡,本文沒有執行範例或測量速度。

  1. 從官方套件載入 MultiVectorEncoder,選擇對應的模型名稱與運算環境。
  2. 用 encode_query 處理一批文字問題,保存這批問題的對照編號。
  3. 把手冊頁面圖轉為 RGB 格式,再用 encode_document 單獨處理圖片批次。
  4. 用 similarity 比較查詢與文件,將排名結果對回原始頁碼和版本。

官方範例中的 CUDA 對應 NVIDIA 運算環境。它展示官方載入方式,不代表所有電腦都能直接照貼執行,硬體條件仍要確認。

測多頁時,把每頁表示和頁面識別碼存成對應資料。排名分數只是排序依據,原本的頁碼與版本不能在處理過程丟掉。

先驗收找頁,再加入答案生成

先看「帳號鎖住」的問題能不能把正確頁面排到前面,再看多頁問題是否找齊。這一輪不需要同時評估生成文字有多漂亮。

若排名不對,先核對圖片是否清晰、文件版本是否一致,以及原問題是否真的有答案。資料問題沒有排除,就難以判斷模型效果。

找頁通過後,再把回傳頁面交給回答模型,要求答案附頁碼與對應說明。回答模型和檢索模型是不同階段,錯誤也要分開記。

例如檢索找到正確頁,但回答把管理員操作說成一般成員能做,這是答案解讀問題,不能把它算成檢索失敗後隨意換索引。

檢索證據要和答案一起交付

客服答案需要的不只是一段文字。使用者應能看到答案依據哪份文件、哪一頁,以及文件是什麼版本,才能判斷能否照做。

引用要對到實際步驟

假設答案寫「到安全設定重設密碼」,引用頁卻只介紹通知設定,就算文件名稱對了,這個引用仍然沒有支持答案。

驗收時可以逐句核對操作與引用,檢查按鈕名稱、角色和先後順序。這比只看文末有沒有附連結更接近可用的客服回覆。

圖上的文字若很小,回答模型也可能讀錯。可以讓同事放大原頁核對,遇到無法辨識的細節,保留人工處理,而不補猜。

檢索排名高不代表答案充分。若只有錯誤說明沒有恢復步驟,系統應說明資料不足,不能把相關頁面包裝成完整解法。

舊版與新版不要互相覆蓋

手冊更新之後,保留版本對應,讓已發出的答案能回查。若只替換相同檔名,原本的引用可能指向不同內容。

新問題預設搜尋目前有效版本,歷史問題則視工作需要保留舊版存取。這是文件管理設計,不能期待模型自動知道公司採哪一版。

每次更新後重跑同一組保留問題,能看出頁碼改動或新增章節是否影響搜尋。只有新增檔案成功,還不能證明答案引用已更新。

如果新版刪除一項功能,測試也要包含原本的問題。系統應認出目前手冊沒有這個步驟,而不從舊版取回不再適用的做法。

權限與成本要在擴大之前驗收

相關內容能被找到,不代表所有使用者都可以看。公開手冊、內部維運與客戶特定文件,應依使用者的可讀範圍篩選。

先篩可讀文件,再做搜尋

可以讓一位只有公開文件權限的測試使用者提問,確認結果、引用和摘要都沒有帶出內部頁面。只隱藏原檔連結仍可能洩漏內容。

同時測有內部權限的使用者,確認他能找到必要資料。權限太寬和權限太窄,都會讓客服流程出問題,只是後果不同。

權限測試可以用沒有敏感資訊的示範文件,先驗證篩選邏輯。沒有必要一開始就用真實客戶資料測試隔離是否成立。

當查詢沒有足夠權限時,回覆要說明無法提供所需資料,不應自行換到另一個不受控來源,繞開原來的文件範圍。

用文件規模量儲存與查詢成本

晚期互動保留多段表示,不能直接套用原本單一向量索引的容量。先記錄這本手冊建完索引的大小,再估算更多文件的需求。

查詢時間則用固定問題測量,包含短問題、長敘述與需要多頁的題目。只挑一題跑得快的問題,無法代表客服常見等待。

若評估大小模型共用空間的配置,也保持問題與文件相同。把品質、等待、索引容量和更新時間列在一起,才方便取捨。

留一份錯誤清單,讓後續更新有方向

錯誤可以分成找不到正確頁、版本不符、圖中文字辨識不清、引用不支持答案與權限篩選失敗。分類能指向不同的修正工作。

如果文件本身沒有說清楚某個步驟,改善手冊可能比換模型更有效。檢索系統能發現缺口,但不能替組織創造不存在的操作規則。

讓客服同事用保留問題抽查,並記錄他們是否能依引用完成操作。這一步能驗證實際可讀性,補上模型排名數字看不到的工作價值。

pplx-embed-v2-late 常見問題 FAQ

它會直接回答問題嗎?

它主要負責產生檢索表示與比對相關內容。若要用自然語言回答,還要另接回答階段,並核對答案是否真的有文件支持。

0.6b 與 9b 能互相配合嗎?

官方說兩者共用嵌入空間,小模型可以查詢大模型建立的索引。是否適合你的資料,仍要在相同問題與文件上評估。

文字和圖片可以放在同一批嗎?

官方要求分開編碼文字批次和圖片批次。兩種內容能共同參與搜尋,不代表編碼時支援混合批次,程式應按文件安排。

PDF 頁面一定比抽文字更準嗎?

有操作截圖與版面資訊的資料,值得比較頁面圖檢索,但不是每份文件都一樣。用人已標好答案頁的問題測試,才能判斷差異。

官方分數就是我的客服正確率嗎?

不是,模型卡的指標是在指定評測中衡量搜尋排序。自己的客服答案還受到文件、問題、權限與回答階段影響,要另行驗收。

下一步:用一本手冊驗收完整引用

先整理文件版本、頁碼與一組有標準頁面的問題,再測搜尋結果。等找頁和引用都通過,才擴大到更多文件與使用者。

訂閱 AI 郵報,持續追蹤檢索模型與文件工作流程。保留問題集也要一起更新,讓每次換模型都有相同的驗收起點。

延伸閱讀:Perplexity Lily 是什麼?開源 Apple silicon 本機 AI 引擎,效能、限制與適合對象一次看

資料來源