NVIDIA AIPerf 是什麼?看懂 AI 推論延遲、吞吐量與多人使用效能

NVIDIA AIPerf 是生成式 AI 推論測試工具,可量測首字等待時間、輸出速度、延遲分布與併發負載。本文整理重要指標,說明如何避免只用每秒 token 比較 AI 服務。

Share
AIPerf 官方 README 中的效能測試儀表板示範。
AIPerf 官方 README 中的效能測試儀表板示範。 圖片來源:https://github.com/ai-dynamo/aiperf

AIPerf 是 NVIDIA 生態系中的生成式 AI 效能測試工具,能向模型服務送出一組請求,記錄使用者等待多久、答案生成多快,以及同時多人使用時的表現。它測量的是整個服務的推論效能,適合評估部署方式是否符合應用需求。

近日 X 上的開發者分享了 AIPerf,讓「AI 速度」這個常見問題重新回到測試方法。聊天畫面看起來很快,可能只是請求較短或只有一位使用者;正式服務還要處理長文件、尖峰流量與少數特別慢的請求。

AIPerf 官方 README 中的效能測試儀表板示範。
AIPerf 官方 README 中的效能測試儀表板示範。 圖片來源:NVIDIA AIPerf 官方儲存庫。

AIPerf 可以測試哪些服務

依官方儲存庫,AIPerf 支援多種端點與測試資料,包括 OpenAI 相容的聊天介面、文字生成,以及嵌入、音訊和影像等類型。端點是提供模型服務的網路入口,工具會依對應格式送出請求。

官方入門範例使用 Ollama 建立本地模型服務,再由 AIPerf 發送測試。正式評估時,也可以改用自己的推論伺服器與工作負載。工具提供命令列顯示、報表與匯出資料,方便把不同配置放在相同條件下比較。

四個指標,看見使用者真正的等待

Token 是模型處理文字的單位,可能是一個字、部分單字或符號。每秒 token 數能描述輸出速度,但還不能完整反映體感。

指標 意義 對使用者的影響
首個 token 時間 從送出請求到開始輸出 按下送出後等多久
token 間隔 相鄰輸出單位的時間 文字出現是否順暢
請求總延遲 完成一整個回應的時間 任務多久做完
吞吐量 一段時間可處理的總工作 同時服務多少使用者

p99 是第 99 百分位的延遲,可理解為約 99% 請求會落在這個時間以內。平均值可能很漂亮,p99 卻很高,表示少數使用者仍會等很久。

併發量和請求頻率有什麼差別

併發量是同時進行中的請求數;請求頻率是每秒送進多少新請求。AIPerf 提供這些不同負載模式,也支援逐步增加負載與重播請求軌跡。

假設客服助理平常只有少數人使用,活動開始後卻有大量詢問湧入,只測單人回答速度就容易漏掉排隊問題。比較服務時,應讓輸入長度、輸出長度、負載模式和模型設定一致,再觀察延遲是否隨人數快速上升。

官方範例數字為什麼不能當排行榜

README 明確標註,範例輸出來自僅使用 CPU 的執行,並非官方效能基準。它的作用是教讀者看報表,不能用來判斷哪張 GPU 或哪個模型最快。

同樣的模型,在不同硬體、推論引擎、快取狀態與提示長度下,結果都可能改變。測試報告應記錄這些條件,並確認暖機是否完成。暖機是先讓服務載入模型與建立必要狀態,避免把初次啟動的等待和穩定運作混在一起。

我的判斷是,小團隊可以先用最常見的三種真實請求建立測試集,再增加併發量。這比先追求複雜的測試參數更能回答產品問題,也比較容易看出改動究竟改善了哪一類任務。

常見問題

AIPerf 會讓模型變快嗎?

它負責量測與分析。改善速度仍需要調整硬體、推論設定、快取或應用設計。

吞吐量高,聊天一定比較順嗎?

不一定。系統可能提高總處理量,卻讓每個人的首字等待或輸出間隔增加。

可以測正式服務嗎?

可以測可存取的服務,但負載測試應依服務容量規劃。先從測試環境與低負載開始,能避免干擾正常使用。

結語:先定義體驗,再決定效能目標

AIPerf 的價值,是把「感覺很快」變成能比較的資料。聊天助理、文件摘要和批次處理各有不同需求,先決定可接受的等待時間,再看指標,才能選到適合產品的配置。

官方資料來源