跳至內容
新聞分析模型和軟體 · 3 分鐘閱讀

MLPerf的新測試跟蹤AI超越聊天框

Inference v6.1 新增 RAG 和 edge-agent 工作負載,這使得比較套件更有意義,同時保持常見的比較規則無效。

透過流動連線連線的活躍和偶然計算板的編輯影象
一個有用的參考標誌必須連線到系統實際上將服務的工作負載,概念影象,而不是參考結果。編輯影象 · 我們的藝術作品,與AI建立

工作負載比模型大

MLCommons 釋出了 MLPerf Inference v6.1 結果於 2026 年 9 月 16 日,引入終端到終端退出增加和邊緣代理退出工作負載。 MLCommons: MLPerf Inference v6.1 結果和新工作負載

這是一個有用的轉變重點. 許多商業應用程式不會傳送一個孤立的快速到另一個模型. 他們收集資訊,保持背景和執行行動序列. 一個測量,其中包含更多的工作流可以揭示一個模型僅測試錯誤的界限。

在排名之前閱讀條件

比較結果仍然是條件的. 硬體人口、軟體版本、準確性、場景和質量要求影響結果的含義. 一個類別的數字不應作為參與加速器的普遍效能評級。

在比較兩個提交之前,確定他們是否按照相容的規則測量相同的任務,檢查列出的配置是否符合您打算購買的系統,並將釋出的結果與確切的硬體可用於即時交付的承諾區分。

為什麼RAG可以展示不同的瓶子

考慮一個知識搜尋服務. 文件收回或重新排序可以延遲迴復,直到發行開始. 如果這些階段占主導地位,取代發行GPU可能會產生比預期的更小使用者可見的改進。

這不會使GPU效能無關緊要,它會改變最佳化單位:在所需質量和延遲時,完整的答案,同樣的原則適用於經常呼叫工具的代理人,快速模型無法消除它所使用的每個外部服務所花費的時間。

對於採購,請求元件測量和終端測試,第一項有助於診斷系統;第二項告訴你是否應用符合其目標。

建立一個小指標,你可以保持

一家企業不需要重複一個完整的公共參考套件,以便做出有用的決定;需要一個穩定的評估套件,一個定義的環境和使用的設定記錄;包括常見的請求,長的請求和現實的競爭需求。

儲存輸出質量檢查時調節速度. 記錄錯誤和尾巴延遲與平均通道一起. 保持測試可執行後驅動程式,模型或框架更新。

MLPerf的擴充套件範圍是重新審查舊的比較分佈表的好理由,也是提醒,最好的購買引數是其中一個條件類似於所購買的系統實際上會做的工作。

來源 & 閱讀更多

分析和結論是我們的;連結的規格和文件可以改變。

訊息來源檢查於2026年9月29日。

我們如何涵蓋產業

我們的編輯團隊撰寫有關 AI 基礎設施、設備採購及其背後的行業的文章。新聞分析將報導的進展與我們的結論區分開來;意見文章被貼上這樣的標籤。

每篇文章中都連結了技術和產業參考文獻。出版日期描述了文章的撰寫時間,而不意味著每個規格或市場條件保持不變。