本文へ移動
ニュース分析ソフトウェア・モデル · 3 min read

MLPerfの新しいテストは、チャットボックスを超えるAIを追跡します。

Inference v6.1 は RAG と edge エージェント の作業負荷を追加します. これは、比較 スイートをより関連性のあるものにし、通常の比較 ルールを無効にします。

流れる接続によって結びついたアクティブおよびアイドルコンピュータパイラの編集イラスト
役に立つ指標は、システムが実際に役立つ作業負荷に接続しなければなりません 概念的なイラストではなく、指標の結果。編集イラスト · 私たちの芸術作品、AIで作成

仕事の負担はモデルより大きくなっている。

MLCommons は MLPerf Inference v6.1 の結果を 2026 年 9 月 16 日に発表し、最終回収増加生成と最終回収増加作業負荷を導入しました。 MLCommons: MLPerf Inference v6.1 の結果と新しいワークロード

多くのビジネスアプリケーションは、別に不思議なモデルに孤立したスピードを送ることはありません. 彼らは情報を取得し、文脈を維持し、行動の順序を実行します. そのワークフローの多くを含む測定は、モデルだけのテストの欠陥の限界を明らかにすることができます。

ランキング前に条件を読む

ハードウェア人口、ソフトウェアバージョン、精度、シナリオ、品質要件は結果が何を意味するかを影響します。1つのカテゴリの数は、関与する加速器のための普遍的なパフォーマンス評価として提示されるべきではありません。

2 件の投稿を比較する前に、互換性のあるルールに基づいて同じ作業を測定しているかどうかを確認します。 リストされた構成が購入するシステムと一致しているかどうかを確認します。 公開された結果を、正確なハードウェアが即時配達のためのものだと約束するものと区別します。

なぜRAGは別のボトルを露出できるのか

知識検索サービスを考える. ドキュメントのリリースまたはリランキングは、世代が始まる前に反応を遅らせる可能性があります. これらの段階が支配する場合、世代のGPUを置き換えることは、予想以上にユーザーに見える改善を減らす可能性があります。

これはGPUのパフォーマンスを無関心にするものではありません。それはユニットが最適化されるのを変える:必要な品質と遅延性で完全な回答です。同じ原則は、ツールを繰り返し呼び出すエージェントに適用されます。

購入には、構成要素の測定と最終テストの両方を要求します. 最初はシステムを診断するのに役立ちます; 第二はアプリケーションが目的を満たしているかどうかを教えてくれます。

あなたが維持できる小さなバランスマークを作成する

ビジネスは、役に立つ決定を下すために、公共のバランスのセット全体を再生する必要はありません. 安定した評価セット、定義された環境、使用された設定の記録を必要とします. 通常の要望、長い要望、現実的な競争需要を含みます。

スピードを調べるときの出力品質チェックを保存します. レコードエラーと尾の遅延を平均通路とともに記録します. ドライバー、モデル、またはフレームアップデート後にテストを実行できるようにします。

MLPerfの拡張範囲は、古い比較スプレッドシートを再検討するための良い理由です。それはまた、購入のベストバランスマークが、購入したシステムが実際にする仕事に似ている条件であることを思い出させるものである。

情報源&続きを読む

分析と結論は私たち自身であり、関連する規格と文書化は変化する可能性があります。

情報源は2026年9月29日に確認されました。

業界をどのようにカバーするか

私たちの編集チームは、AI のインフラストラクチャ、機器調達、およびその背後にある業界について執筆しています。ニュース分析では、報告された展開と私たちの結論を区別します。意見記事にはそのようにラベルが付けられています。

技術および業界の参考資料は各記事内にリンクされています。出版日は、すべての仕様や市場状況が変更されていないことを意味するのではなく、記事がいつ書かれたかを表します。