Ga naar de inhoud
NieuwsanalyseModellen en software · 3 minuten lezen

De nieuwe tests van MLPerf volgen AI buiten de chatbox

Inference v6.1 voegt RAG- en edge-agent-workloads toe. Dat maakt de benchmarksuite relevanter, terwijl de gebruikelijke vergelijkingsregels intact blijven.

Redactionele illustratie van actieve en inactieve computertegels verbonden door een vloeiende verbinding
Een bruikbare benchmark moet aansluiten op de werklast die het systeem daadwerkelijk zal leveren. Conceptuele illustratie, geen benchmarkresultaten.Redactionele illustratie · Ons artwork, gemaakt met AI

De werklast wordt groter dan bij het model

MLCommons heeft op 16 september 2026 de resultaten van MLPerf Inference v6.1 gepubliceerd, waarmee end-to-end retrieval-augmented generatie en edge-agentic inference workloads worden geïntroduceerd. De RAG-taak omvat fasen zoals ophalen en herschikken, evenals genereren; de agentische taak richt zich op multi-turn-gedrag onder beperkingen. MLCommons: MLPerf Inferentie v6.1-resultaten en nieuwe productietaken ↗

Dit is een nuttige accentverschuiving. Veel bedrijfsapplicaties sturen geen geïsoleerde prompt naar een verder inactief model. Ze halen informatie op, behouden de context en voeren reeksen acties uit. Een meting die meer van die workflow omvat, kan beperkingen aan het licht brengen die een test met alleen een model mist.

Lees de voorwaarden vóór de rangschikking

Benchmarkresultaten blijven voorwaardelijk. Hardwarepopulatie, softwareversies, precisie, scenario- en kwaliteitseisen zijn van invloed op wat een resultaat betekent. Een getal uit één categorie mag niet worden gepresenteerd als een universele prestatiebeoordeling voor de betrokken versneller.

Voordat u twee inzendingen met elkaar vergelijkt, moet u vaststellen of zij dezelfde taak meten onder compatibele regels. Controleer of de vermelde configuratie overeenkomt met het systeem dat u wilt kopen. Maak ook onderscheid tussen een gepubliceerd resultaat en een belofte dat de exacte hardware direct leverbaar is.

Waarom RAG een ander knelpunt kan blootleggen

Denk aan een kenniszoekdienst. Het ophalen of herschikken van documenten kan een reactie vertragen voordat het genereren begint. Als deze fasen domineren, kan het vervangen van de generatie GPU een kleinere, voor de gebruiker zichtbare verbetering opleveren dan verwacht.

Dit maakt de prestaties van GPU niet irrelevant. Het verandert de eenheid die wordt geoptimaliseerd: het volledige antwoord met de vereiste kwaliteit en latentie. Hetzelfde principe geldt voor een agent die herhaaldelijk tools aanroept. Een snel model kan de tijd die elke externe dienst gebruikt niet elimineren.

Vraag bij inkoop zowel componentmetingen als een end-to-end test. De eerste helpt bij het diagnosticeren van het systeem; de tweede vertelt u of de toepassing aan zijn doel voldoet.

Bouw een kleine benchmark die je kunt behouden

Een bedrijf hoeft niet een volledige openbare benchmarksuite te reproduceren om een bruikbare beslissing te nemen. Het heeft wel een stabiele evaluatieset, een gedefinieerde omgeving en een overzicht van de gebruikte instellingen nodig. Neem gewone verzoeken, lange verzoeken en realistische gelijktijdige verzoeken op.

Behoud controles van de uitvoerkwaliteit bij het afstemmen op snelheid. Registreer fouten en staartlatentie naast de gemiddelde doorvoer. Houd de test uitvoerbaar na een driver-, model- of framework-update.

De uitgebreide reikwijdte van MLPerf is een goede reden om een ​​oud vergelijkingsspreadsheet opnieuw te bekijken. Het herinnert ons er ook aan dat de beste aankoopbenchmark er een is waarvan de omstandigheden lijken op het werk dat het gekochte systeem daadwerkelijk zal doen.

Bronnen en verder lezen

Primaire bronnen voor de gerapporteerde ontwikkelingen en technische context. Analyse en conclusies zijn van onszelf; gekoppelde specificaties en documentatie kunnen veranderen.

Bronnen gecontroleerd op 29 september 2026.

Hoe we de sector bestrijken

Onze redactie schrijft over AI infrastructuur, aanschaf van apparatuur en de industrie erachter. Nieuwsanalyse maakt onderscheid tussen gerapporteerde ontwikkelingen en onze conclusies; opinieartikelen worden als zodanig bestempeld.

Binnen elk artikel zijn technische en branchereferenties gekoppeld. Publicatiedata beschrijven wanneer een artikel is geschreven, in plaats van te impliceren dat elke specificatie of marktomstandigheid ongewijzigd blijft.