Ugrás a fő tartalomra
Vissza a hírekhez
AI Models

Az AWS benchmarkek azt mutatják, hogy a GPT‑5.6 Luna gyakran felülmúlja a Mini és Nano modelleket költség és minőség tekintetében

Az AWS öt OpenAI modellt hasonlít össze az Amazon Bedrockon, és azt találja, hogy az újabb GPT‑5.6 Luna alacsonyabb költséget ér el helyes válaszonként, ügynök áthaladásonként és szakmai szállítmányonként, mint a régebbi GPT‑5.4 mini és nano.

Közzétéve: 2026. szeptember 11.Szerző GetAISet Editorial

Az eredeti forrás közzétételi dátuma: 2026. szeptember 11.

AWS kiadott egy nyílt forráskódú benchmark keretrendszert, amely ugyanazt az OpenAI Responses API-t futtatja három Bedrock modell (gpt‑5.6‑luna, terra, sol) és két költséghatékony OpenAI API alapmodell (gpt‑5.4‑mini, nano) ellen. Az egyhívásos pontossági tesztek (AIME, GPQA Diamond, MMLU‑Pro) során a Luna a legalacsonyabb megfigyelt költséget érte el helyes válaszonként – $0.0021 a $0.0139 helyett a mini esetében, egy 2026. július 30‑i árcsökkentés után. A többfordulós ügynök feladatokban (DeepSearchQA) a Luna kevesebb fordulót igényelt, és $0.05 költséggel járt egy sikeres válasz, szemben a mini $0.40‑ával, míg a terra magasabb tokenárát a kevesebb forduló ellensúlyozta. Dokumentumtípusú munkaterhelések esetén (GDPval) a Luna 48 szakmai szállítmányból 27-et teljesített $0.010 költséggel egy-egy sikeres szállítmányra, legyőzve a mini $0.030‑át és a nano $0.012‑ját. A bejegyzés azt is megjegyzi, hogy a Luna medián első tokenig tartó ideje 21 % alacsonyabb a minihez képest, és a throughput-ja 43 % magasabb 500 token vagy annál nagyobb kimeneteknél. Az AWS azt javasolja, hogy ezeket a kimenet‑alapú metrikákat – helyes válasz költsége, fordulóhatékonyság és rubrika áthaladási arány – használjuk annak eldöntéséhez, melyik modell illik egy adott munkaterheléshez.