AWS Benchmarks Muestran que GPT‑5.6 Luna Frecuentemente Supera a Mini y Nano en Costo y Calidad
AWS compara cinco modelos de OpenAI en Amazon Bedrock, descubriendo que el más reciente GPT‑5.6 Luna ofrece un costo menor por respuesta correcta, por paso de agente y por entrega profesional que los modelos más antiguos GPT‑5.4 mini y nano.
Publicación de la fuente original: 11 de septiembre de 2026
AWS lanzó un arnés de evaluación de código abierto que ejecuta la misma API de Respuestas de OpenAI contra tres modelos de Bedrock (gpt‑5.6‑luna, terra, sol) y dos líneas base de API de OpenAI optimizadas por costo (gpt‑5.4‑mini, nano). En pruebas de precisión de llamada única (AIME, GPQA Diamond, MMLU‑Pro) Luna logró el costo observado más bajo por respuesta correcta—$0.0021 frente a $0.0139 para mini después de una reducción de precios el 30 de julio de 2026. En tareas de agente de múltiples turnos (DeepSearchQA), Luna requirió menos turnos y costó $0.05 por respuesta aprobada, comparado con $0.40 para mini, mientras que el precio más alto por token de terra se compensó con menos turnos.
Para cargas de trabajo de estilo documental (GDPval), Luna aprobó 27 de 48 entregas profesionales a $0.010 por aprobación, superando los $0.030 de mini y $0.012 de nano. La publicación también señala que el tiempo medio hasta el primer token de Luna fue un 21 % más bajo que el de mini y su rendimiento un 43 % mayor para salidas ≥500 tokens. AWS sugiere usar estas métricas basadas en resultados—costo por respuesta correcta, eficiencia de turnos y tasa de aprobación de la rúbrica—para decidir qué modelo se adapta a una carga de trabajo determinada.