Ajuste fino de agentes de búsqueda con RL multivuelta en SageMaker
AWS detalla cómo ajustar finamente un agente de búsqueda Qwen3.6‑27B usando Amazon SageMaker AI multi‑turn reinforcement learning, logrando una mayor calidad de recuperación y menores tasas de error.
Publicación de la fuente original: 2 de octubre de 2026
AWS explica que los agentes de búsqueda impulsados por modelos de lenguaje grande pueden decidir de forma autónoma qué consultar, qué estrategia de recuperación usar y cuándo detenerse, pero lograr un comportamiento fiable de varios turnos es difícil. El blog presenta Amazon SageMaker AI Multi‑turn Reinforcement Learning (MTRL), que enmarca una tarea agente como una secuencia de decisiones y la optimiza con algoritmos de gradiente de política, manteniendo la integración de bajo código y la ejecución sin servidor.
Los autores ajustaron finamente un modelo Qwen3.6‑27B para un escenario de búsqueda empresarial que accede a herramientas léxicas BM25 y de búsqueda vectorial. El entrenamiento utilizó varios conjuntos de datos públicos y sintéticos, una recompensa basada en nDCG@10 y un cambio mínimo de hiperparámetro (max_epochs = 1, batch = 128, rollout concurrency = 32). La configuración predeterminada de MTRL gestiona la selección de algoritmos, la estimación de ventajas y los límites fuera de política.
La evaluación en cuatro benchmarks reservados mostró mejoras en tres conjuntos de datos, con los mayores incrementos en BrowseComp‑Plus (+23.7 % nDCG@10) y WixQA (+18.4 %). Las tasas de error también disminuyeron drásticamente, ejemplificado por BrowseComp‑Plus que pasó del 22.89 % al 0.68 %, lo que indica una finalización de tareas más fiable.