← News Today

modelos · 14 de agosto de 2026, 23:00

AWS lanza Amazon Nova Forge con funciones de recompensa personalizadas para RL

El nuevo servicio permite entrenar modelos con aprendizaje por refuerzo en múltiples turnos usando métricas definidas por el usuario.

Amazon Web Services (AWS) presentó Amazon Nova Forge, una herramienta diseñada para facilitar el entrenamiento de modelos de lenguaje mediante aprendizaje por refuerzo en conversaciones de múltiples turnos. La novedad central es la posibilidad de definir funciones de recompensa personalizadas, lo que permite a los equipos de desarrollo alinear el comportamiento del modelo con objetivos específicos de cada caso de uso.

A diferencia de los enfoques tradicionales de ajuste fino, el aprendizaje por refuerzo multiturn habilita que el modelo sea evaluado y corregido a lo largo de una conversación completa, no solo en respuestas aisladas. Esto resulta especialmente útil para aplicaciones de atención al cliente, asistentes virtuales y sistemas de diálogo donde la coherencia a lo largo del tiempo es crítica.

Las funciones de recompensa personalizadas de Nova Forge permiten incorporar señales de calidad definidas por el propio equipo: desde métricas de relevancia y tono hasta criterios de cumplimiento normativo. AWS indicó que el servicio se integra con el ecosistema existente de Amazon Bedrock, reduciendo la fricción para equipos que ya trabajan dentro de la nube de la compañía.

Con este lanzamiento, AWS profundiza su apuesta por ofrecer infraestructura de entrenamiento avanzada a empresas que buscan mayor control sobre el comportamiento de sus modelos sin necesidad de gestionar la infraestructura subyacente. La plataforma compite directamente con soluciones similares de Google Cloud y Microsoft Azure en el segmento de IA empresarial.

Fuente original: Amazon Web Services (AWS)