#amazon-nova

Cómo diseñar recompensas para RL multi-turn con Amazon Nova Forge
Machine Learning 6 min lectura

Cómo diseñar recompensas para RL multi-turn con Amazon Nova Forge

En tareas multi-turn, la función de recompensa define lo que el modelo aprende: un error sutil puede enseñar el comportamiento equivocado sin alertas claras. Este artículo explica cómo construir, ejecutar e instrumentar recompensas compuestas con Amazon Nova Forge, usando BYOO para evaluar episodios completos.

Cómo la auto-distilación de razonamiento ayuda a personalizar modelos Nova sin perder capacidades
Machine Learning 6 min lectura

Cómo la auto-distilación de razonamiento ayuda a personalizar modelos Nova sin perder capacidades

Entrenar con Supervised Fine-Tuning (SFT) en datasets sin trazas de razonamiento puede hacer que modelos potentes como Amazon Nova 2 olviden habilidades previas. Self-Distilled Reasoning (SDR) reutiliza las trazas de pensamiento del modelo base para mantener y a veces mejorar el desempeño objetivo sin necesidad de un maestro externo ni anotación humana.