• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

16 – La función estado-valor

Lección 16 del curso Aprendizaje por Refuerzo Nivel Básico.

En la lección anterior hablamos de un primer elemento fundamental del agente: la Política. Sin embargo la Política únicamente decide la siguiente acción a tomar, pero por si sola no permite cuantificar si el estado o la acción tomada realmente son buenas.

Así que la Política requiere algo conocido como las funciones de valor, que permiten cuantificar la bondad de un estado o de una acción en particular.

En esta lección hablaremos particularmente de la función estado-valor, que permite precisamente poner números a los diferentes estados alcanzados por el Agente:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Muy bien, acabamos de ver que la función estado-valor nos permite comparar diferentes políticas en un entorno estocástico, se utiliza la función estado-valor.

Esta función estado-valor cuantifica la eficacia de una Política asignando un valor a cada estado, basado en el retorno esperado. Y ese retorno esperado es la suma promedio de recompensas que un agente puede obtener al seguir una política específica desde un estado dado, considerando todas las posibles trayectorias debido a la naturaleza estocástica del entorno.

Así, la función estado-valor nos permite evaluar y comparar políticas al asignar un número a cada estado, indicando qué tan beneficioso es para el agente estar en ese estado siguiendo una política determinada.

Entonces ya tenemos la función estado-valor, el segundo elemento fundamental del Agente y que permite cuantificar qué tan bien o mal lo haría partiendo de un estado determinado y siguiendo una política en particular.

Pero esta función no es la única que puede usar el Agente, de hecho también es posible cuantificar no sólo el estado sino también la acción tomada usando la función acción-valor, de la cual hablaremos en detalle precisamente en la próxima lección.

Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }