Investigadores han desarrollado un nuevo modelo de proceso estocástico para abordar el clásico problema del bandido de dos brazos. Este problema, fundamental en la teoría de la decisión y el aprendizaje por refuerzo, implica elegir repetidamente entre dos opciones (los "brazos") con recompensas inciertas para maximizar la ganancia total. El nuevo modelo introduce efectos de autocorrelación en las recompensas, lo que permite una representación más realista de situaciones donde las decisiones pasadas influyen en los resultados futuros o donde las recompensas no son completamente independientes entre sí. Esto contrasta con los modelos tradicionales que a menudo asumen independencia de las recompensas, simplificación que puede no reflejar la complejidad de escenarios reales en campos como la economía, la medicina o la inteligencia artificial.

El estudio se centra en cómo la autocorrelación afecta la estrategia óptima de elección. En particular, se examina cómo la persistencia o la reversión en las recompensas de un brazo influye en la decisión de explotar una opción conocida o explorar la otra. Los resultados sugieren que la incorporación de la autocorrelación permite al modelo adaptarse mejor a entornos dinámicos, donde las propiedades estadísticas de las recompensas pueden cambiar con el tiempo. La capacidad de capturar estas dependencias temporales es crucial para optimizar las decisiones en contextos donde la información se acumula secuencialmente y las experiencias previas son relevantes para las expectativas futuras.

Este avance tiene implicaciones significativas para el desarrollo de algoritmos de aprendizaje por refuerzo más sofisticados y para la comprensión de la toma de decisiones en sistemas complejos. Al proporcionar un marco más matizado para modelar las recompensas, el trabajo abre vías para mejorar la eficiencia de la exploración y la explotación en aplicaciones que van desde el diseño de ensayos clínicos adaptativos hasta la optimización de estrategias de inversión o la personalización de recomendaciones en plataformas digitales. La validación y aplicación de este modelo en diversos dominios será el siguiente paso para confirmar su robustez y utilidad práctica.