<p>In Reinforcement Learning, Multi-Armed Bandit (MAB) problems are essential for balancing exploration and exploitation in decision-making. Standard MAB algorithms typically assume constant rewards, a drawback in volatile financial markets. We introduce the Bandit Network architecture, which serves as a foundation for incorporating our new Adaptive Discounted Thompson Sampling (ADTS) and Combinatorial Adaptive Discounted Thompson Sampling (CADTS), along with other stationary and non-stationary bandit variants into a two-stage process, filtering and weighting, for Portfolio Optimization. Backtests with cryptocurrency and S&amp;P data show that the Bandit Network approach outperforms traditional portfolio selection models in Cumulative Returns and Sharpe Ratio. Tests on standard datasets such as FF48 and FF100 indicate Bandit Networks surpass benchmark policies from previous work in cumulative returns while maintaining similar correlation patterns to the full datasets. These findings confirm that employing Bandit Networks enhances adaptability and performance in changing financial environments.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Improving Portfolio Optimization Results with Bandit Networks

  • Gustavo de Freitas Fonseca,
  • Lucas Coelho e Silva,
  • Paulo André Lima de Castro

摘要

In Reinforcement Learning, Multi-Armed Bandit (MAB) problems are essential for balancing exploration and exploitation in decision-making. Standard MAB algorithms typically assume constant rewards, a drawback in volatile financial markets. We introduce the Bandit Network architecture, which serves as a foundation for incorporating our new Adaptive Discounted Thompson Sampling (ADTS) and Combinatorial Adaptive Discounted Thompson Sampling (CADTS), along with other stationary and non-stationary bandit variants into a two-stage process, filtering and weighting, for Portfolio Optimization. Backtests with cryptocurrency and S&P data show that the Bandit Network approach outperforms traditional portfolio selection models in Cumulative Returns and Sharpe Ratio. Tests on standard datasets such as FF48 and FF100 indicate Bandit Networks surpass benchmark policies from previous work in cumulative returns while maintaining similar correlation patterns to the full datasets. These findings confirm that employing Bandit Networks enhances adaptability and performance in changing financial environments.