用强化学习逼近复杂拍卖中的均衡策略,提升计算效率。
Approximating Auction Equilibria with Reinforcement Learning
- 采用自对弈强化学习,结合PPO与神经虚构自我博弈算法
- 在多轮、高维状态拍卖中逼近贝叶斯纳什均衡,策略接近最优
- 适用于私有价值、依存价值及对称/非对称估值场景
传统拍卖均衡计算方法在复杂拍卖中面临计算不可行问题,尤其在多物品和动态拍卖中。本文提出基于自对弈的强化学习框架,使用近端策略优化(Proximal Policy Optimization)和神经虚构自我博弈(Neural Fictitious Self-Play)算法,以逼近贝叶斯-纳什均衡。该方法支持连续动作空间、高维信息状态和延迟回报。通过自对弈训练,算法可在已知均衡的拍卖中学习出稳健且近最优的出价策略,涵盖对称与非对称估值、私有价值与依存价值,以及多轮拍卖等复杂情形。
原文摘要 · Abstract (English)
Traditional methods for computing equilibria in auctions become computationally intractable as auction complexity increases, particularly in multi-item and dynamic auctions. This paper introduces a self-play based reinforcement learning approach that employs advanced algorithms such as Proximal Policy Optimization and Neural Fictitious Self-Play to approximate Bayes-Nash equilibria. This framework allows for continuous action spaces, high-dimensional information states, and delayed payoffs. Through self-play, these algorithms can learn robust and near-optimal bidding strategies in auctions with known equilibria, including those with symmetric and asymmetric valuations, private and interdependent values, and multi-round auctions.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。