G

Guy Zamir, Matthew Zurek, Yudong Chen

Guy Zamir, Matthew Zurek, Yudong Chen의 전문분석자료

Academic · 약 1분

Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs

arXiv:2603.23926v1 Announce Type: new Abstract: Online reinforcement learning in infinite-horizon Markov decision processes (MDPs) remains less theoretically and algorithmically developed than its episodic counterpart, with …

Guy Zamir, Matthew Zurek, Yudong Chen
조회수 106회