{"ok":true,"article":{"slug":"cods-iterative-bellman-residual-data-selection-for-reusable-offline-reinforcemen-9b41c9e1","title":"CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning","url":"https://arxiv.org/abs/2608.07719","canonical":"https://www.aimode.news/article/cods-iterative-bellman-residual-data-selection-for-reusable-offline-reinforcemen-9b41c9e1","sourceName":"arXiv cs.LG","summary":"arXiv:2608.07719v1 Announce Type: new Abstract: Offline reinforcement learning repeatedly trains policies from a fixed transition pool, making redundant data costly across seeds and hyperparameters, while naive subsampling can remove rare transitions needed for long-horizon credit assignment. We introduce CODS, a crit…","category":"AI","image":"https://static.arxiv.org/icons/twitter/arxiv-logo-twitter-square.png","lang":"en","publishedAt":"2026-08-11T04:00:00+00:00","createdAt":"2026-08-11T19:09:30.456448+00:00"}}