{"as_of":"2026-08-10T14:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9abb9624f2f9dc21b87ef30cf504af1f83a4c313276c3ed5a90a800e9b0e349","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:34:55.781594Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:33:50.296933Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:25:50.044346Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"cited_work":{"arxiv_id":"2603.08956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.08956","snapshot_observed_at":"2026-07-28T02:23:27.763889Z","title":null,"venue":null,"work_id":"e37b4416-2546-4d6b-abac-c961d78adb3d","year":2024},"citing_paper":{"arxiv_id":"2604.06621","last_updated":"2026-04-08T03:01:58Z","snapshot_observed_at":"2026-07-06T22:55:01.863342Z","submitted_at":"2026-04-08T03:01:58Z","title":"The Theorems of Dr. David Blackwell and Their Contributions to Artificial Intelligence","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T18:33:50.296933Z"},"links":{"cited_paper":"/paper/2603.08956","citing_paper":"/paper/2604.06621"},"observation_digest":"sha256:f111484bc2fcdc28310886a8db3c65d19bab43d3350991ff35767744871188e5","observation_id":"d15b34f2-af80-4e1c-8936-36870312e240","resolution":{"observed_at":"2026-07-28T02:23:27.763889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.08956/citation-record","integrity":"/paper/2603.08956/integrity","json":"/paper/2603.08956/citation-record.json","paper":"/paper/2603.08956"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1802.03050","last_updated":"2018-02-08T21:17:28Z","snapshot_observed_at":"2026-08-09T08:25:50.412075Z","submitted_at":"2018-02-08T21:17:28Z","title":"Thompson Sampling for Dynamic Pricing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03050","snapshot_observed_at":"2026-08-02T18:34:52.163280Z","title":"Thompson sampling for dynamic pricing.arXiv preprint arXiv:1802.03050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:52.163280Z"},"links":{"cited_paper":"/paper/1802.03050","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:1c9f60e4e48738e786b3da445125c18ba512c0dea07aa7e98655c2e43ad89249","observation_id":"71a340cb-2ad4-4f7f-af90-c4e18d27a645","resolution":{"observed_at":"2026-08-02T18:34:52.163280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.01121","last_updated":"2016-06-28T15:28:30Z","snapshot_observed_at":"2026-08-08T22:18:19.349556Z","submitted_at":"2016-03-03T15:01:54Z","title":"Deep Reinforcement Learning from Self-Play in Imperfect-Information Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.01121","snapshot_observed_at":"2026-08-02T18:34:52.624543Z","title":"Deep reinforcement learning from self-play in imperfect- information games.arXiv preprint arXiv:1603.01121,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:52.624543Z"},"links":{"cited_paper":"/paper/1603.01121","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:9c243f3a8950517d76361305d9e344bef9e440598ef9b2769c8184edc6117bd5","observation_id":"6c5f1fdb-cba4-4d90-897b-6322d092428b","resolution":{"observed_at":"2026-08-02T18:34:52.624543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T18:34:53.020591Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.020591Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:51241cfce69c684c987515da09633bc5e80848f6142d019ec17668b8d6cd4180","observation_id":"927b2e5c-82e4-448e-bd24-903a4f5f2053","resolution":{"observed_at":"2026-08-02T18:34:53.020591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:53.143016Z","title":"Is q-learning minimax optimal? a tight sample complexity analysis.Operations Research, 72(1), 2024a","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.143016Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:07f75bde8d4a5e5ae075ec5e2264fc40c229585828f8096e7a018c3a564c6358","observation_id":"cc626079-6674-4405-84d6-62ddfef4638c","resolution":{"observed_at":"2026-08-02T18:34:53.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2139/ssrn.4717195","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:27.422632Z","title":"Clare Lyle, Mark Rowland, and Will Dabney","venue":null,"work_id":"4af80e00-8213-4cc3-9bac-c862d35e08da","year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.587179Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:788ed562d8de41e2af3d0b861a12cf59483cbfd4c7f3c8e8a30a1ef0480b39f3","observation_id":"0f92ec82-d915-44e7-9f10-cd44bb304454","resolution":{"observed_at":"2026-08-02T18:38:27.564433Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01315","last_updated":"2024-10-29T17:44:21Z","snapshot_observed_at":"2026-07-06T15:11:39.641284Z","submitted_at":"2023-04-03T19:32:24Z","title":"Empirical Design in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01315","snapshot_observed_at":"2026-08-02T18:34:53.949455Z","title":"Empirical design in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.949455Z"},"links":{"cited_paper":"/paper/2304.01315","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:0c7dbdc9c88af58b9c7dd0df22f544f00c3e66deb1ba3a5fe22c845b96d1eef2","observation_id":"4669983a-3fea-4362-8fcd-17d4fc19d61b","resolution":{"observed_at":"2026-08-02T18:34:53.949455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:54.061619Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.061619Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:d7ea507b2c2e94ad2facb0a92d4cf2c481f7cd1109b3d43bdcd76bf05ae3cdb2","observation_id":"119e6291-060f-4239-901b-42e80bf3633a","resolution":{"observed_at":"2026-08-02T18:34:54.061619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T18:34:54.308125Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.308125Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:66d7fa2b28e6f0f778e85d375751fcd9784646222afc1d9674791f4d06f8b625","observation_id":"5f2cd22e-e456-4a26-8948-b6b7bd4decee","resolution":{"observed_at":"2026-08-02T18:34:54.308125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06298","last_updated":"2019-01-03T18:11:15Z","snapshot_observed_at":"2026-07-06T07:21:24.277262Z","submitted_at":"2018-12-15T14:47:21Z","title":"Residual Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06298","snapshot_observed_at":"2026-08-02T18:34:54.495942Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play.Science, 362(6419):1140–1144, 2018a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.495942Z"},"links":{"cited_paper":"/paper/1812.06298","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:891a7a447439ba9c6ad8829fd9abf2109fe089e948243ebbeceb266003739ac8","observation_id":"e7167921-8f51-4979-bdf3-c24f93511b12","resolution":{"observed_at":"2026-08-02T18:34:54.495942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1407.5042","last_updated":"2014-07-18T15:41:28Z","snapshot_observed_at":"2026-07-06T03:49:27.130621Z","submitted_at":"2014-07-18T15:41:28Z","title":"Solving Large Imperfect Information Games Using CFR+","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1407.5042","snapshot_observed_at":"2026-08-02T18:34:54.754901Z","title":"Solving large imperfect information games using cfr+.arXiv preprint arXiv:1407.5042,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.754901Z"},"links":{"cited_paper":"/paper/1407.5042","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:406171d5fac8fefd135bc662f9c7a76ed7b7c48e35621c22d45373224e410dc5","observation_id":"64a11181-fc75-40e7-8191-253dfb935df7","resolution":{"observed_at":"2026-08-02T18:34:54.754901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-02T18:34:54.957047Z","title":"Terry, John U","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.957047Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:992220c387819048a534e68af22ad009877813aaab0607d293d480afa9b5698e","observation_id":"1f82c125-154d-45af-aa97-ec4c8389fe68","resolution":{"observed_at":"2026-08-02T18:34:54.957047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08934","last_updated":"2025-03-24T01:36:25Z","snapshot_observed_at":"2026-08-07T17:11:36.998780Z","submitted_at":"2025-03-11T22:31:03Z","title":"Near-Optimal Sample Complexity for Iterated CVaR Reinforcement Learning with a Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08934","snapshot_observed_at":"2026-08-02T18:34:55.252690Z","title":"Near-optimal sample complexity for iterated CVaR reinforcement learning with a generative model.arXiv preprint arXiv:2503.08934,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:55.252690Z"},"links":{"cited_paper":"/paper/2503.08934","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:4af5b1c867d8a2103867f86081e3082319dee7c1b237e0bff5f80692e541b86e","observation_id":"d5d4fc0e-c118-4390-83a9-0a0b68b9bc99","resolution":{"observed_at":"2026-08-02T18:34:55.252690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-02T18:34:55.457454Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:55.457454Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:c7d1f9e0bb927832eaf28e2c3cd6a76e0c207d0b908100128df531f8cbe37741","observation_id":"6f426e85-277b-48ca-a7f0-571f93d4a738","resolution":{"observed_at":"2026-08-02T18:34:55.457454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01275","last_updated":"2018-04-30T04:24:26Z","snapshot_observed_at":"2026-08-03T12:09:42.690927Z","submitted_at":"2017-12-04T06:03:26Z","title":"A Deeper Look at Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01275","snapshot_observed_at":"2026-08-02T18:34:55.617640Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:55.617640Z"},"links":{"cited_paper":"/paper/1712.01275","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:2f5f690efeeee6e341a402b68227d0d3de06e5d664bd3001dd9b40f46ac28fb7","observation_id":"8bac77cc-6aac-4a84-ac73-212adbbfeb8b","resolution":{"observed_at":"2026-08-02T18:34:55.617640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-02T18:34:55.781594Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:55.781594Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:79743a200f5f4b15367121716efba603dd3dc64a12d567bf774fdbeac6bdeaf9","observation_id":"1f67ffb0-3c62-4ccc-916e-d369ab71e3b1","resolution":{"observed_at":"2026-08-02T18:34:55.781594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:54.209538Z","title":"Santos and John Rust","venue":null,"work_id":null,"year":2094},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1959,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.209538Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:cbb7fbfb344909dfdbc4ce26cb41121a1c066a661e38699b72ba004491185b71","observation_id":"98777ef0-3492-46fb-a102-4aa0c37129cb","resolution":{"observed_at":"2026-08-02T18:34:54.209538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11275","last_updated":"2022-10-21T10:24:00Z","snapshot_observed_at":"2026-07-06T13:12:51.785555Z","submitted_at":"2022-05-23T12:47:13Z","title":"RL with KL penalties is better viewed as Bayesian inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11275","snapshot_observed_at":"2026-08-02T18:34:52.804048Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1960,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:52.804048Z"},"links":{"cited_paper":"/paper/2205.11275","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:96c413aed811c6ca6e1a51966532d678b6527043e8c05300f79ed0b72b4c6225","observation_id":"3aa4ea9d-4aa4-4680-b70c-b827d8e4e9b5","resolution":{"observed_at":"2026-08-02T18:34:52.804048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07956","last_updated":"2025-04-08T16:18:36Z","snapshot_observed_at":"2026-08-05T02:38:48.577926Z","submitted_at":"2023-09-14T18:00:02Z","title":"Classifying fermionic states via many-body correlation measures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07956","snapshot_observed_at":"2026-08-02T18:34:51.151228Z","title":"Wainwright, and Linda Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1982,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.151228Z"},"links":{"cited_paper":"/paper/2309.07956","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:53b8ebdeb59146be8535e605cc6568cdc1e1aeb52c4e06c8547ef555de1219c7","observation_id":"22f541ec-4d3b-49de-87f0-d9c7e45661cd","resolution":{"observed_at":"2026-08-02T18:34:51.151228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:54.651143Z","title":"Richard S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.651143Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:05059714727f64e2d80c7f1e58342e0b75826d09704b0a36e47418cd55a8bb87","observation_id":"7bcf9018-48f8-4f49-94c2-872f28177592","resolution":{"observed_at":"2026-08-02T18:34:54.651143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:53.281062Z","title":"Markov games as a framework for multi-agent reinforcement learning","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.281062Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:803598a3aeab67d0458db8f58460e21fcc586efa9d695489ce17cac7b20d6526","observation_id":"91d8cf4c-8412-4a2f-9c12-9dd68b69c670","resolution":{"observed_at":"2026-08-02T18:34:53.281062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:52.317741Z","title":"First-order methods for Wasserstein distributionally robust MDP","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:52.317741Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:a74af1a2d4fcec415e797e4e1a8b13103b615c3ade6d861e3a906b5dd70329d3","observation_id":"07be33d8-1cc9-4968-873e-45541c0561bc","resolution":{"observed_at":"2026-08-02T18:34:52.317741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00993306","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Machine Learning","work_id":"690a4715-fe2c-4f4d-804b-f5fa4e2dcde8","year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.976781Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:32fd70586d5a4250455eb36cfa4cdc269de5ffbd73713ac1eb4c9cf21da08252","observation_id":"00c241db-d497-4aa5-a9f6-3c4a36166254","resolution":{"observed_at":"2026-08-02T18:38:27.259490Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04895","last_updated":"2023-07-10T20:35:22Z","snapshot_observed_at":"2026-08-04T13:00:50.553674Z","submitted_at":"2023-07-10T20:35:22Z","title":"Learning to Solve Constraint Satisfaction Problems with Recurrent Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04895","snapshot_observed_at":"2026-08-02T18:34:54.981380Z","title":"Contextual dynamic pricing with strategic buyers under unknown valuations.arXiv preprint arXiv:2307.04895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.981380Z"},"links":{"cited_paper":"/paper/2307.04895","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:a1636eab83865d8b9a619440153c34fa12c17eb6f7df441b70322167a2b21992","observation_id":"09a6e2d1-766a-4fb1-abcc-f68be9b8c1ed","resolution":{"observed_at":"2026-08-02T18:34:54.981380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04055","last_updated":"2024-06-25T18:25:54Z","snapshot_observed_at":"2026-07-06T15:51:46.997267Z","submitted_at":"2023-07-08T23:06:42Z","title":"Contextual Dynamic Pricing with Strategic Buyers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04055","snapshot_observed_at":"2026-08-02T18:34:53.382887Z","title":"Contextual dynamic pricing with strategic buyers.arXiv preprint arXiv:2307.04055, 2024a","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.382887Z"},"links":{"cited_paper":"/paper/2307.04055","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:eca5a03814b077790b3e5d7e11041acbd5891768ea9e1cc2a4c1275170b7e575","observation_id":"f93d637a-29e8-444d-bf6e-0117c7a7071c","resolution":{"observed_at":"2026-08-02T18:34:53.382887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01136","last_updated":"2025-05-08T20:02:50Z","snapshot_observed_at":"2026-08-04T10:05:17.014550Z","submitted_at":"2024-01-02T10:23:02Z","title":"Core equality of real sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01136","snapshot_observed_at":"2026-08-02T18:34:51.728721Z","title":"Semiparametric dynamic pricing.arXiv preprint arXiv:2401.01136,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.728721Z"},"links":{"cited_paper":"/paper/2401.01136","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:a0ed7e34e5708e31490af7e771f8d330b3ddaa766d1ff752615bb3b00d339e9d","observation_id":"1d0a0f84-62ca-4e8e-8e6d-8a31da115225","resolution":{"observed_at":"2026-08-02T18:34:51.728721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.04374","last_updated":"2020-09-15T16:11:34Z","snapshot_observed_at":"2026-07-06T09:54:12.429500Z","submitted_at":"2020-09-09T15:49:14Z","title":"Assessing Game Balance with AlphaZero: Exploring Alternative Rule Sets in Chess","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.04374","snapshot_observed_at":"2026-08-02T18:34:54.851226Z","title":"Assessing game balance with AlphaZero: Exploring alternative rule sets in chess.arXiv preprint arXiv:2009.04374,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.851226Z"},"links":{"cited_paper":"/paper/2009.04374","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:fcb0465a72d1d0f6e41eebe787af266ea5f5c71512bf93b576772179a34651f4","observation_id":"c4c7435d-f718-4e02-8e66-00a09d950a12","resolution":{"observed_at":"2026-08-02T18:34:54.851226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:50.916350Z","title":"Peter Arcidiacono and Robert A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:50.916350Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:52b73c85c376f769eee4ea81de107b6b26714516af61919d62f939d443a1a42b","observation_id":"91e31647-01c9-4f35-8e62-6adecfc4f605","resolution":{"observed_at":"2026-08-02T18:34:50.916350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-10T12:35:10.713462Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-02T18:34:55.067775Z","title":"Learning values across many orders of magnitude","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:55.067775Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:e5cfd586ea97e97ada48ab9a45589a1a76ddfeff5a5a6a6fc79e64a7f6cbe1a8","observation_id":"c587db8a-935b-4326-807c-d59b0b5ba6eb","resolution":{"observed_at":"2026-08-02T18:34:55.067775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08573","last_updated":"2022-06-08T10:24:15Z","snapshot_observed_at":"2026-07-06T11:58:34.888164Z","submitted_at":"2021-10-16T13:37:57Z","title":"Insight from the elliptic flow of identified hadrons measured in relativistic heavy-ion collisions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08573","snapshot_observed_at":"2026-08-02T18:34:55.353046Z","title":"A dual approach to constrained Markov decision processes with entropy regularization.arXiv preprint arXiv:2110.08573,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:55.353046Z"},"links":{"cited_paper":"/paper/2110.08573","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:03492e6b9f6ce6f97063abc381d3519a235abde256825afa9046adfe37f80264","observation_id":"6402ceee-ba27-4ed3-b4ff-d00b2dd5e9da","resolution":{"observed_at":"2026-08-02T18:34:55.353046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:51.853335Z","title":"Fleming and William M","venue":null,"work_id":null,"year":1915},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.853335Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:dc5c04d33db460fe2ba9c2a5f8e99f5a9296a018f874202e9610c9de8515dc4c","observation_id":"8e98d37c-c83d-4e75-a175-3f619ef22804","resolution":{"observed_at":"2026-08-02T18:34:51.853335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:53.696586Z","title":"Asynchronous methods for deep reinforce- ment learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.696586Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:4caf81ff213c8cfe8c4e3f85f0af93919ae3387e50b24582896c281eef17226a","observation_id":"15c6b402-2baf-4b60-8858-5b6bff1233a9","resolution":{"observed_at":"2026-08-02T18:34:53.696586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-02T18:34:52.913040Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review.arXiv preprint arXiv:1805.00909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:52.913040Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:c18ed37de7d9cb0ad49d8ad09e2cedaed85964d6d0c60cc7afa7165ab2886b15","observation_id":"cc756144-df6d-4d3c-914e-b05d665be10e","resolution":{"observed_at":"2026-08-02T18:34:52.913040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15174","last_updated":"2022-09-30T01:49:52Z","snapshot_observed_at":"2026-08-01T15:56:08.980579Z","submitted_at":"2022-09-30T01:49:52Z","title":"Music Source Separation with Band-split RNN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15174","snapshot_observed_at":"2026-08-02T18:34:50.651580Z","title":"Adusumilli, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:50.651580Z"},"links":{"cited_paper":"/paper/2209.15174","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:388cd6af717d7c972d4bcdf83252649fdf5b2b8f60f82b5756b036c285cbfb7e","observation_id":"446d8768-e16b-46ff-a6dd-6144eb50ec26","resolution":{"observed_at":"2026-08-02T18:34:50.651580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:51.982337Z","title":"Off-policy deep reinforcement learning with- out exploration","venue":null,"work_id":null,"year":2052},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.982337Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:516fb8ab535161a9c4863b7c34c9fe5f4d9359ba2258c73c2de4a7cf0bb057ea","observation_id":"cecaf6e8-7df4-4e35-8a21-a56aa9cfac76","resolution":{"observed_at":"2026-08-02T18:34:51.982337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00552","last_updated":"2022-02-03T20:48:15Z","snapshot_observed_at":"2026-07-06T12:03:55.626372Z","submitted_at":"2021-10-31T17:46:26Z","title":"Policy Optimization for Constrained MDPs with Provable Fast Global Convergence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00552","snapshot_observed_at":"2026-08-02T18:34:53.495337Z","title":"Policy optimization for constrained MDPs with provably fast convergence.arXiv preprint arXiv:2111.00552,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.495337Z"},"links":{"cited_paper":"/paper/2111.00552","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:da1a3ab2505a9bab50b51cfe3e9c8758bfc9cfee9d37b11301c1d41c410d145c","observation_id":"7a5f69ed-2c80-46e3-b39d-11e9649ee6c5","resolution":{"observed_at":"2026-08-02T18:34:53.495337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:51.033340Z","title":"Deep reinforcement learning: Emerging trends in macroe- conomics and future prospects","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.033340Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:aa98dafc8b1a23104a1f14ed8dac33fea6b0a6d4ec7285587e5c3b33f4748182","observation_id":"35f2d2d3-0679-4b3b-becf-104b1167add1","resolution":{"observed_at":"2026-08-02T18:34:51.033340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07834","last_updated":"2024-02-15T18:28:51Z","snapshot_observed_at":"2026-08-08T08:33:30.033368Z","submitted_at":"2024-02-12T17:45:40Z","title":"Generalizing across Temporal Domains with Koopman Operators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07834","snapshot_observed_at":"2026-08-02T18:34:51.455116Z","title":"Dynamic pricing with fairness constraints.arXiv preprint arXiv:2402.07834,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.455116Z"},"links":{"cited_paper":"/paper/2402.07834","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:6799f5ecf1eda9e73757d9873d2f8be4ae5f335207a208d6470207b72e7f8056","observation_id":"23280bfc-bf70-48a0-b34a-71d88ffa8a98","resolution":{"observed_at":"2026-08-02T18:34:51.455116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:51.580275Z","title":"Unifying causal reinforcement learning: Survey, taxonomy, algorithms and applications.arXiv preprint arXiv:2512.18135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.580275Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:c4da74ba4d066c9fe57f9b67e8922f7afe2e1e86efa6f9edf2175a0650149757","observation_id":"560b2954-1697-4888-95b7-bb4c44c3845e","resolution":{"observed_at":"2026-08-02T18:34:51.580275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:51.271729Z","title":"Lili Chen, Kevin Lu, Aravind Rajeswaran, Kimin Lee, Aditya Grover, Michael Laskin, Pieter Abbeel, Aravind Srinivas, and Igor Mordatch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:51.271729Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:d6998bf4a0615a422a75ffe64de353a07b46df1c0df37f19d1fc5b16c7afac67","observation_id":"2f95a455-8d94-49ca-aa7f-ae9c74fce8f0","resolution":{"observed_at":"2026-08-02T18:34:51.271729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:34:52.497920Z","title":"Strategic classifi- cation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:52.497920Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:29a2e63add107f9abb0b17e283a9cb2c952b9adb825513808dcdd2c802679cc8","observation_id":"62fa3c21-54ae-41a9-b35c-980a993046a9","resolution":{"observed_at":"2026-08-02T18:34:52.497920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/ej/ueaf104","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jonas Mueller, Vasilis Syrgkanis, and Matt Taddy","venue":"The Economic Journal","work_id":"dbb69bbd-7b2f-4efb-a385-9a6ece3ed357","year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.848980Z"},"links":{"citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:5bf8d120b4b2a75438a6e211e9cb23bc7c72a5372c7834213af60e4cafb06425","observation_id":"70ce1f1a-f9f1-4941-ab16-f50dfa0933c0","resolution":{"observed_at":"2026-08-02T18:38:27.393039Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02497","last_updated":"2023-01-06T13:16:28Z","snapshot_observed_at":"2026-08-04T13:40:16.961395Z","submitted_at":"2023-01-06T13:16:28Z","title":"Some asymptotic formulae for torsion in homotopy groups","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02497","snapshot_observed_at":"2026-08-02T18:34:50.788053Z","title":"114 Alekh Agarwal, Sham M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:50.788053Z"},"links":{"cited_paper":"/paper/2301.02497","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:21d074095043e99d1f39e62dee7bed98fc1b9c52489ed784f7cf63e1acacc257","observation_id":"3e7c990f-f04f-48fe-b847-7e44fa88a3c9","resolution":{"observed_at":"2026-08-02T18:34:50.788053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","latest_version":6,"primary_category":"econ.GN","snapshot_observed_at":"2026-08-07T20:21:11.336714Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2603.08956."}