{"as_of":"2026-08-21T00:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de729612ff6b4540f711ceae756c236ecad34ae1ed9beefe97752a6632719984","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:58:03.027593Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06700/citation-record","integrity":"/paper/2501.06700/integrity","json":"/paper/2501.06700/citation-record.json","paper":"/paper/2501.06700"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.617284Z","title":"Reinforcement learning: An introduction by richards’ sutton,","venue":null,"work_id":"bd8d674c-ac49-4e5a-8b5d-e0ef3d3ba942","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.867946Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:e41fd781d94db5758487e525e01d3bb139d4f70a8a26ee757fe14671b87baf86","observation_id":"fe418e7b-8936-457b-be7e-cf0d22d8cbb8","resolution":{"observed_at":"2026-08-10T20:58:03.622682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.600527Z","title":"Average-reward off- policy policy evaluation with function approximation,","venue":null,"work_id":"88442061-9edc-4cef-8fb6-77e729cc6179","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.873578Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:2b6a2ef45eecd9f9253dfc10a9b49b5aca1f725b95d7cff31217fa7dd7a1347f","observation_id":"63e51f31-3ce3-41dd-a0f5-29f0c4a04cee","resolution":{"observed_at":"2026-08-10T20:58:03.606153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.583853Z","title":"Off-policy average reward actor-critic with deterministic policy search,","venue":null,"work_id":"ba997419-af16-4bd4-96b3-6bdde97b5fa9","year":2023},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.878783Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:1f14d34373d13f391da81cdea353160baa68b39174f7c48b697e595b04a7f242","observation_id":"9be1150f-6663-4a75-9b9c-539ee364bde6","resolution":{"observed_at":"2026-08-10T20:58:03.589049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.568020Z","title":"Power control for a network of access points,","venue":null,"work_id":"88695534-f790-48e0-a590-61af53dfac20","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.883865Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:998c9bfbbddd17829e824dd4b140bed2ccbd8c31a732ec03c21032ca7eca9037","observation_id":"153af67c-6a51-4bce-a795-01b689aa1b11","resolution":{"observed_at":"2026-08-10T20:58:03.573092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.550091Z","title":"Base station employing shared resources among antenna units,","venue":null,"work_id":"a11b965c-8dd5-4b74-a1e5-126ba878b618","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.888817Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:c4266a2d44d6cee3cc65aa6ff6a00a585f17efd22fe2273b9bd8ca660dcd643b","observation_id":"444c08a9-f2dd-430c-992a-1da342f5233d","resolution":{"observed_at":"2026-08-10T20:58:03.556489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.533275Z","title":"Methods and apparatus for power management in a wireless communication system,","venue":null,"work_id":"117dcf97-e06f-4eef-b9bc-d494524765e3","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.893915Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:9a5b64a35c5636d30662c975242fa9a2b375f84d9527fbdffc8c549337780e2a","observation_id":"832225f1-a78d-4760-b37c-37bcf3a5e033","resolution":{"observed_at":"2026-08-10T20:58:03.538941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.516826Z","title":"Generalized global bandit and its application in cellular coverage optimization,","venue":null,"work_id":"13f73749-d819-4bef-8b20-44412a229a1f","year":2018},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.899554Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:721cdb8fa7ce9b0a173add72b1a5ae5d9103da3191be0d6d94f08b2648ac0b9a","observation_id":"9b85fed7-2f67-4e5f-a05b-86b4a65ceb9e","resolution":{"observed_at":"2026-08-10T20:58:03.522036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.499191Z","title":"A non-stationary online learning approach to mobility management,","venue":null,"work_id":"eef71d7d-1bef-47f7-a1bf-a3a8a5a60204","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.904069Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:acc046933ce36678fa6ed6351c96aaa42a5419517937e06f603976194c593720","observation_id":"3048fc99-bf64-4f0d-87f0-7383e2230e45","resolution":{"observed_at":"2026-08-10T20:58:03.505499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.13032","last_updated":"2019-04-30T03:18:39Z","snapshot_observed_at":"2026-08-19T15:45:15.952267Z","submitted_at":"2019-04-30T03:18:39Z","title":"A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.13032","snapshot_observed_at":"2026-08-10T20:58:02.908832Z","title":"A deep Q-learning method for downlink power allocation in multi-cell networks,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.908832Z"},"links":{"cited_paper":"/paper/1904.13032","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:a58678e0c5f6923a03f0c8e31f5b40ffbf4aa85cc5bfdd3c7bac6c1ef03ae73a","observation_id":"8b685e6b-9a91-481d-822e-971cf0f84b39","resolution":{"observed_at":"2026-08-10T20:58:02.908832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.482441Z","title":"Power allocation in multi-user cellular networks with deep Q learning approach,","venue":null,"work_id":"f09de800-56a2-455c-81f8-09e4617c762d","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.914367Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:842957225ac774324c79adb7483151b0aa75f88c5b07df379b92aa70ac9d51f5","observation_id":"8f0986a6-d45d-476f-b06d-17ed7a5f424d","resolution":{"observed_at":"2026-08-10T20:58:03.487857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.463117Z","title":"Joint power control and channel allocation for interference mitigation based on reinforcement learning,","venue":null,"work_id":"3eb91c1e-19e7-4bc1-9f24-65d2a0cd5e5f","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.919206Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:3ce9d8ff8a5af2ec2a8f0df1b7fa70ba5b9f4be7d6a7036a2f298a5519bbac71","observation_id":"d86cf87a-3445-470b-a252-e99e5069f05f","resolution":{"observed_at":"2026-08-10T20:58:03.469648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.441723Z","title":"Deep actor-critic learning for distributed power control in wireless mobile networks,","venue":null,"work_id":"f7b2384c-bc82-47a5-bbb3-ae1bb9c0187e","year":2020},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.923840Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:60f009a9cf0e2730f4c3b246d36bf023a9af971ab8362a23bb0c25681cf46e63","observation_id":"e896803b-aba4-4573-b966-ed5796e76b39","resolution":{"observed_at":"2026-08-10T20:58:03.447250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.424249Z","title":"Deep reinforcement learning based wire- less network optimization: A comparative study,","venue":null,"work_id":"f398366b-47e3-4a54-8394-51baa779ec12","year":2020},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.928335Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:1f0e527abf28c259e2670b1de30f8f10b4b122db29e747a999bd422a50f11cc5","observation_id":"a9e7afcb-a20d-4767-806d-f055c673c843","resolution":{"observed_at":"2026-08-10T20:58:03.429992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.407435Z","title":"ColO- RAN: Developing Machine Learning-based xApps for Open RAN Closed-loop Control on Programmable Experimental Platforms,","venue":null,"work_id":"1b09a7ea-1f0a-46f6-b9c2-6f69070bb792","year":2022},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.933233Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:de30ecc5bea97b820bb88329b53c7a3897ac811c505e98e6415879276f8b5847","observation_id":"4a8fb1ba-fd12-4558-8c98-551e9435361f","resolution":{"observed_at":"2026-08-10T20:58:03.412476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.388201Z","title":"FlexRAN: A flexible and programmable platform for software- defined radio access networks,","venue":null,"work_id":"8adbc7b9-3494-4fea-bdad-7d60af4803ec","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.938283Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:7dc242c0c982bdc8f79917e885889d4b2eac965e20cf23caace0a5e19c74018c","observation_id":"0efcb88b-4d34-4582-8df1-cf93c067722c","resolution":{"observed_at":"2026-08-10T20:58:03.396691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.370718Z","title":"Deep reinforcement learning for joint spectrum and power allocation in cellular networks,","venue":null,"work_id":"a9212b31-e4d2-4b6e-aa5c-47575548c58e","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.943681Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:af80bfc95de76e44d56fc02f04eb06d0e7f29a24bca86a67917d51a9a84cfc95","observation_id":"04d1d7ad-6a01-41cf-9b35-9849bb3fec9e","resolution":{"observed_at":"2026-08-10T20:58:03.376074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.353879Z","title":"Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,","venue":null,"work_id":"1a4ec6ca-0be9-4c23-84ff-f26153e494e2","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.948386Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:e9c246d4fa2821eab51eed6b962fd12b15f2cfa094c0f2480e777de18ae80678","observation_id":"8c8a43ac-33d9-4d35-aeda-e0329a01963f","resolution":{"observed_at":"2026-08-10T20:58:03.359596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.333671Z","title":"Multi- agent reinforcement learning for wireless user scheduling: Performance, scalablility, and generalization,","venue":null,"work_id":"1e5fa953-2f28-48f1-8a66-33e4529850e1","year":2022},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.953229Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:a34f55a224d32752c62d8efe58c9014656d2c72891204744a1fa4c5ad1f06de7","observation_id":"abbb5159-d0a4-4f5a-a14c-376c7d667aa0","resolution":{"observed_at":"2026-08-10T20:58:03.340416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:02.958639Z","title":"Resource management in wireless networks via multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.958639Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:21d291c8df23cdaf92898f0c349236cf5d78c837809e60e2d48e39884dd2ac63","observation_id":"4786d838-3339-4a54-a55a-9d0ad12459ac","resolution":{"observed_at":"2026-08-10T20:58:02.958639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.306766Z","title":"Distributed MARL for scheduling in conflict graphs,","venue":null,"work_id":"0841c7b0-134c-4f97-ad90-451847428faf","year":2023},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.963929Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:606f0dba9ab4535c020d90f01a44204b796d230071482ede3136af242ef9cada","observation_id":"9f6fe38c-60b8-4321-a8e6-407c26949b68","resolution":{"observed_at":"2026-08-10T20:58:03.311863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.290014Z","title":"Offline reinforcement learning for wireless network optimization with mixture datasets,","venue":null,"work_id":"20e780a1-0b3d-4f18-bfcb-dbb76fad580d","year":2024},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.970809Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:39bf4a7563cd0293d6fe48ba66e67ec85e220a6e4a8ab478e7c469661a25ba78","observation_id":"d2de51e2-2bdd-4ffa-9194-8accdc97981a","resolution":{"observed_at":"2026-08-10T20:58:03.295227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.273761Z","title":"Advancing RAN slicing with offline reinforcement learning,","venue":null,"work_id":"a8214200-8bc0-4262-ac8f-db49c70773eb","year":2024},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.976751Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:f2767b32ed800449c0cd4cf252d737586c28c8d4c116b02df87135303e075028","observation_id":"3daa3c11-e5c9-4b28-bc45-5af3768177b2","resolution":{"observed_at":"2026-08-10T20:58:03.279124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.255846Z","title":"Mean-variance policy iteration for risk-averse reinforcement learning,","venue":null,"work_id":"284c945b-b96e-4589-b20b-343ffdfe3e4d","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.982057Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:6d0b1f3350cc21fe2ca0b71d6e75186135e967929db2e89e10fc5e615979c628","observation_id":"0fc23e0a-4c89-4b71-abaf-532fb6834614","resolution":{"observed_at":"2026-08-10T20:58:03.261064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.238008Z","title":"Averaged-dqn: Variance reduc- tion and stabilization for deep reinforcement learning,","venue":null,"work_id":"3f2012e6-c3f7-49b7-9292-9c6b5c24b0cc","year":2017},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.987694Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:df90fefd69c1b934192dc9c27f453a1400ce44a6765f88a2c7383b3f083a15f7","observation_id":"e0aed05d-01fa-49d7-8e9f-d6d13de8f23a","resolution":{"observed_at":"2026-08-10T20:58:03.243701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03442","last_updated":"2021-11-01T03:53:25Z","snapshot_observed_at":"2026-08-17T12:32:53.813629Z","submitted_at":"2021-06-07T09:19:42Z","title":"Average-Reward Reinforcement Learning with Trust Region Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03442","snapshot_observed_at":"2026-08-10T20:58:02.992888Z","title":"Average-reward reinforcement learning with trust region methods,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.992888Z"},"links":{"cited_paper":"/paper/2106.03442","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:fd38808ac273586f22a001cd52a5163870ce5dc37993003189addf800af86178","observation_id":"38faea7d-0567-4d26-9138-308f0ede6ca3","resolution":{"observed_at":"2026-08-10T20:58:02.992888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.219349Z","title":"The NS-3 network simulator,","venue":null,"work_id":"097855d8-9353-4591-b786-c431e277bb39","year":2010},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.997779Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:dd3e9285362106702a933d3b96943a35db3a257ee748d4af5973daa1b4771ca2","observation_id":"79263734-8de1-48bf-9c0d-79864f8f6157","resolution":{"observed_at":"2026-08-10T20:58:03.224731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.201286Z","title":"Network slicing architecture,","venue":null,"work_id":"712e156f-a6b7-41d6-ac2f-e85987e30bfa","year":2017},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.002821Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:42d758eacc91cf037c0799e4b1ef8e66ddafd07d4d5a377f16e1ba66cfe8a023","observation_id":"bf85f0c0-a91e-49a3-b59b-75d2d16428ae","resolution":{"observed_at":"2026-08-10T20:58:03.206772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.183198Z","title":"NetworkGym: Democratizing Network AI via Sim-aaS,","venue":null,"work_id":"b99e6ecb-a175-4993-80cd-19978a66668b","year":2023},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.007765Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:7d81333f9d1d19e47ac469f1d7c51922e5abb1a3c66527661ba2a3cf5f9af19f","observation_id":"a0c4bc3e-559f-45c2-8445-4840f43886d2","resolution":{"observed_at":"2026-08-10T20:58:03.188710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T20:58:03.012480Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.012480Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:3c61369af77f7e3c73fba881dd4ebfe1ac90859b0b9c333303088e064282d71e","observation_id":"77cd05a6-0482-4fbd-8745-f0df02bb77af","resolution":{"observed_at":"2026-08-10T20:58:03.012480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01069","last_updated":"2022-01-26T18:07:28Z","snapshot_observed_at":"2026-08-16T19:16:17.430670Z","submitted_at":"2020-10-02T15:51:48Z","title":"A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms","version":4},"cited_work":{"arxiv_id":"2010.01069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.01069","snapshot_observed_at":"2026-08-10T20:58:03.070075Z","title":"A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms","venue":"cs.LG","work_id":"b34d0e74-fad0-48a8-8779-c36b89351e69","year":2020},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.017617Z"},"links":{"cited_paper":"/paper/2010.01069","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:43f2598000378244f3990cb628d23266aa6e19db8fee307f2d69195b09112428","observation_id":"75f746b8-3394-412e-9bdd-861ba0a638f8","resolution":{"observed_at":"2026-08-10T20:58:03.078406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.166782Z","title":"Revisiting the minimalist approach to offline reinforcement learning,","venue":null,"work_id":"77f08422-ad86-41d5-bc93-9d34d9b00880","year":2024},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.022995Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:b25c96007abbb94a629e4eb7a74850395537266be95bc4a5512ff7de02f9bb83","observation_id":"8a8d116c-0e34-452f-9949-38b760fd7858","resolution":{"observed_at":"2026-08-10T20:58:03.171997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.148649Z","title":"Supported policy optimization for offline reinforcement learning,","venue":null,"work_id":"0f057723-d00e-427e-b7de-60b35b237da1","year":2022},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.027593Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:61dbe31b697d5814c6fddaaf8a3e216c4021126cc5f395d358e9dd09e9e21174","observation_id":"9bc0867d-2531-42e9-b963-a953fdb3ed79","resolution":{"observed_at":"2026-08-10T20:58:03.154181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","latest_version":1,"primary_category":"cs.IT","snapshot_observed_at":"2026-08-16T18:57:05.934580Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2501.06700."}