{"as_of":"2026-08-23T17:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:633551b26f623003f5f962de4da56742c8ec29559fae6ecb652fd5d420458281","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:38:26.733680Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:55:04.341082Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-09T15:55:04.398895Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"cited_work":{"arxiv_id":"2501.12991","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12991","snapshot_observed_at":"2026-08-09T15:55:04.398895Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","venue":"cs.MA","work_id":"83b7d179-8f28-42e9-8b41-c7ca240ed2a6","year":2025},"citing_paper":{"arxiv_id":"2502.01268","last_updated":"2025-02-03T11:39:12Z","snapshot_observed_at":"2026-08-19T07:50:56.614781Z","submitted_at":"2025-02-03T11:39:12Z","title":"Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T15:55:04.341082Z"},"links":{"cited_paper":"/paper/2501.12991","citing_paper":"/paper/2502.01268"},"observation_digest":"sha256:7ea337012bb36c6d4de49fbae33a5900313347dc76c309c8be8a5a3fcb408339","observation_id":"9f306572-e2e7-414a-83fb-9e47fd72be58","resolution":{"observed_at":"2026-08-09T15:55:04.404438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12991","snapshot_observed_at":"2026-08-04T18:09:30.327529Z","title":"An offline multi-agent reinforcement learning framework for radio resource management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10163","last_updated":"2025-09-12T11:41:40Z","snapshot_observed_at":"2026-08-14T06:47:03.699520Z","submitted_at":"2025-09-12T11:41:40Z","title":"Federated Multi-Agent Reinforcement Learning for Privacy-Preserving and Energy-Aware Resource Management in 6G Edge Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:09:30.327529Z"},"links":{"cited_paper":"/paper/2501.12991","citing_paper":"/paper/2509.10163"},"observation_digest":"sha256:b74a1e33143b0457aa08b693bb3d2e65a95fbeccea681dbbae9b3962ecb0669f","observation_id":"1d288dbb-6b10-4364-a3b6-13fe170d96bb","resolution":{"observed_at":"2026-08-04T18:09:30.327529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12991","snapshot_observed_at":"2026-08-02T17:28:25.473170Z","title":"An offline multi-agent reinforcement learning framework for radio resource management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.25332","last_updated":"2026-07-29T13:02:23Z","snapshot_observed_at":"2026-08-15T01:37:48.384524Z","submitted_at":"2026-03-26T11:20:49Z","title":"DRL-Based Spectrum Sharing for RIS-Aided Local High-Quality Wireless Networks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T17:28:25.473170Z"},"links":{"cited_paper":"/paper/2501.12991","citing_paper":"/paper/2603.25332"},"observation_digest":"sha256:ba606d27b775d0dac34df635057a983b779af57ee007db7748b12e6ae03011eb","observation_id":"9433e9d2-a1c2-42cf-9fbd-a97138cf5e5a","resolution":{"observed_at":"2026-08-02T17:28:25.473170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12991/citation-record","integrity":"/paper/2501.12991/integrity","json":"/paper/2501.12991/citation-record.json","paper":"/paper/2501.12991"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.377434Z","title":"Applications of deep reinforcement learning in communications and networking: A survey,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.377434Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:536ab35e384add54d4c4aed8ce6897da4d552044cd77a6494eec9ea0be67d221","observation_id":"7d71513c-9f5f-4a2a-93a2-b3435fb52707","resolution":{"observed_at":"2026-08-10T16:38:26.377434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.349749Z","title":"Machine type communications: key drivers and enablers towards the 6G era,","venue":null,"work_id":"647cc5ef-c2f2-48e5-9ebb-69609f8c00ac","year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.383055Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:798cc3687e97fd2c05d2f75094acfe25953e1c9fee23f7f123f6fa9d269d17e4","observation_id":"1fcb869b-748c-4833-8e12-1408e6dd4db3","resolution":{"observed_at":"2026-08-10T16:38:28.353585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.387098Z","title":"Machine learning for large-scale optimization in 6G wireless networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.387098Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:a12708b85e04bf50b9657b9a2616049a620e1bb1b421aa5697440396797a7ce8","observation_id":"f89b911a-4939-477b-9955-242340c90f7e","resolution":{"observed_at":"2026-08-10T16:38:26.387098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.391573Z","title":"Traffic prediction and fast uplink for hidden markov IoT models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.391573Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:3ed64de2d57dbc80cbdf9651fe67715378c0c7f47cf74eb790c18d575b10b5fe","observation_id":"b169aff0-50b1-4008-b570-6194553607b9","resolution":{"observed_at":"2026-08-10T16:38:26.391573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.293754Z","title":"ITLinQ+: An improved spectrum sharing mech- anism for device-to-device communications,","venue":null,"work_id":"27da7df5-aa06-4fdf-9c7c-eb04253f2c26","year":2015},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.396079Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:92f11028b44a1a9f0ccf8da3294a1ba843db1c328ace77b61ff0f572b4cdaa86","observation_id":"7bdf73bb-4cb6-4eac-8c3e-31948bd53963","resolution":{"observed_at":"2026-08-10T16:38:28.307166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.234896Z","title":"Binary power control for sum rate maximization over multiple interfering links,","venue":null,"work_id":"f47c82cd-5d58-42bc-9605-65e3499987f0","year":2008},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.400119Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:634fb0831e5372f76a22a190c6bf246a1e9f70ef30249300802fbdf620da73cf","observation_id":"0603d526-e60b-4646-b84b-29890a4a6360","resolution":{"observed_at":"2026-08-10T16:38:28.264891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.069800Z","title":"Game-theoretic resource allocation methods for device-to-device communication,","venue":null,"work_id":"9318ccf5-3528-4935-a636-5d29c859b565","year":2014},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.404809Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:0ae8efcbca00ecd7b560f91b68c9ede2a11779ca254321cca0d2698937c91e15","observation_id":"87163d71-2dde-4d97-bbda-a357717ebbea","resolution":{"observed_at":"2026-08-10T16:38:28.168993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.933815Z","title":"Reinforcement learning for radio resource management in RAN slicing: A survey,","venue":null,"work_id":"738f2a82-656e-4e4f-8849-084d1ead565e","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.409001Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:8ef7bb404334fb0d149e9cbe330ce169bae89ec75ed9aad1cbfe1a3f2fb640eb","observation_id":"43973fb1-4fe0-4d83-8a5f-077d92220f0d","resolution":{"observed_at":"2026-08-10T16:38:27.995236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.834739Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"cedf84da-bd87-4ea1-808d-452fc4af8b28","year":2015},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.412890Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:60061f18adf3d48020ff09423a14fb1b1cc1a416b7b6f2f344516599a2ec0c12","observation_id":"735ef8f1-f2dd-4537-8266-e26a3b4cd0a6","resolution":{"observed_at":"2026-08-10T16:38:27.889435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.417654Z","title":"Distributed learning methodologies for massive machine type commu- nication,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.417654Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:3f050091bbd297d81fa0f2bd2fbf849cb5e3ceaf55ec2808f0dae13cf2fed01d","observation_id":"e01f4e44-e7f2-4d5d-af5c-3269828ce5ea","resolution":{"observed_at":"2026-08-10T16:38:26.417654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.422116Z","title":"A review of cooperative multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.422116Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:b65b1b55bec00314022b5aac419ca83edbd7c6943cd1617b080c3d2155ea2f3d","observation_id":"84ac731c-bba5-457c-8881-d00ac52865a6","resolution":{"observed_at":"2026-08-10T16:38:26.422116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.774582Z","title":"Multiagent cooperation and competition with deep reinforcement learning,","venue":null,"work_id":"f30e289a-a235-4a32-852c-178374d66c4f","year":2017},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.426282Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:f3136b866704caa4e6f61af445ba62567a5b268fa410e1f9d908ae8b72d04b6b","observation_id":"d78e7986-f0c9-45e9-ab32-ccbddf6842f3","resolution":{"observed_at":"2026-08-10T16:38:27.778506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.430814Z","title":"Traffic learning and proactive UA V trajectory planning for data uplink in markovian IoT models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.430814Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:eb373ab1e8f628d532cfdb1c31bc1024795be186b518a5d9f0835e808a34f315","observation_id":"66b0eda9-c64a-4673-a906-3c5990328021","resolution":{"observed_at":"2026-08-10T16:38:26.430814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.732389Z","title":null,"venue":null,"work_id":"ac2f123f-2568-4b94-8b1d-64c29ca519a7","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.434820Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:06f0be6a1d86d74af87b0f4173f38e1cab0e252d17f45c7bf95e805683be1707","observation_id":"716a8365-1daa-4776-be8b-39873a992dac","resolution":{"observed_at":"2026-08-10T16:38:27.746843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-08-14T20:53:35.783079Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-10T16:38:26.438685Z","title":"Value-decomposition networks for cooperative multi-agent learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.438685Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:2d642652bf7c69b2f73efa3641b2b9d5bc82afdcc267555f788fbb1fa80e0c49","observation_id":"5b0a152c-e1be-4636-aeea-bc7d40772eb1","resolution":{"observed_at":"2026-08-10T16:38:26.438685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-08-21T15:57:22.153221Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-10T16:38:26.443158Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.443158Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:bb3242654c00830527d189f6a034b52eaec45c2f27795329f28547d3ed80aa1d","observation_id":"f004739c-02cf-4384-bba4-f63558092690","resolution":{"observed_at":"2026-08-10T16:38:26.443158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-10T16:38:26.447226Z","title":"Offline reinforcement learning with implicit Q-learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.447226Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:8ddbcfcf7ff00a72d84561619a2eb2c38aa0c64cbec571f80c8a1d2c76a7c5a0","observation_id":"869719da-66ed-4fbc-964b-b6de49ad4e56","resolution":{"observed_at":"2026-08-10T16:38:26.447226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.451361Z","title":"Trust region policy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.451361Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:a8b02a7cfd900483cf5fb649f1ae80f9ac3ae5a7f4d56d909105632ac85417ff","observation_id":"c9c98b66-7cc4-49e5-8643-b6b6fb8a400d","resolution":{"observed_at":"2026-08-10T16:38:26.451361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.694737Z","title":"Conservative Q-learning for offline reinforcement learning,","venue":null,"work_id":"23e00f73-ef1e-4b04-9bbc-06e6f843c5f0","year":2020},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.454510Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:6d10e2ef5282037837de942bdec3f44b77d1987dc2b277188902f4d48d1dc245","observation_id":"2f4a169e-6b7d-499d-966b-578772424190","resolution":{"observed_at":"2026-08-10T16:38:27.704739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.457917Z","title":"Self- organization in small cell networks: A reinforcement learning approach,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.457917Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:e6b88e49534e31321338d457efae47f3df4a303531159342a339b4cce9dcc447","observation_id":"805f3ed8-0c1e-491a-af3a-365dcf7b8bda","resolution":{"observed_at":"2026-08-10T16:38:26.457917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.462158Z","title":"Intelligent power control for spectrum sharing in cognitive radios: A deep rein- forcement learning approach,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.462158Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:c8c2013b217736c562e8b5b5616806306be672761d98735e7606b5d0e4ae2855","observation_id":"dfce22b9-4928-42d3-a04a-36253c9ef5f3","resolution":{"observed_at":"2026-08-10T16:38:26.462158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.466094Z","title":"Multi-UA V path learning for age and power optimization in IoT with UA V battery recharge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.466094Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:eb727681b2ca2c2fbf771bef42b67bbed1f56d001f5b1c11458063220d05e152","observation_id":"122452db-342a-4b00-ada6-9222e3c3aaea","resolution":{"observed_at":"2026-08-10T16:38:26.466094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.547834Z","title":"GAN-Powered Deep Distributional Reinforcement Learning for Resource Management in Network Slicing,","venue":null,"work_id":"7a78b051-d371-485c-a02d-94a1c924483e","year":2020},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.469760Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:5b45160a04e66ebd3a15840cd6d7cae9bcd0f56251112406147fc25a9b4e218c","observation_id":"c93a2828-5430-4f29-b302-506fc9c5988f","resolution":{"observed_at":"2026-08-10T16:38:27.574737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.515044Z","title":"Learning resilient radio resource management policies with graph neural networks,","venue":null,"work_id":"9b8f4778-74ce-4f05-8f91-acb91f960c1c","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.473955Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:c3c2b9f20de0eee97b8f9299c20e2b3e782e3a0d3c6b82824e966e0b7a402297","observation_id":"af79347b-0df3-4cde-bbca-863a9736d2de","resolution":{"observed_at":"2026-08-10T16:38:27.527007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.472506Z","title":"Age minimization in massive IoT via UA V swarm: A multi-agent reinforcement learning approach,","venue":null,"work_id":"e3de9b75-3322-4116-b44b-2dac9f0cdb2c","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.478001Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:0f4d16d6d931a46bf887e7373a51987a2ea35e03bd911a3c747c23943e5cae25","observation_id":"5ff51be5-31b4-4171-89b2-2190470d0289","resolution":{"observed_at":"2026-08-10T16:38:27.488983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.369296Z","title":"Resource management in wireless networks via multi-agent deep reinforcement learning,","venue":null,"work_id":"afd9ee45-9ed9-41dc-82fa-80862c941aa1","year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.503529Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:b3582c2dc39fbb58fe5b084457718e449e20d4120e64ac1f5e4b50f17207ff7d","observation_id":"2564065d-ce49-458e-899d-c1f0ab8a3c46","resolution":{"observed_at":"2026-08-10T16:38:27.434744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.573908Z","title":"Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.573908Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:bee178e324c8fe348d4fede6f856b1c78bf9c921472b732c2e1c6e559fe194bb","observation_id":"3cc94fe7-2fb0-46ee-856f-823605af0e3f","resolution":{"observed_at":"2026-08-10T16:38:26.573908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.275014Z","title":"Multi-agent deep reinforcement learning for distributed resource management in wirelessly powered communication networks,","venue":null,"work_id":"dccbdea7-cc78-4cef-9783-2fd2312f38b9","year":2020},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.647441Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:59b41806d8dcf0f9e8aa45725135bfcb17a65ba9eb34f4af6f84f0c479029aa9","observation_id":"6d2a53a4-26ed-458e-b9b5-7d80d3893d86","resolution":{"observed_at":"2026-08-10T16:38:27.316562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.254965Z","title":"Multi-agent reinforcement learning for dynamic resource management in 6G in-X subnetworks,","venue":null,"work_id":"38f236f4-2e10-44fc-9d61-f045885ad430","year":1900},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.679758Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:7865bf3b3f1d4d38227c90fea3094851a0cdf383b8e0dfde0c7ba411fdcfa2c9","observation_id":"d1711627-08c0-4e2c-ac39-873f11bc8bcd","resolution":{"observed_at":"2026-08-10T16:38:27.261959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08421","last_updated":"2024-11-16T10:08:06Z","snapshot_observed_at":"2026-08-16T14:18:59.632166Z","submitted_at":"2024-02-13T12:49:22Z","title":"Conservative and Risk-Aware Offline Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2402.08421","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08421","snapshot_observed_at":"2026-08-10T16:38:26.786020Z","title":"Conservative and Risk-Aware Offline Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"5e7349a8-d7c5-41f0-8522-200195aa03b0","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.685726Z"},"links":{"cited_paper":"/paper/2402.08421","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:f537c5eb7cd906184e7f01d5a96c4ff4b11cbdc10c0bed0865934a461431b543","observation_id":"941997f2-b1b5-4268-8480-bd88ac62d783","resolution":{"observed_at":"2026-08-10T16:38:26.792615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.236006Z","title":"Offline reinforcement learning for wireless network optimization with mixture datasets,","venue":null,"work_id":"ea3f3dfd-0a0f-4bd0-b452-532c10a7899c","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.696342Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:4c747f178de35c1c0b31c15dd85a723c85871af71f55406e491d56b122c5d28f","observation_id":"23877ae2-2859-4cca-9cb2-3ebf5db9a51e","resolution":{"observed_at":"2026-08-10T16:38:27.243284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16764","last_updated":"2025-01-23T12:00:38Z","snapshot_observed_at":"2026-08-20T00:42:01.958934Z","submitted_at":"2024-09-25T09:22:23Z","title":"Offline and Distributional Reinforcement Learning for Radio Resource Management","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16764","snapshot_observed_at":"2026-08-10T16:38:26.703308Z","title":"Offline and distributional reinforcement learning for radio resource management,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.703308Z"},"links":{"cited_paper":"/paper/2409.16764","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:7e7d2c845e816202d6f02a0586b9982ec837bd22f04be12ee0694127e5ff2c76","observation_id":"8a07c1c9-3bfd-45a8-bfec-462e9db6398f","resolution":{"observed_at":"2026-08-10T16:38:26.703308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.191765Z","title":"Offline pre-trained multi-agent decision transformer,","venue":null,"work_id":"5289235d-ca21-4e9e-a849-5b46d051dca8","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.707643Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:6c961d94837d24aae2f84b99c6a4a51b8527b53049c15a25dd980f94ba893778","observation_id":"30ffdfdd-7217-40b3-ace4-9eb4ca16137e","resolution":{"observed_at":"2026-08-10T16:38:27.206189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.089624Z","title":"Simulation assumptions and parameters for FDD HeNB RF requirements,","venue":null,"work_id":"47090305-4c8a-47ed-952d-b9d9f3c9200b","year":null},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.711712Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:c3bf0b0855d360c8e4e9ac76dd854a2dd789963996059302b1adfb7a10cbf22c","observation_id":"139ee972-80a6-4d0a-84da-5bc13e8c7d67","resolution":{"observed_at":"2026-08-10T16:38:27.113493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.045957Z","title":"NR; physical layer measurements,","venue":null,"work_id":"ce7a0719-54c5-43e7-91f3-104f39baa06a","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.715180Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:e4e9181a256ea2d34f5250d16e9f36965289f6f628178dfc523822780f0fff42","observation_id":"90e2dd4c-342a-47c4-b5b4-1eccae466435","resolution":{"observed_at":"2026-08-10T16:38:27.065394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.960654Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"a7fe19de-aad9-4a4e-a346-4f2d23868f6c","year":2018},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.718994Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:c1f28269301ed5723ce5e6f2f987a7c1e830fc99467e04dba607687ef0100105","observation_id":"a53bb287-3bb2-45dd-a55f-1afc03342f70","resolution":{"observed_at":"2026-08-10T16:38:27.005362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.886380Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"26d67175-d4a2-4d12-840e-c14c1aa032c4","year":2018},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.722492Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:887d8924c2c14e118acafa94b085cb904df6e7e0f2a32c4101b62ce2bcb7e1c7","observation_id":"5eb5ba51-366b-4228-9603-4174863e201d","resolution":{"observed_at":"2026-08-10T16:38:26.902181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.865615Z","title":"Value-decomposition multi-agent actor- critics,","venue":null,"work_id":"4e7b14a3-7226-4fe0-9f3c-87b7210b10d3","year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.726166Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:f7c8ab0ad2c3d0bb107aaef8967a61b465f8f468cc655b3d56e74a6cf6b30f59","observation_id":"78170cad-effe-4c74-834c-8afe0d12f9ef","resolution":{"observed_at":"2026-08-10T16:38:26.871767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.853127Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"532e7b9c-0cc5-43ee-85fc-9c854b65ed5c","year":2019},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.729412Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:d48e2ee5b45feda251843dc8eb10fb49bdb51642446160b9ea998001fc4d53f8","observation_id":"b16994bf-91fe-48ee-a830-8f0f3ae11f3e","resolution":{"observed_at":"2026-08-10T16:38:26.857112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.838910Z","title":"ITLinQ: A new approach for spectrum sharing in device-to-device communication systems,","venue":null,"work_id":"825fd0f3-b27c-4910-8db8-95a07315aa13","year":2014},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.733680Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:1e0a991c5102ec76e1f5b09cb47e0bccaf25db0c1af69c068fa4fd2f98499f95","observation_id":"0ebd5816-83ba-4ba1-a3a4-e64ec924adce","resolution":{"observed_at":"2026-08-10T16:38:26.843606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-18T00:46:47.509510Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2501.12991."}