{"as_of":"2026-08-10T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:764cf4316c79a7346324707f04f1b96e506ff0128316207fe364d3c9d0eb8d83","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:47:39.488108Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09989/citation-record","integrity":"/paper/2507.09989/integrity","json":"/paper/2507.09989/citation-record.json","paper":"/paper/2507.09989"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15858","last_updated":"2023-11-27T14:25:40Z","snapshot_observed_at":"2026-08-09T20:51:35.725115Z","submitted_at":"2023-11-27T14:25:40Z","title":"Multi-Agent Reinforcement Learning for Power Control in Wireless Networks via Adaptive Graphs","version":1},"cited_work":{"arxiv_id":"2311.15858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15858","snapshot_observed_at":"2026-08-06T17:47:39.712283Z","title":"Multi-Agent Reinforcement Learning for Power Control in Wireless Networks via Adaptive Graphs","venue":"cs.NI","work_id":"486d4a6f-02b8-45ab-8e16-7503c8667bd5","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:36.874336Z"},"links":{"cited_paper":"/paper/2311.15858","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:0cb8bbf08d4c55b1a9cfac4f5329111ecf5b6cc7c7fd144c481a62b6cd9e36e5","observation_id":"a1fb07d7-507a-48af-9ee5-513978531797","resolution":{"observed_at":"2026-08-06T17:47:39.820541Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.433557Z","title":"Proceedings of the International Conference on Learning Representations (2022)","venue":null,"work_id":"0453bec4-b0b3-4468-b866-36a09eec6f37","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:36.967492Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:7c7f95d19fda8403f9ba2188fe4d096f45e9a5c5354531d18e41482f6095f505","observation_id":"8c506b9e-95db-4b15-b18b-0e8c687d69d7","resolution":{"observed_at":"2026-08-06T17:47:40.438220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.416161Z","title":"Pro- ceedings of the 2023 International Conference on Autonomous Agents and Multiagent Sys- tems pp","venue":null,"work_id":"c64ea7ae-8920-4a03-ba5a-7a11d350e5f6","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.010854Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:58e4fbd38483686e760aee0b9d3b2b1afe49bcbd515a7a7c53ad22783b49af81","observation_id":"61012a7c-78bf-4851-98d2-78bf93e6df10","resolution":{"observed_at":"2026-08-06T17:47:40.422021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.395023Z","title":"Joint European Conference on Machine Learning and Knowledge Discovery in Databases pp","venue":null,"work_id":"acbd9fbd-818f-4b76-8c84-3088827ae78e","year":2018},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.093328Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:68f2278ebfc2e78ff0a1fda8323abe405e6e2d90670d84b24da343df7a8bde9b","observation_id":"78901d04-639e-469c-bbb3-88b198cb3e12","resolution":{"observed_at":"2026-08-06T17:47:40.403187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.372914Z","title":"International Joint Conference on Artificial Intelligence (2024)","venue":null,"work_id":"8ce5adc7-25fb-4388-8037-fed8420ee6bf","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.169395Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:5f39b192ead72e78c8f52d5deb09d4dcfe1ab13f4417efd4680f1e8d76b8fffc","observation_id":"a28de0a2-a975-4e82-8050-52db1790c0dd","resolution":{"observed_at":"2026-08-06T17:47:40.377888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11251","last_updated":"2022-04-04T06:39:20Z","snapshot_observed_at":"2026-08-09T20:50:35.771527Z","submitted_at":"2021-09-23T09:44:35Z","title":"Trust Region Policy Optimisation in Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11251","snapshot_observed_at":"2026-08-06T17:47:37.242154Z","title":"arXiv preprint arXiv:2109.11251 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.242154Z"},"links":{"cited_paper":"/paper/2109.11251","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:2abfc86300a61abaa32cebbf502d47eb4fce201ca2d7246cf17de5d59aa70d5e","observation_id":"b9f7b077-a641-4f1e-b536-eba274abbe39","resolution":{"observed_at":"2026-08-06T17:47:37.242154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.355437Z","title":"the Thirty-Eighth Annual Conference on Neural Information Pro- cessing Systems (NeurIPS) (2024)","venue":null,"work_id":"cfd8ffe4-b18a-43fe-af08-fa10d875967d","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.375135Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:485b0e1d89ff9705c1c408356c46ecac5671986fc36a7705814b9b479153a655","observation_id":"063b6800-0521-46b1-85f8-6a051fef939d","resolution":{"observed_at":"2026-08-06T17:47:40.361427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.337845Z","title":"CoRR (2023)","venue":null,"work_id":"f91e0a31-da30-472f-878e-20aa313f6441","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.470113Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:591660aeae8176d8bc578803c50f298a5d64e809d21d57c6d7c205a694bc9e90","observation_id":"5d2937e1-04a3-4716-b108-7b0d664281a3","resolution":{"observed_at":"2026-08-06T17:47:40.342816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.318085Z","title":"The Twelfth International Conference on Learning Representations (2024)","venue":null,"work_id":"71654b12-f53a-416d-97c7-58897c27a3f2","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.537944Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:a4c7ad56ee61c1eb320ed9c8ee98d8e170f7f375c8a5b889f1c582a1e2566b21","observation_id":"380c99e2-9524-4959-b545-1389d5e469e7","resolution":{"observed_at":"2026-08-06T17:47:40.323345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.301331Z","title":"The Twelfth International Conference on Learning Representations (2024) Title Suppressed Due to Excessive Length 13","venue":null,"work_id":"4cdd52f7-28a2-4e1d-a8e0-6d290f47d9f9","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.637960Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:d77a3ad4341bac4b86d81b3bc57d69cf7ff98cb4edba094b239570036d815210","observation_id":"7c7dd837-0402-40a1-aaeb-442128e50d50","resolution":{"observed_at":"2026-08-06T17:47:40.307050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.283727Z","title":"Neural Information Processing Systems (NIPS) (2017)","venue":null,"work_id":"f6dbf81f-f486-4454-bdd5-0dffe89868b8","year":2017},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.696465Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:7eb54083371c5c68cf5bfa7baee6fa2c0c5a249ba4cc1d545090857ff5e5e76f","observation_id":"eb079445-1324-4aa5-9a0a-78e13167b24a","resolution":{"observed_at":"2026-08-06T17:47:40.289219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.263186Z","title":"Advances in Neural Information Processing Systems 32 (2019)","venue":null,"work_id":"867c9c6a-5ebd-49d6-9525-1bc41ec17e01","year":2019},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.781829Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:c83ebbd99c4894c4b78515a5b17977353f05da8a58e937702699c1b6766d14cd","observation_id":"fb8c8ab5-4842-438f-a72f-a58e8421c799","resolution":{"observed_at":"2026-08-06T17:47:40.270317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.245458Z","title":"Springer (2016)","venue":null,"work_id":"5b0875f0-f71c-4d33-a926-124f61c2051e","year":2016},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.882998Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:45c46ae795cf4d958f9338a46a0667cb825a5d60ecd312425f8c08f39f393189","observation_id":"439d077f-ba02-49f9-a46e-99ac3d29cc92","resolution":{"observed_at":"2026-08-06T17:47:40.249864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.230524Z","title":"Applied Intelligence 53(4), 4483–4498 (2023)","venue":null,"work_id":"7c4cca36-3531-453e-9a41-a08a47c2b39f","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.976283Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:43a6d012d7acf29cab74d81b7de1995840e13fba8298b82a7a3650c04687d966","observation_id":"a7c27d62-01f7-4309-92ce-878c65b67101","resolution":{"observed_at":"2026-08-06T17:47:40.235075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.212062Z","title":"The Journal of Machine Learning Research 21(1), 7234–7284 (2020)","venue":null,"work_id":"9ce2466b-14e9-4daa-b66e-d3793eca206c","year":2020},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.043046Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:c23891bd4be549da1f337b381ebbc6cb27c260ca9fec4c4337f4ede0330c16c8","observation_id":"76057f61-0aa5-49b1-b1de-78c6a887666c","resolution":{"observed_at":"2026-08-06T17:47:40.219283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05800","last_updated":"2024-07-08T10:10:07Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T10:10:07Z","title":"FedMRL: Data Heterogeneity Aware Federated Multi-agent Deep Reinforcement Learning for Medical Imaging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05800","snapshot_observed_at":"2026-08-06T17:47:38.095243Z","title":"arXiv preprint arXiv:2407.05800 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.095243Z"},"links":{"cited_paper":"/paper/2407.05800","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:869b5cc7c6fc6a7d1ec40ddbde0d8c9a5e2a91cb7ec2402483d858544e1e36ed","observation_id":"6d3bb8c5-9eb2-482c-96b9-6d21f21b69eb","resolution":{"observed_at":"2026-08-06T17:47:38.095243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.193544Z","title":"Neural Computing and Applications 35(27), 19765–19781 (2023)","venue":null,"work_id":"53826490-18be-4b02-b4be-a4d775d4104b","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.208471Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:5b2dad5600e8eb5eb4aaf3a140311bc6fd41a435740fd43850771ccf49307ff1","observation_id":"3b5161f9-e1ee-498d-9936-389d9f3020d7","resolution":{"observed_at":"2026-08-06T17:47:40.199924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.167580Z","title":"Advances in Neural Information Processing Systems 35, 16509–16521 (2022)","venue":null,"work_id":"3143678f-5ba7-4b8a-87c6-2c6fe5944720","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.274554Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:888948ef85eb2e49bb75dcc53b77ca0fae1e751b08c02a19794f3bf41a8c288f","observation_id":"dffaa61c-db81-4f8f-81ab-fe11b132a75b","resolution":{"observed_at":"2026-08-06T17:47:40.173531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.140541Z","title":"Theses and Dissertations","venue":null,"work_id":"46ba28d0-f97c-468d-b592-af58eca21815","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.399755Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:c6c343055464faba7635a0ba8b141ddf4e4c6d6cf5fb078baf89d046562508cc","observation_id":"41ef0326-dcc2-416f-bc7c-779c1a4dc774","resolution":{"observed_at":"2026-08-06T17:47:40.148295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.116103Z","title":"The International FLAIRS Conference Proceedings, 35 (2022)","venue":null,"work_id":"3ba460cc-f8d9-4b50-98bd-e73c82d020a1","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.542071Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:c3d44d0efeba964bc141dfd6ce46e23af7b4021b4bb1eef06e5609f6876f6e50","observation_id":"63631aa8-cc7f-417e-939a-6a96e0d49dfa","resolution":{"observed_at":"2026-08-06T17:47:40.124489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.089845Z","title":"IEEE Transactions on Vehicular Technology69(8), 8243–8256 (2020)","venue":null,"work_id":"9944e926-d08c-487b-8412-067b06ab1347","year":2020},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.596388Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:44c868b2aa2f90655a1f6fa73bf70d301200d4c4c4961ef8856f8d53e6aa1f04","observation_id":"5e89f877-1b8c-44bc-8037-515e86d2fd20","resolution":{"observed_at":"2026-08-06T17:47:40.102216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05799","last_updated":"2024-01-11T10:06:42Z","snapshot_observed_at":"2026-08-02T04:14:18.610286Z","submitted_at":"2024-01-11T10:06:42Z","title":"Designing Heterogeneous LLM Agents for Financial Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05799","snapshot_observed_at":"2026-08-06T17:47:38.762403Z","title":"arXiv preprint arXiv:2401.05799 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.762403Z"},"links":{"cited_paper":"/paper/2401.05799","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:97202e6a8ac871012ac74fa4d1970933195a9d0e263d2ca8b113c016bc7924f7","observation_id":"d5642dde-b820-4321-b5c4-1219b425b296","resolution":{"observed_at":"2026-08-06T17:47:38.762403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.069662Z","title":"2021 IEEE International Confer- ence on Systems, Man, and Cybernetics (SMC) pp","venue":null,"work_id":"59e77aa2-fbd1-448e-a5ff-12814fa1c5cc","year":2021},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.800514Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:6c1b2d89486cdf45e46ee64e57fcfe38830f4bd65d82f2e80511381d214d7993","observation_id":"65dea1ea-b486-4dfd-8204-73e9e4c6c55a","resolution":{"observed_at":"2026-08-06T17:47:40.076193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.047217Z","title":"AIAA Scitech 2019 Forum p","venue":null,"work_id":"8ac948f7-eeef-4f3c-867c-aebf1a28dcfa","year":2019},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.922343Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:0b67846ffd1277f900bd40603b6a9bf96a583e2875a514c018d6fb15219720b1","observation_id":"c86db028-91ff-41eb-89c9-caf595f0452f","resolution":{"observed_at":"2026-08-06T17:47:40.053893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01955","last_updated":"2022-11-04T06:16:11Z","snapshot_observed_at":"2026-08-10T10:21:53.609183Z","submitted_at":"2021-03-02T18:59:56Z","title":"The Surprising Effectiveness of PPO in Cooperative, Multi-Agent Games","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.01955","snapshot_observed_at":"2026-08-06T17:47:39.086300Z","title":"arXiv preprint arXiv:2103.01955 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.086300Z"},"links":{"cited_paper":"/paper/2103.01955","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:e685d23921881e3308bb9ef99ed32bea3ed5bbbf2eb705143bca2353189a6e4c","observation_id":"819dfc1c-9d73-4f90-98ea-28967e163a33","resolution":{"observed_at":"2026-08-06T17:47:39.086300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.025578Z","title":"Applied Sciences 15(5), 2580 (2025)","venue":null,"work_id":"5d3fee4e-98c4-474e-8c8d-c09914c472ef","year":2025},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.148563Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:21341e748fe1267a086702981c84135a24132f995e5187890fc5fd8f028c25f5","observation_id":"a20098aa-3adb-4c03-aa7f-5b1476f29c16","resolution":{"observed_at":"2026-08-06T17:47:40.032904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.004755Z","title":"Complex & Intelligent Systems pp","venue":null,"work_id":"43e52be8-3700-4d63-806b-88a779ceef86","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.268295Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:3195d436e243d4762cc6a508cc7add5234fa760a28cedf13f6b78db3438f1139","observation_id":"42be7f25-7db7-4388-a20f-ffa157071d99","resolution":{"observed_at":"2026-08-06T17:47:40.010555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.985029Z","title":"Neurocomputing 411, 206–215 (2020)","venue":null,"work_id":"848430cf-fe1d-4cd8-bc90-63000c63911d","year":2020},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.329041Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:9ca9d7285e37c3839b66b7a06bcaf276543f5a079b7d525e7760fe1dd738fb4f","observation_id":"6a71bfb5-a906-4ae5-9763-2a2ed60b78d7","resolution":{"observed_at":"2026-08-06T17:47:39.991068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.929137Z","title":"Autonomous Agents and Multi-Agent Systems 38(1), 4 (2024)","venue":null,"work_id":"d13effea-4f09-4e36-a141-0e863a355f89","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.488108Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:0e111731dbeecb9a5d7ab38b2d620d1d6d5d220974ccd9cbc5c67e83db8e9009","observation_id":"998a9b7f-804e-4023-804a-b80a1f1d82d4","resolution":{"observed_at":"2026-08-06T17:47:39.969754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T20:50:53.679493Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.09989."}