{"as_of":"2026-08-17T07:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd1724ff2b0e2d2afd2a52084764ecc5825e0ec82b6873c5f20ff3713f1619fe","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:13.560082Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00797/citation-record","integrity":"/paper/2506.00797/integrity","json":"/paper/2506.00797/citation-record.json","paper":"/paper/2506.00797"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:21.065310Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms","venue":null,"work_id":"16e9280c-407c-423b-a03a-4b8ecac846f0","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:08.649500Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:e89af36750545cf412ba5d15cd82f4426b522cbdb920de695eb6187f54abada5","observation_id":"8b6bd020-82aa-42ab-88a0-e05f2d1d3abe","resolution":{"observed_at":"2026-08-07T12:09:21.135416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:08.748019Z","title":"A review of cooperative multi-agent deep reinforce- ment learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:08.748019Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:4594c78d51621114b5918d3555ba1b132a73a272b776a07f5683bbae01292f7c","observation_id":"51024266-e33e-4c57-97d6-a3db8b1a2638","resolution":{"observed_at":"2026-08-07T12:09:08.748019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.869582Z","title":"Revisiting some common practices in cooperative multi-agent reinforcement learning","venue":null,"work_id":"557ac164-ac21-4e05-8fb7-3b353d1b53cb","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:08.860682Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:5dbb2740296d4bf5c194d673794472216ff041f0093a0d7a26ca5a6bd46467ed","observation_id":"c7f3603e-4208-4639-9314-9223ee5d0c63","resolution":{"observed_at":"2026-08-07T12:09:20.954678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.719369Z","title":"Towards global optimality in cooperative marl with sequential transformation","venue":null,"work_id":"46a49f4a-c5c1-4131-8105-8790b5f9c41a","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.003537Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:ad6015699cddef848447d886911f56f67811cc85e0c209daea85bb189a01e0f1","observation_id":"89109b44-7e27-47d0-9b75-268f5356a050","resolution":{"observed_at":"2026-08-07T12:09:20.771005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.488926Z","title":null,"venue":null,"work_id":"b8c3afad-a49e-4039-bb73-93153b0e4758","year":2024},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.155414Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:ab9f360de9b1b78f9d60b641a8eff8ebb481ed79ab9d63c38c1ed974fb92c769","observation_id":"e38ff12b-715f-4e7a-bca9-b8c61d99d06f","resolution":{"observed_at":"2026-08-07T12:09:20.579717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.320240Z","title":"Multiagent reinforcement learning: Rollout and policy iteration","venue":null,"work_id":"4d0faa83-17ff-4eb8-9ee4-7106e89e7bfa","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.249278Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:77adc2e414ec3b75a0e9016bf81c7f13510644ce0e1684e746c21e7d8f809c15","observation_id":"f87454b7-397d-457d-91dc-cdd452778d19","resolution":{"observed_at":"2026-08-07T12:09:20.397911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.108447Z","title":"Context-aware bayesian network actor-critic methods for cooperative multi-agent reinforcement learning","venue":null,"work_id":"4b5e0bb4-3706-4912-aaf0-937bd2898d30","year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.341192Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:e7c1ce24a1db6a152478cf68b2d12e88b1bd6d971c0d6e7e292b7392c3f6d668","observation_id":"2e812c2d-9698-4dc1-bf85-6c04095e31bb","resolution":{"observed_at":"2026-08-07T12:09:20.209812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.883935Z","title":"Coordinated reinforcement learning","venue":null,"work_id":"6447f7ab-6bbb-44ef-a246-d8fceb8ae901","year":2002},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.429599Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:3e5da868707a15059887ef551863181598764d42d87b8321716b5117f8be86b5","observation_id":"1c7acf73-a58e-4307-afc1-2ee4bc6c28aa","resolution":{"observed_at":"2026-08-07T12:09:19.999451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12681","last_updated":"2023-02-10T09:29:51Z","snapshot_observed_at":"2026-08-16T16:29:49.828190Z","submitted_at":"2022-09-26T13:29:22Z","title":"More Centralized Training, Still Decentralized Execution: Multi-Agent Conditional Policy Factorization","version":2},"cited_work":{"arxiv_id":"2209.12681","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.12681","snapshot_observed_at":"2026-08-07T12:09:14.223413Z","title":"More Centralized Training, Still Decentralized Execution: Multi-Agent Conditional Policy Factorization","venue":"cs.LG","work_id":"5ae68ca0-b779-40df-b2bf-dfc82fa46c39","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.530585Z"},"links":{"cited_paper":"/paper/2209.12681","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:15d8e4e30b403d7ac301122ebf06c5c3658fbaa7da453ecb673ba74483f3f577","observation_id":"5b1cc5d4-84a6-4c0c-9624-aff77fee7ada","resolution":{"observed_at":"2026-08-07T12:09:14.299095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.670475Z","title":"Multi-agent reinforcement learning: Independent vs","venue":null,"work_id":"424bc3f1-cc0f-403f-8e71-eb20cbf0a663","year":1993},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.679161Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:ec9f5642e5cccb66923387ec774a04cb2ae2038f41ce0ee58b30384f429ec2dd","observation_id":"32ccfa27-6f00-40a1-a13a-276a6a831e68","resolution":{"observed_at":"2026-08-07T12:09:19.760972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:09.757254Z","title":"Value- decomposition networks for cooperative multi-agent learning based on team reward","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.757254Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:c92f299a7e8f1e0f2b241eac547ef11c2ea2a7cfd4268f9bf9092dc0c7fb1d82","observation_id":"5fdb052c-3b61-4b2b-a13e-ed0f424ccbd0","resolution":{"observed_at":"2026-08-07T12:09:09.757254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:09.871952Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.871952Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:4bf43e8cc9cbc2847719ba1c6a8acedbf8c9eb5846092d2c6ce61894fd95a23f","observation_id":"617e1732-bcb8-4416-9fa7-b10ea31c513f","resolution":{"observed_at":"2026-08-07T12:09:09.871952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.470382Z","title":"Qtran: Learning to factorize with transformation for cooperative multi-agent reinforcement learning","venue":null,"work_id":"718ce213-7f40-4462-99dc-58129531396c","year":2019},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.006495Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:e5b514df19bd726c5817a66810a0f4af316442b5a7c2c47900627e722b0e2696","observation_id":"9f9d4401-e4c2-4462-ab8f-6f2f0b0c0310","resolution":{"observed_at":"2026-08-07T12:09:19.533967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.296950Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":"2ac99597-71b0-4a23-ad00-dd6113d6dd12","year":2017},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.158960Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:7a0a96744ca3a121ace19da27fb9d054cacd67f65a0a7faf7047cb339deaef07","observation_id":"2d436245-855b-47d1-a796-f8c1f5101110","resolution":{"observed_at":"2026-08-07T12:09:19.388235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:10.294956Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.294956Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:613d1610f67fec498eef13a9bedfce87a02aaa29e91d40751b0956a016df339a","observation_id":"2c22b13d-e5f9-4fc1-980a-0f6363672d32","resolution":{"observed_at":"2026-08-07T12:09:10.294956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.027942Z","title":"Actor-attention-critic for multi-agent reinforcement learning","venue":null,"work_id":"97bf16d9-47f1-499e-a862-f127e9e4f020","year":2019},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.443532Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:37af50428827c5c9be3902c123810226a296393112fbd1a1dc56c527995ef12f","observation_id":"7f009bdb-7411-4286-8e57-61636f1a08b4","resolution":{"observed_at":"2026-08-07T12:09:19.168581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.867699Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games","venue":null,"work_id":"52f38f13-e0e4-4045-be6b-29240748a4f9","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.589233Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:ffe8d07c8d4d210ac1307ba429dd70604e38fba201933eec3558be32dc288e9c","observation_id":"da0dc977-e59a-4176-aeaa-e2452537fbca","resolution":{"observed_at":"2026-08-07T12:09:18.942059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.671898Z","title":"Deep coordination graphs","venue":null,"work_id":"4cbce4fb-18cc-4a8b-ba87-e8aa91b135ff","year":2020},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.709772Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:7867776fe327ade87584341022e8de0032503e99967325ab41ec614cfe718b23","observation_id":"1b428e06-5328-44be-9ed5-0917852f530a","resolution":{"observed_at":"2026-08-07T12:09:18.754897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.482670Z","title":"Deep implicit coordination graphs for multi-agent reinforcement learning","venue":null,"work_id":"a7b47ce2-7e71-4d30-b231-fd1e0a3c1450","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.773040Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:0778c467ed1e9854fff5c5ac381b51b35d5e2bc9b041225fb0e34170d9168b1e","observation_id":"6349482b-11c0-43e9-9a51-0b679ed6eea2","resolution":{"observed_at":"2026-08-07T12:09:18.551846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:10.869588Z","title":"Context-aware sparse deep coordination graphs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.869588Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:c485193b84fdfb6dab77a1eb6ebab202d71cc4bff4165b0a8b4de0ae066aa603","observation_id":"2eecfbe2-19f6-4f33-94bd-62d8861d7bf3","resolution":{"observed_at":"2026-08-07T12:09:10.869588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.315202Z","title":"Analysing factoriza- tions of action-value networks for cooperative multi-agent reinforcement learning","venue":null,"work_id":"6aa6e33c-a041-40ec-bcdd-33950821ebd2","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.972434Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:75d6fb94f5cfc05c5f2c41de4edea881bff6e28ed501c9b58aa0d2dbd87f8457","observation_id":"aa0c4210-4186-4ffe-a81b-fc3e9971270e","resolution":{"observed_at":"2026-08-07T12:09:18.377599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.171847Z","title":"Biasing coevolutionary search for optimal multiagent behaviors","venue":null,"work_id":"132bbbba-4b19-4d9a-95b3-5d1cbb546492","year":2006},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.048003Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:3850168a2da2297d53a06a38a7ff23b3ddde36bc1924d91cb5a500b5bb0a555f","observation_id":"b2e9d5bf-c29b-4406-83a2-9d2fb17d526e","resolution":{"observed_at":"2026-08-07T12:09:18.216281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.976294Z","title":"Bounded approximate decentralised coordination via the max-sum algorithm","venue":null,"work_id":"3ac4f33c-ab25-46a9-bed1-845607616675","year":2011},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.130000Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:bfc39d2770740fd21779cdd1630c31d697753d696dcee29b7559223758f39d71","observation_id":"f88da3a5-629c-41da-935e-3766dd477d76","resolution":{"observed_at":"2026-08-07T12:09:18.090154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.773469Z","title":"Nonserial dynamic programming","venue":null,"work_id":"11824b9d-075d-4fb7-bc5d-54982832497f","year":1972},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.226850Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:db3f2472b73c749c86189dc075c021f9ced656b5a2caeeb8659593d324a31ebf","observation_id":"908f2428-3f57-4636-bf13-0dbf972ef113","resolution":{"observed_at":"2026-08-07T12:09:17.865044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.590748Z","title":"Gcs: Graph-based coordination strategy for multi-agent rein- forcement learning","venue":null,"work_id":"f3eeacdf-c85e-4cfd-ba3b-e32652bbd230","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.302675Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:255dc1124f1aca067916eceb847b11889a852787645690c9dc979b12b26a92fc","observation_id":"184c00e3-a0d2-49d9-acc3-b51f6c95b328","resolution":{"observed_at":"2026-08-07T12:09:17.665808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.418994Z","title":"Ace: Cooperative multi-agent q-learning with bidirectional action-dependency","venue":null,"work_id":"92a255c3-1654-4388-8e09-a792ad0e2bc1","year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.375942Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:d5ed5e8e66b4b96f33562c8495113fc2619fab2c54c886d2c418a6579704ef7d","observation_id":"ad4dc34a-6841-4ad4-a88e-b29c27c1e97a","resolution":{"observed_at":"2026-08-07T12:09:17.505016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.251251Z","title":"Backpropagation through agents","venue":null,"work_id":"593b6516-8f75-418e-8adf-b1546e666903","year":2024},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.463197Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:5a58276e6fda6ca3ac87e42187e271615b9252943035a59170e39668f0d90f83","observation_id":"ad3ff415-1ea2-4460-ad54-4dd744c33bcf","resolution":{"observed_at":"2026-08-07T12:09:17.302075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.032915Z","title":"Group-aware coordination graph for multi-agent reinforce- ment learning","venue":null,"work_id":"a4c203a0-46ca-4176-a767-ea88d8170634","year":2024},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.548731Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:b5855f0869a0b933be549f6f97770d92c09685f25e0f39e449212db7292562ca","observation_id":"0ad99584-ad15-4aad-8479-709a1fd67805","resolution":{"observed_at":"2026-08-07T12:09:17.124913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17352","last_updated":"2025-05-13T10:06:37Z","snapshot_observed_at":"2026-08-16T15:29:06.802195Z","submitted_at":"2023-05-27T03:15:24Z","title":"Is Centralized Training with Decentralized Execution Framework Centralized Enough for MARL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17352","snapshot_observed_at":"2026-08-07T12:09:11.648515Z","title":"Is centralized training with decentralized execution framework centralized enough for marl? arXiv preprint arXiv:2305.17352, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.648515Z"},"links":{"cited_paper":"/paper/2305.17352","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:679115feaf4615cb317e57fb9a04048b0b12e0bbd3bc75e17891803e789bfaab","observation_id":"d7e21359-9f50-4aa0-a801-56994194dd44","resolution":{"observed_at":"2026-08-07T12:09:11.648515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.796798Z","title":"Multi-agent reinforcement learning is a sequence modeling problem","venue":null,"work_id":"e8d1d01c-ff56-45d6-b553-a5fff424803b","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.719251Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:7ff2feca51c81728c3c7390143bafebfa31d036902b0029e746bf0c07695b41d","observation_id":"e55f56e1-7572-4113-8bbd-39aa00d71bb6","resolution":{"observed_at":"2026-08-07T12:09:16.911860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.595008Z","title":"Coordinated multi-agent reinforcement learning in net- worked distributed POMDPs","venue":null,"work_id":"0c49174b-43a2-4e5d-a672-f11197232c8f","year":2011},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.819710Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:1866ad6b58a57bcc265ae8d1b08dc50c05db9b01d782fdcce3dabf812838f6a7","observation_id":"0e09f4b3-627c-4f57-b282-b16fd3ef2fd5","resolution":{"observed_at":"2026-08-07T12:09:16.673642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.373353Z","title":"Learning to coordinate with coordination graphs in repeated single-stage multi-agent decision problems","venue":null,"work_id":"7783fad6-5ae0-449f-a782-1cca904ffbdc","year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.885075Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:f995fc26e83b9a3cecac68e7fee889e4c2e650dd384aad98b7d4379980057a8f","observation_id":"809ce0f2-1670-46a6-ab0e-8f3084295b37","resolution":{"observed_at":"2026-08-07T12:09:16.457907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.15175","last_updated":"2021-09-30T14:46:18Z","snapshot_observed_at":"2026-08-16T17:52:45.052883Z","submitted_at":"2021-09-30T14:46:18Z","title":"Coordinated Reinforcement Learning for Optimizing Mobile Networks","version":1},"cited_work":{"arxiv_id":"2109.15175","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.15175","snapshot_observed_at":"2026-08-07T12:09:14.028015Z","title":"Coordinated Reinforcement Learning for Optimizing Mobile Networks","venue":"cs.LG","work_id":"33f84c32-1189-4a48-b982-43ab57f6b7d4","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.957490Z"},"links":{"cited_paper":"/paper/2109.15175","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:18169bc735b5359fd96cd0c33c157dbc63de7236692a8cc57f0c85c28ee0275b","observation_id":"02f366e8-e52a-4426-9378-aa4310f7ef90","resolution":{"observed_at":"2026-08-07T12:09:14.106967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04868","last_updated":"2022-02-16T03:17:57Z","snapshot_observed_at":"2026-08-16T17:22:21.352890Z","submitted_at":"2022-02-10T06:59:08Z","title":"Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2202.04868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.04868","snapshot_observed_at":"2026-08-07T12:09:13.888405Z","title":"Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"4c4796fb-fdb2-4b1c-846f-0ab526a7d3e0","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.080207Z"},"links":{"cited_paper":"/paper/2202.04868","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:b6583828961613e1c158567eaeaa389683aa98d28f6bf4866d5219009e0f895d","observation_id":"41654430-94ba-4132-96aa-30a723418a60","resolution":{"observed_at":"2026-08-07T12:09:13.963852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.205868Z","title":"On the global convergence rates of decentralized softmax gradient play in markov potential games","venue":null,"work_id":"3c6f27de-e001-4919-9b3d-6daf3aa526b8","year":1923},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.157464Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:924c1e1bdd1c3aca5ad03933d0b45adafd474a21b9b090ab56d4303aa81473b8","observation_id":"1f1f0e6a-b47a-4210-8dba-072c3981eac2","resolution":{"observed_at":"2026-08-07T12:09:16.257303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.978992Z","title":"Trust region policy optimisation in multi-agent reinforcement learning","venue":null,"work_id":"02664afb-760f-43a5-bdd4-a09bdba83723","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.226182Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:9384ccb8f355a6afa2b8688fd52dc3dd1f113c3bba73fea5c87bc34886909d0d","observation_id":"1da1cc19-7669-4d0a-8ca0-1869eb7b544d","resolution":{"observed_at":"2026-08-07T12:09:16.081145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.814515Z","title":"On minmax theorems for multiplayer games","venue":null,"work_id":"40dbe3c3-2e00-40e6-99ec-167f8fa7a089","year":null},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.275355Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:0219bf49f69b66e186b331237969e68a10d5b324afd2cdaf816d370dea3ae3f0","observation_id":"69ee98c4-8091-4c8c-aced-d371d6ed6dfa","resolution":{"observed_at":"2026-08-07T12:09:15.898241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.645187Z","title":"Team theory and person-by-person optimization with binary decisions","venue":null,"work_id":"c11bd6c3-b635-4bcf-b817-fa20b2aaf22d","year":2012},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.360426Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:483a51d3c0b5cc2f32393bd2e6bfa3535c1c2537f5b1215c9cca116c4e3dea67","observation_id":"c780cd43-1d7f-4464-98d5-af134bf54847","resolution":{"observed_at":"2026-08-07T12:09:15.732224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.441443Z","title":"Collaborative multiagent reinforcement learning by payoff propagation","venue":null,"work_id":"e44c510e-1ec9-4e2e-ab12-392a0dbcd972","year":2006},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.491947Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:7de04855e9d277e14fba9307d35b7c904e27d672b8ac3482ad101794d01382c1","observation_id":"850a2fe5-a037-4794-a047-ec8be72c6304","resolution":{"observed_at":"2026-08-07T12:09:15.527030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:12.638776Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.638776Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:f34df4c1ecf390c3c80a76b7af37c7c17736ec24cc4ef7e97f31fc7fd3f183d9","observation_id":"1ed0f93c-a933-458c-b352-e2eefac6ca96","resolution":{"observed_at":"2026-08-07T12:09:12.638776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.254038Z","title":"Microscopic traffic simulation using sumo","venue":null,"work_id":"352775b6-f115-482d-b4ca-486c8342702d","year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.701283Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:dba4960b769ba6ccf31cf423e66856bc3a01f8df4447230fcd43baa0130c71f1","observation_id":"3c90702e-bb78-468b-ae25-b015cb39909e","resolution":{"observed_at":"2026-08-07T12:09:15.312623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.081936Z","title":null,"venue":null,"work_id":"4409ea35-ff58-4717-b643-1a9a43205c58","year":2019},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.775891Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:98fcb20891cd99873eb1dc09cc6dd5c7de9654ce99c6d72261bf5df74b1cf8ed","observation_id":"84d1ec4b-c5e0-423b-8129-c892d0aa8b05","resolution":{"observed_at":"2026-08-07T12:09:15.146793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-14T17:37:44.544678Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-08-07T12:09:12.878586Z","title":null,"venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.878586Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:b65186a8f03f76ef9a33cef75e24c15aee01619cfb57f93a9c60e3607ce88db8","observation_id":"e963249d-7e11-47ae-b019-9e3359cf0bd2","resolution":{"observed_at":"2026-08-07T12:09:12.878586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.914934Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"0676b2b2-3fae-4f71-a43b-5aa26b5852b3","year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.993195Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:f133ff55399f1a7e9575a79d9cabb0e409c8c131f6c7cfc5b2008ff0d15226de","observation_id":"ddcf55f2-8984-4bd4-9119-914bb90b057b","resolution":{"observed_at":"2026-08-07T12:09:14.987869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01339","last_updated":"2020-04-24T01:54:46Z","snapshot_observed_at":"2026-08-11T01:57:51.115236Z","submitted_at":"2020-04-03T02:21:07Z","title":"Multi-agent Reinforcement Learning for Networked System Control","version":2},"cited_work":{"arxiv_id":"2004.01339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.01339","snapshot_observed_at":"2026-08-07T12:09:13.733603Z","title":"Multi-agent Reinforcement Learning for Networked System Control","venue":"cs.LG","work_id":"a2ca9a9b-03ec-42f0-921b-1af44c10b98f","year":2020},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.071784Z"},"links":{"cited_paper":"/paper/2004.01339","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:665f41e73f8dcf55310b365a1de72c80de7388116f71946a99414f36c34f272f","observation_id":"770ba9b0-04db-4ea9-960a-d0f43d179fc6","resolution":{"observed_at":"2026-08-07T12:09:13.790402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:09:13.162796Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.162796Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:9c9e7b8b0bc780e0fc04a859ff30ec5cc24ab4d7e8911d605aac07e33ae266c9","observation_id":"792e14a1-b117-4f07-97aa-11490eed0c67","resolution":{"observed_at":"2026-08-07T12:09:13.162796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.744284Z","title":"Abstract dynamic programming","venue":null,"work_id":"c1c2dd31-685b-4194-950d-fe599ce513f7","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.215863Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:07359ac0e5999eafd6fcaedc499220d60d7b93aaa15d4d213d700bc1710715a6","observation_id":"31c27e78-34fa-4be7-ad14-d95b43c19ca2","resolution":{"observed_at":"2026-08-07T12:09:14.827639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.605531Z","title":"Dynamical model of traffic congestion and numerical simulation","venue":null,"work_id":"3cb7e582-5f6e-48ed-addf-05e539eaa733","year":1995},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.294728Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:a1beb43f5b238d5a5dbd48af1bd5c64aef39cdf076289c554846958b0cc762af","observation_id":"2f839a35-c33c-41fc-b476-2f4ed18c165e","resolution":{"observed_at":"2026-08-07T12:09:14.696229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T12:09:13.360881Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.360881Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:8e237f2d9bcea1fd97eee6fad0fad862cc00c550a1964ea1b82a9123addbd7c3","observation_id":"4bc9af4d-727e-4618-85e9-d07eb361547d","resolution":{"observed_at":"2026-08-07T12:09:13.360881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01682","last_updated":"2022-08-02T18:16:42Z","snapshot_observed_at":"2026-08-16T16:41:37.386351Z","submitted_at":"2022-08-02T18:16:42Z","title":"Heterogeneous-Agent Mirror Learning: A Continuum of Solutions to Cooperative MARL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01682","snapshot_observed_at":"2026-08-07T12:09:13.464761Z","title":"Heterogeneous-agent mirror learning: A continuum of solutions to cooperative marl","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.464761Z"},"links":{"cited_paper":"/paper/2208.01682","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:10026cfac36f1806c4ec2683f64d654f1dbf933112067b4ac888899e1f3aab66","observation_id":"6bc46274-8ff6-4695-8499-a18a4dfa8c4f","resolution":{"observed_at":"2026-08-07T12:09:13.464761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.429331Z","title":"Albrecht","venue":null,"work_id":"3167c6a7-a170-4b6e-baee-f6cb8880313a","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.560082Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:1741b3714dbcdf803c22f8ad648b6b23ca3f6c24cbc12339d478cf3d6cfed0b2","observation_id":"6276f5eb-db5b-4c6f-8332-e34c28c3607f","resolution":{"observed_at":"2026-08-07T12:09:14.491389Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T05:37:46.961754Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":4,"verified_fuzzy":33},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2506.00797."}