{"as_of":"2026-08-12T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09aa30c89fe5632afbc277143c8677fbc877fbed85fb8bae87069858a04d9944","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:19:32.354140Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.12326/citation-record","integrity":"/paper/2412.12326/integrity","json":"/paper/2412.12326/citation-record.json","paper":"/paper/2412.12326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.132675Z","title":"Albrecht and Peter Stone","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.132675Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:7cc12e39748df52a5dcf1c32b1e4ffedf59b471f0c7148e52bf0b6894f14e3d1","observation_id":"5a7ea804-97a6-4924-9d4b-dfdd9afc40a8","resolution":{"observed_at":"2026-08-11T14:19:32.132675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.141863Z","title":"Giannakis, and Tamer Basar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.141863Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:3a8aa91c04955103553a5e821a1ed6c533775a855dff3e73a134b08a19dacc2b","observation_id":"d6df5b9a-de0b-4e37-83ff-51b81f9b4767","resolution":{"observed_at":"2026-08-11T14:19:32.141863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10469","last_updated":"2024-01-29T16:37:55Z","snapshot_observed_at":"2026-07-06T13:44:18.807144Z","submitted_at":"2022-08-22T17:42:03Z","title":"Formal Contracts Mitigate Social Dilemmas in Multi-Agent RL","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10469","snapshot_observed_at":"2026-08-11T14:19:32.146571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.146571Z"},"links":{"cited_paper":"/paper/2208.10469","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:0be35ce9ce2c59fe3b6d87fa815218f897f258363c52338d28c2a57f660e6c0d","observation_id":"53e99242-bb3d-4fc3-90e8-d33302965c58","resolution":{"observed_at":"2026-08-11T14:19:32.146571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01339","last_updated":"2020-04-24T01:54:46Z","snapshot_observed_at":"2026-08-11T01:57:51.115236Z","submitted_at":"2020-04-03T02:21:07Z","title":"Multi-agent Reinforcement Learning for Networked System Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.01339","snapshot_observed_at":"2026-08-11T14:19:32.151157Z","title":"Multi-agent Reinforcement Learning for Networked System Control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.151157Z"},"links":{"cited_paper":"/paper/2004.01339","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:52ed43387f462be4aca75601f25081a82d2d00f3e8e36840bb1c0777ef2b3045","observation_id":"f73bb17c-cb3d-484d-85aa-6c18ffad38db","resolution":{"observed_at":"2026-08-11T14:19:32.151157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:34.060066Z","title":"Multi-Agent Deep Reinforcement Learning for Large-Scale Traffic Signal Control","venue":null,"work_id":"3a639f23-58df-4459-b894-0c6955a9e900","year":2020},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.155779Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:e1c7ad29853f040917345d488d9ae49ac94479eb4d3d41e0a8f680685747ee1d","observation_id":"ee923d9b-fa2c-48d9-8cdc-d9f2c0bfa878","resolution":{"observed_at":"2026-08-11T14:19:34.065149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06559","last_updated":"2022-09-01T19:39:27Z","snapshot_observed_at":"2026-07-06T13:31:06.022171Z","submitted_at":"2022-07-13T23:52:14Z","title":"Scalable Model-based Policy Optimization for Decentralized Networked Systems","version":2},"cited_work":{"arxiv_id":"2207.06559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.06559","snapshot_observed_at":"2026-08-11T14:19:33.661133Z","title":"Scalable Model-based Policy Optimization for Decentralized Networked Systems","venue":"cs.LG","work_id":"3c9b45e2-1ef5-425b-8b88-7036555eba57","year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.160038Z"},"links":{"cited_paper":"/paper/2207.06559","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:18d72d2accd3025e248f3d4f9ef6eecf8745821da4311f111c3ca1ba26dd28a0","observation_id":"e093aac0-3e7a-4bf2-86f1-c0433a3e1a49","resolution":{"observed_at":"2026-08-11T14:19:33.666937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:34.047150Z","title":"Torr, Pushmeet Kohli, and Shimon Whiteson","venue":null,"work_id":"ee48687d-be1f-4ab0-afc1-9f052f1adf0b","year":2017},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.165638Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:5cdd28c6bbf191c539a9ac110a46ea95b979d1c982d8d8d98a72a4faf27fa5e0","observation_id":"184b8f26-1249-4924-9360-0ddeed157b97","resolution":{"observed_at":"2026-08-11T14:19:34.051501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0477.2001","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.641016Z","title":"Brown, Erin E","venue":null,"work_id":"422f2e22-f4cd-4406-8529-90e5676755d4","year":2001},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.169923Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:71e221c616adfe6eab27f302ddb3561c0f4b130da2782e491ca973461203db8c","observation_id":"52bab823-68f4-4418-911d-d70b3ab505c5","resolution":{"observed_at":"2026-08-11T14:19:33.647190Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-019-1488-5","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.457999Z","title":"Hauser, Christian Hilbe, Krishnendu Chatterjee, and Martin A","venue":null,"work_id":"4a82b31e-2417-4f5a-9cb0-45d2df320094","year":2019},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.174444Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:245f1965a82000fd3b7da307804914768b7b7614e3a12b5509d965cb1b0f6817","observation_id":"dc381d80-4b83-4486-af76-3e032aadb1c5","resolution":{"observed_at":"2026-08-11T14:19:32.463013Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:34.034848Z","title":"Opponent modeling in deep reinforcement learning","venue":null,"work_id":"c26aadae-16b7-42ad-b861-b358bc24636b","year":2016},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.178197Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:414b879703ad422e6c213ea425e2441873626d2c0dfc971a6bce5db2a5c312b2","observation_id":"ac7b753b-4e33-4bb3-8ab8-ed7ec8fdefc5","resolution":{"observed_at":"2026-08-11T14:19:34.038825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.182470Z","title":"Importance-Aware Message Exchange and Prediction for Multi-Agent Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.182470Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:7bb0b041cf7e91f23205c52d78c2fc598d1d472770b67e91712ee7c568c2ff4c","observation_id":"760e2073-ade7-4536-bfac-b455e2c3f1d4","resolution":{"observed_at":"2026-08-11T14:19:32.182470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:34.022025Z","title":"Leibo, Matthew Phillips, and Karl Tuyls","venue":null,"work_id":"334abb43-a3fc-4a20-aa22-db7d4ca10f43","year":2018},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.186182Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:82910e71faf634eccb975290fb857fbe5a55602efae97ff803b115a4e415e76c","observation_id":"e7553d3d-d35c-4614-abe7-639606192cd3","resolution":{"observed_at":"2026-08-11T14:19:34.026446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:34.007916Z","title":"Actor-attention-critic for multi-agent reinforcement learning","venue":null,"work_id":"d641c804-5568-408d-b1d6-38affb98781a","year":2019},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.189687Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:1cb307aabd9c9daa2f91b4d6080e265cfb1fb28a30cbc7a63486ec3b17529eb0","observation_id":"98f8b06a-3bbf-483e-9f2a-9b1e00076be1","resolution":{"observed_at":"2026-08-11T14:19:34.013000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.994285Z","title":"Ortega, D","venue":null,"work_id":"e0b17828-c605-4ab4-aed1-e619e9a6ba98","year":2019},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.193039Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:be3a4e6340bb7c1ddb1192a6d03a21e068365da49464a80aa6b1affcf65cf120","observation_id":"0a14c871-ea27-4ac3-a2eb-f6f9e0878c92","resolution":{"observed_at":"2026-08-11T14:19:33.999579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.975987Z","title":"I2Q : A Fully Decentralized Q-Learning Algorithm","venue":null,"work_id":"bd2097fb-f815-4c94-afc8-7b56fe721394","year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.196844Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:a85f7a5940abf71404b515a0d8a0762df04e42c6dc791e825f0d7cc31decb628","observation_id":"8de08f22-5822-486d-bd59-6d72c3f0fcf4","resolution":{"observed_at":"2026-08-11T14:19:33.981781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.30898","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.481980Z","title":"Hierarchical and Stable Multiagent Reinforcement Learning for Cooperative Navigation Control","venue":null,"work_id":"fef4adcb-166c-4535-9870-22e6481a69f6","year":2021},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.201008Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:538d99b85fff4830e41487b307d6fb7f0e53252f776411322be218879581e799","observation_id":"a82aa75a-7150-45f9-a024-0b0d5acb2651","resolution":{"observed_at":"2026-08-11T14:19:33.488755Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.958561Z","title":"Communication in Multi-Agent Reinforcement Learning: Intention Sharing","venue":null,"work_id":"ea9dfcf5-2759-44a2-a9ec-aab1c8affd13","year":2021},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.205701Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:d1e41ab15f60ce82b56c3944de3d4aa831fb6d1fd7e8fe8233ecb186d4ca555b","observation_id":"b5291ebf-3136-4084-8f3a-5482b3e1442a","resolution":{"observed_at":"2026-08-11T14:19:33.963658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.946882Z","title":"SOCIAL DILEMMAS: The Anatomy of Cooperation","venue":null,"work_id":"597e70bc-97b9-4b66-b457-190bd3bb29ed","year":1998},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.209983Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:340144221dc5ced2f50301ac31a32c036c2d48b6f3aad71d5fd148ddf273cfa2","observation_id":"00e82d2f-ba0b-442b-a386-aae343c4d63f","resolution":{"observed_at":"2026-08-11T14:19:33.950745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.213587Z","title":"Communication-Efficient and Federated Multi-Agent Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.213587Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:ba47865f9fbac621f805639aec7f6cd747b9b8a3ce71882765a662bfcf31d10b","observation_id":"42593a57-b929-4530-a7a5-8a71ba40a57c","resolution":{"observed_at":"2026-08-11T14:19:32.213587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.933684Z","title":"Trust Region Policy Optimisation in Multi-Agent Reinforcement Learning","venue":null,"work_id":"d908bc71-5ea2-47b8-be2a-ee109a15d18b","year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.217492Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:1727c24c690e12f5ca6c350dbba97a9451e6283b80ccd938b76ff573c568baa7","observation_id":"b0110ca2-ac21-42d5-b942-bc523e125d5b","resolution":{"observed_at":"2026-08-11T14:19:33.938355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.222122Z","title":"Adaptive Stochastic ADMM for Decentralized Reinforcement Learning in Edge IoT","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.222122Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:35d564177b76af0bc444847171b83b8755af71e54bd194a2f66ad1c6b3ccb508","observation_id":"f9289c9c-adb0-4be8-922b-f9758a912f85","resolution":{"observed_at":"2026-08-11T14:19:32.222122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03037","last_updated":"2017-02-10T01:48:40Z","snapshot_observed_at":"2026-08-02T16:32:14.415500Z","submitted_at":"2017-02-10T01:48:40Z","title":"Multi-agent Reinforcement Learning in Sequential Social Dilemmas","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03037","snapshot_observed_at":"2026-08-11T14:19:32.226247Z","title":"Leibo, Vinicius Zambaldi, Marc Lanctot, Janusz Marecki, and Thore Graepel","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.226247Z"},"links":{"cited_paper":"/paper/1702.03037","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:303fcab3b3fe92647e33dc394d6b4ee20d5081e7e43a36e78bb19b305deddf0d","observation_id":"cf49bacf-c726-4402-8980-8a35d08fea4e","resolution":{"observed_at":"2026-08-11T14:19:32.226247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.920078Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":"46984bd2-a5dd-4193-89cf-9a34b4cf6698","year":2017},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.230577Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:dfc050ffb20737807103ccd320cd29b137276a89d87f16a05570f4a3083401c8","observation_id":"58b8e183-0e69-45a0-abca-4f1e3a63c28d","resolution":{"observed_at":"2026-08-11T14:19:33.925292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.906667Z","title":"Learning dynamics in social dilemmas","venue":null,"work_id":"cedd29ac-51c6-4052-8db9-92ec1e0c724a","year":null},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.234622Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:d0fbdfc8a2b9896e1699e40b55fc53c7274feaf289b1543f2855ec09ab51443d","observation_id":"dba09fe6-56d9-4946-b472-ce7ba02e9e8f","resolution":{"observed_at":"2026-08-11T14:19:33.911359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/science.1064748","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.444018Z","title":"Milinski, D","venue":null,"work_id":"97a29c33-6667-4ca8-9594-4defc2f7c4e5","year":2002},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.238823Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:610093b69ef903b7738662a167dad36d90015ed234f92278084e797d66bf4867","observation_id":"451e8bd8-9595-4d98-886a-105c43fa5d13","resolution":{"observed_at":"2026-08-11T14:19:32.449490Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5890.33059","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.223511Z","title":"Deep Decentralized Multi-task Multi-Agent Reinforcement Learning under Partial Observability","venue":null,"work_id":"4856f9e3-3612-4763-8157-09a53af2b826","year":2017},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.242933Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:19f476062aabdbb187d15235f8d07e688a50bdb3c3ac46c58e8a557b45940c23","observation_id":"1245ba5f-cebe-4dc1-bebe-52bfbac33288","resolution":{"observed_at":"2026-08-11T14:19:33.229751Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/3146384","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.430783Z","title":null,"venue":null,"work_id":"6f72924a-57f4-4465-a50d-a586ed814cbd","year":1990},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.247371Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:b981cebe1675a6ae7004279a3cb4189919ecdff3b4cce522439ec1e541d172d9","observation_id":"578eef1a-158f-4853-a9c0-6f6dc716daf4","resolution":{"observed_at":"2026-08-11T14:19:32.434846Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.892297Z","title":"Schroeder de Witt, Pierre Alexandre Kamienny, Philip H.S","venue":null,"work_id":"7c3259d2-8de6-47df-b141-ce2c79177f6e","year":2021},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.251536Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:490595de14ad46daf5542811872654fa658e4e81722ee6c797c9556cfd3a8b8e","observation_id":"9d47a5e9-ccd3-494b-9f12-172ef710ca86","resolution":{"observed_at":"2026-08-11T14:19:33.896602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.256195Z","title":"Improving Sample Efficiency of Multi-Agent Reinforcement Learning with Non-expert Policy for Flocking Control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.256195Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:a24ab594a16e630e8f4cf4b6463300af243ebe94d921f38a3977bf8f534b7a96","observation_id":"c5c93bb0-e2a8-45f5-bdb4-139c47c3f6a3","resolution":{"observed_at":"2026-08-11T14:19:32.256195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.873144Z","title":"Trust region policy optimization","venue":null,"work_id":"461dbade-a19e-4f19-a926-c433bb315510","year":2015},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.260667Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:bb19b9d10cd63eafafdd7e55cb8c9a7356703f2c2500cd58e3a3a573c25774c6","observation_id":"6d63ad35-e724-4ab4-ae44-d82ef3ebbefb","resolution":{"observed_at":"2026-08-11T14:19:33.881363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.856657Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":"1ef1462d-119e-4e21-b92d-b0fd34917177","year":2016},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.264747Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:0e2f84fffa1053e455a55b7ea621d4b25034c8fa5612f2ca9425d517174224ea","observation_id":"33440bc9-2440-4de8-bfeb-718f759d9b9a","resolution":{"observed_at":"2026-08-11T14:19:33.861430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T14:19:32.269152Z","title":"Proximal Policy Optimization Algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.269152Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:37f2ae51eb13cef8a4efc6ac69990a64fe738317e56352fc5b5b39e640821d7a","observation_id":"f8fd5291-cb14-4fa0-9a97-88d330c78d40","resolution":{"observed_at":"2026-08-11T14:19:32.269152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.273844Z","title":"Policy evaluation for reinforcement learning over asynchronous multi-agent networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.273844Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:8a72f6aba1eef57a913afdebe4b9f992e9cb8e0c9d478836ac43e29d6a963799","observation_id":"18ab4e36-db35-40f0-b7e4-8c4559f291c6","resolution":{"observed_at":"2026-08-11T14:19:32.273844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.842994Z","title":"Dynamic Collaborative Multi-Agent Reinforcement Learning Communication for Autonomous Drone Reforestation","venue":null,"work_id":"b7214b0e-ea4b-4ce4-96dc-4ff09cb6348f","year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.277737Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:93392a9ca3d1151f41c593f41beb13774263f5c6cf8839966faff3ac7088301e","observation_id":"2c1e90a3-c93e-42ff-b5e1-578284e3cd04","resolution":{"observed_at":"2026-08-11T14:19:33.847491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.281639Z","title":"Stankovic, Marko Beko, and Srdjan S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.281639Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:863192a67bc7a344d52ea4c92f8fd6f35d7e0281c1578d094b84d0c1d958c007","observation_id":"45f04930-a628-4ff6-91c2-fbd10b76343f","resolution":{"observed_at":"2026-08-11T14:19:32.281639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.285049Z","title":"Stankovic, Marko Beko, and Srdjan S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.285049Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:2d12cd6e1b65b7b0f1339326cb80f1bd247e075c8615b2c7e475f98e4c632f6e","observation_id":"f283ca85-a102-479c-a4aa-467ee5138516","resolution":{"observed_at":"2026-08-11T14:19:32.285049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03032","last_updated":"2022-11-06T05:38:23Z","snapshot_observed_at":"2026-08-12T13:20:12.712166Z","submitted_at":"2022-11-06T05:38:23Z","title":"Decentralized Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03032","snapshot_observed_at":"2026-08-11T14:19:32.288596Z","title":"Decentralized Policy Optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.288596Z"},"links":{"cited_paper":"/paper/2211.03032","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:0aa2bacd785a9cddbfc1332f78f5bf36022d66b466fc5f8e999ace09aefd5456","observation_id":"7a48e88a-5feb-42c4-92fc-645201acaa17","resolution":{"observed_at":"2026-08-11T14:19:32.288596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.292618Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.292618Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:aa2540f19c570516e76b51051b3943e55091ff83fdfeca2a8c848e4b6279c871","observation_id":"ccb84ab6-98b8-4098-959b-ea53995b484c","resolution":{"observed_at":"2026-08-11T14:19:32.292618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00082","last_updated":"2023-02-15T11:50:24Z","snapshot_observed_at":"2026-08-12T12:40:11.465152Z","submitted_at":"2022-01-31T20:39:48Z","title":"Trust Region Bounds for Decentralized PPO Under Non-stationarity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00082","snapshot_observed_at":"2026-08-11T14:19:32.296024Z","title":"Trust Region Bounds for Decentralized PPO Under Non-stationarity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.296024Z"},"links":{"cited_paper":"/paper/2202.00082","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:1d1e6543ae0abbfcd676d94804decbdb9bd5a53f0a42ca27736b8a0d8e325533","observation_id":"c0b50ea6-9c0c-4f96-a4c6-36b7c6a2bd3b","resolution":{"observed_at":"2026-08-11T14:19:32.296024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ifacol.2020.12.2021","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.418482Z","title":"A multi-agent off-policy actor-critic algorithm for distributed reinforcement learning","venue":null,"work_id":"6c02b090-f824-4a7b-a8af-60642b2409a4","year":2020},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.300716Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:b71272ba630ad6e5dda2496cfcc20c6e2531611f18e0ccc8f65e77680c6ad09f","observation_id":"9f9ec162-f738-4c32-a2a3-264539def5e1","resolution":{"observed_at":"2026-08-11T14:19:32.422543Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08491","last_updated":"2023-08-30T14:43:46Z","snapshot_observed_at":"2026-08-12T13:03:28.660130Z","submitted_at":"2023-01-20T09:36:42Z","title":"Modeling Moral Choices in Social Dilemmas with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2301.08491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.08491","snapshot_observed_at":"2026-08-11T14:19:32.739686Z","title":"Modeling Moral Choices in Social Dilemmas with Multi-Agent Reinforcement Learning","venue":"cs.MA","work_id":"f918279a-40cf-4524-9f16-b753d3c02a4f","year":2023},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.305272Z"},"links":{"cited_paper":"/paper/2301.08491","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:74b9c459f5c923257d844a4096096b9598610afa8d09bd88fbb4fa55a9346050","observation_id":"998d458f-25d5-4bd9-8e02-2396fae9665b","resolution":{"observed_at":"2026-08-11T14:19:32.744828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.309855Z","title":"Van Lange, Jeff Joireman, Craig D","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.309855Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:ad90da46088366fdd5ff2ea2508c2a366f5fe821ca07cd59d44a1672b210ddc0","observation_id":"6fa6032d-d81d-4c0d-a834-df0e9715cd8d","resolution":{"observed_at":"2026-08-11T14:19:32.309855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03516","last_updated":"2022-04-07T15:34:19Z","snapshot_observed_at":"2026-08-12T06:34:41.328191Z","submitted_at":"2022-04-07T15:34:19Z","title":"Distributed Reinforcement Learning for Robot Teams: A Review","version":1},"cited_work":{"arxiv_id":"2204.03516","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03516","snapshot_observed_at":"2026-08-11T14:19:32.721089Z","title":"Distributed Reinforcement Learning for Robot Teams: A Review","venue":"cs.RO","work_id":"822f7f14-e5f3-423e-9a94-509ff05c3e71","year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.313924Z"},"links":{"cited_paper":"/paper/2204.03516","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:c8199b3f403034039cfb5857c1319c0889be782ef5d4c6c3c5c422b7e0deda16","observation_id":"246e360d-6409-41c0-9c70-8dc9a273296d","resolution":{"observed_at":"2026-08-11T14:19:32.725846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.825921Z","title":"Probabilistic recursive reasoning for multi-agent reinforcement learning","venue":null,"work_id":"b40063d9-f554-4c1e-998c-0da6c594aef3","year":2019},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.318204Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:1da720dd1e6f5e0e5b22adaa9720fe70f5bf943aac9c27f0b521dfc6fe47af33","observation_id":"59257c7e-c13f-4606-b6d3-d270b33acacd","resolution":{"observed_at":"2026-08-11T14:19:33.830886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.812381Z","title":"Coordinated Proximal Policy Optimization","venue":null,"work_id":"4e416899-e975-4e17-9ade-6c8701f70087","year":2021},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.322237Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:46330d55fa69a5939ebd791c0afe20f9ff4aee544a94f05b66e95d24c04fa29f","observation_id":"da6a5814-5cd5-473d-819a-6bfe0afd4a81","resolution":{"observed_at":"2026-08-11T14:19:33.817061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.326177Z","title":"Multi-Agent Reinforcement Learning Aided Intelligent UAV Swarm for Target Tracking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.326177Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:1b03f77d145a5677ba6a0aedf7197573fd75cd1562106f42d6eb747e2e5c0a18","observation_id":"12273adc-97b8-4a41-981d-9ef80138d6bc","resolution":{"observed_at":"2026-08-11T14:19:32.326177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08702","last_updated":"2022-06-21T15:38:40Z","snapshot_observed_at":"2026-07-06T12:19:25.743466Z","submitted_at":"2021-12-16T08:43:20Z","title":"Learning to Share in Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2112.08702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.08702","snapshot_observed_at":"2026-08-11T14:19:32.637494Z","title":"Learning to Share in Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"c65cf791-7b3d-4e9c-b1b9-625bb1e45ae6","year":2021},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.329928Z"},"links":{"cited_paper":"/paper/2112.08702","citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:866494e71e890a52659fdadea41a4bff31abc3a5a5e19f7ee0ea21f4bf2ae03b","observation_id":"7ef714b3-833e-4d12-8dd8-e7a2493b65f4","resolution":{"observed_at":"2026-08-11T14:19:32.642168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.333972Z","title":"Networked Multi-Agent Reinforcement Learning in Continuous Spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.333972Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:be27f915acb4bd0be7fe5b06bbb53a67cf78d6ef3d29810bb997327b0f94d883","observation_id":"0a51bcb5-21d6-4958-9b14-673194979588","resolution":{"observed_at":"2026-08-11T14:19:32.333972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.797835Z","title":"Fully decentralized multi-agent reinforcement learning with networked agents","venue":null,"work_id":"5bc890dc-38a7-40b8-82b8-c47963888c5f","year":2018},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.337904Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:17a8b0a401f439f60854cc645340447cebbb6fe038c52bd63a554e93a9086f65","observation_id":"244bbf76-f167-4774-a66e-25f486e73af7","resolution":{"observed_at":"2026-08-11T14:19:33.803461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ifacol.2020.12.1290","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.397825Z","title":"Finite-sample analysis for decentralized cooperative multi-agent reinforcement learning from batch data","venue":null,"work_id":"148e362b-6cf8-451d-9c33-6fdacca385a1","year":2020},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.341778Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:15b30b16ac20caf50094a5548363ab83ab423d88bcc72ad175129f6db31aeb56","observation_id":"65850eb7-d79b-45c2-8674-dcbc5019924d","resolution":{"observed_at":"2026-08-11T14:19:32.401711Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.345482Z","title":"Zavlanos","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.345482Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:1c55aed7e6272b0b77ab393874614c9aec896e2da33ac62245baa6dac80c8550","observation_id":"dd37d025-b62d-45f7-b726-8dc8f10fa8b1","resolution":{"observed_at":"2026-08-11T14:19:32.345482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11768-020-00007-x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:32.383745Z","title":"Distributed policy evaluation via inexact ADMM in multi-agent reinforcement learning","venue":null,"work_id":"e11523fb-b57d-46fd-94cf-8ab6974db8fa","year":2020},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.349609Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:ee59eac67d62c43763842cf48292a61e51194ae1c2c6d33b471278826456dc63","observation_id":"c1177606-0320-48f5-a837-b8fcde538305","resolution":{"observed_at":"2026-08-11T14:19:32.389423Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:19:33.783309Z","title":"A deep Bayesian policy reuse approach against non-stationary agents","venue":null,"work_id":"c4ac373b-c6b8-402f-b07c-fac792b4f7e0","year":2018},"citing_paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T14:19:32.354140Z"},"links":{"citing_paper":"/paper/2412.12326"},"observation_digest":"sha256:0fee2a9b81d9a5cce161dc090f6e21d8c7749d17d8a521a7025b24dcd448e671","observation_id":"9a10b1d2-5b6b-4c01-a513-c2059e1cfd70","resolution":{"observed_at":"2026-08-11T14:19:33.789129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12326","last_updated":"2025-06-16T11:10:31Z","latest_version":2,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-11T14:10:24.030150Z","submitted_at":"2024-12-16T19:44:44Z","title":"Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":20,"verified_exact":11,"verified_fuzzy":20},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2412.12326."}