{"as_of":"2026-08-19T07:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45e17db683be9f5765b8247ff4ac4563f9ba2200e7a94e01100e7d25d44a48d6","coverage":[{"denominator":168,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:42:57.122356Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10142/citation-record","integrity":"/paper/2507.10142/integrity","json":"/paper/2507.10142/citation-record.json","paper":"/paper/2507.10142"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:49.204591Z","title":"A comprehensive survey of multia- gent reinforcement learning.IEEE Transactions on Systems, Man, and Cybernetics, Part C (Applications and Reviews), 38(2):156–172, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.204591Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:c02cabe67b5240e524ce73e24e1a22de9c870122daed47dbc3e9372d5ac8131d","observation_id":"79b5e472-bed4-41ba-b5c8-887dec4dcccf","resolution":{"observed_at":"2026-08-06T17:42:49.204591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01058","last_updated":"2023-12-02T08:04:31Z","snapshot_observed_at":"2026-08-18T10:05:27.315701Z","submitted_at":"2023-12-02T08:04:31Z","title":"A Survey of Progress on Cooperative Multi-agent Reinforcement Learning in Open Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01058","snapshot_observed_at":"2026-08-06T17:42:49.308345Z","title":"A survey of progress on cooperative multi-agent reinforcement learning in open environment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.308345Z"},"links":{"cited_paper":"/paper/2312.01058","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:6012c4ba112d410b661a156fd4300d422716469bc9c4f05b0805ac9a20ea4911","observation_id":"d5201f86-d96c-4afc-850e-6c3a1c0d5475","resolution":{"observed_at":"2026-08-06T17:42:49.308345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:49.395705Z","title":"A survey of multi-agent deep reinforcement learning with communication.Autonomous Agents and Multi-Agent Systems, 38(1):4, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.395705Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:ea9fbed056126240fdaa17c35311edd5c61b3afd2b1af0b9822fcd8e75c74a6c","observation_id":"b0f2f134-c785-428b-86c0-de3151eb2c18","resolution":{"observed_at":"2026-08-06T17:42:49.395705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:49.476155Z","title":"Single and multi-agent deep reinforcement learning for ai-enabled wireless networks: A tutorial","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.476155Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:7d626e5092e055d76f68706bd5a95bd153dfce7f2849108fe1cce2664254212c","observation_id":"cd336ca3-e500-4b0d-9ea8-de6c3136fc11","resolution":{"observed_at":"2026-08-06T17:42:49.476155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:49.546887Z","title":"Multi-agent deep reinforcement learning for multi-robot applica- tions: A survey.Sensors, 23(7):3625, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.546887Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:e1f365046be87cc407f3cb776544a003ff56876e65c07410019f747ade5a6030","observation_id":"70018174-e6d4-4f24-90cb-f8cdbb5dba69","resolution":{"observed_at":"2026-08-06T17:42:49.546887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:49.637985Z","title":"Multi-agent deep reinforcement learning: a survey.Arti- ficial Intelligence Review, 55(2):895–943, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.637985Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:16cd3aba73ea8222bdf0e4879ba1d40ff85173b74e76c9ab4af6529bf1d780e5","observation_id":"e2723a35-7894-4bb9-b300-e293b1d02da8","resolution":{"observed_at":"2026-08-06T17:42:49.637985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03859","last_updated":"2022-09-08T14:58:50Z","snapshot_observed_at":"2026-08-16T16:33:51.295754Z","submitted_at":"2022-09-08T14:58:50Z","title":"A Survey on Large-Population Systems and Scalable Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03859","snapshot_observed_at":"2026-08-06T17:42:49.744069Z","title":"A survey on large-population systems and scalable multi-agent reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.744069Z"},"links":{"cited_paper":"/paper/2209.03859","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:639861ade75a8adf529ed2f58d1dc009bb7b9339d70f2371dcacb8a900941027","observation_id":"696121d7-a3fe-4624-aa0e-322df50c2068","resolution":{"observed_at":"2026-08-06T17:42:49.744069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:49.854258Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms.Handbook of reinforcement learning and control, pages 321–384, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.854258Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:d33091624d066154db1d6fbcfd5bb0a4c57f24f26c56b138b1e148baeaa8923c","observation_id":"f8f5e70e-db62-4177-b0db-980ca59950ff","resolution":{"observed_at":"2026-08-06T17:42:49.854258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:49.980874Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:49.980874Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:ad5965e427083dd20bff9acf7a8271db3604014d7c2f85a7975cbec77a404e5f","observation_id":"235e5c4d-84d6-44bf-9238-820e84b031fd","resolution":{"observed_at":"2026-08-06T17:42:49.980874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.103369Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.103369Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:d90c044716e2f1a9df203e02578db470e0da35b1e52f954b2edd083fbf2c4f6a","observation_id":"8e8b7457-8ad0-4659-a19c-885484f81958","resolution":{"observed_at":"2026-08-06T17:42:50.103369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.165134Z","title":"Deep reinforcement learning: A brief survey.IEEE Signal Processing Magazine, 34(6):26–38, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.165134Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:aeb8308e4297da9f5059d7a443cad154cf1d6ea923f3c5fb21592ea1258175fc","observation_id":"426e0eee-2e97-445b-afbb-3eea80e1e4e6","resolution":{"observed_at":"2026-08-06T17:42:50.165134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.321549Z","title":"Multi-agent reinforcement learning: Independent vs","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.321549Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:bdc7e30387b02696425bfede58d40ae4ede9f690a6dadaa41b6f4b682361a001","observation_id":"e8db56f8-81f9-48c6-b81b-24186bc7a58a","resolution":{"observed_at":"2026-08-06T17:42:50.321549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.420945Z","title":"Mean field multi-agent reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.420945Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:b1390dd6c7e02f058298cdf56bd93cb9c406b98f6a46fbb9bed7537063ff4d89","observation_id":"f29492cd-8904-4fd9-94f5-291d256fe61d","resolution":{"observed_at":"2026-08-06T17:42:50.420945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.514112Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.514112Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f738561f58612e9fe66920e47b40a7f767027b4f3dc2062d88ce3b8c40996ba8","observation_id":"98c18353-78df-4abc-bf33-bd2bd85f988a","resolution":{"observed_at":"2026-08-06T17:42:50.514112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.603384Z","title":"Partially observable mean field reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.603384Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:1c342e27f8417099c8799781acd05bbe67dcfb9dd58c3277fd8984d831c358d5","observation_id":"9297e378-1fce-4a9b-8f71-7bc6345edb63","resolution":{"observed_at":"2026-08-06T17:42:50.603384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.673972Z","title":"Rode: Learning roles to decompose multi-agent tasks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.673972Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:7f17cbe61ed0d423d143b07cd40024df8630dbe24bbf0747144fbfcb65a97f10","observation_id":"16673b40-a680-40dd-ae84-54f199d44cbd","resolution":{"observed_at":"2026-08-06T17:42:50.673972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01682","last_updated":"2022-08-02T18:16:42Z","snapshot_observed_at":"2026-08-16T16:41:37.386351Z","submitted_at":"2022-08-02T18:16:42Z","title":"Heterogeneous-Agent Mirror Learning: A Continuum of Solutions to Cooperative MARL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01682","snapshot_observed_at":"2026-08-06T17:42:50.766527Z","title":"Heterogeneous-agent mirror learning: A continuum of solutions to cooperative marl.arXiv preprint arXiv:2208.01682, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.766527Z"},"links":{"cited_paper":"/paper/2208.01682","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:ad1f86599f56c195a2710cb1ea7b5314414119fb2165aff123b5c45a36540b3c","observation_id":"0843ae6c-cfe7-4429-b545-52d132d0353e","resolution":{"observed_at":"2026-08-06T17:42:50.766527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.836753Z","title":"The surprising effectiveness of PPO in cooperative multi-agent games","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.836753Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:8c9571a86f1cac8214d6bb55408b790d2e774ff0817895fc7c368322b2ea9ee6","observation_id":"7b755f29-f056-402b-85a1-531e3aeb4c24","resolution":{"observed_at":"2026-08-06T17:42:50.836753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:50.883328Z","title":"Trust region policy optimisation in multi-agent reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:50.883328Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:2097565362a8bf8c0690c258b4d68585c0b3a2f840ed73919d689008f7706c82","observation_id":"4c5869a5-f014-4cda-abcf-89e6ca35181a","resolution":{"observed_at":"2026-08-06T17:42:50.883328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:51.014627Z","title":"Learning mean-field games.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.014627Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:fb5cae730ec9c73c22666607c4840f2151f057189474aa3278587527a791a921","observation_id":"ba5a190e-3a9b-41c6-854b-2280b374f3ea","resolution":{"observed_at":"2026-08-06T17:42:51.014627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:51.128565Z","title":"Believewhatyousee: Implicitconstraintapproachforofflinemulti-agent reinforcement learning.Advances in Neural Information Processing Systems, 34:10299–10312, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.128565Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:2a5d5508f2c145822a7db26eb2f73eaf56fc2419b049ea624fcb6a47ac4441cb","observation_id":"05af5343-9291-49f3-851d-cd21fcb346ca","resolution":{"observed_at":"2026-08-06T17:42:51.128565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:51.254380Z","title":"Plan better amid conservatism: Offline multi-agent reinforcement learning with actor rectification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.254380Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:1264313b129504fa905fb1831a1dbc4ae9b506cc8f3f3cef7eaab5f28d83c8d8","observation_id":"a1f5f8ad-56e1-4a5e-aa6b-8f1770f30055","resolution":{"observed_at":"2026-08-06T17:42:51.254380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:51.420357Z","title":"Off-the-grid marl: Datasets and baselines for offline multi-agent reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.420357Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:71eaf3910163f0b0704c2ccf5a2deb37551ed3a7757328c78dae3e026d625a7d","observation_id":"3f9f8dc2-c385-4cdd-bd30-bda11056eafa","resolution":{"observed_at":"2026-08-06T17:42:51.420357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:51.519004Z","title":"Networked multi-agent reinforcement learn- ing in continuous spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.519004Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:3871fb6859ff26b35331cc4c370c5afb4f9cc51785ef263bd9d38434bbae086e","observation_id":"c1abd791-7b37-4b6b-90c7-8d45c50357bd","resolution":{"observed_at":"2026-08-06T17:42:51.519004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:51.631447Z","title":"Fully decentralized multi-agent reinforcement learning with networked agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.631447Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:2ffe842ecbd6303dddf9798c525a460f3d4b9a9251e9409aedbe4aa8b0ebb04f","observation_id":"b8369d25-4724-42ef-b220-93dba4f2d522","resolution":{"observed_at":"2026-08-06T17:42:51.631447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09202","last_updated":"2020-02-11T13:46:23Z","snapshot_observed_at":"2026-08-18T20:12:49.238866Z","submitted_at":"2018-10-22T12:17:40Z","title":"Graph Convolutional Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09202","snapshot_observed_at":"2026-08-06T17:42:51.769161Z","title":"Graph convolutional reinforce- ment learning.arXiv preprint arXiv:1810.09202, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.769161Z"},"links":{"cited_paper":"/paper/1810.09202","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:0acf765fbbb98be70ccd0c3014a7be56c00a7960437a8c885c894f821aac7d0a","observation_id":"12ae6d12-1e4c-4320-b61e-8df57f7649a4","resolution":{"observed_at":"2026-08-06T17:42:51.769161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:51.931293Z","title":"Mambpo: Sample-efficient multi-robot reinforcement learning using learned world models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:51.931293Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:16a22d3a31f4baff89eaf8ebf171db5d165f6a18514ca744bd84db6dabd9c364","observation_id":"c5bfb0a5-5d4a-4406-9cbf-dbf0c4d4cb57","resolution":{"observed_at":"2026-08-06T17:42:51.931293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.033284Z","title":"Mingling foresight with imagination: Model-based cooperative multi-agent reinforcement learning.Advances in Neural Information Processing Systems, 35:11327–11340, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.033284Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:228137d634e12cca237683846238bcd703f48abfc3f177d57762a86433a70b48","observation_id":"f1628151-c620-47ff-b7bc-232a4737f9f5","resolution":{"observed_at":"2026-08-06T17:42:52.033284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15023","last_updated":"2022-05-25T08:35:00Z","snapshot_observed_at":"2026-08-16T16:57:49.893431Z","submitted_at":"2022-05-25T08:35:00Z","title":"Scalable Multi-Agent Model-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15023","snapshot_observed_at":"2026-08-06T17:42:52.132874Z","title":"Scalablemulti-agentmodel-basedreinforcementlearn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.132874Z"},"links":{"cited_paper":"/paper/2205.15023","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:7034f22c71fe909d8e70c4bbd45012db444043ac08f4dde71e3e27059c7b0c0d","observation_id":"dd410ad3-650c-4f5f-8427-59dd1723b374","resolution":{"observed_at":"2026-08-06T17:42:52.132874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12639","last_updated":"2019-12-28T03:03:04Z","snapshot_observed_at":"2026-08-10T20:31:22.283484Z","submitted_at":"2019-10-25T01:26:04Z","title":"MAMPS: Safe Multi-Agent Reinforcement Learning via Model Predictive Shielding","version":2},"cited_work":{"arxiv_id":"1910.12639","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.12639","snapshot_observed_at":"2026-08-06T17:42:59.376953Z","title":"MAMPS: Safe Multi-Agent Reinforcement Learning via Model Predictive Shielding","venue":"eess.SY","work_id":"24c93b95-fe7b-4a90-9b12-025f0c8e30b9","year":2019},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.188678Z"},"links":{"cited_paper":"/paper/1910.12639","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:4d8dc1b86676b56f1d1a6048394c578029d53783fa40b0f1129305726cf87adc","observation_id":"730365c9-7faa-4738-bd25-624fb7dcc895","resolution":{"observed_at":"2026-08-06T17:42:59.380325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.230428Z","title":"Cmix: Deep multi-agent reinforcement learning with peak and average constraints","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.230428Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:4b105670a0c256466a1833548dcbfd830b60685bf450361a7cc06341805e042f","observation_id":"42b8179a-8e2a-4e0b-8455-65cafe8fa10f","resolution":{"observed_at":"2026-08-06T17:42:52.230428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.278175Z","title":"Safe multi-agent reinforcement learning for multi-robot control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.278175Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:2ae967770083ad29ee87e488a1fe9a135f174b45ed9fe800c8d92481cd52f975","observation_id":"9c0295ad-d3f8-4abe-8c72-6a21f3c50382","resolution":{"observed_at":"2026-08-06T17:42:52.278175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.350658Z","title":"Multi- agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.350658Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:ba89a193c3bfbecb501b64315329a6da5204f159983c8cd305ee433674d1dc09","observation_id":"33de91ae-11d5-4864-8ac3-a2c87d441b0d","resolution":{"observed_at":"2026-08-06T17:42:52.350658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.383562Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.383562Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:75c1d39f5131427e3c55f7ae76022c96e5333d52a1cf8f331b9af8e2f03bb1e4","observation_id":"968df221-589d-45a4-9dd7-3c199bdb0cb0","resolution":{"observed_at":"2026-08-06T17:42:52.383562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.464054Z","title":"Value-decomposition networks for cooperative multi-agent learning based on team reward","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.464054Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:27b9244a3098d456444242596d3a11024c5f7596732d0ccae97213eb459877ed","observation_id":"a2b0ea3d-2fdb-4560-b58e-a0181e4df166","resolution":{"observed_at":"2026-08-06T17:42:52.464054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.545315Z","title":"{QPLEX}: Duplex dueling multi-agent q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.545315Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:d796a957af04f303c5dc1e24ec62463127055e95866e49c9a9d9dcfbeab7f87c","observation_id":"9ac68691-e695-462b-ade7-861768e4b6ed","resolution":{"observed_at":"2026-08-06T17:42:52.545315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.629048Z","title":"Maximum entropy heterogeneous-agent reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.629048Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:894f0093602f7063c68f781a094727d57d6c93e5fc36e37e20cefdc44ec23ace","observation_id":"ba858a96-3d44-4313-9dc9-fc19e00628a0","resolution":{"observed_at":"2026-08-06T17:42:52.629048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.723706Z","title":"Heterogeneous-agentreinforcementlearning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.723706Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f8c3696a151022b6bbe6eb6b684567b01cc5d64e97f91193d829c2aa7fb3597e","observation_id":"4d6d0e12-5e14-4f16-9bf0-0e082fc43a13","resolution":{"observed_at":"2026-08-06T17:42:52.723706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.786486Z","title":"Metadrive: Composing diverse driving scenarios for generalizable reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.786486Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f6333d53d9a737bfe6709cdd7d8a6cfaec4f5af981b31e00cc5d16b3ba24c346","observation_id":"9799ffa7-ab9b-4e4f-8663-bd88c8c11cef","resolution":{"observed_at":"2026-08-06T17:42:52.786486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.867152Z","title":"Smarts: Scalable multi-agent reinforcement learning training school for autonomous driving, 11 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.867152Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:51d2a562004276cc5f74c8081bab725c7387e7e747b1695601c1a6ebeefacd7c","observation_id":"68e57559-9b2f-4ad9-862f-7fce322b378f","resolution":{"observed_at":"2026-08-06T17:42:52.867152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.957454Z","title":"Multi-agent reinforcement learning aided intelligent uav swarm for target tracking","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.957454Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:695df5d1341993eda83bc605c7b2c004be5c048323714306b8f3d435030e3a9c","observation_id":"afb1cddd-2469-47a0-ab2d-5a77b2d1e01d","resolution":{"observed_at":"2026-08-06T17:42:52.957454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:52.996869Z","title":"Mean-field theory for scale-free random networks","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:52.996869Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:431888cec4b3beb664c6e4d1ad281c9d4dac2e2599f6a4f24836225007377b36","observation_id":"c8394315-7eb7-46f0-b0b2-8ef85c7983fe","resolution":{"observed_at":"2026-08-06T17:42:52.996869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.063316Z","title":"Mean field games and mean field type control theory, volume 101","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.063316Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:6302af8b9661e55d86f7c1192d38493536d296721a52db5950ce80965c348f9a","observation_id":"5db80373-f978-48a4-8a4d-761293c3d6aa","resolution":{"observed_at":"2026-08-06T17:42:53.063316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.119077Z","title":"Optimal control of partially observable markovian systems.Journal of The Franklin Institute, 280(5):367–386, 1965","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.119077Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:593feaba5b5b8cd392cd541a5e047b8c43f4e8134b0bb363432c033c424b26e4","observation_id":"3606999c-b135-4006-a4d4-0ccdf8d31dcb","resolution":{"observed_at":"2026-08-06T17:42:53.119077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.249734Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.249734Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:65ece521f0a4e9771fbdf8b65a997718900a6890b8dcca1a9432419f9ab04783","observation_id":"1a30baf4-9bf6-402d-a8c3-928413191b87","resolution":{"observed_at":"2026-08-06T17:42:53.249734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T17:42:53.309762Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.309762Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:6bf18cec57d424b447dbaf1296c03fb9631b5e3b3c6e6d157650600c1a32c438","observation_id":"3b50b0b9-de87-4b6d-acb5-d477c186496d","resolution":{"observed_at":"2026-08-06T17:42:53.309762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.418145Z","title":"Off-policy deep reinforcement learning with- out exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.418145Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:cb4bb5562bc9413be35eb3b6c8fd7520c560801d171cfeab0148a83255e55cf2","observation_id":"066bd643-83c4-4ed3-bbb9-4ac20b2eaca4","resolution":{"observed_at":"2026-08-06T17:42:53.418145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.493625Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.493625Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:44fa6bc24bb5d5a23667f789cdc68b687d71b0b9fa152df6c4ec9c81ef9b7b88","observation_id":"dd90c377-709e-4c4c-8c86-e90e86655d27","resolution":{"observed_at":"2026-08-06T17:42:53.493625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.565420Z","title":"A review of cooperative multi-agent deep rein- forcement learning.Applied Intelligence, 53(11):13677–13722, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.565420Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f6ac11d316add9ffb056291b9f2cd7de4b3b688cbc72fdb0a3f26ecaddb5dc65","observation_id":"b23a61ee-781c-413f-9251-76f4793effce","resolution":{"observed_at":"2026-08-06T17:42:53.565420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-16T16:58:50.532049Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-06T17:42:53.625181Z","title":"A review of safe reinforcement learning: Methods, theory and applications.arXiv preprint arXiv:2205.10330, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.625181Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:4efb95070aa7d3ca7e8d66b282a2e3c8e813109d6c3d1fed276797ae785f56ac","observation_id":"6d5ebb4b-2f56-4c4c-a0b4-c539cb611fa1","resolution":{"observed_at":"2026-08-06T17:42:53.625181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.09533","last_updated":"2020-11-18T20:29:59Z","snapshot_observed_at":"2026-08-19T03:09:02.515007Z","submitted_at":"2020-11-18T20:29:59Z","title":"Is Independent Learning All You Need in the StarCraft Multi-Agent Challenge?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.09533","snapshot_observed_at":"2026-08-06T17:42:53.723048Z","title":"Is independent learning all you need in the starcraft multi-agent challenge?arXiv preprint arXiv:2011.09533, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.723048Z"},"links":{"cited_paper":"/paper/2011.09533","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:7c37d97b35c666de943de2cc81d2621bddcc50b3017d571b0232080cc323af63","observation_id":"7e8f0393-2fad-4f5b-9c8a-e71f9b3cd339","resolution":{"observed_at":"2026-08-06T17:42:53.723048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09183","last_updated":"2019-03-11T20:17:29Z","snapshot_observed_at":"2026-08-18T01:04:44.186355Z","submitted_at":"2017-07-28T10:49:41Z","title":"A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.09183","snapshot_observed_at":"2026-08-06T17:42:53.778345Z","title":"A survey of learning in multiagent environments: Dealing with non-stationarity.arXiv preprint arXiv:1707.09183, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.778345Z"},"links":{"cited_paper":"/paper/1707.09183","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:b589ad529f6fad23c142091b2a976d121aa9f689c0601f2721b8c9840aaf8530","observation_id":"0e71f0e7-e243-44ff-9ab6-3c5b43416426","resolution":{"observed_at":"2026-08-06T17:42:53.778345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.819779Z","title":"Bench- marking multi-agent deep reinforcement learning algorithms in cooperative tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.819779Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:d9b36e19f453f7008b1b1e076edefc06c7318123e02bcdeeeb59e132fef3bc4a","observation_id":"7087da8f-895d-42b2-b821-96b7724e497b","resolution":{"observed_at":"2026-08-06T17:42:53.819779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.882712Z","title":"Qtran: Learning to factorize with transformation for cooperative multi-agent reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.882712Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:50a3c5b93d12c90d87455ba58e5ef3eff6f78c85a13c09fbf65fd358764aac67","observation_id":"6b8cd852-ba1b-4e12-820d-f6579cc41dcf","resolution":{"observed_at":"2026-08-06T17:42:53.882712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:53.961293Z","title":"Weighted qmix: Ex- panding monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.961293Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:13cc6df3bd584de7ba0cd3edb3f0bba7e311bd31b090dbd1e40b6877d772b6f1","observation_id":"17c844a7-f063-4d85-b255-7d2199ea6984","resolution":{"observed_at":"2026-08-06T17:42:53.961293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.070237Z","title":"On the approximation of cooperative heterogeneous multi-agent reinforcement learning (marl) using mean field control (mfc).Journal of Machine Learning Research, 23(129):1–46, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.070237Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:82638600beb12c79a3a4957d6157b3ba6ad5280278f030333de84bdea7b9b01e","observation_id":"b4afce7d-2c9f-4335-9bda-d28de958d940","resolution":{"observed_at":"2026-08-06T17:42:54.070237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.140245Z","title":"Multi type mean field reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.140245Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:1f0f33c8ac07666ff2395b3fd4ec31d5aca4cfff3e86eeb43f057f979f058751","observation_id":"5b40a73a-daa7-4048-9d87-2312d28f4230","resolution":{"observed_at":"2026-08-06T17:42:54.140245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.204300Z","title":"Efficient model-based multi-agent mean- field reinforcement learning.Transactions on Machine Learning Research, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.204300Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:358a50a9ebc3ff7110a7b75167d4e4514c86124586100416cf986b41ab212952","observation_id":"1af8edd8-ce22-4ac3-b536-a821161c6de6","resolution":{"observed_at":"2026-08-06T17:42:54.204300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06434","last_updated":"2022-02-07T02:12:12Z","snapshot_observed_at":"2026-08-16T18:10:12.886207Z","submitted_at":"2021-07-14T00:34:08Z","title":"Centralized Model and Exploration Policy for Multi-Agent RL","version":2},"cited_work":{"arxiv_id":"2107.06434","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06434","snapshot_observed_at":"2026-08-06T17:42:59.335272Z","title":"Centralized Model and Exploration Policy for Multi-Agent RL","venue":"cs.AI","work_id":"40ee936e-02f2-4085-93ae-2106a9d8f8e3","year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.298216Z"},"links":{"cited_paper":"/paper/2107.06434","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:6624c4e7194ffa76280140c1db837e5d43f4d37af97876571cc543caccd67c1d","observation_id":"615c251b-16ed-45fd-ba04-a7212c1dff1c","resolution":{"observed_at":"2026-08-06T17:42:59.338847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.369128Z","title":"Model-based opponent modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.369128Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:a4037ed156269e5aabe19489ae865b7b6e1e5fb33e6662ff28039303f8b751f5","observation_id":"6e99958c-96ee-4e23-8233-8f5ed1c2173f","resolution":{"observed_at":"2026-08-06T17:42:54.369128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.452841Z","title":"Decentralized policy gradient descent ascent for safe multi-agent reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.452841Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:dfb22703041d16bf67971f076a0f110e625df5b70695d70feae05d72d5fbdbb7","observation_id":"05fb65e1-6447-4cf5-9c30-fc7f732f9cd2","resolution":{"observed_at":"2026-08-06T17:42:54.452841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.517414Z","title":"Shield decentralization for safe multi-agent reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.517414Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:a8127d787cb514e7450149c6f4af6040cce3ce4ea04a95f9c9a4a94c65840595","observation_id":"9b0c29b1-8e7a-4a0d-9a5a-ee28ed5fbf3a","resolution":{"observed_at":"2026-08-06T17:42:54.517414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.576599Z","title":"Scalable primal- dual actor-critic method for safe multi-agent rl with general utilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.576599Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:1301df024bfeb691c0ca43190da4170ce4f5645950a94e091f65e0aa7435cf93","observation_id":"7e2bbb27-78af-4e0b-8495-1fdfb8b77f7b","resolution":{"observed_at":"2026-08-06T17:42:54.576599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.650052Z","title":"Multiagent planning with factored MDPs","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.650052Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:c13e148159d1a7bf9c28573ddfb63c44ae975c8951a73116ad669406d08e7bad","observation_id":"88bc0658-dabb-4d83-aede-6a309bf8511e","resolution":{"observed_at":"2026-08-06T17:42:54.650052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.718729Z","title":"Efficient solution algorithms for factored mdps.Journal of Artificial Intelligence Research, 19:399–468, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.718729Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:d2599e89ee9e7a7c151920f391cf7c4b926b8a25939bdf93f6e6af801b77b68b","observation_id":"2a87f53b-e471-4d6c-b1b9-9df15f0e0cb0","resolution":{"observed_at":"2026-08-06T17:42:54.718729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.775700Z","title":"Coordinated reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.775700Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:ae087d6c146d767a6363dbc4befee6302d47f664705c8aebffae94e09ee7880e","observation_id":"392b09ff-5c2e-4593-a266-943da601bd9e","resolution":{"observed_at":"2026-08-06T17:42:54.775700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.855846Z","title":"Sparse cooperative q-learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.855846Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:4da93408ee23098e88b28da409532b2f0f61c1c3e6b4eafd0c22396867cd90e8","observation_id":"011e0078-26ba-4f09-819d-3602cd67d4b6","resolution":{"observed_at":"2026-08-06T17:42:54.855846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.904297Z","title":"Kok and Nikos Vlassis","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.904297Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:ba6cdf3f139ac00dab32f17e317535933a113a6b01295fcc4c19dce81448941a","observation_id":"7b0fb32c-aa30-4af7-a32f-531c467cac40","resolution":{"observed_at":"2026-08-06T17:42:54.904297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:54.974180Z","title":"Networked distributed pomdps: A synthesis of distributed constraint optimization and pomdps","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:54.974180Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:1a151c3124a4fd47f18deecd98422f78750c27f6bcc9f54d493250f38f021052","observation_id":"a4a7f225-f1ef-4cac-8873-6794cef8c31f","resolution":{"observed_at":"2026-08-06T17:42:54.974180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.037660Z","title":"Approximate solutions for factored dec-pomdps with many agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.037660Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:088106b3caf1049920589aa4809a3d7748c25fa888280e9f0423ef3d09991b16","observation_id":"703ab691-d170-41c1-9932-9fd21da1706b","resolution":{"observed_at":"2026-08-06T17:42:55.037660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.090469Z","title":"Scalable reinforcement learning of localized policies for multi-agent networked systems","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.090469Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:bb28fbdc206aa0affd7744216d20e9bbc123e83277093bb0f3db612f84fd3b53","observation_id":"8627cbeb-7a74-4c0c-8750-8ea9e243ae45","resolution":{"observed_at":"2026-08-06T17:42:55.090469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.147227Z","title":"Multi-agent reinforcement learning in stochastic networked systems.Advances in neural information processing systems, 34:7825–7837, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.147227Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:cdd11915a832b27fe3fcce8684333b72012a3237d9fc772f3c30a82cca7f926a","observation_id":"4f704428-c377-4535-b5a6-1b81b6069ab9","resolution":{"observed_at":"2026-08-06T17:42:55.147227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06771","last_updated":"2022-04-28T13:44:53Z","snapshot_observed_at":"2026-08-17T10:48:49.186660Z","submitted_at":"2021-12-09T08:40:38Z","title":"Cooperative Multi-Agent Reinforcement Learning with Hypergraph Convolution","version":2},"cited_work":{"arxiv_id":"2112.06771","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.06771","snapshot_observed_at":"2026-08-06T17:42:59.322468Z","title":"Cooperative Multi-Agent Reinforcement Learning with Hypergraph Convolution","venue":"cs.AI","work_id":"20abc353-9cdf-4b93-a725-4e2b51b9fdf4","year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.231411Z"},"links":{"cited_paper":"/paper/2112.06771","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f40b12e971e84c838caf398a201126bc27e0e9cce2fef6205736cffdb7d3eea7","observation_id":"f873834b-6371-43e7-bb08-66b5eee707fa","resolution":{"observed_at":"2026-08-06T17:42:59.327250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03265","last_updated":"2022-10-11T10:53:59Z","snapshot_observed_at":"2026-08-16T17:16:30.595803Z","submitted_at":"2022-03-07T10:34:40Z","title":"Efficient Policy Generation in Multi-Agent Systems via Hypergraph Neural Network","version":2},"cited_work":{"arxiv_id":"2203.03265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.03265","snapshot_observed_at":"2026-08-06T17:42:59.309802Z","title":"Efficient Policy Generation in Multi-Agent Systems via Hypergraph Neural Network","venue":"cs.AI","work_id":"2253915a-6d4c-483e-8ac3-3fbe8a4f641e","year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.306176Z"},"links":{"cited_paper":"/paper/2203.03265","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f341840e51f3a2b026994da5376059c06f316bd8a6f1258247e00b1c25bf8655","observation_id":"84bdabf7-7355-455e-a5c9-76ee6cd09aef","resolution":{"observed_at":"2026-08-06T17:42:59.313251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.378780Z","title":"Magent: Amany-agentreinforcementlearningplatformforartificialcollectiveintelligence","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.378780Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:fc5a0749f2e1cb754137448af127a540deccf3698e76da9f95daf3cf18caa316","observation_id":"ac6d326e-eccc-40b4-a831-ad126e5cc38c","resolution":{"observed_at":"2026-08-06T17:42:55.378780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.437727Z","title":"Partially observable mean field reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.437727Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:0350fcd1c4bf772eef69bc1831200f5d0fe141adb28efd36a74e652f4a1a66c0","observation_id":"ef7c0188-9e16-498d-b2b6-f31da72bf65d","resolution":{"observed_at":"2026-08-06T17:42:55.437727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12802","last_updated":"2021-10-13T17:57:21Z","snapshot_observed_at":"2026-08-18T21:59:55.444720Z","submitted_at":"2019-10-28T16:56:46Z","title":"Model-Free Mean-Field Reinforcement Learning: Mean-Field MDP and Mean-Field Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12802","snapshot_observed_at":"2026-08-06T17:42:55.493100Z","title":"Model-free mean-field reinforcement learning: mean-field MDP and mean-field Q-learning.arXiv:1910.12802, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.493100Z"},"links":{"cited_paper":"/paper/1910.12802","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:a7c7a289a67a505649f873118304c56765531a8e28ad0af5caea336ea1c0665a","observation_id":"cf61d131-fffc-4ce6-9570-c4ede11667d5","resolution":{"observed_at":"2026-08-06T17:42:55.493100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02731","last_updated":"2022-02-19T23:36:18Z","snapshot_observed_at":"2026-08-18T15:47:04.086977Z","submitted_at":"2021-08-05T16:52:36Z","title":"Mean-Field Multi-Agent Reinforcement Learning: A Decentralized Network Approach","version":2},"cited_work":{"arxiv_id":"2108.02731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.02731","snapshot_observed_at":"2026-08-06T17:42:59.289935Z","title":"Mean-Field Multi-Agent Reinforcement Learning: A Decentralized Network Approach","venue":"cs.LG","work_id":"abd8e783-1e71-47b1-a7d7-57395714cf01","year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.567860Z"},"links":{"cited_paper":"/paper/2108.02731","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:e821493092d9b885013586d92456c8114bd43333dadb774f9a2139b8fd2caa63","observation_id":"ad84a013-25ce-4147-8a77-c11f6c8a8d2b","resolution":{"observed_at":"2026-08-06T17:42:59.294140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.647180Z","title":"Swarm robotics: a review from the swarm engineering perspective.Swarm Intelligence, 7:1–41, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.647180Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:3d2f8e10030db53fbaa10a3cf709109c41b70b228fd1f207a217c68bd7f92eab","observation_id":"b2e4bd79-8882-4cce-a2a0-159e1d9a4ecc","resolution":{"observed_at":"2026-08-06T17:42:55.647180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.723684Z","title":"Neural mmo 2.0: A massively multi-task addition to massively multi-agent learning.Advances in Neural Information Processing Systems, 36:50094–50104, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.723684Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f8b7481d85478c5eeb7459daad60c6e3dc0e75dcf012d18c333253dcb7da7917","observation_id":"ec4f636b-5848-4156-87fa-410f48e704c3","resolution":{"observed_at":"2026-08-06T17:42:55.723684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.791882Z","title":"Bsk-rl: Modular, high-fidelity reinforcement learning environments for spacecraft tasking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.791882Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:e148cccc45d049339433292d8312ee1b6238a830574db4dca0955d6ea6785049","observation_id":"a38645d7-db43-4e74-8ec1-58c0e8138c6c","resolution":{"observed_at":"2026-08-06T17:42:55.791882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.858348Z","title":"Multi-agent reinforcement learning for active voltage control on power distribution networks.Advances in Neural Information Processing Systems, 34:3271–3284, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.858348Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:681220c31b7a69a1f9da7d18c7fefbcb8366b4ff15ba128c675fa01ea638730b","observation_id":"6859b8f1-f144-43ab-83d2-96f18b3de7ae","resolution":{"observed_at":"2026-08-06T17:42:55.858348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:55.950091Z","title":"Updet: Universal multi-agent rl via policy decoupling with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:55.950091Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:d2a8eefe803515cd1f1c23befbf61c9fb9ba1d375b655cb6b0d48358a195c2cc","observation_id":"b26e763f-8eb5-476b-8f9a-56764aff8f5f","resolution":{"observed_at":"2026-08-06T17:42:55.950091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.014785Z","title":"Randomized entity-wise factorization for multi-agent reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.014785Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:a76b7de3b55ab226188eeb90e72284929b5e4729f55cd1053d37140f454df539","observation_id":"c043b144-fdd1-454a-ac53-87b11891cea0","resolution":{"observed_at":"2026-08-06T17:42:56.014785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.069997Z","title":"Boosting multiagent reinforcement learning via permutation invariant and permutation equivariant networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.069997Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:2b6b540000882639468a0d6e007435b5a6b544fb1333b2c45eee2d42246435ff","observation_id":"00c49b66-a4cd-440c-9783-ec533dddb001","resolution":{"observed_at":"2026-08-06T17:42:56.069997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-14T17:37:44.544678Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-08-06T17:42:56.131650Z","title":"The starcraft multi-agent challenge.arXiv preprint arXiv:1902.04043, 2019","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.131650Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:374597c2796575df4adfff254085e4534cc684d0f7ca2cb9af30c53798086e68","observation_id":"e9bd22fd-2bb8-446d-990b-08be171f2651","resolution":{"observed_at":"2026-08-06T17:42:56.131650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.226171Z","title":"Cityflow: Amulti-agentreinforcementlearning environment for large scale city traffic scenario","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.226171Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:1c0ec5fd80609cc9d925c81c7479917e07762eaefc32ba7ca5b48f5d3a270f52","observation_id":"36df1842-a95a-4bdb-93c3-dc215743678e","resolution":{"observed_at":"2026-08-06T17:42:56.226171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.270406Z","title":"Google research football: A novel reinforcement learning environment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.270406Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:f2b2e2c083a18bef7ccfb0f88720b564dcae87461ea0d89a73a0a430b400cdba","observation_id":"52a69144-0bea-4f2f-b124-1db10b013dc5","resolution":{"observed_at":"2026-08-06T17:42:56.270406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.322930Z","title":"Shaq: Incorporating shap- ley value theory into multi-agent q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.322930Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:2a254fb7cb0724910d672631bc3627fd23b0b4ced60483eb0d9b8c96bc54084d","observation_id":"37e2b72f-7a80-44e7-91f6-0be1028f01e4","resolution":{"observed_at":"2026-08-06T17:42:56.322930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.394074Z","title":"Learning correlated communication topology in multi-agent reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.394074Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:8f51e3da95187a0ffcc77f215aada8c2df395c869f98cdb6d4f3e23192c30739","observation_id":"968eed5f-7fca-41b0-b009-f27a79e367e0","resolution":{"observed_at":"2026-08-06T17:42:56.394074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.448222Z","title":"Facmac: Factored multi-agent centralised policy gradients","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.448222Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:a799a31bca490d445c85df6c1573ba31350a10ea2af9be293febeb7a7718ad12","observation_id":"5a882716-132c-496b-86b1-6eed3294d532","resolution":{"observed_at":"2026-08-06T17:42:56.448222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.507030Z","title":"Shapley q-value: A local reward approach to solve global reward games","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.507030Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:05469c0adfd47e4df528cb5e49e9b7d63a038e99900f1c98602671ab7421caeb","observation_id":"187d299c-0158-4063-ad9d-51dab532fe3a","resolution":{"observed_at":"2026-08-06T17:42:56.507030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00372","last_updated":"2025-03-01T07:01:58Z","snapshot_observed_at":"2026-08-19T02:15:21.945691Z","submitted_at":"2025-03-01T07:01:58Z","title":"Nucleolus Credit Assignment for Effective Coalitions in Multi-agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.00372","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.00372","snapshot_observed_at":"2026-08-06T17:42:59.269899Z","title":"Nucleolus Credit Assignment for Effective Coalitions in Multi-agent Reinforcement Learning","venue":"cs.MA","work_id":"d383c600-97f7-4576-9a90-d4d13f54b705","year":2025},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.617713Z"},"links":{"cited_paper":"/paper/2503.00372","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:5250f250091a7a8cfa13926d259dfce3cc1abe7008f739d854d621133def80d9","observation_id":"97825d7d-1f68-4e67-b6d2-acb5dbdb88aa","resolution":{"observed_at":"2026-08-06T17:42:59.273844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.688063Z","title":"Model-free mean-field reinforcement learning: mean-field mdp and mean-field q-learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.688063Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:55233cd2bfac49b4178f8a28faf75b359463477bedf34abdc81edfa68b3ec310","observation_id":"84bf7819-75ae-4946-a4bc-0d9d3a9ee72b","resolution":{"observed_at":"2026-08-06T17:42:56.688063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.755100Z","title":"Learning to communicate with deep multi-agent reinforcement learning.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.755100Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:d750d037ab4ebe7341c01736c5c915d55b4f350c3a0d56224a8d4a6dd4683492","observation_id":"2313382a-c76e-4846-a8df-201d1c4cfa00","resolution":{"observed_at":"2026-08-06T17:42:56.755100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.843848Z","title":"Learning multiagent communication with backprop- agation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.843848Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:08009d9682806ebecc23175055fb1fd4e10e34bc7a8808f531ce283562c4d856","observation_id":"a98fdd1a-6609-4746-ab49-8ab009cdc1d8","resolution":{"observed_at":"2026-08-06T17:42:56.843848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:56.912357Z","title":"Learning structured communication for multi-agent reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.912357Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:9d6f1857bfaab0fc588958cc14f1be082a56d52b5c15ef8360f24970d9d89383","observation_id":"597d1900-586b-4566-a113-b6fec07fe698","resolution":{"observed_at":"2026-08-06T17:42:56.912357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03363","last_updated":"2022-03-16T18:51:38Z","snapshot_observed_at":"2026-08-16T18:26:19.117767Z","submitted_at":"2021-05-07T16:20:22Z","title":"Model-based Multi-agent Policy Optimization with Adaptive Opponent-wise Rollouts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03363","snapshot_observed_at":"2026-08-06T17:42:56.998822Z","title":"Model-based multi-agent policy optimization with adaptive opponent-wise rollouts.arXiv preprint arXiv:2105.03363, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:56.998822Z"},"links":{"cited_paper":"/paper/2105.03363","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:5f92f272de87699c6488720323c23a1b2f5324f1eb1fcbd56245563efda0462c","observation_id":"6b479907-8072-4f78-a28e-4c5e8b2aae38","resolution":{"observed_at":"2026-08-06T17:42:56.998822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:57.052121Z","title":"Offline pre-trained multi-agent decision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:57.052121Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:563a98336fb86da14e7587a32bc100457b7f3b985e4477a702a2523567ef1c82","observation_id":"9801fe57-121e-478f-aa61-f1a24951ddf2","resolution":{"observed_at":"2026-08-06T17:42:57.052121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:57.122356Z","title":"Hgap: boosting permutation invariant and permutation equivariant in multi-agent reinforcement learning via graph attention network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:57.122356Z"},"links":{"citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:cbd0663dbdea63870c6b9596a631d53bfbc6b6441435d70f30324f12c808574d","observation_id":"7606781d-9617-4c41-a680-c24168f5da4b","resolution":{"observed_at":"2026-08-06T17:42:57.122356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T17:28:57.910671Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":168},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 168 outbound references and 0 inbound Pith citation observations for arXiv:2507.10142."}