{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:403b4fbbd0b1b82c652b0fc45c11f496359bfc0bb342c011653f81814f0b2ee9","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:31:04.600502Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.10340/citation-record","integrity":"/paper/2508.10340/integrity","json":"/paper/2508.10340/citation-record.json","paper":"/paper/2508.10340"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:01.616005Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:01.616005Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:05367acecf28d02c4ca783b8f43111756f7ae849526afcf9af34252d30c07397","observation_id":"6a9b5422-628b-4426-b94a-c5223b25693d","resolution":{"observed_at":"2026-08-05T20:31:01.616005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:01.687998Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:01.687998Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:3fc60196f15966d9cb907527c7ed0727b9d0c66a4efd04cf1475a5f205b01524","observation_id":"e98ed10d-7f4e-4528-9f95-a7bab16af734","resolution":{"observed_at":"2026-08-05T20:31:01.687998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:07.985067Z","title":null,"venue":null,"work_id":"af4d2f44-b47d-4f92-a896-60802776cbdf","year":2020},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:01.778601Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:88a2a6a7a1d7b9d2f0bb00978c3e599964654ae141d507099d5753a4578e1c5a","observation_id":"55d8aa98-a54d-4e99-aa28-dc0268b5f2d7","resolution":{"observed_at":"2026-08-05T20:31:08.043669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:07.845824Z","title":"C.; Di Nunzio, L.; Fazzolari, R.; Giardino, D.; Re, M.; and Span \\`o , S","venue":null,"work_id":"d98b3702-273e-4288-a45f-2f8488c3ca03","year":2021},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:01.884398Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:9893422da9cc8c4bb7e5a6d8dcc468dec0ee10f9f1f9cf0369c05c1fe387d568","observation_id":"e50b22ef-bec7-4336-92c4-32c91868492f","resolution":{"observed_at":"2026-08-05T20:31:07.900698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.09533","last_updated":"2020-11-18T20:29:59Z","snapshot_observed_at":"2026-08-06T15:48:23.562152Z","submitted_at":"2020-11-18T20:29:59Z","title":"Is Independent Learning All You Need in the StarCraft Multi-Agent Challenge?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.09533","snapshot_observed_at":"2026-08-05T20:31:02.015643Z","title":"S.; Gupta, T.; Makoviichuk, D.; Makoviychuk, V.; Torr, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.015643Z"},"links":{"cited_paper":"/paper/2011.09533","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:d0e6df74c59b715bc0d119fb6d7c99a6a6f391c83f52ff57450acc13d651f7ab","observation_id":"fe83a0c0-68b9-41ed-9c36-27b5f677bcc3","resolution":{"observed_at":"2026-08-05T20:31:02.015643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:07.647189Z","title":null,"venue":null,"work_id":"96baa922-2365-4c82-a824-3e99d25b34ea","year":2024},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.126336Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:04bc8d0ff3c7bfde4c9356379d0ef2ae123a5314a599aded473dc6d6ce135375","observation_id":"19940b95-044d-4479-a496-1b41d47b7438","resolution":{"observed_at":"2026-08-05T20:31:07.720190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05053","last_updated":"2023-10-08T07:26:35Z","snapshot_observed_at":"2026-08-09T20:51:36.200913Z","submitted_at":"2023-10-08T07:26:35Z","title":"FP3O: Enabling Proximal Policy Optimization in Multi-Agent Cooperation with Parameter-Sharing Versatility","version":1},"cited_work":{"arxiv_id":"2310.05053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05053","snapshot_observed_at":"2026-08-05T20:31:05.240495Z","title":"FP3O: Enabling Proximal Policy Optimization in Multi-Agent Cooperation with Parameter-Sharing Versatility","venue":"cs.LG","work_id":"6768ec0b-c339-4b21-9412-31f837dfbb8d","year":2023},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.202547Z"},"links":{"cited_paper":"/paper/2310.05053","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:3f01ba3b0e9664f1159ea21551d9abb5911cb4d28ea72eaba700e3324d1450ed","observation_id":"aae1aa7b-4ad2-4643-90d8-a2e9a6a96744","resolution":{"observed_at":"2026-08-05T20:31:05.305714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:07.444109Z","title":"G.; Chen, Y.; Du, Y.; Yang, L.; Knoll, A.; and Yang, Y","venue":null,"work_id":"46269e83-b960-4b68-9c84-38d1e983de93","year":2023},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.264188Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:9d8fe31bb5b607db61e4295987fe28ba57835af2ed23499a06a9e47bc3820012","observation_id":"7a5036b0-f4cd-4a9a-ae3d-aee386adfb37","resolution":{"observed_at":"2026-08-05T20:31:07.541025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:07.317763Z","title":null,"venue":null,"work_id":"a788f152-1219-4ad3-a043-e64bfb1fbd84","year":2013},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.354528Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:222fa12e0f76472d033a3733ff278a128ed9fe5b58f76add9d9e47fec38e2e54","observation_id":"a609de09-31c4-4264-b9be-4dc61cb7b598","resolution":{"observed_at":"2026-08-05T20:31:07.371838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11251","last_updated":"2022-04-04T06:39:20Z","snapshot_observed_at":"2026-08-09T20:50:35.771527Z","submitted_at":"2021-09-23T09:44:35Z","title":"Trust Region Policy Optimisation in Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11251","snapshot_observed_at":"2026-08-05T20:31:02.434225Z","title":"G.; Chen, R.; Wen, M.; Wen, Y.; Sun, F.; Wang, J.; and Yang, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.434225Z"},"links":{"cited_paper":"/paper/2109.11251","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:12a12ab21df39c1df195cf6cf86018bbca5a404a0dfe4eac5c330a39ea7c9d61","observation_id":"924df6fc-5af8-4b3f-8a73-96966cc68a29","resolution":{"observed_at":"2026-08-05T20:31:02.434225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01682","last_updated":"2022-08-02T18:16:42Z","snapshot_observed_at":"2026-07-06T13:38:05.839536Z","submitted_at":"2022-08-02T18:16:42Z","title":"Heterogeneous-Agent Mirror Learning: A Continuum of Solutions to Cooperative MARL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01682","snapshot_observed_at":"2026-08-05T20:31:02.534597Z","title":"G.; Feng, X.; Ding, S.; Dong, H.; Wang, J.; and Yang, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.534597Z"},"links":{"cited_paper":"/paper/2208.01682","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:4c5d23a235b1a6e875d28f3ce6fdcf1fe4d422bdae168d9ee3162e9a6abb217f","observation_id":"b898df75-b2ed-49ef-be8a-d99c77fbe0ca","resolution":{"observed_at":"2026-08-05T20:31:02.534597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11831","last_updated":"2024-07-05T02:55:49Z","snapshot_observed_at":"2026-07-06T18:01:57.998555Z","submitted_at":"2024-04-18T01:27:02Z","title":"JointPPO: Diving Deeper into the Effectiveness of PPO in Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11831","snapshot_observed_at":"2026-08-05T20:31:02.610322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.610322Z"},"links":{"cited_paper":"/paper/2404.11831","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:71a6797f160ae6a9ca65d8001c6cdded6caa35152c11d7cd78baab4fb7e8ff95","observation_id":"f8e47238-dac4-44e7-8eba-39a9b7f58bd4","resolution":{"observed_at":"2026-08-05T20:31:02.610322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10715","last_updated":"2025-03-12T20:29:23Z","snapshot_observed_at":"2026-08-04T06:11:55.202128Z","submitted_at":"2023-06-19T06:22:02Z","title":"Maximum Entropy Heterogeneous-Agent Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2306.10715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.10715","snapshot_observed_at":"2026-08-05T20:31:05.070397Z","title":"Maximum Entropy Heterogeneous-Agent Reinforcement Learning","venue":"cs.MA","work_id":"f10255e2-c0fc-497f-8891-c920dd19211e","year":2023},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.688767Z"},"links":{"cited_paper":"/paper/2306.10715","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:0b33e65782ad43ed3649009ea0410318bd37c6f5236ad6a95488b696d340aab6","observation_id":"35e6fd57-d178-47dd-8309-cdb235358b4f","resolution":{"observed_at":"2026-08-05T20:31:05.136512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:02.767609Z","title":"I.; Tamar, A.; Harb, J.; Pieter Abbeel, O.; and Mordatch, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.767609Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:c1ecedcb2452502c4a1d9688c71e207c13681230f11a99dc2951d475f974fbf9","observation_id":"957b1550-aad6-4ad0-8666-ab90f37b65f4","resolution":{"observed_at":"2026-08-05T20:31:02.767609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:02.869250Z","title":"A.; Veness, J.; Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.869250Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:827b962ee5e17a9580a1d64e1b52ed757a0c003614ffa6225739b9d4f0d488e1","observation_id":"79cfbc1a-bd69-4702-b4fa-59f8440f295d","resolution":{"observed_at":"2026-08-05T20:31:02.869250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:07.158265Z","title":null,"venue":null,"work_id":"637cec2e-a42e-485a-8d8e-5820b571daf8","year":2022},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:02.982653Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:2012775c2317864c6ae36b2194f58943d8993e422737ce5444a1e87071f5c086","observation_id":"216b08d2-c7bd-4622-93a7-cd83374942b7","resolution":{"observed_at":"2026-08-05T20:31:07.230894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:03.064732Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.064732Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:d1f6467efeb1ead4889fad4918840502f6141d6a42df0964e370572421daae40","observation_id":"ba7aa6f2-8ca1-465d-bde2-72fc3a041dfe","resolution":{"observed_at":"2026-08-05T20:31:03.064732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:06.929373Z","title":"S.; Farquhar, G.; Foerster, J.; and Whiteson, S","venue":null,"work_id":"4c62208a-9d7b-4c78-adfa-b9b421878710","year":2020},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.159045Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:d00ebb453b6856d0b3180708cdd72f8d82b9cd4814c4af4a664398c9d12febc0","observation_id":"f10c4f76-d8ae-4b20-983c-5a49fa6ccc32","resolution":{"observed_at":"2026-08-05T20:31:07.060833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:06.791400Z","title":null,"venue":null,"work_id":"48ff00e1-0f5a-42bd-9d67-3154591d125b","year":2020},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.236559Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:5d4f70683c2b3802306066444e26080e2b2c7e936a9872bcab2ab0cabd0b4826","observation_id":"892ecc4b-0a4a-433b-aedb-1f9dde011335","resolution":{"observed_at":"2026-08-05T20:31:06.865445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:06.639079Z","title":null,"venue":null,"work_id":"20b74a98-67fa-454a-9ad8-95a19bc47118","year":2015},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.302238Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:b6bfe4b26d2a162b183fdadbf7516f94d39f1952bc2319f7822c00f8c1b225c5","observation_id":"13dd5f30-69df-4104-8dea-cf3acc095f52","resolution":{"observed_at":"2026-08-05T20:31:06.694604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T20:31:03.357599Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.357599Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:9ee154ab9dc72f7861719c4f634149bdfe242386f4a0567f87e64a116bec1528","observation_id":"718bc970-49a2-4c35-bd25-f2899e5becfd","resolution":{"observed_at":"2026-08-05T20:31:03.357599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T20:31:03.489756Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.489756Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:774bc252108690340ef33eb78ce01d26f79ffc4dfcd2ebb6b743cadf27fe95e4","observation_id":"f967d6a1-4929-43af-ac80-4bc01f88b0ae","resolution":{"observed_at":"2026-08-05T20:31:03.489756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12010","last_updated":"2020-10-06T01:50:57Z","snapshot_observed_at":"2026-07-06T09:31:14.331447Z","submitted_at":"2020-06-22T05:08:36Z","title":"QTRAN++: Improved Value Transformation for Cooperative Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2006.12010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.12010","snapshot_observed_at":"2026-08-05T20:31:04.791352Z","title":"QTRAN++: Improved Value Transformation for Cooperative Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"a990c383-4c06-480d-a58d-66d16e781305","year":2020},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.575713Z"},"links":{"cited_paper":"/paper/2006.12010","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:abea51090a24d43da290eff050bad1cda04a62643b9e236f0dfbfa7ff7b5c5ca","observation_id":"5f6eff1c-c1d1-42e3-a5a3-1904a8060f04","resolution":{"observed_at":"2026-08-05T20:31:04.934148Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:03.664075Z","title":"J.; Hostallero, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.664075Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:6695a555405d5e645bf915f2dda246f0d2ebfc76fbb12f1e0ceba3fd2f07a50f","observation_id":"e74f1c9b-ccb9-45e3-b478-e57701498c44","resolution":{"observed_at":"2026-08-05T20:31:03.664075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:06.451587Z","title":null,"venue":null,"work_id":"f30875bb-8691-466c-b8b2-6a6b20f07df1","year":2025},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.714299Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:0f7d478d72e5c10d74e3d233c24aa73a7365a3ab888b4cd75869ccdf1d362969","observation_id":"1bf32f8d-77ab-4f32-9f92-02755da44d51","resolution":{"observed_at":"2026-08-05T20:31:06.556410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06205","last_updated":"2023-02-26T17:13:07Z","snapshot_observed_at":"2026-08-03T18:39:55.192330Z","submitted_at":"2023-02-13T09:24:34Z","title":"Order Matters: Agent-by-agent Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06205","snapshot_observed_at":"2026-08-05T20:31:03.774416Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.774416Z"},"links":{"cited_paper":"/paper/2302.06205","citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:b0b380243c17806e7aacf000bfdb569665f205eaa582160f645fadbf09432378","observation_id":"a20d0ba8-6acd-4400-9c7d-6cf0bcdc0e3f","resolution":{"observed_at":"2026-08-05T20:31:03.774416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:06.297123Z","title":null,"venue":null,"work_id":"067489a3-70df-4866-91a4-73e68f049c7f","year":2022},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.846693Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:0f3a0ffd3e28b24a7c947409239b802f6bd3f6ceb0260328d71353d352025337","observation_id":"c06c0ffa-36e9-48ea-aa1f-cbd8dccf44b7","resolution":{"observed_at":"2026-08-05T20:31:06.368573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:06.117085Z","title":null,"venue":null,"work_id":"004bbb86-424a-4809-8ae5-22427bb92a21","year":2023},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:03.938276Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:33b392c80c1f67c2e50f4a0672b079dd37063349f87817efdafacdd05b10ce8e","observation_id":"dde27cee-57a9-4123-8e3e-fc1d7af7c330","resolution":{"observed_at":"2026-08-05T20:31:06.208324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:04.018564Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:04.018564Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:e6162556d83310e29abc15d32006adc5ae0e080845d738c58441397a75e6977b","observation_id":"00df7ad7-d1ed-4dac-8069-f08262785ba3","resolution":{"observed_at":"2026-08-05T20:31:04.018564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:05.901437Z","title":"D.; and Cioffi, J","venue":null,"work_id":"19eb448f-dd5d-4fa5-9c2f-2b74b4251e58","year":2006},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:04.078907Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:ed74b18ba0a284f4d198f867c72f87f3978a0bea59199d50c7b69a48b1386482","observation_id":"d22c4f59-dddd-46fc-add0-9eb2ba831445","resolution":{"observed_at":"2026-08-05T20:31:05.992537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:05.757657Z","title":null,"venue":null,"work_id":"1d7655fa-14fc-44d5-adf6-56f26444155d","year":2021},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:04.251203Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:6bd03fb58a12cd0cc77b7105ceb4130eca999a67e6eae5ba3436e6ead84357e2","observation_id":"2f3dad14-ebe9-4b20-a48d-1098141b8ef1","resolution":{"observed_at":"2026-08-05T20:31:05.818535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:05.609914Z","title":null,"venue":null,"work_id":"8de147b3-a8bf-4a2d-b840-7d92db5e413b","year":2024},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:04.342243Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:5f025ff4b706e51bfa2d7439baf2694e92ed7d120e8b9f7849004d477059722e","observation_id":"24bfe0ea-b0aa-4075-9624-17398652e2ad","resolution":{"observed_at":"2026-08-05T20:31:05.683506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:04.439246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:04.439246Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:e2d14b92be009d3340d9356faba3049edb4b6fc2f8dffa1c10d1d518085453c7","observation_id":"0e703673-3364-42c6-974d-f18e41da56e4","resolution":{"observed_at":"2026-08-05T20:31:04.439246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:05.397140Z","title":null,"venue":null,"work_id":"0e8ccc66-28fa-4e42-9287-bd4ea30247d1","year":2025},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:04.512180Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:5177e18959b61d93c6c1721f711cb20aa71930c0abcd4298a1b9f1c8ecba5077","observation_id":"bc382132-c1bd-4a2e-9cd4-4aa699581190","resolution":{"observed_at":"2026-08-05T20:31:05.463085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:04.600502Z","title":"G.; Feng, X.; Hu, S.; Ji, J.; and Yang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:04.600502Z"},"links":{"citing_paper":"/paper/2508.10340"},"observation_digest":"sha256:fef4eec37b43f6fd1eca11a3f79258f1b2d11d481a2484fececc5a7d4d7c9b51","observation_id":"7e31b259-ae8d-4c3d-9872-d2fe1f546158","resolution":{"observed_at":"2026-08-05T20:31:04.600502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10340","last_updated":"2025-08-14T04:48:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T20:51:22.713388Z","submitted_at":"2025-08-14T04:48:46Z","title":"Multi-Agent Trust Region Policy Optimisation: A Joint Constraint Approach"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2508.10340."}