{"as_of":"2026-08-17T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6358a6b5dfd726cfe55a4f83ce50728b5ff5e6552ce031c3685e8a46f45d8cc","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:07:45.671697Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18554/citation-record","integrity":"/paper/2607.18554/integrity","json":"/paper/2607.18554/citation-record.json","paper":"/paper/2607.18554"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.131604Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.131604Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:758be22f59c153643ae9db096bac142b4c1aff592e7055d3c47745a28cb283e4","observation_id":"db074900-9149-4f9e-9ff3-efba1aaf7f94","resolution":{"observed_at":"2026-08-01T15:07:44.131604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.242509Z","title":"Stability constrained reinforcement learning for decentralized real-time voltage control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.242509Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:3f1301b7062c57073f8b3271642db102fa5d5c7b5ebb98137dfcd76e4d9b88e3","observation_id":"4d0640fd-9165-401e-a914-f4e93c376b17","resolution":{"observed_at":"2026-08-01T15:07:44.242509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.336581Z","title":"Scalable reinforcement learning of localized policies for multi-agent networked systems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.336581Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:60a0bd260f473a16b1f974ea6bc8e677a89bd307f4d14ba8affd1aec9247e511","observation_id":"98d8d835-e27f-40d5-9f1e-f373ce4ec53b","resolution":{"observed_at":"2026-08-01T15:07:44.336581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.428470Z","title":"Scalable reinforcement learning for multiagent networked sys- tems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.428470Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:ebe07b4c25941ebf4625bca30c1990e26f47884b70532931745503b3257cd16e","observation_id":"39abe093-75f4-43d7-bcd1-2ed504277f55","resolution":{"observed_at":"2026-08-01T15:07:44.428470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.504402Z","title":"Multi-agent reinforcement learning in stochastic networked systems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.504402Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:a792aa7c0350d43062f75a72d70ae2921a3d806999db8a3ff97bed1f97d90e57","observation_id":"9b0bebf4-cc51-4cac-8dcc-91045062ae00","resolution":{"observed_at":"2026-08-01T15:07:44.504402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.587308Z","title":"Global convergence of localized policy iteration in networked multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.587308Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:122ee1c942adba105d312108978de9fde584bb25f751a97d545f4eb4dfbdff2e","observation_id":"26d11f3e-74f4-45f7-b721-4fbdb9af915f","resolution":{"observed_at":"2026-08-01T15:07:44.587308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.672839Z","title":"Fully decentralized multi-agent reinforcement learning with networked agents,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.672839Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:c9c6943937b17f5be499ea3125548a8858dda84f64e2a84d98f3c0e2dce4d34d","observation_id":"a5fd7b01-b3ea-470a-983e-9fb19504aaac","resolution":{"observed_at":"2026-08-01T15:07:44.672839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.749424Z","title":"Finite-time analysis of dis- tributed td (0) with linear function approximation on multi-agent rein- forcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.749424Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:d5a3fed5ba525552c0c1c20c55229a8167851f4802661fc14f015bbcf04a40b0","observation_id":"380f43a1-8d15-4e7e-a29a-f779e003e649","resolution":{"observed_at":"2026-08-01T15:07:44.749424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.816692Z","title":"Decentralized online convex optimization in networked systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.816692Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:3846fc73284ad5d0eef93f2ba0a0ed72a46a632ccdff89ece1bf11a8ebb41dd2","observation_id":"80fce664-357f-49ca-ac5e-0e9859a7e637","resolution":{"observed_at":"2026-08-01T15:07:44.816692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01339","last_updated":"2020-04-24T01:54:46Z","snapshot_observed_at":"2026-08-11T01:57:51.115236Z","submitted_at":"2020-04-03T02:21:07Z","title":"Multi-agent Reinforcement Learning for Networked System Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.01339","snapshot_observed_at":"2026-08-01T15:07:44.900715Z","title":"Multi-agent reinforcement learning for networked system control,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.900715Z"},"links":{"cited_paper":"/paper/2004.01339","citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:f1b9b6e0b2901cc2e12df196fd76872f65eb73b10a6c29ac2526d9825610b1ce","observation_id":"ff360be4-3fe0-43b1-a6e6-7082e426bde6","resolution":{"observed_at":"2026-08-01T15:07:44.900715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.968846Z","title":"Random features for large-scale kernel machines,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.968846Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:6d5ceb0f7a03791c228f81246f92f7467868f11e0f406d711581ad7b6c6c21b4","observation_id":"ff10ef29-0db5-445e-b3dd-d0e651b15034","resolution":{"observed_at":"2026-08-01T15:07:44.968846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.043151Z","title":"Random features for ker- nel approximation: A survey on algorithms, theory, and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.043151Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:22ae4b04ab755a488a3ab4990d378a0b126a4e9a9e8e07b2404fd26b4e06d4b8","observation_id":"45b6321f-8983-43f4-8e68-0aa60bec6e0b","resolution":{"observed_at":"2026-08-01T15:07:45.043151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17221","last_updated":"2024-11-18T15:21:40Z","snapshot_observed_at":"2026-08-16T13:06:53.793371Z","submitted_at":"2024-10-22T17:45:45Z","title":"Scalable spectral representations for multi-agent reinforcement learning in network MDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17221","snapshot_observed_at":"2026-08-01T15:07:45.122994Z","title":"Scalable spectral representations for multi-agent reinforcement learning in network mdps,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.122994Z"},"links":{"cited_paper":"/paper/2410.17221","citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:e0140f07aaa187db73cc2e3b652ddec8793b3e264f6e3271baffae62482c9d1e","observation_id":"0758319c-58e1-4bb2-ae17-8568332d969e","resolution":{"observed_at":"2026-08-01T15:07:45.122994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.209477Z","title":"Linear least-squares algorithms for temporal difference learning,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.209477Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:93bb0a5eac9bf87f53a44a8e0dfef734a8adef1bfc1905980411f4ce0dcb5852","observation_id":"af3c1833-2880-4063-92fd-cfa01126defc","resolution":{"observed_at":"2026-08-01T15:07:45.209477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.298257Z","title":"Technical update: Least-squares temporal difference learning,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.298257Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:b7f31f556720c3dd7b8239839b00d2a564c0fe27ef776bdc4e0463be1a7c445f","observation_id":"820e9772-ffdf-4788-abfe-c477b2a7d58c","resolution":{"observed_at":"2026-08-01T15:07:45.298257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.391730Z","title":"Finite-sample analysis of least-squares policy iteration,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.391730Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:b7d04446fee1a70314c85a9bc8c1f5741cc3dbbddc7e4c0cc1c9c61dead04319","observation_id":"9c84af58-9a4d-4e35-8308-b8ae758afa4d","resolution":{"observed_at":"2026-08-01T15:07:45.391730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.455637Z","title":"A finite time analysis of temporal difference learning with linear function approximation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.455637Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:cec7cd4153560a63722e89de8e55320e95751b917b54debe856b1bfb2aef50cc","observation_id":"bf0b56bf-d20b-4ebe-8711-5e4887d30db3","resolution":{"observed_at":"2026-08-01T15:07:45.455637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.493186Z","title":"An introduction to matrix concentration inequalities,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.493186Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:edcd651a598e5ef42b28bd0124f716626b2b34e818d27834e098089d52b2d69b","observation_id":"fc623c16-c7c9-42c7-b88d-12c72fc7b6bf","resolution":{"observed_at":"2026-08-01T15:07:45.493186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.534618Z","title":"Vershynin,High-dimensional probability: An introduction with ap- plications in data science","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.534618Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:965bd36c578a9aff8a2f99155604c3ecb6519671ed0a1920c2e3c0e63cd01eb7","observation_id":"8a738021-d68d-4b74-aa2f-2c70b18a138e","resolution":{"observed_at":"2026-08-01T15:07:45.534618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.609186Z","title":"Optimum bounds for the distributions of martingales in banach spaces,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.609186Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:28a3a16f3718bb7a709978468c4c1231823ecb16a746f8dfa0bcaebfa68ef3ae","observation_id":"9912ec25-11ff-43f0-b13c-6c977f9c24e1","resolution":{"observed_at":"2026-08-01T15:07:45.609186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.625579Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.625579Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:c2fad7f5848c532d3987e6b346211c34f5e9d1ac0208185d6a726127843fed33","observation_id":"02ba7837-d616-490e-971e-35b18668207b","resolution":{"observed_at":"2026-08-01T15:07:45.625579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.629412Z","title":"Policy gradi- ent methods for reinforcement learning with function approximation,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.629412Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:7fd387f2bbfca13d1de005ccf0e8f3a06ca20c7c96fa312e274177cfab478890","observation_id":"7dd116c8-5efc-4694-ad44-d110294d6535","resolution":{"observed_at":"2026-08-01T15:07:45.629412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.633092Z","title":"Lower bounds for non-convex stochastic optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.633092Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:576c047c534cd00873dcfa2cfff8d2275fd355c263bbaf84e472b7009ec9b755","observation_id":"f6d9d64c-2c40-4010-a9b0-ec8248b72543","resolution":{"observed_at":"2026-08-01T15:07:45.633092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.636986Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.636986Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:f0c25d54608a2453560633aef34975813ddae9c25e1ff90244d8bbfa79dfb368","observation_id":"fdf0f9db-840d-4561-9b15-0bcb01c2a9bd","resolution":{"observed_at":"2026-08-01T15:07:45.636986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.640729Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environ- ments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.640729Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:361458a6186b24e4aecdf686177565f1cf75342a4925aae8b2538372316e6aeb","observation_id":"17da105f-f405-4446-bce6-e922b25e8719","resolution":{"observed_at":"2026-08-01T15:07:45.640729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.644189Z","title":"Counterfactual multi-agent policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.644189Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:f83d492ddf65c8563a361a6011053e7e6febc489a2d5054b5f92c0c3b805c655","observation_id":"1ac1c5a9-6649-41a3-8111-6a498f25c506","resolution":{"observed_at":"2026-08-01T15:07:45.644189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.647674Z","title":"Actor-attention-critic for multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.647674Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:9eddf63a7d55598f79f28a27b875e4da6296d776d2381ab9f4d8183d44136898","observation_id":"473a9151-3d76-4f46-a4b3-2dbc7785c245","resolution":{"observed_at":"2026-08-01T15:07:45.647674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.651434Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.651434Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:d4fe6855da95c5e090eb55d0976cf09243dd535ce9bc381afced0fcd607bbed7","observation_id":"b786be04-134f-4043-9584-1e38448ba09a","resolution":{"observed_at":"2026-08-01T15:07:45.651434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.654811Z","title":"Near-optimal distributed linear-quadratic regulator for networked systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.654811Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:b8e484ba9bce811b86fdc03eea9a207a41e16f3a5a84875eb66669caff6db1ad","observation_id":"a368e43b-aa00-4bd3-bb82-6b0019cdf913","resolution":{"observed_at":"2026-08-01T15:07:45.654811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.658193Z","title":"Network reconfiguration in distribution systems for loss reduction and load balancing,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.658193Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:7a7fcf213506b582c277365df7e271b7a6174256c8e29aeacfbff8f074401304","observation_id":"11be9423-6ad9-4224-baf8-250cb9548d5b","resolution":{"observed_at":"2026-08-01T15:07:45.658193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.661726Z","title":"The description of a random field by means of conditional probabilities and conditions of its regularity,","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.661726Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:5ae7db696a4865098423f16f106130d56015649ac8fd59340a0b2dd6365042a1","observation_id":"67f10cbf-2aa6-477b-9827-8c23e0c86bdc","resolution":{"observed_at":"2026-08-01T15:07:45.661726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.665084Z","title":"Can local particle filters beat the curse of dimensionality?","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.665084Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:9d0f7a661bda38da0c9b7be4239ad42ff92275bb82383f51052aceb982f110bf","observation_id":"cb46e0a5-6875-44b3-ba4b-4267b90c209c","resolution":{"observed_at":"2026-08-01T15:07:45.665084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.668392Z","title":"Mini-batch stochastic approx- imation methods for nonconvex stochastic composite optimization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.668392Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:0dbaa13c3ee8ca58d77baf8d51fc2e954bf50388f527cabb3030eb84610b4dd2","observation_id":"dde6708c-d21c-42d2-afc5-192f05407b19","resolution":{"observed_at":"2026-08-01T15:07:45.668392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.671697Z","title":"Stochastic first-and zeroth-order methods for nonconvex stochastic programming,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.671697Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:25a116940c483e37b81694ee18650c5d49a645a1e191377b97034f94c58fb368","observation_id":"e0bcf005-760d-4027-9f54-2ae8649d016b","resolution":{"observed_at":"2026-08-01T15:07:45.671697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-11T01:58:13.384291Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.18554."}