{"as_of":"2026-08-14T23:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52949a9f85ce33ec689d496d576188933f613a0aa91e0691bee6a9d8a3215f1a","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:42:28.270299Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.02805/citation-record","integrity":"/paper/1908.02805/integrity","json":"/paper/1908.02805/citation-record.json","paper":"/paper/1908.02805"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.021233Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.021233Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:91abae2bf11551cffecfaff2387b7798c02896dbf65b965deec53bfa89729157","observation_id":"e15827cd-0928-4329-b202-777b519b224e","resolution":{"observed_at":"2026-08-14T14:42:28.021233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.026903Z","title":"Learning to predict by the methods of temporal differences,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.026903Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:14fa8b96de1755ce64424e0e55a25f003dc13096e5a8bb348566bf714cf45a44","observation_id":"28d695ab-85b1-4a7f-9e67-87ff82746cfb","resolution":{"observed_at":"2026-08-14T14:42:28.026903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.151443Z","title":null,"venue":null,"work_id":"2221953d-9573-4fa0-8dd9-8ddbd6b285f6","year":1996},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.031474Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:c42f601bff1197c324454a09240aad3260d8356c7853b2b5d38e15869c5223d2","observation_id":"b85d0643-9bca-4e5c-aaf1-4cba95ea484a","resolution":{"observed_at":"2026-08-14T14:42:29.156338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.137821Z","title":"Residual algorithms: reinforcement learning with function approximation,","venue":null,"work_id":"e622d293-bcef-4a9c-a859-989df4fcddc5","year":1995},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.035942Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:31875fea772b8969dbf1dae281aac30e89da25e3938e7d000ad5d97bb3618b06","observation_id":"f097c121-60d1-48e4-9657-2d4f9196d5ed","resolution":{"observed_at":"2026-08-14T14:42:29.142212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.123212Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"7f25b8fe-d82f-4ac0-a593-1dbe741c6649","year":2015},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.040138Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:11d3634c15ed59b629b8ad0e99b405992ed77fc7369d52e97a40c3f9c09c8781","observation_id":"012a80d8-3e06-4301-8e8d-96b9f264a07b","resolution":{"observed_at":"2026-08-14T14:42:29.128048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.109003Z","title":"Mastering the game of Go with deep neural networks and tree search,","venue":null,"work_id":"1011fe62-842c-457f-9e79-ff6319dc999b","year":2016},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.044430Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:cee3c1e466da4d6c3cf1a58a97d7d84f85a501372beb220cafce870e47fb0503","observation_id":"7fa4b313-3b5a-4079-8380-02ec11b83324","resolution":{"observed_at":"2026-08-14T14:42:29.113770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.092937Z","title":"Residential energy management in smart grid: A Markov decision process-based approach,","venue":null,"work_id":"e21a9c38-0f7a-49d1-8f64-6e2397095ebd","year":2013},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.048757Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:9b5ecb5ee16688bff95a30de7fedb239dc39a9fbb95e9ab67ba2cdcbb9d2777d","observation_id":"92d3b55c-5b72-454e-ac5f-94f028458fe6","resolution":{"observed_at":"2026-08-14T14:42:29.098963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.078554Z","title":"Multiagent reinforcement learning for urban trafﬁc control using coordination graphs,","venue":null,"work_id":"25a17ab6-ad74-4c9a-84cc-a9f60f5fcc3e","year":2008},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.052409Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:3b96fbf0863298aa6fe88e8e22d9f67c4ee58794ad3e36f0cc5fb6a90e7e7267","observation_id":"e95ae937-a098-4317-aebf-beff5d4a8211","resolution":{"observed_at":"2026-08-14T14:42:29.083452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.062746Z","title":"A distributed actor-critic algorithm and applications to mobile sensor network coordination problems,","venue":null,"work_id":"3e5051e1-679f-4f91-ab56-e99b4471db37","year":2010},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.056249Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:91f62f846bdd258f245e0dea94a58a3772f3a7d3c8dc91d11a4aadae00e869ec","observation_id":"fbb5bb53-4125-4ee2-b78b-e8f348687ee4","resolution":{"observed_at":"2026-08-14T14:42:29.067997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.049581Z","title":"Reinforcement learning in robotics: A survey,","venue":null,"work_id":"41e070a0-c411-4c21-8c9a-eae564d51d99","year":2013},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.060569Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:bb172576caee18801bf66dab1268142d5c6a5c003951663f4b604bf83bb56463","observation_id":"49766629-fc3d-454e-9cc1-9b5052ce5a04","resolution":{"observed_at":"2026-08-14T14:42:29.053696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.035263Z","title":"Distributed policy evaluation under multiple behavior strategies,","venue":null,"work_id":"4ffe5975-c901-458c-9f6e-e3a79ad57643","year":2014},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.065089Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:bf7cae261f7fcd9e530e5c7cfb42d8f4be567627df58cc10fafdfdad0f3af04b","observation_id":"9b700b1d-9cf8-455e-b181-e9d553b1c303","resolution":{"observed_at":"2026-08-14T14:42:29.040159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.021739Z","title":"Distributed reinforcement learning via gossip,","venue":null,"work_id":"6ca3d5f7-fc6a-4e86-b945-5e8c94182efc","year":2016},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.069673Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:af313ac6ba62f26cdaeee6408c19544c2cf5305f827e3782f0a5e3387f1a8506","observation_id":"b2b6d37e-4d05-4f0a-bb5e-c999ed00be54","resolution":{"observed_at":"2026-08-14T14:42:29.026525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:29.007680Z","title":"Primal-dual algorithm for distributed reinforcement learning: distributed GTD,","venue":null,"work_id":"b83122a1-4590-42df-b567-8e2450fdc2e4","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.073776Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:ce4f8082ed33ee13c18d0697d03bc1dda9b726ddaa0c8aeef913abde5d00ad67","observation_id":"a3990ef9-fa7d-433a-a8e8-0f316331d07f","resolution":{"observed_at":"2026-08-14T14:42:29.012073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.993078Z","title":"Multi-agent reinforcement learning via double averaging primal-dual optimization,","venue":null,"work_id":"85cdb37e-0eeb-4477-b48d-81280f1143f6","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.078023Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:7926c01ec0b4e201cee198741d42f0cc8bae4ca8d57fa2a1a3f0486a2c5b0e53","observation_id":"517665fd-0af4-4b0c-9e51-34bec6416c86","resolution":{"observed_at":"2026-08-14T14:42:28.997808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.07792","last_updated":"2019-08-12T09:44:11Z","snapshot_observed_at":"2026-08-14T18:12:58.904744Z","submitted_at":"2018-10-17T20:54:47Z","title":"Multi-Agent Fully Decentralized Value Function Learning with Linear Convergence Rates","version":5},"cited_work":{"arxiv_id":"1810.07792","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.07792","snapshot_observed_at":"2026-08-14T14:42:28.451717Z","title":"Multi-Agent Fully Decentralized Value Function Learning with Linear Convergence Rates","venue":"cs.LG","work_id":"005987ae-c0a7-43a0-afb5-658c611d160d","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.082359Z"},"links":{"cited_paper":"/paper/1810.07792","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:53704762f43c14d4f94645eca5994280e54bc7fbe4a02e942346f3e069d7e026","observation_id":"f08ca55e-3645-4e75-8322-1e38b754e677","resolution":{"observed_at":"2026-08-14T14:42:28.457039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.978950Z","title":"Finite-time analysis of distributed TD(0) with linear function approximation on multi-agent reinforcement learning,","venue":null,"work_id":"f7ee6288-e4de-46fe-afd4-8997dc24a404","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.086840Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:4e31f5fa6b242244dd80c26c4082094acd8e81864f03b536e3dd530bd8df4d08","observation_id":"5a347f68-9944-4d32-b06b-89d9b2ca8741","resolution":{"observed_at":"2026-08-14T14:42:28.983791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12530","last_updated":"2020-01-09T20:10:38Z","snapshot_observed_at":"2026-08-14T16:02:13.506989Z","submitted_at":"2019-07-25T18:32:43Z","title":"Finite-Time Performance of Distributed Temporal Difference Learning with Linear Function Approximation","version":2},"cited_work":{"arxiv_id":"1907.12530","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.12530","snapshot_observed_at":"2026-08-14T14:42:28.431069Z","title":"Finite-Time Performance of Distributed Temporal Difference Learning with Linear Function Approximation","venue":"math.OC","work_id":"9bfb8863-a859-40f8-a87f-c9def479bd27","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.091067Z"},"links":{"cited_paper":"/paper/1907.12530","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:8843dc8c8472bebd2b4f6723470973c3e2447b44f756fb38c3a429dcc83bf56f","observation_id":"d057ba14-535b-4eea-a1e0-a34e572e6da5","resolution":{"observed_at":"2026-08-14T14:42:28.436052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00934","last_updated":"2020-01-29T21:30:10Z","snapshot_observed_at":"2026-07-06T08:34:21.494347Z","submitted_at":"2019-11-03T17:30:07Z","title":"Finite-Sample Analysis of Decentralized Temporal-Difference Learning with Linear Function Approximation","version":2},"cited_work":{"arxiv_id":"1911.00934","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.00934","snapshot_observed_at":"2026-08-14T14:42:28.410491Z","title":"Finite-Sample Analysis of Decentralized Temporal-Difference Learning with Linear Function Approximation","venue":"cs.LG","work_id":"9cc9cc75-221a-45c9-afee-3ffe517f12ec","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.095985Z"},"links":{"cited_paper":"/paper/1911.00934","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:b95630b0592890ae280dc484fcebef8647d1baad4af916175814e360dc9664e4","observation_id":"2f048e6b-ac78-4cbd-8448-70eadbe156a0","resolution":{"observed_at":"2026-08-14T14:42:28.415808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00433","last_updated":"2021-01-22T16:45:28Z","snapshot_observed_at":"2026-07-06T09:01:15.097578Z","submitted_at":"2020-03-01T08:12:08Z","title":"Fully Asynchronous Policy Evaluation in Distributed Reinforcement Learning over Networks","version":3},"cited_work":{"arxiv_id":"2003.00433","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.00433","snapshot_observed_at":"2026-08-14T14:42:28.387449Z","title":"Fully Asynchronous Policy Evaluation in Distributed Reinforcement Learning over Networks","venue":"cs.LG","work_id":"2c3a1e1c-a1f8-4498-be54-3e220d953678","year":2020},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.100700Z"},"links":{"cited_paper":"/paper/2003.00433","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:a4baa54f576480728df12048e60454fa9aa7e8dc3c1959756aa1bfd3f8d79ce1","observation_id":"59102187-fb98-4eef-81bb-b01ed09342aa","resolution":{"observed_at":"2026-08-14T14:42:28.392356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.964445Z","title":"An analysis of temporal-difference learning with function approximation,","venue":null,"work_id":"d86920b4-6b51-48b7-9b72-358251d8c764","year":1997},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.105575Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:28fce776a8f6d0d25f696b27e164dc598fd8b77ff7aa8f790602e33d11dd45b8","observation_id":"f0da8c8e-5c83-45ba-a38c-8d6038b48645","resolution":{"observed_at":"2026-08-14T14:42:28.969568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.950178Z","title":"Szepesv ´ari, Algorithms for Reinforcement Learning","venue":null,"work_id":"2904fe82-c2df-4bde-9e59-30dcfc743256","year":2010},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.110004Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:1f0308919a398d86f6ad14eb45b9af48559a0e4912462e38d6e9b63606eab26c","observation_id":"4e0211f5-e45b-4b76-a0f6-468639555184","resolution":{"observed_at":"2026-08-14T14:42:28.954808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.936226Z","title":"Linear least-squares algorithms for temporal difference learning,","venue":null,"work_id":"3c777d4d-9a33-4a72-aad1-f076fada16c9","year":1996},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.114330Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:f4df6b7a22dc72ddd3b42349f50ffc81d741b90701339e400793f1a744b62a60","observation_id":"73fcb46f-c3b1-4e43-866c-c2630f4dd833","resolution":{"observed_at":"2026-08-14T14:42:28.940962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.923133Z","title":"A convergent O(n) temporal-difference algorithm for off-policy learning with linear function approximation,","venue":null,"work_id":"cb1e4067-ffd4-4aec-85cc-d9192e85430f","year":2009},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.118634Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:f0eba776f81f8e5fe6d7af357bf8012ecb6cfaed158345795110a95f5bca7299","observation_id":"f90470b3-a611-4d59-91af-bc6f3ee59f2d","resolution":{"observed_at":"2026-08-14T14:42:28.927720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.909955Z","title":"Fast gradient-descent methods for temporal- difference learning with linear function approximation,","venue":null,"work_id":"85970f5c-6a44-4279-b393-4c6276fa10f1","year":2009},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.122954Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:7f945e9a0f2742a3aeb72df080781ee68535e7062dc3269a6f9186a4e0ba9ad0","observation_id":"ac13deb6-978c-4372-8152-6ae0dd191a98","resolution":{"observed_at":"2026-08-14T14:42:28.914294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.895065Z","title":"The ode method for convergence of stochastic approximation and reinforcement learning,","venue":null,"work_id":"1fb42480-fc6a-47a6-a25e-6fb8819d590d","year":2000},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.127491Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:fe24bcfc839d4384d7baf898163dfb6642481cf70cc7991fc80fc954e9346bf6","observation_id":"6f565f6f-6aa6-4de7-9fa3-e22375eeb500","resolution":{"observed_at":"2026-08-14T14:42:28.900843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.879397Z","title":"Finite sample analyses for TD (0) with function approximation,","venue":null,"work_id":"f0a84b01-ce8e-4b47-949c-5dc120d1fae0","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.132222Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:a2c9a4038b11d4fb462b5962b6519634c969da84290bbde37214908346c46d51","observation_id":"20c35761-fc08-47d0-90af-40a44c7d1cc0","resolution":{"observed_at":"2026-08-14T14:42:28.884765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.863680Z","title":"Finite sample analysis of two-time scale stochastic approximation with applications to reinforcement learning,","venue":null,"work_id":"8c085a10-2e9e-48f2-b764-e5fd9ba539d1","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.136958Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:1913c9e09da83c6d8b83225de412a8919ec0debe04875839bcff8dc672af28fc","observation_id":"6939bf3f-a554-4063-a6a5-98a4180b16b3","resolution":{"observed_at":"2026-08-14T14:42:28.868871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.848841Z","title":"Linear stochastic approximation: How far does constant step-size and iterate averaging go?","venue":null,"work_id":"731db39a-3a15-492e-bec7-96be190aff63","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.141580Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:e0d040caffa1d316e7f8d356293a9036b066eb9e0be082bc76713dc371ce30c1","observation_id":"66367c32-08dd-40ce-8b9a-ab70528672e5","resolution":{"observed_at":"2026-08-14T14:42:28.853601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.834690Z","title":"A ﬁnite time analysis of temporal difference learning with linear function approximation,","venue":null,"work_id":"691a4c12-128f-409c-a4f3-bb11aff1b6a9","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.145862Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:0bab406ee9d71883846dfa247b597ce96dd5e56f58c25c1eabc620a2cca85a9b","observation_id":"06eb515a-d082-401a-80c6-2b3e17f9add6","resolution":{"observed_at":"2026-08-14T14:42:28.839187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.820178Z","title":"Finite-time error bounds for linear stochastic approximation and TD learning,","venue":null,"work_id":"ab98f5b0-d39e-4460-8069-0d399a7c7be5","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.150011Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:1733f601c47b6c2662d44db268639daae3a967d88a1b5a4fe737f3de43fba820","observation_id":"95e39187-8e19-4362-8185-d6a6c666981e","resolution":{"observed_at":"2026-08-14T14:42:28.825063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.805466Z","title":"Finite-sample analysis for SARSA and Q-learning with linear function approximation,","venue":null,"work_id":"66cb4e3a-5bf3-40c0-8b3f-248f1f283569","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.154518Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:c7847e130256c328c0d7dea42dc1e26752d10ef42702868b8a134807be1dc118","observation_id":"45ba3c6c-be93-46d6-b446-428f7ee9b6b2","resolution":{"observed_at":"2026-08-14T14:42:28.810675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.790050Z","title":"Characterizing the exact behaviors of temporal difference learning algorithms using markov jump linear system theory,","venue":null,"work_id":"97c3c96c-4c92-4eb1-bc05-d996d4933143","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.158742Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:5631bb36d8bb15b8c690949b83268ddd7e399e0572bcfb47afad7953758bb7c5","observation_id":"51467f7d-61b6-49b9-8f4f-a80679da323c","resolution":{"observed_at":"2026-08-14T14:42:28.794956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.774802Z","title":"Finite-sample analysis of proximal gradient TD algorithms,","venue":null,"work_id":"626c19f7-74a4-4a8c-81dd-1ae5ad4612b9","year":2015},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.163018Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:a9b865084c66376adf0f1c52a3d2f0542f7a72521fbdc58f74fec3053a6282c9","observation_id":"ef182439-bc13-4652-9d4d-4822cfd586f7","resolution":{"observed_at":"2026-08-14T14:42:28.779789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.760099Z","title":"Robust stochastic approximation approach to stochastic programming,","venue":null,"work_id":"e179093e-731e-4d1e-a30b-fa46eaca59cc","year":2009},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.166628Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:7b15dc0cc91e3781dfc436f2bf2ed6851723bfd7a376f1e878ff416f3574f94d","observation_id":"b780a0a6-e9a2-45ac-b7ea-a3f85231aff6","resolution":{"observed_at":"2026-08-14T14:42:28.764325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.747531Z","title":"Finite sample analysis of the GTD policy evaluation algorithms in Markov setting,","venue":null,"work_id":"068540bc-9b77-4f70-be62-f9a0cf8eda6f","year":2017},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.170230Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:fc01f70fcadd94f82ba8ad689af0b3f5520d29f3f54f26cb6635a33a3dbf9dbc","observation_id":"a4617d73-7f75-4c8e-b1a1-63a25af517d5","resolution":{"observed_at":"2026-08-14T14:42:28.751541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.733505Z","title":"Convergent TREE BACKUP and RETRACE with function approximation,","venue":null,"work_id":"0a614c4e-3ebe-488e-bb89-404ca16b3c28","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.174649Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:27a5a58c0818f894a36e496891e0686aee4793f06bc3595b93d8399f321b08f3","observation_id":"ac25571a-6ed9-426b-8388-51be3f3b9244","resolution":{"observed_at":"2026-08-14T14:42:28.738015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.718701Z","title":"Multi-agent temporal-difference learning with linear function approximation: Weak convergence under time-varying network topologies,","venue":null,"work_id":"27b79832-ff5b-4074-8121-ecdb2b0b7c22","year":2016},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.178323Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:58d87f9bbfb65699d997b531551402ea67c0fafe1f91c9e2fb3a2ddc24c98ce7","observation_id":"73ea2fba-c87f-4977-903a-97b03dd3cf02","resolution":{"observed_at":"2026-08-14T14:42:28.723701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.703915Z","title":"Gossip algorithms: Design, analysis and applications,","venue":null,"work_id":"eed5ea83-d1e7-425c-b4da-8a2cd86d2821","year":2005},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.182268Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:66e6810aab5e2bb2004f5761df4bd245f7c16ec6acc6697b2b3b0eca89386d83","observation_id":"e08e85de-756e-4c96-a584-477976830884","resolution":{"observed_at":"2026-08-14T14:42:28.708438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10155","last_updated":"2019-12-21T00:51:47Z","snapshot_observed_at":"2026-07-06T08:46:12.464068Z","submitted_at":"2019-12-21T00:51:47Z","title":"Finite-Time Performance of Distributed Two-Time-Scale Stochastic Approximation","version":1},"cited_work":{"arxiv_id":"1912.10155","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.10155","snapshot_observed_at":"2026-08-14T14:42:28.365631Z","title":"Finite-Time Performance of Distributed Two-Time-Scale Stochastic Approximation","venue":"math.OC","work_id":"8f5e84ce-445f-4650-acb5-f437dea61fc8","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.187587Z"},"links":{"cited_paper":"/paper/1912.10155","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:565ac44257982aeceb44ec45d10268ca55cd6ed60abcb6275c3919e681be2785","observation_id":"1f620643-cab7-4efa-aa6c-0eb9ee15de60","resolution":{"observed_at":"2026-08-14T14:42:28.371015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.688540Z","title":"On the averaged stochastic approximation for linear regression,","venue":null,"work_id":"a0145dd4-1dc7-41f5-868d-ec8127c1fdee","year":1996},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.191638Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:1dc677fb08a595c717f0dbce62c046a3fd791516eb3b8d9d57f65dc397454489","observation_id":"b2d4b097-a69b-4af9-8cd6-1134b27a7fa0","resolution":{"observed_at":"2026-08-14T14:42:28.693809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.672957Z","title":"Fully decentralized multi-agent reinforcement learning with networked agents,","venue":null,"work_id":"d70bfbc9-26b2-4bf8-a5f5-e9b53719c2e1","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.195009Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:076fb54982b55f51499f3dc0953d90a5ca006977ca8461e62b58002d72a3a5bb","observation_id":"e3bf95e0-e298-4e82-b8c1-75be7ed12b99","resolution":{"observed_at":"2026-08-14T14:42:28.678415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.10635","last_updated":"2021-04-28T21:33:13Z","snapshot_observed_at":"2026-08-08T14:49:36.216169Z","submitted_at":"2019-11-24T22:50:32Z","title":"Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.10635","snapshot_observed_at":"2026-08-14T14:42:28.199222Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.199222Z"},"links":{"cited_paper":"/paper/1911.10635","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:9bc33d81f038f631e8001041fb78c1fa4abdfb80e09fc86b6cdebad578b0c11d","observation_id":"6eb6318d-1818-47b9-8b8a-758f95e86eb9","resolution":{"observed_at":"2026-08-14T14:42:28.199222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03821","last_updated":"2019-12-09T02:33:57Z","snapshot_observed_at":"2026-07-06T08:42:58.275367Z","submitted_at":"2019-12-09T02:33:57Z","title":"Decentralized Multi-Agent Reinforcement Learning with Networked Agents: Recent Advances","version":1},"cited_work":{"arxiv_id":"1912.03821","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.03821","snapshot_observed_at":"2026-08-14T14:42:28.325008Z","title":"Decentralized Multi-Agent Reinforcement Learning with Networked Agents: Recent Advances","venue":"cs.LG","work_id":"4700f696-cdbf-4398-a356-610211c671fc","year":2019},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.204080Z"},"links":{"cited_paper":"/paper/1912.03821","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:a719d16db545b692d5b008ffe0a66010056f79fa44877c25b18379b1aa80f89d","observation_id":"15053b9a-4992-476a-9986-4bf793619ce4","resolution":{"observed_at":"2026-08-14T14:42:28.332117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.657348Z","title":"Optimization for reinforcement learning: From a single agent to cooperative agents,","venue":null,"work_id":"16957864-17b7-4411-a888-d97caaec1a53","year":2020},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.208814Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:2f7563f5c5f717c1950b6bacb5668b4eec4cb5a3edbb9a46fb4fa26dc99792c4","observation_id":"331c0120-082c-4297-934e-f0b439308d19","resolution":{"observed_at":"2026-08-14T14:42:28.661986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.641658Z","title":"Dual averaging for distributed optimization: Convergence analysis and network scaling,","venue":null,"work_id":"ea6188a2-cfc2-4adf-935b-829d3397c26b","year":2012},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.212999Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:b9b2cfb6e07b62db3fa258f8ad124bc3913c668ef014e5ad11ac22c54c95c708","observation_id":"96093c6c-b5ea-4845-a011-2fd34165f988","resolution":{"observed_at":"2026-08-14T14:42:28.646492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.625123Z","title":"A proximal-gradient homotopy method for the sparse least-squares problem,","venue":null,"work_id":"2709ebeb-1826-4b94-9ab5-815c6f990053","year":2013},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.217396Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:a25b6fc685125b7e1c4018c4fda0d20894fb1058229edeb048d66643fa16cbf6","observation_id":"322c32f7-041e-45b6-a7ab-24056a097dee","resolution":{"observed_at":"2026-08-14T14:42:28.629867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.611592Z","title":"Information-theoretic lower bounds on the oracle complexity of convex optimization,","venue":null,"work_id":"40f8c541-e161-4eeb-8ca7-f9b28e4659ba","year":2009},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.221610Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:8e7ec26a440b83ec12bd76750532443b1c0132a17d59d6aa2a1d15f496e29ba6","observation_id":"2e4ff128-f5a6-4c47-98e5-4da431be0da5","resolution":{"observed_at":"2026-08-14T14:42:28.615945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.07918","last_updated":"2020-04-28T14:54:58Z","snapshot_observed_at":"2026-08-14T19:13:06.979442Z","submitted_at":"2018-05-21T06:56:04Z","title":"Primal-Dual Distributed Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.07918","snapshot_observed_at":"2026-08-14T14:42:28.226368Z","title":"Stochastic primal-dual algorithm for distributed gradient temporal difference learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.226368Z"},"links":{"cited_paper":"/paper/1805.07918","citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:0f05f636c6fc3c8ec7f96a7db546c7d8723ce19f67bc04bee0d2dadddbbefb74","observation_id":"d71e7535-4f8d-4caf-a653-28f8b97eda96","resolution":{"observed_at":"2026-08-14T14:42:28.226368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.595783Z","title":"Ergodic mirror descent,","venue":null,"work_id":"37cc8bcb-8c53-4a14-b3a3-6b08ed00421b","year":2012},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.230720Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:0006eb9655c99286bc7bf087b1e78f6cd5602d72a5e883ee39593828ec2b479b","observation_id":"d20b27ad-6586-460c-9ef3-4e68192c65e8","resolution":{"observed_at":"2026-08-14T14:42:28.600588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.234977Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.234977Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:fb58f4b529ae3bbede9d32a100b794e7c5427744c1768168595d90a6a7dea0ce","observation_id":"44f75023-312d-4267-a165-1604f6da2615","resolution":{"observed_at":"2026-08-14T14:42:28.234977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.569926Z","title":"Distributed subgradient methods for multi-agent optimization,","venue":null,"work_id":"3fb160b1-56c8-4ff4-ae2e-4cc9eb914919","year":2009},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.239573Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:76bc75cb283a27bb2eb125b373d8d614b1d2b764b5bbca3f783e651ec8b01548","observation_id":"08f1fd21-5507-4b8b-aed7-64c44c070a52","resolution":{"observed_at":"2026-08-14T14:42:28.574614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.555699Z","title":"Distributed strongly convex optimization,","venue":null,"work_id":"3790d1d5-9d9b-4b5e-b7b6-fdb1bd4de9c3","year":2012},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.244768Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:a647bc430b36e3fff25bf0eefa60b73510e48e951836d6344ca40cccbadc6a01","observation_id":"e3dc3f03-1020-4ec2-b5d0-00c6b926807e","resolution":{"observed_at":"2026-08-14T14:42:28.560560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.541179Z","title":"RSG: Beating subgradient method without smoothness and strong convexity,","venue":null,"work_id":"7bc93d42-0bf2-49e8-b9b7-d8451b7c6f3c","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.249153Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:8c89f64ba74218a3d5b6d4c3e9361f2e019c2bf3840586a843b736d58b5f0fa6","observation_id":"0ce185fb-4ea1-4eb2-9816-287ff1cb412e","resolution":{"observed_at":"2026-08-14T14:42:28.545976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.525937Z","title":"Homotopy smoothing for non-smooth problems with lower complexity than O (1/ϵ),","venue":null,"work_id":"c673aace-3735-46f9-9c1b-05f8ed89cd10","year":2016},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.253551Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:33a3faeb73d191f6e377d9b69549f7493d5ed307804172816ae055512b48ca9d","observation_id":"e032b661-ff55-49d1-a624-f209749af128","resolution":{"observed_at":"2026-08-14T14:42:28.530768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.510814Z","title":"Solving non-smooth constrained programs with lower complexity than O (1/ε): A primal-dual homotopy smoothing approach,","venue":null,"work_id":"d18517ba-406a-400a-8899-020617cb0fc1","year":2018},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.257995Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:27a96aa0065ae92f9de576e027185cfaddacc0b16b6f5cb854a84e9eb71b90a1","observation_id":"0ed1903b-d18b-4bdb-a93c-06ad7f2944f6","resolution":{"observed_at":"2026-08-14T14:42:28.515981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.496444Z","title":"Online convex programming and generalized inﬁnitesimal gradient ascent,","venue":null,"work_id":"9379bf5d-28d5-4d2c-97b1-13cb56e7b97e","year":2003},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.261827Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:96af8e99c5c29f3aacebbd1c6b1105bc9bc77fe31a81520a0e83a8cbe8b28e84","observation_id":"f47f105f-00c4-48e8-8a6e-76ebdf94aca7","resolution":{"observed_at":"2026-08-14T14:42:28.500723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.482575Z","title":"Subgradient methods for saddle-point problems,","venue":null,"work_id":"aae1f37a-2f76-4c11-a6e2-ba14cca9e4f8","year":2009},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.265746Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:87a53bb4a4e6a2e946e6349bae1eb80bb8b2b5fac52660b005a89f4509185091","observation_id":"20700199-4016-4498-9da4-b56091d6d5f1","resolution":{"observed_at":"2026-08-14T14:42:28.486704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:42:28.467302Z","title":"Optimum bounds for the distributions of martingales in Banach spaces,","venue":null,"work_id":"18055fde-ebc2-4d2f-b7a2-9ce960ac6117","year":1994},"citing_paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T14:42:28.270299Z"},"links":{"citing_paper":"/paper/1908.02805"},"observation_digest":"sha256:8d4fb0b46d9a14ebe3749aa46329bfdf4af998f3155b3eab001e2f9468329add","observation_id":"66a736dc-51d0-4107-95b9-88c0bfe1fc8f","resolution":{"observed_at":"2026-08-14T14:42:28.472142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.02805","last_updated":"2021-11-04T18:24:45Z","latest_version":4,"primary_category":"math.OC","snapshot_observed_at":"2026-08-14T14:31:27.179318Z","submitted_at":"2019-08-07T19:25:37Z","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":6,"verified_fuzzy":46},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:1908.02805."}