{"as_of":"2026-08-16T17:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:516ed9c15e7bc7eea1ea86acd05abce46fcf2966e95e29131d7813cf999050c5","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:39:04.102807Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T21:19:12.496946Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:16:12.256474Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"cited_work":{"arxiv_id":"2505.01041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.01041","snapshot_observed_at":"2026-07-01T20:16:12.256474Z","title":"Global optimality of single-timescale actor-critic under continuous state-action space: A study on linear quadratic regulator,","venue":null,"work_id":"c1d85301-291e-4e7e-8087-b90c293b7fb7","year":2025},"citing_paper":{"arxiv_id":"2605.31310","last_updated":"2026-05-29T13:42:00Z","snapshot_observed_at":"2026-08-07T07:17:16.233363Z","submitted_at":"2026-05-29T13:42:00Z","title":"Model-free LQG Control with Chance Constraints","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T21:19:12.496946Z"},"links":{"cited_paper":"/paper/2505.01041","citing_paper":"/paper/2605.31310"},"observation_digest":"sha256:41ec038cdd3c85c5fc654f3847c995cf54f6376b1e02711bf71fb5f7797f8a4e","observation_id":"f137a911-33be-4446-b838-e91cae6a39b3","resolution":{"observed_at":"2026-07-01T20:16:12.258406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.01041/citation-record","integrity":"/paper/2505.01041/integrity","json":"/paper/2505.01041/citation-record.json","paper":"/paper/2505.01041"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.194108Z","title":"Optimal control: linear quadratic methods","venue":null,"work_id":"5b2f3295-a8cc-4fed-b4a0-12e5f7ff27be","year":2007},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.933597Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:27110c5072fcec8d7077d8370158511e391796fc23ec7899ee3c1964c271881f","observation_id":"77beed5a-3374-4197-b449-10b64429b004","resolution":{"observed_at":"2026-08-16T04:39:05.198954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.179425Z","title":"Analysis of a target-based actor-critic algorithm with linear function approximation","venue":null,"work_id":"365000f5-dae6-4c19-95a9-35003249a544","year":2022},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.938760Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:40998b0cc8d853f91352670a6fa7241b74d58393181f7c0d2a9ffa8de4605968","observation_id":"95e5b361-ca27-40dc-ad64-77c64c1f73d7","resolution":{"observed_at":"2026-08-16T04:39:05.183451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.164784Z","title":"Natural actor--critic algorithms","venue":null,"work_id":"956bc5fd-6bd2-4b15-817a-69a2e89b04d0","year":2009},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.943471Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:5c6e516421afaf8812e99206a1e9a559b00c8944a1c98f9759d79568d3db7a9d","observation_id":"1285b3ce-bc7e-4e0b-b7a1-6cc8aee2e572","resolution":{"observed_at":"2026-08-16T04:39:05.169532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.150770Z","title":"Adaptive linear quadratic control using policy iteration","venue":null,"work_id":"45116be2-ba4c-470a-bb99-2f418de6b59b","year":1994},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.949259Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:84b7d1ef40b62e729c3189675ddda3150693a543f649f3eca81d8965d0559701","observation_id":"07e00a86-c27a-4d1b-8eb8-d2e70870f18b","resolution":{"observed_at":"2026-08-16T04:39:05.154817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.136860Z","title":"A convergent online single time scale actor critic algorithm","venue":null,"work_id":"3910f776-cf97-426c-8f54-b68f88d7d801","year":2010},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.953848Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:d7bd8bdd732f659dcfe6227d07c5545e3bbae08f610edd3456c9228fd7ea18f8","observation_id":"dca7fea3-6cfd-43ff-998c-54b5142d5f6e","resolution":{"observed_at":"2026-08-16T04:39:05.141308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09921","last_updated":"2024-01-26T08:06:09Z","snapshot_observed_at":"2026-08-16T16:23:10.044046Z","submitted_at":"2022-10-18T15:03:56Z","title":"Finite-time analysis of single-timescale actor-critic","version":4},"cited_work":{"arxiv_id":"2210.09921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.09921","snapshot_observed_at":"2026-08-16T04:39:04.182994Z","title":"Finite-time analysis of single-timescale actor-critic","venue":"cs.LG","work_id":"6bc879af-b525-4038-a4e3-16ede375182f","year":2022},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.958608Z"},"links":{"cited_paper":"/paper/2210.09921","citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:7c78df4cd47c6503fb8f95015d9d1c11fea91273ac12cfa9a925ac999d823f33","observation_id":"732c5bc3-1c8d-4570-b12f-8d0882aa34d2","resolution":{"observed_at":"2026-08-16T04:39:04.189631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.123154Z","title":"Closing the gap: Tighter analysis of alternating stochastic gradient methods for bilevel problems","venue":null,"work_id":"6c31a2d5-077a-4c40-a199-b75cc3e67dc9","year":2021},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.963866Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:303c702c1deac9f0765d32e4f61ac2541ce91bfbd083700e91f2fdde43be8210","observation_id":"111a90a9-f69c-4a9a-92bc-d171ff0dce6c","resolution":{"observed_at":"2026-08-16T04:39:05.127660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.104020Z","title":"Learning linear-quadratic regulators efficiently with only T regret","venue":null,"work_id":"9a10316d-8838-4db4-b852-66f0982ebabe","year":2019},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.968112Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:c2daab7252c47691a814e3883c4b53b6bbc9d85e61171fefd6d65847275ccb0a","observation_id":"3f906a92-ba3f-4522-88c2-d24a7aef8e0c","resolution":{"observed_at":"2026-08-16T04:39:05.114199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:05.020270Z","title":"Regret bounds for robust adaptive control of the linear quadratic regulator","venue":null,"work_id":"e8a1b7a8-7f84-4e4b-9b9b-f58a15127b09","year":2018},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.972346Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:baf19c5b73c3037f2cc1704618b9a31d40dd35195e20421d45e523597e7d07ff","observation_id":"20e8ab97-7c29-4169-956a-c6af3c57576a","resolution":{"observed_at":"2026-08-16T04:39:05.075198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:03.976504Z","title":"On the sample complexity of the linear quadratic regulator","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.976504Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:f361b5a59d1daa95f238fcb5f474a907dbb24afb5ddc7e34d4c6bae6a15368bf","observation_id":"ecb9ae34-d866-4c73-936e-3d4fdb2b8883","resolution":{"observed_at":"2026-08-16T04:39:03.976504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.927393Z","title":"Optimization landscape of policy gradient methods for discrete-time static output feedback","venue":null,"work_id":"fa6739cb-536f-458d-9f0b-4f49d0744570","year":2023},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.980785Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:d2a3535805183a10a9221a22a5bae48d1cc7e06b3c206b1ef21bfdd7da069963","observation_id":"aa3a1011-1731-4097-ba84-07440835bf8e","resolution":{"observed_at":"2026-08-16T04:39:04.932099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.902411Z","title":"Global convergence of policy gradient methods for the linear quadratic regulator","venue":null,"work_id":"68518664-fa8d-4c54-8c4d-8fda87f39078","year":2018},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.984934Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:8f060a240368b1b2e27f94c4486500a00582a69044ab4a5c84efa9ef2f307e49","observation_id":"2e84f3da-7edf-4855-a6b8-9ebeb84828c3","resolution":{"observed_at":"2026-08-16T04:39:04.907386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.887980Z","title":"On statistical characteristics of the product of two correlated chi-square variables","venue":null,"work_id":"389a6b44-e133-4081-bdee-e485ae6c730a","year":2011},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.989074Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:83ae94b4ea4e466e5b0d8c7823bc482c91bb8c9f53fcbec889853316e30b2f28","observation_id":"677c7683-b0de-40c4-9f58-45fd1a733706","resolution":{"observed_at":"2026-08-16T04:39:04.892862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.874281Z","title":"A natural policy gradient","venue":null,"work_id":"57234a41-b9e2-46af-b553-743b26b138df","year":2001},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.992826Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:d8565fd62b9026db36b12438b8272812f944d6b78595e6bd668e8a3f402affaa","observation_id":"401322f9-ffdf-4bed-b316-cc952c734547","resolution":{"observed_at":"2026-08-16T04:39:04.878879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.859597Z","title":"Two time-scale stochastic approximation with controlled markov noise and off-policy temporal-difference learning","venue":null,"work_id":"08e8ee76-f5b7-4f2c-b030-57878af4c14c","year":2018},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:03.996901Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:ede4d6fcec333362200a913de53d2151f5a2fc29168bfaacb34c4cb7292cadd5","observation_id":"36791a7f-7509-4adb-af9c-7931550b7683","resolution":{"observed_at":"2026-08-16T04:39:04.863882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.845761Z","title":"Actor-critic algorithms","venue":null,"work_id":"2210d0be-239e-462b-8754-ffffacf70b49","year":1999},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.000998Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:d6d2e82c2543358827a756aedeebd5df57e3cce675ef7cf5d3a64f220190e9b4","observation_id":"b505173e-1a01-46e8-86a4-4125755e5b40","resolution":{"observed_at":"2026-08-16T04:39:04.850485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.823317Z","title":"Finite-time analysis of approximate policy iteration for the linear quadratic regulator","venue":null,"work_id":"1b5e6918-3f6a-47a2-a1b2-9522750c0aff","year":2019},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.005015Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:589b1bc137c3f618d6956cee2889ff469d50bf353db3feb817ce1d1017da8942","observation_id":"f32f9f7d-1bab-4bf0-877c-4850136440df","resolution":{"observed_at":"2026-08-16T04:39:04.832550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08412","last_updated":"2023-01-27T19:46:39Z","snapshot_observed_at":"2026-08-01T16:43:52.209665Z","submitted_at":"2019-10-18T13:33:17Z","title":"On the Sample Complexity of Actor-Critic Method for Reinforcement Learning with Function Approximation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08412","snapshot_observed_at":"2026-08-16T04:39:04.009195Z","title":"On the sample complexity of actor-critic method for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.009195Z"},"links":{"cited_paper":"/paper/1910.08412","citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:709d5778c48f152633402a7cc737a93166731e73aed3dbc20196dbcd9f31e985","observation_id":"76331952-d21d-4999-9597-0720a0dcf5e4","resolution":{"observed_at":"2026-08-16T04:39:04.009195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.014586Z","title":"Deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.014586Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:fefd8cbf68fc9d3eacccb76897c243049cc3461b932d1b1dc4f4159a2df4b472","observation_id":"ef4b0f6b-9f73-4d8c-aab5-0cdaf956ae03","resolution":{"observed_at":"2026-08-16T04:39:04.014586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.669859Z","title":"The moments of products of quadratic forms in normal variables","venue":null,"work_id":"ef6f7f79-0bde-4d60-9f6c-c7c92a0260a1","year":1978},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.018899Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:d17d84f9494fc50a6c42d164757a978e76505a1e15b8fae16b7610acced779e5","observation_id":"bcdf1311-62cd-4a86-a549-2b10df58d446","resolution":{"observed_at":"2026-08-16T04:39:04.734062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.456621Z","title":"Derivative-free methods for policy optimization: Guarantees for linear quadratic systems","venue":null,"work_id":"b9e06871-63df-4b21-8901-ffef1540c1ed","year":2019},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.022973Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:8724e95714eed7f6d8a4b8c0479a0a52fb93598969a802d9528fc903b96664a2","observation_id":"bb4c4a02-5450-48f6-884d-0ffaf396339a","resolution":{"observed_at":"2026-08-16T04:39:04.550748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.027127Z","title":"Certainty equivalence is efficient for linear quadratic control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.027127Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:5b6f8f933cd3822fe260d7783bd96035fdf1728bc34367d51ec0972b8641afa4","observation_id":"35d03659-b21b-4470-970a-8db91b6d649b","resolution":{"observed_at":"2026-08-16T04:39:04.027127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.031146Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.031146Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:d3bbb4131c128a9274fd7d6e87e62259fab36b3bab9863050f42c710b3e4a4a6","observation_id":"01ca1eec-99a7-404e-b094-d9c6b172bdb3","resolution":{"observed_at":"2026-08-16T04:39:04.031146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.357708Z","title":"The bias and moment matrix of the general k-class estimators of the parameters in simultaneous equations","venue":null,"work_id":"ffc5e384-1eec-45b2-bf5c-6351b47faf47","year":1959},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.035398Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:593a95e59279138028871d2a2ac1f52b8206769c99916eb9273ee80838035976","observation_id":"45617141-dd60-40e1-92e9-66064391c51e","resolution":{"observed_at":"2026-08-16T04:39:04.361828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.344327Z","title":"A small gain analysis of single timescale actor critic","venue":null,"work_id":"65e561a8-3e25-47f4-95c7-4cd0b865f6b5","year":2023},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.039811Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:c81e33d28b07d999746301035787d767cbf1f2481ca4bf2ab6441281f824eb88","observation_id":"6451decf-8e6d-40e0-a40a-76eb2906cdb9","resolution":{"observed_at":"2026-08-16T04:39:04.348797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.331037Z","title":"Linear models in statistics","venue":null,"work_id":"695c7373-619e-42a7-8867-0abadcb5fe73","year":2008},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.043884Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:284c17db125bee89b658a22479b6f5934f0267b1c7fdccbff1248b40b7201126","observation_id":"375b99d3-a857-4d3e-a822-3f03f743f72c","resolution":{"observed_at":"2026-08-16T04:39:04.335451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.317883Z","title":"On the kronecker product","venue":null,"work_id":"cd0f6d6d-daec-47a6-9c23-60f0b55b2e15","year":2004},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.048063Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:94a45ac86cc14d24ff0fe4291b34907b6e664f8305673b91edc6e08b3ea6d638","observation_id":"df3c4068-ccd1-4e46-b7c6-dcba03e0aab2","resolution":{"observed_at":"2026-08-16T04:39:04.322080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.052431Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.052431Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:ed1956e759b5584f1beaf93e297e8f6cf82bf6c8d649e22262f7a0147566fedd","observation_id":"478cbc88-863d-44f8-9525-424162a64ad9","resolution":{"observed_at":"2026-08-16T04:39:04.052431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.295828Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":"458bd78f-cc5c-4a83-9e2b-d3306a35c427","year":2017},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.056667Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:b78a7f64c3c925fbd6506f7a233b1314d4b0c9e8abf1bdf0afe6e1043121f528","observation_id":"a4f946c3-44e1-4c6d-818e-f5fe2099ffd1","resolution":{"observed_at":"2026-08-16T04:39:04.300132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.060747Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.060747Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:18606f952958a72aaa57fb6bc84e24b0cdf4c88160448c78f4668a7726d12a7c","observation_id":"feeaa4a2-c026-49df-b038-72b8ab5fb6a8","resolution":{"observed_at":"2026-08-16T04:39:04.060747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.066728Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.066728Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:2fd5043a020351e69d859ca18afcbaa87dcc2a5f95790c02254778d7c8196ffa","observation_id":"5573521a-383a-4246-a56c-00624d160314","resolution":{"observed_at":"2026-08-16T04:39:04.066728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.264917Z","title":"Least-squares temporal difference learning for the linear quadratic regulator","venue":null,"work_id":"f0cdd790-52f9-4b4f-8e69-f5fe60689fd8","year":2018},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.071051Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:9af501ab02aa929d06ea925d35ed690fe08491cb51cf20891da2a23c867bbd56","observation_id":"1d99fc50-763c-44f9-a6b6-7c82327147c5","resolution":{"observed_at":"2026-08-16T04:39:04.269001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-15T10:56:00.207708Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-08-16T04:39:04.075074Z","title":"Neural policy gradient methods: Global optimality and rates of convergence","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.075074Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:0a19dfc1e34c4fcfb854145a78364eaab01dff4550e9672f51655e7f7334bb8a","observation_id":"e65fee3c-47ea-4add-b470-0f22216c3445","resolution":{"observed_at":"2026-08-16T04:39:04.075074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.251341Z","title":"A finite-time analysis of two time-scale actor-critic methods","venue":null,"work_id":"348fca65-5f13-422e-b2f8-1d47a1bb0b7d","year":2020},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.079544Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:21a1f49418dbccfbdfbd54d8802f6984808c55e88752f0e72d424a9ef9b1cc59","observation_id":"1d50a4fe-ed6d-490a-a5f6-920ac378f22a","resolution":{"observed_at":"2026-08-16T04:39:04.255580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-16T04:39:04.083982Z","title":"Non-asymptotic convergence analysis of two time-scale (natural) actor-critic algorithms","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.083982Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:ceece817fa40a72847b0cd77e4cbfec1475f339de3d9126537038eced4ba08bb","observation_id":"a3378bad-de8b-4c30-b78e-c7e048cbb534","resolution":{"observed_at":"2026-08-16T04:39:04.083982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.237161Z","title":"Provably global convergence of actor-critic: A case for linear quadratic regulator with ergodic cost","venue":null,"work_id":"df402073-f291-4891-aef5-2eb075af0583","year":2019},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.089531Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:4ca5e9be09865a110b1dd22d5e4deb90bd95302753b1674f54f378a088815320","observation_id":"7b3dcbe4-54e8-475b-9c6c-b6937a689ed9","resolution":{"observed_at":"2026-08-16T04:39:04.242143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.222728Z","title":"Provably convergent two-timescale off-policy actor-critic with function approximation","venue":null,"work_id":"5ee59195-7a4c-4177-83c5-a70849429015","year":2020},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.093831Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:d902ad32558407a7a6a8b76d64e1e066a4e7bcfd27a697e1535bf0c1ed859e43","observation_id":"bdcce64d-f4f4-4b70-a10c-6f7fd701b328","resolution":{"observed_at":"2026-08-16T04:39:04.227283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.209502Z","title":"Single timescale actor-critic method to solve the linear quadratic regulator with convergence guarantees","venue":null,"work_id":"870a4648-8a20-4b2d-9611-fafa5171670d","year":2023},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.098363Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:3ce7917445064a050fcaae119d94a73cac99fb4cc17e7286d1c692c6177e0516","observation_id":"1bdb2454-131d-4cbc-9021-1ee40c1bb6fd","resolution":{"observed_at":"2026-08-16T04:39:04.213778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:04.102807Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.102807Z"},"links":{"citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:69ef35cce48be4f85b669b6f59492f5bb70762b9c331efbc74ae697aeca9a396","observation_id":"33689e7b-af1a-481d-843f-7dee1f23cbb5","resolution":{"observed_at":"2026-08-16T04:39:04.102807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2505.01041."}