{"as_of":"2026-08-20T06:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4090189f1836b9159a2baf8026bf7da610ac8a08f254cbd7e1e2739caf05952","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:47:08.802211Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1909.02769/citation-record","integrity":"/paper/1909.02769/integrity","json":"/paper/1909.02769/citation-record.json","paper":"/paper/1909.02769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.043808Z","title":null,"venue":null,"work_id":"9c61a73c-0e0d-4320-8740-40f5ad2e6287","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.736214Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:4c25935ea97ca5616cf095be7a2b47799978dc4020314b8428bbd887bd47aeaf","observation_id":"27ae6628-b5af-497e-821a-4d18c8f20f7f","resolution":{"observed_at":"2026-08-14T04:47:09.046718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.034110Z","title":null,"venue":null,"work_id":"f0c082e9-abd6-4212-ac19-b92930d3a21f","year":2000},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.739625Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:fc44c1901eb80869ddbc707c192ff7ddfcd7dcf59a5c504e7e8b0ca49983f264","observation_id":"c1a6a39d-480f-4387-98c7-627952f0d949","resolution":{"observed_at":"2026-08-14T04:47:09.038264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.968027Z","title":"The only difference is the approximation ter m which we bound in E.5","venue":null,"work_id":"f7baa87e-3bcf-4738-bf1f-0c7120eda2a0","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.763760Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:11ee4184f675a20f43821d498e7af53a0e535affa3043726ee2cc6b3aa5095b5","observation_id":"58988014-eee5-4149-ade9-6d1a1516382f","resolution":{"observed_at":"2026-08-14T04:47:08.971284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.959112Z","title":"non- euclidean, unregularized vs","venue":null,"work_id":"71885f83-7392-4d7d-98f9-df8514301f7c","year":1997},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.767172Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:b9d669736dd1bd66d072c9b33d8d64d38d1b31adf126b143296d2139a6aa4f88","observation_id":"efe63d85-b522-4406-89aa-b57a39700d16","resolution":{"observed_at":"2026-08-14T04:47:08.962357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.024886Z","title":null,"venue":null,"work_id":"62d87054-c624-4aae-89d0-b0c7ecca6d6b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.743335Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:6d2a58bf8f75dfa0849115e75486c882a7bc56cf1c5f3a638c47d49d2f53c7c2","observation_id":"66b59133-8b8c-4b5e-b803-0dbdf0920770","resolution":{"observed_at":"2026-08-14T04:47:09.028033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.015480Z","title":"WhereCω,1 = √ A,Cω,3 = 1 for the euclidean case, and Cω,1 = 1,Cω,3 = logA for the non-euclidean case","venue":null,"work_id":"104a94b3-e108-4fe3-8546-2d84f9038ebe","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.746609Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:351cb03a7d1553917f87a477bfbe7b0b7c818d0457c3cfecdb1d52cac14a9bf6","observation_id":"cf7e8417-522e-4b0a-80d2-971ec7c92fd0","resolution":{"observed_at":"2026-08-14T04:47:09.019274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.005844Z","title":null,"venue":null,"work_id":"5bfb1b59-79cf-438e-b3e4-7557a9cd3d4a","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.750296Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:282c62ade0406a459e4c77ac68f1cf63339acca89920b9be916a9e84232ff585","observation_id":"f5f13223-a89d-4191-a53a-e76c138f82c6","resolution":{"observed_at":"2026-08-14T04:47:09.009673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.996249Z","title":"WhereCω,1 = √ A,Cω,3 = 1 for the euclidean case, and Cω,1 = 1,Cω,3 = logA for the non-euclidean case","venue":null,"work_id":"aa666a5f-5eb4-48cc-8aa4-c28497747a2d","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.753588Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:9beab468785764b8c1f808f74236b2a0cf9bf0df5fd2714069aa550045ae8aef","observation_id":"c20aa758-a173-4606-9e3f-cbf8d46b7bfb","resolution":{"observed_at":"2026-08-14T04:47:08.999885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.986233Z","title":null,"venue":null,"work_id":"dc6ef874-9d38-4b5a-ac3a-78864e501f5b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.757324Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:133a6181a205bee7fa8f6aa434601e11b9c171165363569915b32d0fd847b698","observation_id":"93ae11a8-afaf-4ca8-b46b-b59d64516109","resolution":{"observed_at":"2026-08-14T04:47:08.989294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.977001Z","title":"(a) In Lemma 20 we deal with the sampling error","venue":null,"work_id":"d738511c-c84d-44ba-8c0a-3c3a80291409","year":2003},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.760535Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:4f06db128d662ae5e6ac66e353bd9cea63bcf937adb735aebfb4c307bb26cd01","observation_id":"55445983-088c-42e4-8b83-bd4efb7d2177","resolution":{"observed_at":"2026-08-14T04:47:08.980478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.950033Z","title":"In the next lemma we combine the results of Lemmas 20 and 21 to b ound the overall approximation error due to both sampling and truncation","venue":null,"work_id":"3b59af01-55e9-415f-baa9-1fa23c04ae8c","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.770555Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:46e397ccc6a989392410c640867076cac49a2d9135289671fe308755f6125b79","observation_id":"bc1c9d44-33f3-4d05-ac71-25770abd81ac","resolution":{"observed_at":"2026-08-14T04:47:08.953319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.940932Z","title":null,"venue":null,"work_id":"8d0c94f4-d7a9-4fa6-9366-637dd4cfd66b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.773935Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:24581c49085eda3a74c63760371cd3ea00286bb9508cdcf0211dfa600d21ee26","observation_id":"2371636e-77e1-4d26-8d7d-b4a8e3a8b8c7","resolution":{"observed_at":"2026-08-14T04:47:08.943964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.931051Z","title":null,"venue":null,"work_id":"c7f3679e-5377-420c-8cbf-52bd01e08db9","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.777023Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:d8cb263b8ef993466880f426573cfc5954c4258d78cfcca0a57fef1519fa9cc4","observation_id":"7ca7e3c4-653a-4f59-95e5-16ee2c79b86a","resolution":{"observed_at":"2026-08-14T04:47:08.934522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.921463Z","title":"The statement holds by the properties of 1 2‖·‖2 2 and thus holds for both the uniform and exact versions","venue":null,"work_id":"e6ca9553-1f14-4bf4-8e2d-998baac9b997","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.780702Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:754f175689b64e7735d08de1c62c418915d5c84abd866a5cb1f44560d7f6b90c","observation_id":"62d802c8-6992-4a0e-a69e-e22e78dfc04a","resolution":{"observed_at":"2026-08-14T04:47:08.925105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.912407Z","title":"For the non-euclidean case,ω(·) = H(·) + logA","venue":null,"work_id":"3d84f1cc-5b4e-4e26-8b38-10655ed8e8ce","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.784197Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:73f40c914ef2b274365093084e59c170674350a9c690d23a5d53bf20e3b04a68","observation_id":"d2405a42-66bd-41a8-915e-09c220d835ba","resolution":{"observed_at":"2026-08-14T04:47:08.915618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.901575Z","title":"(74) By the ﬁrst order optimality condition, for any state s and policyπ, ⟨∇ω (s;πk+1)−∇ω (s;πk),πk+1(·| s)−π⟩≤ tk⟨ˆqπk λ (s,·) +λ∇ω (s;πk),π−πk+1(·| s)⟩","venue":null,"work_id":"c7cb945a-d6ce-4c36-8ed2-c79394f3eb48","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.787314Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:dd4bb5c62b1b15575d62fb17406033fede11dd7fd5097f8f0c895611a8a81e7d","observation_id":"7af65408-fd5b-41c9-81ff-c184dc7bcb28","resolution":{"observed_at":"2026-08-14T04:47:08.905881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.891866Z","title":null,"venue":null,"work_id":"7e5a0f76-1f78-4776-94b7-60ab8509a21b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.790347Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:f39fc56e6c8b4a1566daffac899ee889782178b9d9a31ed9f8c8b6acee9a09f2","observation_id":"9fcd234b-5d1a-41c7-8ca8-0320372afaca","resolution":{"observed_at":"2026-08-14T04:47:08.894985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.880998Z","title":null,"venue":null,"work_id":"9307ce41-72a0-4a6b-aa5e-0c040d349dc9","year":2014},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.793510Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:ed621b6b1af243c416367d9d3aee6520ddd6f011ae3a8cf3d16eb15388c2849f","observation_id":"2e951eae-63c9-452b-88ed-3cce9ab743b6","resolution":{"observed_at":"2026-08-14T04:47:08.884098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.871114Z","title":null,"venue":null,"work_id":"fdba1e98-f546-4a91-bb90-b87bdc9f556e","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.796489Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:457587abf7e1b29bcdd23ec617e850ee74ddc8139e9e7500188d646658b0ef37","observation_id":"53fd9995-616f-4611-974f-e82590d9addd","resolution":{"observed_at":"2026-08-14T04:47:08.874335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.861676Z","title":null,"venue":null,"work_id":"b00010df-d894-4db7-b94d-f367ba351750","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.799331Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:811d1090e039af8811b38579e1f06438cd2fbd93939cceb8897776cb86ef9ddb","observation_id":"f4280a46-45a2-414a-a43e-a4c2de889c7b","resolution":{"observed_at":"2026-08-14T04:47:08.865014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.849351Z","title":null,"venue":null,"work_id":"22123739-31fd-4e2f-918c-9f95b0f68504","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.802211Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:5f32f1a496a61f91b2bc9b4bb1b252ff5da4df2c5d3d846619eb81e5dec878e5","observation_id":"d5a6da65-0c71-48dc-a40c-69e899bcc0af","resolution":{"observed_at":"2026-08-14T04:47:08.854823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.10306","snapshot_observed_at":"2026-08-14T04:47:08.728735Z","title":"In ICML, volume 2, 267–274","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.728735Z"},"links":{"cited_paper":"/paper/1906.10306","citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:e4346811499ce37f2ec77f8e8d0f21697c5cf1ef3dac883da220ab164aac7a77","observation_id":"ece489f0-733e-4085-8d4b-11e9f78920b1","resolution":{"observed_at":"2026-08-14T04:47:08.728735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.052487Z","title":"MIT press","venue":null,"work_id":"f08b5ec3-94b0-4161-8eed-82269278cb70","year":2000},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.732647Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:d69d8d3d32879d59967e1f82ffbbf15ec9b49a0aa3b7d142c9572a379a8f53f9","observation_id":"806d2a1e-f687-4559-a210-8c6646ad89f1","resolution":{"observed_at":"2026-08-14T04:47:09.055634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01786","last_updated":"2022-06-20T01:01:28Z","snapshot_observed_at":"2026-08-18T17:48:45.731224Z","submitted_at":"2019-06-05T02:12:22Z","title":"Global Optimality Guarantees For Policy Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01786","snapshot_observed_at":"2026-08-14T04:47:08.724414Z","title":"arXiv preprint arXiv:1906.01786","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.724414Z"},"links":{"cited_paper":"/paper/1906.01786","citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:348c5c3b82a9e160a69b1fa19e9adef0cc120992fdd21b3c1769bc36b7d0c625","observation_id":"51e97a6a-4784-4ae1-a00a-61754fd6ac25","resolution":{"observed_at":"2026-08-14T04:47:08.724414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:1909.02769."}