{"as_of":"2026-08-15T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6890a786a32a1f886f2280ea99657a57d72181206b9e86d21564666a80da9c72","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:56:46.449273Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T21:50:18.827822Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T21:53:59.250802Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.04406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04406","snapshot_observed_at":"2026-06-29T21:53:59.250802Z","title":"Convergence and sample complexity of first-order methods for agnostic reinforcement learning.arXiv preprint arXiv:2507.04406,","venue":null,"work_id":"36b14c0b-1634-4f14-bc30-0b017326f78e","year":null},"citing_paper":{"arxiv_id":"2605.25507","last_updated":"2026-05-26T17:23:26Z","snapshot_observed_at":"2026-08-13T15:47:23.369259Z","submitted_at":"2026-05-25T07:11:50Z","title":"Credit Assignment with Resets in Language Model Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T21:50:18.827822Z"},"links":{"cited_paper":"/paper/2507.04406","citing_paper":"/paper/2605.25507"},"observation_digest":"sha256:be6fd6550a2a56d97656faa8a910688a606ee4b0d67b87d9279c96e6b9690999","observation_id":"2620bc73-578c-44a4-8e65-b6a2367a48dd","resolution":{"observed_at":"2026-06-29T21:53:59.252556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04406/citation-record","integrity":"/paper/2507.04406/integrity","json":"/paper/2507.04406/citation-record.json","paper":"/paper/2507.04406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:55.609810Z","title":"Agarwal, N","venue":null,"work_id":"ab51a40e-a62d-4d86-b0a9-ba8a0f7787c1","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.503054Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:74b0be29f6e27e3404810476144e4ad2a898866e48e30677f6ce29a9101e313c","observation_id":"4cb08db8-3aae-4918-847c-d63652e6b698","resolution":{"observed_at":"2026-08-06T19:56:55.769014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:55.300148Z","title":"Agarwal, S","venue":null,"work_id":"0466e29b-ba61-49cb-a37b-c20e95c4ad2f","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.547698Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:2349149a2c143b9c3522a441b89981182cbb289f505ffa46517f42f04e0aa61d","observation_id":"dbdaa2ff-6213-445a-b08b-b46becb5f5a3","resolution":{"observed_at":"2026-08-06T19:56:55.380046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:55.149043Z","title":"Agarwal, S","venue":null,"work_id":"700860d7-0a2e-4eb1-ac26-ddac622c965b","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.606734Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:aa58b41f12ed51b1d89f113243a39fdd5e788bce612cae37d6c4b6365fa1a4ef","observation_id":"6b73a9c2-1863-42ce-be42-c7e3235d89cb","resolution":{"observed_at":"2026-08-06T19:56:55.221806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-06T19:56:42.688874Z","title":"Akkaya, M","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.688874Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:345b80d12c5f969b8b212ebdb9c473d15034b90158d58d1839bccddd570d1844","observation_id":"61b49577-d808-4e8c-86f4-307547fc27d8","resolution":{"observed_at":"2026-08-06T19:56:42.688874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15382","last_updated":"2023-03-13T18:33:28Z","snapshot_observed_at":"2026-08-13T14:15:34.498837Z","submitted_at":"2022-09-30T11:17:44Z","title":"Linear Convergence for Natural Policy Gradient with Log-linear Policy Parametrization","version":2},"cited_work":{"arxiv_id":"2209.15382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15382","snapshot_observed_at":"2026-08-06T19:56:46.894140Z","title":"Linear Convergence for Natural Policy Gradient with Log-linear Policy Parametrization","venue":"cs.LG","work_id":"6537f5af-c0b3-4641-ae6c-3d504aef9f08","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.747280Z"},"links":{"cited_paper":"/paper/2209.15382","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:e37bb29480d3daee8909864b9110e93408bc33e857a62562c8e81407aa7c1e93","observation_id":"3a48d8a1-0a0e-410a-ac46-4cff4b2ed971","resolution":{"observed_at":"2026-08-06T19:56:46.944973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.962894Z","title":"Alfano, R","venue":null,"work_id":"c92d6ccd-d93a-422c-9fba-7db61cdd1fab","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.814465Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:5f68d245d4398f3494854bd87215cbf2b0a5072126340765950fa6e51ed56328","observation_id":"ce801c2c-3810-4685-ab3a-220f890f5392","resolution":{"observed_at":"2026-08-06T19:56:55.018954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.810294Z","title":"Bagnell, S","venue":null,"work_id":"2f7b1fea-6140-4a94-be15-1fcc0cbd5c75","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.885713Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:31e11a5b67d723e99939297b0a6155ecac17a1986bb51e24c207c223c104d063","observation_id":"8e6b671c-d9e7-4ef5-821c-4d47cd8ee2f6","resolution":{"observed_at":"2026-08-06T19:56:54.892376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.687250Z","title":"Beck and M","venue":null,"work_id":"38de9b3e-d40e-4f4b-a907-06b0802976d6","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.944430Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:48c2b3e995a87169ef2a52e9b2d8fe494c9fb7dfae14bdd4d681859819a63baa","observation_id":"f186f1d8-9b20-4275-9830-16d8977f5f8e","resolution":{"observed_at":"2026-08-06T19:56:54.735011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:43.005441Z","title":"Bertsekas and J","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.005441Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:005a5cfe4b8028fa522ccd4999b0982db0579ef0c360bf700695e4a14d2dca05","observation_id":"97f64c9c-04de-44a1-994b-be8663a0da70","resolution":{"observed_at":"2026-08-06T19:56:43.005441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.494623Z","title":"Bhandari and D","venue":null,"work_id":"e3a7e5f2-8f02-4e44-a59c-d43c431ae6ce","year":2024},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.064504Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:11b04b173322c6810fb5452ee193d9a7b89ad550354f3cf1985109ca2d515bee","observation_id":"547c527b-ccfa-4f03-8ea5-24e8a06a458e","resolution":{"observed_at":"2026-08-06T19:56:54.591127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T19:56:43.152040Z","title":"Brockman, V","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.152040Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:75311e2947859611ac5bee1a563efa6dd35dbcf68c9291d78a4dc40a66e3ea48","observation_id":"87bc8901-84e5-4e6e-85c4-f8998e664b44","resolution":{"observed_at":"2026-08-06T19:56:43.152040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.338630Z","title":"Chen and N","venue":null,"work_id":"aa1ae8a7-8366-47a0-8807-69ea86ed4d11","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.212351Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a8b4ecf0c684bcbb737fb6dd3bdbce663d2dd83674e1e73c047f9dea7b96e49c","observation_id":"5ab872a4-1a6a-414e-8a52-c7936fd1f999","resolution":{"observed_at":"2026-08-06T19:56:54.399478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.227193Z","title":null,"venue":null,"work_id":"37c6206e-8ab7-40fa-aeb5-680223091f96","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.300680Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:d57c89725c4f83d02b00b430d639bb173b3edbfc465f071fa1aa59f240c6c24c","observation_id":"48e2ceb8-e6fb-4ab9-b704-f57ebe9e4356","resolution":{"observed_at":"2026-08-06T19:56:54.274635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.068433Z","title":null,"venue":null,"work_id":"748ec436-65b3-4ca9-89cc-c20c20ab0763","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.360615Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:f758c9e11d377908d6ad758fd9eb280523cf04c5b72cdef8209250d73d87ce84","observation_id":"804cb60b-5951-4213-b16e-7a914deb3133","resolution":{"observed_at":"2026-08-06T19:56:54.151302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.900049Z","title":"Even-Dar, S","venue":null,"work_id":"8f133ce5-e0f6-4c6d-bbb1-a3ac0ca7702e","year":2009},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.432264Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:18d0d6dd5da23cba2c4a44386fbc1fb0db2239cac076f9e8bb4f8ccddd7efc9e","observation_id":"a06fdf79-8f4e-42fb-84b7-6db34e66bf27","resolution":{"observed_at":"2026-08-06T19:56:53.948994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.791864Z","title":"Frank and P","venue":null,"work_id":"9d0c66eb-9455-4f0e-9984-a265ddafa7c0","year":1956},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.522085Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:513edc4f778899e451a88287fdffee9fc0c11bfb4a8af015fcf24131884ff288","observation_id":"079b41e2-47de-40bc-b4f7-951c094d2321","resolution":{"observed_at":"2026-08-06T19:56:53.847496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.685385Z","title":"Geist, B","venue":null,"work_id":"de14ce60-0215-4123-bef6-3a0efe2fcc52","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.591388Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:4e9c71beccd559dd43496b6e9d8ec82ae0f922affe0d1052f42c9d9886085ee9","observation_id":"9310e645-84f7-40a6-9ea1-1965563cdac1","resolution":{"observed_at":"2026-08-06T19:56:53.735537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.544236Z","title":"Grudzien, C","venue":null,"work_id":"5d31eec7-a844-41f4-96e5-1076f497d8bb","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.686563Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:62d50ae099f5939beb2525f83095c16e6cfbbff60e973939085b1c615742c28c","observation_id":"2c9851d6-064e-4a23-8846-181e764637b3","resolution":{"observed_at":"2026-08-06T19:56:53.615558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.290997Z","title":null,"venue":null,"work_id":"f2aa65ca-d9ab-4286-9c9c-77257f27a7c0","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.771531Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:5b5c66b69534929cf303feac4c84bd642425650d438c86b70870d5987742ddc9","observation_id":"b7889c24-92d6-4d34-aabd-ab55574468bb","resolution":{"observed_at":"2026-08-06T19:56:53.403754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.086461Z","title":"Jiang, A","venue":null,"work_id":"cebf869e-7d07-4f9e-a3f1-b000ba111cb7","year":2017},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.849683Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:90695cf4474ffc44582cb641f9443ce103ac71cf66b20ef5f090019cc2dd5164","observation_id":"ecf22019-93fd-48c5-95ea-a2dbafacc3e2","resolution":{"observed_at":"2026-08-06T19:56:53.193150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:43.964974Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.964974Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:52ad60858865afefeb3574cb09034d2eea52cfd3e0c674910a1527ebdbcc2b2b","observation_id":"8c056add-ab94-4309-b6a6-d07d9a185a6a","resolution":{"observed_at":"2026-08-06T19:56:43.964974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.913231Z","title":null,"venue":null,"work_id":"747b1163-e23f-4363-8893-bfdc3c4a67fc","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.032915Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:9eab8deaa292b041468ddf5c1c9519809a445554429fdc4bf5d33e3fea84f7aa","observation_id":"91edb8ea-b2d1-4d47-9bf0-e0c8fa829a53","resolution":{"observed_at":"2026-08-06T19:56:52.962578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.686319Z","title":"Johnson, C","venue":null,"work_id":"69a91fe8-9eb6-46d5-a235-151fc22bf207","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.081985Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:b69844cfe8863b7050c3623e86ace0a685c472dcddaeeefe0f7e564ab9bb69f1","observation_id":"35fa3159-72a6-4cbb-8a5b-cf9a1216ddb2","resolution":{"observed_at":"2026-08-06T19:56:52.771011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:44.118452Z","title":"Ju and G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.118452Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:175c60c82f4592f4a93d6610554e77d409e90f29ad8bb45cf67a7b83a28256a1","observation_id":"d53b4a6f-59ec-4938-a9e8-11db32de3450","resolution":{"observed_at":"2026-08-06T19:56:44.118452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.562281Z","title":"Kakade and J","venue":null,"work_id":"40576c11-a1e6-4c14-8642-0e273b34cb2e","year":2002},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.206945Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:28ba3b2ef5d77254db7105e9aa682a026d37d7a29e592b25a9a59eb0d28740ec","observation_id":"f740fd37-05e7-4b81-98ff-3815c1399566","resolution":{"observed_at":"2026-08-06T19:56:52.627089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.353116Z","title":null,"venue":null,"work_id":"2ab82e69-d2d9-485f-afef-ab1bcbb4673a","year":2001},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.259673Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:b6a3c02cf568827c8ec3162cb9c3ad7d0c824755b388d4e1256673dc135cdea1","observation_id":"1903ff39-ddfb-4e94-afbe-12a827d4d68b","resolution":{"observed_at":"2026-08-06T19:56:52.430002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.149531Z","title":null,"venue":null,"work_id":"4ac4cd0c-82b0-4efe-9ecd-f95aba00e569","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.340317Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:ec3309a3a207a9968f6f151b9e1f82b3bc0e42a33cbb30f1e0d57f7896365a7d","observation_id":"ddfe54ef-ab21-4ae8-a771-db1415b3773c","resolution":{"observed_at":"2026-08-06T19:56:52.280873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.850405Z","title":null,"venue":null,"work_id":"99059028-45b2-4ee0-a837-1690e2525955","year":2014},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.430229Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:bfb875b3328c2cf08aed9cf8ffac67d14d2e4d9cd443dce2f835082673f9ab34","observation_id":"c0b326c0-3e58-4e44-ac3b-562e6b3de904","resolution":{"observed_at":"2026-08-06T19:56:52.014064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.574942Z","title":"Krishnamurthy, A","venue":null,"work_id":"d059eff2-bc7b-4714-b3d5-1f9fae888bb0","year":2016},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.528849Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:4bcb2c937cf2f83f22e1f9e805aa7565c23f3fac2c7c36acaf32276e9dfbdb28","observation_id":"720d198c-24d4-4ccd-935c-171fc5b54a64","resolution":{"observed_at":"2026-08-06T19:56:51.690570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05405","last_updated":"2025-04-07T18:19:56Z","snapshot_observed_at":"2026-08-13T16:41:52.408921Z","submitted_at":"2025-04-07T18:19:56Z","title":"The Role of Environment Access in Agnostic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.05405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05405","snapshot_observed_at":"2026-08-06T19:56:46.700343Z","title":"The Role of Environment Access in Agnostic Reinforcement Learning","venue":"cs.LG","work_id":"2f4a0da4-b52b-48a8-88e8-f5249b3564d5","year":2025},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.589686Z"},"links":{"cited_paper":"/paper/2504.05405","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:e07c36f170fbf9d187d52b4afd999b257f912ab1af37f247bd9a9e26cb883521","observation_id":"ae6355d2-53d5-4006-bf07-89d30cbf6a5e","resolution":{"observed_at":"2026-08-06T19:56:46.744379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.309762Z","title":null,"venue":null,"work_id":"621a20f3-36b7-4198-95c0-9b46f8b4d452","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.685036Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:e3ebd111c77210e1c1a540f46cdf7265e0093d7f2562360df2edf0574184e854","observation_id":"d876acf5-0ee3-41e2-8ec8-20c60df2ba57","resolution":{"observed_at":"2026-08-06T19:56:51.426378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.078788Z","title":null,"venue":null,"work_id":"a48d8204-47d6-4101-986e-1d13d2a46352","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.771130Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:7837d18b52de2727d8ff7620eff691cba6c627b5650abf954e7b4706f6820ce1","observation_id":"03a6ccb3-1981-4cd8-807d-e40dd642b1fc","resolution":{"observed_at":"2026-08-06T19:56:51.193656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-15T12:04:28.662048Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-06T19:56:44.872943Z","title":"Lillicrap","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.872943Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a082e674309faef95c5c1693ed8a1e687c85d090620ff5a508cfecd4ad03df3d","observation_id":"e35fad7d-dc00-45b0-8e3d-b8c41e659f7f","resolution":{"observed_at":"2026-08-06T19:56:44.872943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.806522Z","title":null,"venue":null,"work_id":"29e2de63-27da-4f78-9450-09741429344d","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.947341Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:0de51ff94b8fe40d2aa562c11843bca7f13c77cae4f7d09e5b78c764d97bcf20","observation_id":"64c2c14a-8925-4eef-a705-67621c5bbb64","resolution":{"observed_at":"2026-08-06T19:56:50.941668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.504747Z","title":"Mannor, Y","venue":null,"work_id":"9020c3fd-75b3-4a99-ae12-a59d1c078fea","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.029546Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:644506b7284fdc09385c0855cde039681de3c00beaa56b9e22cc634f5b94f7d8","observation_id":"a697fa0a-93a3-4c4f-b1aa-0fd84058bc08","resolution":{"observed_at":"2026-08-06T19:56:50.644861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.349664Z","title":null,"venue":null,"work_id":"4e68413a-c76c-43b6-a523-9ef39448579e","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.085461Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:aa9c625010bfcd58e0cd355e9cc50790f416189ad6600b96f39fc1cd3dc89560","observation_id":"cb8f30b9-858a-4f1b-81d2-396965c6b071","resolution":{"observed_at":"2026-08-06T19:56:50.415231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.023785Z","title":null,"venue":null,"work_id":"125a65b4-359e-4fc6-8fcf-cc38e996f8f4","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.156647Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:5f308e9b156c10529688fef774ad5f02da077fa5a7cbf3c43b0fe142d45476eb","observation_id":"e36d6700-19b9-46a5-8b72-d5fb045699fb","resolution":{"observed_at":"2026-08-06T19:56:50.172857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.762613Z","title":"Mu and D","venue":null,"work_id":"d961966b-502c-4353-8dcb-723df5d448d6","year":2024},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.224617Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:d560403b7e4856d2bbd1e00e067f5da0e5c9eae90958cfa0a14ab9b5602308b0","observation_id":"761e8cbe-81a7-4ae4-b549-9d4f4f221291","resolution":{"observed_at":"2026-08-06T19:56:49.885374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.465471Z","title":null,"venue":null,"work_id":"4eefa122-53e6-419e-8209-edb1d6e4ce92","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.273675Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:c5d7ea506e654055747515ed43b39690ce3f1148460175fdfac2a822cecbdbb8","observation_id":"9bb38d44-a3da-4306-8eff-d8fcb130ff92","resolution":{"observed_at":"2026-08-06T19:56:49.566220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.185011Z","title":null,"venue":null,"work_id":"6d41714d-f58f-46ff-b006-723acc9eb0f8","year":1999},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.341213Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:188631dc86723fb1c219bd8145baeade0acc7d7fe09bd8ce5c410d622d8a4e13","observation_id":"35bb5d3f-170c-4db7-9189-48206e91fa1c","resolution":{"observed_at":"2026-08-06T19:56:49.300451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.063082Z","title":null,"venue":null,"work_id":"f302d5c6-11bf-4aa7-899b-ac9b9da229ee","year":1983},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.401503Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:03c1db618e82d26a80f2054727507c448bce8f44e1aeec0fbd4d3bc3403982ae","observation_id":"a2ad5e08-2779-46a3-9c82-22fd29811265","resolution":{"observed_at":"2026-08-06T19:56:49.148822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:45.428551Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.428551Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:c84a3c295e7cd43982a3bd5925b105e1e7735b673f6f6ebef143d69ec2166903","observation_id":"6d6105a0-d557-45bc-b6bb-05de768896f6","resolution":{"observed_at":"2026-08-06T19:56:45.428551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.869852Z","title":null,"venue":null,"work_id":"60c6652c-3986-47df-937b-562ef6ab1c68","year":1994},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.480563Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:638cefaf728a16e3c3648542c868aacc9692c776fac6f52a41b1206489a6c334","observation_id":"f9a7b781-900e-4d38-9026-2bc097e05bc4","resolution":{"observed_at":"2026-08-06T19:56:48.990240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.694954Z","title":"Scherrer","venue":null,"work_id":"5bde0679-0c9c-4128-a67c-371daa4b01e0","year":2014},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.538405Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a2655f42a04bc3255f33c72f47cef77cfaafcf1c470c47087780bad5544d4d4c","observation_id":"a448a263-20f4-4f70-8b38-b602d42cb30a","resolution":{"observed_at":"2026-08-06T19:56:48.809612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.515614Z","title":"Scherrer and M","venue":null,"work_id":"27d7b4a5-887b-437e-8807-1e5dd884f4bc","year":2014},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.609898Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a815b1fbee680bf0c2766f05cdfe31c14fb9cbac184298da847ac1f2f198da1f","observation_id":"9b9d5221-9a52-49e0-be58-99d26e3cc2d5","resolution":{"observed_at":"2026-08-06T19:56:48.595104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T19:56:45.687253Z","title":"Schulman, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.687253Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:ed09d6c08546f67274f246c2d5d5fca642a1cca0c7a272864366a32ba03447a6","observation_id":"920be5b2-6a53-4195-b1c6-48b0c2efd2ab","resolution":{"observed_at":"2026-08-06T19:56:45.687253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.314916Z","title":"Sekhari, C","venue":null,"work_id":"81a4aa94-1dce-41c5-9ca6-a4e7a26ced50","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.780324Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:7ea9f6b18fef29e457453490d16b65aeb60e7b4116278073bac85581eaec192c","observation_id":"5ea4cc05-0826-43ae-befc-31e94eb4b87c","resolution":{"observed_at":"2026-08-06T19:56:48.423747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11033","last_updated":"2025-07-06T14:24:11Z","snapshot_observed_at":"2026-08-15T06:45:13.478074Z","submitted_at":"2025-02-16T08:05:46Z","title":"Convergence of Policy Mirror Descent Beyond Compatible Function Approximation","version":3},"cited_work":{"arxiv_id":"2502.11033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11033","snapshot_observed_at":"2026-08-06T19:56:46.569107Z","title":"Convergence of Policy Mirror Descent Beyond Compatible Function Approximation","venue":"cs.LG","work_id":"2d7bead3-b15b-430a-8527-3f83b5cc3dda","year":2025},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.846402Z"},"links":{"cited_paper":"/paper/2502.11033","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:063f502dfb6782d553b118b5990afab4c86d4a052367676a5c2b4032e7585ee6","observation_id":"85c38d33-ce5a-49fc-8843-99803980f082","resolution":{"observed_at":"2026-08-06T19:56:46.619489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:45.893634Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.893634Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:e5273e89463d0687de18a79d1f112f118da306ceeff91afa51bd775e86aa502c","observation_id":"559703b8-d094-4d62-a071-cbcd094a8ec6","resolution":{"observed_at":"2026-08-06T19:56:45.893634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.225574Z","title":null,"venue":null,"work_id":"45d78675-d538-404b-82ba-6476ecb9b2fe","year":1999},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.945576Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:5594c8230c4f321bb1514dc620b8d153a19c209bde51b9077686ef79a0217301","observation_id":"4dc824b3-e8c0-4bb0-bba7-31b6446568ee","resolution":{"observed_at":"2026-08-06T19:56:48.283564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-06T19:56:46.000303Z","title":"Tomar, L","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.000303Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:2460955a42af7c91af1e4c9fa1818f7c335f1cb938a0147fc9fe94ba0b0bcc58","observation_id":"ae7111e3-ab19-47b2-b7ab-59905970265b","resolution":{"observed_at":"2026-08-06T19:56:46.000303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:46.046621Z","title":"Vershynin","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.046621Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:ea987bedda120faed550f8ef4afc6dde250b57d35ac69d5488701e540abb5adb","observation_id":"273af57d-c580-4457-a7e7-adf7eca57901","resolution":{"observed_at":"2026-08-06T19:56:46.046621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.018630Z","title":null,"venue":null,"work_id":"10ce712b-16ea-40f4-b1ae-16148ce84232","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.097993Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:e4ab2e40e5ed9b7396acc8341cd24294097cb4f71c87970c16efed3c29a29528","observation_id":"d8324125-b868-4f48-a877-50282f7e2f5a","resolution":{"observed_at":"2026-08-06T19:56:48.125297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.821792Z","title":"Yang and M","venue":null,"work_id":"2c854547-356b-4dc2-a78b-28aacf6066d0","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.150654Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:3b4ca66532ee7359344e16e5107f831d6d152ccefe6312ad0d96c969b1eae85b","observation_id":"a40d530f-4b33-4938-8b7d-beb633a48f0a","resolution":{"observed_at":"2026-08-06T19:56:47.950777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.653499Z","title":"Yang and M","venue":null,"work_id":"ed116a9d-70ba-48e5-a608-1c6072bae7a9","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.198579Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:6f9d8d9b0ce43500ddf46099c4ca88bec21d45702c7e0b08155f3ad7f1124c9a","observation_id":"72a8ebea-8d42-452c-9d8f-24ab795c99b9","resolution":{"observed_at":"2026-08-06T19:56:47.753489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-08-14T17:05:38.465346Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-06T19:56:46.234417Z","title":"Young and T","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.234417Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:cbc77d095eb23bb8cfcff20f79883031d5615ec64510c201ed46fbaa2e9ca2c4","observation_id":"31fb04ef-15dd-4d81-a775-2b5c09f3d042","resolution":{"observed_at":"2026-08-06T19:56:46.234417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.521044Z","title":null,"venue":null,"work_id":"f8b8fd6b-aacf-40bd-a024-6c9927880edc","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.313633Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:031b49db62a5dbc2895ebce6f29ffb32ef67f794ab782f6fd49919b6be660817","observation_id":"0ceb1743-7cc5-4209-9961-2238828dca5d","resolution":{"observed_at":"2026-08-06T19:56:47.593740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.348369Z","title":null,"venue":null,"work_id":"8d515f6c-293c-4d88-92e1-666dce1e385c","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.355145Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:d8eda8e62a85e0b4fe6979bb5547d83cb6cffe2cdaafc3dd771109dbb0ddb4b1","observation_id":"a3d6a1de-b23d-417d-ad79-ace3acb4b356","resolution":{"observed_at":"2026-08-06T19:56:47.460885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.191387Z","title":null,"venue":null,"work_id":"3a049624-3fa8-40b4-a623-aafa8af330d2","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.390450Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:c9beb1de6b52064ad3cbc3b50d93eab375e9704937ff50bce7a44e79291e4209","observation_id":"49d8462a-9de8-4f67-a5f1-6dcec81c199f","resolution":{"observed_at":"2026-08-06T19:56:47.282605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.046234Z","title":"Zhang, A","venue":null,"work_id":"8f7ce1e9-4245-445d-8235-2b80050d643c","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.449273Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:6551c503f2bff9b3d026767945357d1127273b9b851f1155da324cf40f51f09c","observation_id":"b9a2af75-23a5-4467-a444-e72bc3caaa7a","resolution":{"observed_at":"2026-08-06T19:56:47.112733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T23:26:40.831365Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.04406."}