{"as_of":"2026-08-10T02:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4575f6faf2e6a3961ed17387fc532f60570a9d210f36c05f2424b348ed8d478","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:37:43.138992Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T09:24:21.047027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.01432","doi":"10.48550/arxiv.2509.01432","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://arxiv.org/ abs/2509.01432","venue":"ArXiv.org","work_id":"eb7b9792-c345-4c28-beaa-94b676d9f03d","year":null},"citing_paper":{"arxiv_id":"2606.29092","last_updated":"2026-06-27T21:20:26Z","snapshot_observed_at":"2026-07-07T00:03:07.870153Z","submitted_at":"2026-06-27T21:20:26Z","title":"Priced Motion Through Optimal Faces: A Normal-Fan Geometry for Non-Stationary Adversarial MDPs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T09:24:21.047027Z"},"links":{"cited_paper":"/paper/2509.01432","citing_paper":"/paper/2606.29092"},"observation_digest":"sha256:62e24605d5449e0de0030f0dbcda8cc30aad45df82f8d06520d142ab92b83482","observation_id":"ca580af9-5ac7-4c3c-93c9-5f55179017f4","resolution":{"observed_at":"2026-06-30T09:24:31.577549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01432/citation-record","integrity":"/paper/2509.01432/integrity","json":"/paper/2509.01432/citation-record.json","paper":"/paper/2509.01432"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-07-06T06:45:27.162265Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-05T12:37:41.058718Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.058718Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:b0afcd39c2e0687628b12cb7703b27496fc14b87ebbb11c0504a92f4354896d4","observation_id":"7017f336-dd9e-45ff-8230-88b646aeb530","resolution":{"observed_at":"2026-08-05T12:37:41.058718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.038587Z","title":null,"venue":null,"work_id":"0a409fb3-d4a6-4852-b55c-80093f5dd6b0","year":2016},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.672881Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:e3969ea095da4ebfbdff146937167449f7ceaf4ea4833ffbb02e2967de36d726","observation_id":"4a833dc7-94fc-4146-b840-4d5c48f00440","resolution":{"observed_at":"2026-08-05T12:37:45.041818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02957","last_updated":"2025-08-15T12:29:02Z","snapshot_observed_at":"2026-08-08T11:31:58.146859Z","submitted_at":"2024-11-05T09:55:50Z","title":"Embedding Safety into RL: A New Take on Trust Region Methods","version":4},"cited_work":{"arxiv_id":"2411.02957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02957","snapshot_observed_at":"2026-08-05T12:37:43.755872Z","title":"Embedding Safety into RL: A New Take on Trust Region Methods","venue":"cs.LG","work_id":"049fee18-9a90-4dcf-a66f-ebb1876f1283","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.538793Z"},"links":{"cited_paper":"/paper/2411.02957","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:45bd938a492f5271084b0fa927faa6e75aadbc32b8ca185973e44168a26db9d0","observation_id":"00258e82-80e4-45ea-8e95-57830cc71bbb","resolution":{"observed_at":"2026-08-05T12:37:43.877379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00700","snapshot_observed_at":"2026-08-05T12:37:41.630698Z","title":"Central path proximal policy optimiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.630698Z"},"links":{"cited_paper":"/paper/2506.00700","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:6ed7aee768461b465917c2aa023331f277636f827a19f7a951fdac53a55211d6","observation_id":"7a1ef6a6-4859-4cd6-84de-2a19d6439ba4","resolution":{"observed_at":"2026-08-05T12:37:41.630698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01511","last_updated":"2023-01-27T11:13:06Z","snapshot_observed_at":"2026-08-09T21:45:14.993445Z","submitted_at":"2022-02-03T10:47:10Z","title":"Challenging Common Assumptions in Convex Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2202.01511","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.01511","snapshot_observed_at":"2026-08-05T12:37:43.437887Z","title":"Challenging Common Assumptions in Convex Reinforcement Learning","venue":"cs.LG","work_id":"62d3e6fd-3e28-4dee-af70-3a6f3c09e685","year":2022},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.781429Z"},"links":{"cited_paper":"/paper/2202.01511","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:dcce7a306f7daa60b9ff0fd1f9ad0affcddd398f99c9d373ced7e1c6e610616b","observation_id":"da82822d-3ba2-44a5-917e-2123bfae2ef0","resolution":{"observed_at":"2026-08-05T12:37:43.566193Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T12:37:41.925676Z","title":"Martin L Puterman.Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.925676Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:a76e634cfe9bdd65b80479e566bf8b42d71e1650d544118ce7a73cc291a4e3e3","observation_id":"9b485471-8f66-456a-bb8a-ff4990223dc6","resolution":{"observed_at":"2026-08-05T12:37:41.925676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.047807Z","title":"∇θ log π(a′|s′) X s,a Mπ(s, a|s′, a′)rπ(s, a) # (30) = (1 − γ)Es′,a′∼ω","venue":null,"work_id":"bbca9dec-32e6-4dfa-9540-8ac93f585937","year":2020},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.618804Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:ee01125f2c21f478d1e7bf0bc6e13684b0d6d9894f5a6a79f796377c2a30b0be","observation_id":"cd88364a-c138-46fb-9d54-6033d95ee3aa","resolution":{"observed_at":"2026-08-05T12:37:45.051249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.088094Z","title":"Mirror descent policy optimization","venue":null,"work_id":"6d800c91-95fc-4ec2-aaec-66e9c887dbed","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.255450Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:64b8d82be0047ac5e125240e6d266555b948550441a2c6a2574a8607f2d2fa4f","observation_id":"aeb9da49-ed6c-420a-af72-5dde93a64e1d","resolution":{"observed_at":"2026-08-05T12:37:45.091767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11066","last_updated":"2023-01-10T19:21:06Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T02:21:34Z","title":"Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11066","snapshot_observed_at":"2026-08-05T12:37:42.367138Z","title":"Junyu Zhang, Alec Koppel, Amrit Singh Bedi, Csaba Szepesvari, and Mengdi Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.367138Z"},"links":{"cited_paper":"/paper/2105.11066","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:581d48b097f1db785e2043b9d5ae5d4565aea07c55c8753a1f25b20e3b84f1ad","observation_id":"0b3b05ba-0956-46ea-af58-317195781842","resolution":{"observed_at":"2026-08-05T12:37:42.367138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.058406Z","title":"Interestingly, it also appears in the differential of the map between policy and state-action spaces","venue":null,"work_id":"697c119d-0437-4d7a-b315-552a45a9e813","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.537762Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:327a9a01da61bf50f30b5e00572ad6ec3053ea49c8b75346ed38ca7d17d0fb84","observation_id":"a9aeef1b-a7fe-40fa-8600-2d5e8c36dc54","resolution":{"observed_at":"2026-08-05T12:37:45.061885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.027487Z","title":"The reward isrπ(s, a) = P i zi[log pπ(i|s) − log zi]","venue":null,"work_id":"bc357b87-5e4b-496c-b6f5-22dceb5c9b97","year":2019},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.757521Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:2ce4f12c2af9c9d51b61450ebf404dbf4b3fce9c1abbdc82b58f18d881fc5147","observation_id":"c10c0bf0-b641-4ffe-83d7-6b67e25d83fe","resolution":{"observed_at":"2026-08-05T12:37:45.031379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.017176Z","title":null,"venue":null,"work_id":"a6e4f597-76d1-42e2-a4b9-5af7f653fa70","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.843902Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:afe5c7e7d3883bd189c90b433e5bb1ef46f886e0e7f413b8ad54552afdb564e5","observation_id":"bf70a841-3077-48e5-9eeb-61078b2c0de7","resolution":{"observed_at":"2026-08-05T12:37:45.020228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.007243Z","title":null,"venue":null,"work_id":"be6bfaf2-8f78-42e6-a1ba-87b8782db7f2","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.902934Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:ab7e7fe334b499a249c0062eac753850d71978023a8a6cd72c1f6dfe1edcb8c6","observation_id":"e2bf02d1-78b0-4fe9-b301-dc9c0ef871f9","resolution":{"observed_at":"2026-08-05T12:37:45.010369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:44.996161Z","title":"This results in anintractable policy divergence with Hessian 16 GTML 2025 HC(θ) = Es∼ωπ F (θ) + X i βiϕ′′(bi − Vci (θ))∇2 θVci (θ) θ=θk","venue":null,"work_id":"bed9a35b-4057-4569-a7df-827a715f2cd6","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.993772Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:c7715a47022c204b71333280da197e8f44a70360a8737c4306547a0cd8bb9cb4","observation_id":"e82d5808-1bfc-4614-9f81-0debb65398b8","resolution":{"observed_at":"2026-08-05T12:37:44.999360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:44.985167Z","title":"17 GTML 2025 When this standard geometry is restricted to the manifoldΩ, i.e","venue":null,"work_id":"7196a4ba-4f44-480b-8c3c-c7971f36e0ec","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:43.077827Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:90931ad18e9bc1dd562df5c6c0087f11a8204b5e490a62cb38bea1b623db866d","observation_id":"c0433396-15d7-4f67-b278-5d0b262b1b41","resolution":{"observed_at":"2026-08-05T12:37:44.988359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.068581Z","title":"Definition C.1(Successor Representation)","venue":null,"work_id":"2a9a60c1-5148-4348-94de-77baccba4167","year":2021},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.484428Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:29b360e48a80c9595e4bfd70f4bfe6ba73696e8d0d2d515c2093493a8664710f","observation_id":"69823b71-98d0-4259-bac2-dcf6352681f2","resolution":{"observed_at":"2026-08-05T12:37:45.071461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04426","last_updated":"2026-07-31T09:26:16Z","snapshot_observed_at":"2026-08-09T20:26:21.424571Z","submitted_at":"2025-01-08T11:20:48Z","title":"Dual-Force: Enhanced Offline Diversity Maximization under Imitation Constraints","version":2},"cited_work":{"arxiv_id":"2501.04426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04426","snapshot_observed_at":"2026-08-05T12:37:43.991437Z","title":"Dual-Force: Enhanced Offline Diversity Maximization under Imitation Constraints","venue":"cs.LG","work_id":"3922a36f-c5db-45c9-abc5-f82bcf1a554c","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.477513Z"},"links":{"cited_paper":"/paper/2501.04426","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:f06ed23c00ae5fc79e2c8c588d8ecc387004d51223750d0972c3a4a1b6608f7f","observation_id":"d3426bb7-af16-429d-8bb2-cc5bfcfd3252","resolution":{"observed_at":"2026-08-05T12:37:44.142127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-07-06T06:23:52.853341Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-05T12:37:41.228201Z","title":"Diversity is all you need: Learning skills without a reward function.arXiv preprint arXiv:1802.06070,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.228201Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:db518edf13b59eb54de531500d070dfcbf259dbac6a9f50fb2bd8bb5a4468b3b","observation_id":"b1fc9aea-a97a-4876-811b-c0960063ca8f","resolution":{"observed_at":"2026-08-05T12:37:41.228201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:44.974226Z","title":"Motivation for a General Hessian FrameworkThe existence of at least two distinct, natural geometries on the same occupancy manifold is a key insight","venue":null,"work_id":"fbdc940d-b769-4303-bc0a-1d63b855f7cd","year":2007},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:43.138992Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:aa8ba366d38804292931f978d8c40fa59d1160026f7969df7bb7438e7db8e9d3","observation_id":"14ad5aa8-9218-485c-9508-bfe56b4e9f54","resolution":{"observed_at":"2026-08-05T12:37:44.977412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00669","last_updated":"2022-01-04T14:40:18Z","snapshot_observed_at":"2026-07-06T11:14:53.651087Z","submitted_at":"2021-06-01T17:56:13Z","title":"Discovering Diverse Nearly Optimal Policies with Successor Features","version":2},"cited_work":{"arxiv_id":"2106.00669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00669","snapshot_observed_at":"2026-08-05T12:37:43.271906Z","title":"Discovering Diverse Nearly Optimal Policies with Successor Features","venue":"cs.AI","work_id":"6a8ff6e7-699e-40e7-b638-5b0fd2374de0","year":2021},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.318169Z"},"links":{"cited_paper":"/paper/2106.00669","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:08d195cad79637fa366c59b5cc4770fa8715a44c4ad9dba85c944050d9c552c7","observation_id":"785880e8-847f-4a4d-b36e-ed8247e1eb0f","resolution":{"observed_at":"2026-08-05T12:37:43.327076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.097593Z","title":"Prompt, plan, perform: Llm-based humanoid control via quantized imitation learning","venue":null,"work_id":"d703fe87-e271-4175-bf3e-d5059b00c85a","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.172013Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:92db2988e1ca2bb784729040ff0bad2fd9c80ed0f14622446e877f313ac6d8b2","observation_id":"577f2040-8e0c-4fc8-84f9-032c966a58e6","resolution":{"observed_at":"2026-08-05T12:37:45.100499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.077705Z","title":"∞X t=0 γtf (st, at) # = Es,a∼dµ π [f (s, a)] (5) 8 GTML 2025 Proof. (1 − γ)Eτ ∼π,µ","venue":null,"work_id":"3664efa3-f3ef-417f-8d2d-6c8e1bee8c21","year":2023},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.447186Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:17ef6e0a9398595e5551bb5c01dae7a10a2a509725080f7c62e7ddd6d5877b15","observation_id":"e2546c89-beba-4e33-9484-133f4faf63b9","resolution":{"observed_at":"2026-08-05T12:37:45.081576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:42.043518Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.043518Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:3e4753d7a5e698ec66bbe062f7cbf488004af851b772c3736543c348572d4808","observation_id":"e23415ff-ead5-4ac1-be5c-778fe12aa0a4","resolution":{"observed_at":"2026-08-05T12:37:42.043518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09930","last_updated":"2024-06-03T09:46:32Z","snapshot_observed_at":"2026-07-31T06:09:52.035945Z","submitted_at":"2024-03-15T00:09:47Z","title":"Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features Critics","version":3},"cited_work":{"arxiv_id":"2403.09930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09930","snapshot_observed_at":"2026-08-05T12:37:44.388653Z","title":"Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features Critics","venue":"cs.LG","work_id":"f817f490-2704-4d9d-943f-a8b561fcef5c","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.368134Z"},"links":{"cited_paper":"/paper/2403.09930","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:747c38fa7e34a0be63de338d7bd7a6003d8b0c53d7c7d7a7c5de8abe62b41507","observation_id":"40b258de-e9bb-4761-8430-f7f02e90b5ad","resolution":{"observed_at":"2026-08-05T12:37:44.503773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07507","last_updated":"2016-11-22T20:44:39Z","snapshot_observed_at":"2026-08-02T15:05:52.307944Z","submitted_at":"2016-11-22T20:44:39Z","title":"Variational Intrinsic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07507","snapshot_observed_at":"2026-08-05T12:37:41.314647Z","title":"Variational intrinsic control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.314647Z"},"links":{"cited_paper":"/paper/1611.07507","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:fd9359f8b6186c68460a7eb25a08e877274d3d48337b4a3efd38f6df9474b79b","observation_id":"b5e69283-05ea-44f4-a252-07ef7c669a48","resolution":{"observed_at":"2026-08-05T12:37:41.314647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.106805Z","title":"cc/paper_files/paper/2019/file/873be0705c80679f2c71fbf4d872df59-Paper.pdf","venue":null,"work_id":"39d4f96f-f116-4abe-83c4-82b419ebe288","year":2019},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.701622Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:77ab0611962c4036771a47915a4ed4f4f0b08ce013e520bb79978da0a464135f","observation_id":"6b51656a-4d66-476c-bf2c-b372f13c1876","resolution":{"observed_at":"2026-08-05T12:37:45.109888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-05T12:37:41.845185Z","title":"A unified view of entropy-regularized markov decision processes.arXiv preprint arXiv:1705.07798,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.845185Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:b7ffc7bba53afbb1d3809db196d3829e611e07c7eda63cbbac2109897c67b1ec","observation_id":"fe7a6825-0ebf-4860-99c5-caa4cffe3680","resolution":{"observed_at":"2026-08-05T12:37:41.845185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03787","last_updated":"2022-02-16T10:01:00Z","snapshot_observed_at":"2026-07-06T11:16:49.764856Z","submitted_at":"2021-06-07T16:51:07Z","title":"Concave Utility Reinforcement Learning: the Mean-Field Game Viewpoint","version":4},"cited_work":{"arxiv_id":"2106.03787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.03787","snapshot_observed_at":"2026-08-05T12:37:44.647030Z","title":"Concave Utility Reinforcement Learning: the Mean-Field Game Viewpoint","venue":"cs.LG","work_id":"d57f9e9c-e5c3-4f99-8dcd-dfb082ee5850","year":2021},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.266986Z"},"links":{"cited_paper":"/paper/2106.03787","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:ab464d1ac0061f73583b5aacb1f62a6f4919dd8d1da5762d225f4a39d7e5d7c4","observation_id":"8ba514d3-52d7-4f4c-b52e-f0152f3eb758","resolution":{"observed_at":"2026-08-05T12:37:44.810808Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-05T12:37:41.141219Z","title":"Peter Dayan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.141219Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:0e5e229a59c02690c28e4002c574734e2628446504f6501c3cc7f88a137d678a","observation_id":"0003b65f-ac2a-4d90-bd5a-7a38a7dc51b4","resolution":{"observed_at":"2026-08-05T12:37:41.141219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05030","last_updated":"2020-01-27T18:14:54Z","snapshot_observed_at":"2026-08-09T14:58:07.177385Z","submitted_at":"2019-06-12T09:39:05Z","title":"Fast Task Inference with Variational Intrinsic Successor Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05030","snapshot_observed_at":"2026-08-05T12:37:41.422027Z","title":"Fast task inference with variational intrinsic successor features.arXiv preprint arXiv:1906.05030,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.422027Z"},"links":{"cited_paper":"/paper/1906.05030","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:cf1a6820cd3a30721c94342dbe726307e62d3895cde8c31d7aeeb6c48c8ddee9","observation_id":"cbecf1e9-e25b-42d0-a701-e49ea4ca7953","resolution":{"observed_at":"2026-08-05T12:37:41.422027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T12:37:42.090426Z","title":"John Schulman, Sergey Levine, Philipp Moritz, Michael I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.090426Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:bbb0b0d1d2603265a604562329c89cab6eb3910f0303f22f77f21039c8c1fd21","observation_id":"b588e5e9-9603-43e3-81cf-0272262e8a24","resolution":{"observed_at":"2026-08-05T12:37:42.090426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":14,"verified_exact":4,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2509.01432."}