{"as_of":"2026-08-19T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb9061dc8dc413341e9cdd9788f12fdba2844cd0cf7e9ff5c1df96d861ba05c6","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:26:02.942258Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11052/citation-record","integrity":"/paper/2608.11052/integrity","json":"/paper/2608.11052/citation-record.json","paper":"/paper/2608.11052"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.539102Z","title":"Therefore, αDKL(epπθ ∥epϕ) =E τ∼epπθ \" ∞X t=1 (αlogπ θ(at |s t)−r ϕ(st, at)) # +αlogZ ϕ","venue":null,"work_id":"6246c8a1-3857-4be7-85ac-5742edc2b242","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.934443Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:e7ec5763df7285c9e2ca9ab8ba27b9dfa20c8aad678a818ee57606522eebd9e4","observation_id":"28a544c9-ce1c-46a3-9b4c-2e9a0bb31ec3","resolution":{"observed_at":"2026-08-12T11:26:03.543094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.525276Z","title":"∞X t=1 γt−1 logπ θ(at |s t) # =−E τ∼p expert","venue":null,"work_id":"c7857f95-6ada-47a4-82bd-8b46b947d005","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.938246Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:136f8e36fede77c3ea7d81088bfc495248613e05078d2676fbba2ec896113f16","observation_id":"8d26906d-e9d7-4351-9676-5ae542388b98","resolution":{"observed_at":"2026-08-12T11:26:03.530082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10905","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.312598Z","title":"Natural hypergradient de- scent: Algorithm design, convergence analysis, and parallel implementation.arXiv preprint arXiv:2602.10905,","venue":null,"work_id":"0e1578f5-8e35-44b2-96f6-6d12a8bd0a30","year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.906229Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:fa91412c93fdfd079281f422a6a9d206baa258b7b4a4e27ad5fef484ee9fe171","observation_id":"99918331-970a-4806-b099-f850cac23993","resolution":{"observed_at":"2026-08-12T11:26:03.319693Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01820","last_updated":"2022-09-05T08:06:29Z","snapshot_observed_at":"2026-08-17T23:23:51.976914Z","submitted_at":"2022-09-05T08:06:29Z","title":"Natural Policy Gradients In Reinforcement Learning Explained","version":1},"cited_work":{"arxiv_id":"2209.01820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.01820","snapshot_observed_at":"2026-08-12T11:26:03.098617Z","title":"Natural Policy Gradients In Reinforcement Learning Explained","venue":"cs.LG","work_id":"4b23d006-9395-47a2-8b47-66d40c53bc0c","year":2022},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.918211Z"},"links":{"cited_paper":"/paper/2209.01820","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:78d1997708c1d6cdc8fe7a7c1d94c7d7c21df76a0fa633e98ca40a49162db763","observation_id":"a6300e82-9013-4f85-b8f3-27690ad68883","resolution":{"observed_at":"2026-08-12T11:26:03.105051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.550459Z","title":"∂g ∂θ θ⋆(ϕ),ϕ #−1 ∂g ∂ϕ θ⋆(ϕ),ϕ . Since ∂g ∂θ = ∂2Linner ∂θ 2 , ∂g ∂ϕ = ∂2Linner ∂θ∂ϕ , we get dθ⋆ dϕ ϕ =−","venue":null,"work_id":"b6519dd6-fbe7-4ff3-99b9-c8a440a83d73","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.930040Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:053ef94661f3648384fbd3dd2ae7f44a35dcc85014ec7a1d229be9b9a3ccf2f6","observation_id":"a2d1dcd2-a8ef-4ae1-8586-5ac449da702a","resolution":{"observed_at":"2026-08-12T11:26:03.554667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.512482Z","title":"∞X t=1 gt(τ)g t(τ) ⊤ # . Finally, applying Lemma 4.1 componentwise gives Eτ∼epπθ","venue":null,"work_id":"6dfe6454-dd89-408b-9a54-b632c953b85b","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.942258Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:803393c1ad9c9e8b8e06db3d4d513c0852158fe3bd249fb811b341d3c9b466d2","observation_id":"835c4e51-022e-47ac-b652-c035985b099a","resolution":{"observed_at":"2026-08-12T11:26:03.516484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.70401","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.499191Z","title":"Souradip Chakraborty, Amrit Bedi, Alec Koppel, Huazheng Wang, Dinesh Manocha, Mengdi Wang, and Furong Huang","venue":null,"work_id":"68be8db3-d2a6-479d-bd96-345a7e2852f1","year":2014},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.885600Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:f56319ccd683f15f4ee331fbc60c7a38f6ebe831a9403ef54524bee879382119","observation_id":"77b36f46-a84c-4f6c-8c3f-4d103b32b54e","resolution":{"observed_at":"2026-08-12T11:26:03.505054Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18626","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.391062Z","title":"Rank-1 ap- proximation of inverse fisher for natural policy gradients in deep reinforcement learning.arXiv preprint arXiv:2601.18626,","venue":null,"work_id":"e8f00bd8-5c94-4799-8b9c-c6229aee4a75","year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.902323Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:82f01ebe0d192f31c1d8b782b5cdf1f52e76d6f73cc14d2f6547d17a40360fe6","observation_id":"c70af340-f658-41db-9ef7-2cf63e31a3b2","resolution":{"observed_at":"2026-08-12T11:26:03.397415Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19697","last_updated":"2025-02-27T06:52:19Z","snapshot_observed_at":"2026-08-16T13:47:55.533896Z","submitted_at":"2024-05-30T05:24:20Z","title":"Bilevel reinforcement learning via the development of hyper-gradient without lower-level convexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19697","snapshot_observed_at":"2026-08-12T11:26:02.922372Z","title":"Bilevel reinforcement learning via the development of hyper-gradient without lower-level convexity.arXiv preprint arXiv:2405.19697,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.922372Z"},"links":{"cited_paper":"/paper/2405.19697","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:29182e779c59645d1d464a1da6425eccbbe257f1b4f7eccc0204e6308eb16184","observation_id":"d5f7b85f-c790-4f6b-be2c-172610441a12","resolution":{"observed_at":"2026-08-12T11:26:02.922372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1501.01711","last_updated":"2015-04-21T16:17:01Z","snapshot_observed_at":"2026-08-14T23:04:52.026998Z","submitted_at":"2015-01-08T02:32:32Z","title":"Frequent Directions : Simple and Deterministic Matrix Sketching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1501.01711","snapshot_observed_at":"2026-08-12T11:26:02.897810Z","title":"Frequent directions: Simple and deterministic matrix sketching.arXiv preprint arXiv:1501.01711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.897810Z"},"links":{"cited_paper":"/paper/1501.01711","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:04955fbfda774272c34737fa48a374aac288abe92a81c72ad5df0c219f89366e","observation_id":"9f09e1a8-f956-4cb0-b6ec-e6f769f93771","resolution":{"observed_at":"2026-08-12T11:26:02.897810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-12T11:26:02.909932Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.909932Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:18badf6cdc8574e149bbb57847ec41d2ef720901408933ca9b0d35d60dcdd626","observation_id":"53da9989-9480-4f50-bfb5-83c2cef374ac","resolution":{"observed_at":"2026-08-12T11:26:02.909932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04266","last_updated":"2026-05-05T20:01:36Z","snapshot_observed_at":"2026-08-01T01:52:21.623300Z","submitted_at":"2026-05-05T20:01:36Z","title":"Explaining and Preventing Alignment Collapse in Iterative RLHF","version":1},"cited_work":{"arxiv_id":"2605.04266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04266","snapshot_observed_at":"2026-08-12T11:26:03.433332Z","title":"Explaining and Preventing Alignment Collapse in Iterative RLHF","venue":"cs.LG","work_id":"f399b322-84ae-46e1-927e-47d65a0ad3e1","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.889788Z"},"links":{"cited_paper":"/paper/2605.04266","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:9987b036d738777bea1945a593093761ac6a10164f7c7b79d8b0e6df94dc39cf","observation_id":"444421fd-0641-4f09-ab05-109e196003cc","resolution":{"observed_at":"2026-08-12T11:26:03.437865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.562974Z","title":"Then the gradient of the induced outer objective eLouter(ϕ) :=L outer(θ⋆(ϕ)) is given by ∇ϕ eLouter ϕ =− ∂2Linner ∂ϕ∂θ θ⋆(ϕ),ϕ \" ∂2Linner ∂θ 2 θ⋆(ϕ),ϕ #−1 ∇θLouter|θ⋆(ϕ)","venue":null,"work_id":"90e07436-e6ef-47ec-ab1a-8f1ffa435a48","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.926453Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:591c4cf2fa0ce7867771e6019975ca19146fa1524b57081d6f7150cd0a1c2a63","observation_id":"239f0717-51cb-4e91-9462-21904e9e9e82","resolution":{"observed_at":"2026-08-12T11:26:03.568289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19349","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.208370Z","title":"Scalable linucb: Low-rank design matrix updates for recommenders with large action spaces.arXiv preprint arXiv:2510.19349,","venue":null,"work_id":"97d57fec-d801-46bb-8e05-5519e3c2db38","year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.914384Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:d53504db4ad6070cb73efe1e1e2bdc01611c60c2b723d7381ef7cae410ea86a9","observation_id":"e58c82b5-d24e-49e6-9a5d-35eefb8e4fc7","resolution":{"observed_at":"2026-08-12T11:26:03.214880Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-08-16T15:51:37.195604Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-08-12T11:26:02.893846Z","title":"Approximation methods for bilevel programming.arXiv preprint arXiv:1802.02246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.893846Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:74b6bf6ced1d13de85bc1001c2fc743b7c9ea98bc328b6fd1a12fe611f79262a","observation_id":"b77cffe1-f9a4-4743-bc39-6893c3c913f5","resolution":{"observed_at":"2026-08-12T11:26:02.893846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T02:25:55.726667Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":5,"verified_fuzzy":5},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2608.11052."}