{"as_of":"2026-08-19T11:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82c31fa6abdb789e391778a5297fa1a3540181075534f725c37f2c06663093cf","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:17:38.700024Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:15:33.500556Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T13:20:25.624340Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13368","snapshot_observed_at":"2026-08-07T05:15:33.500556Z","title":"An optimal discrimina- tor weighted imitation perspective for reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08644","last_updated":"2025-06-10T09:57:25Z","snapshot_observed_at":"2026-08-15T06:53:39.926040Z","submitted_at":"2025-06-10T09:57:25Z","title":"Semi-gradient DICE for Offline Constrained Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:15:33.500556Z"},"links":{"cited_paper":"/paper/2504.13368","citing_paper":"/paper/2506.08644"},"observation_digest":"sha256:a9cd7609dec664c0bd3ed04a55d790f9011a6a7b367026871e487ec4331fb42d","observation_id":"76e4dfae-42b7-4f45-8e16-afb9d4a6634c","resolution":{"observed_at":"2026-08-07T05:15:33.500556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13368","snapshot_observed_at":"2026-08-03T13:18:31.831475Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-15T09:57:00.601813Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.831475Z"},"links":{"cited_paper":"/paper/2504.13368","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:9f9c6b06f86544d2a1e05d4609fda0bc4548590c4f8c511907274fd1b2851301","observation_id":"c6a1765c-5ccd-42f4-9528-f69f63c67c47","resolution":{"observed_at":"2026-08-03T13:18:31.831475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.13368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An optimal discriminator weighted imitation perspective for reinforcement learning","venue":null,"work_id":"605e6307-8c78-4b15-b6c0-327958462b60","year":2025},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-08-15T02:53:18.322914Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2504.13368","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:2e10fbc92aff881687972f8a361a66b74923aef6bc2229e69aaf32b0894b0eb7","observation_id":"48d266f3-efc1-4b59-853c-1d004699c332","resolution":{"observed_at":"2026-05-10T13:20:25.626504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13368/citation-record","integrity":"/paper/2504.13368/integrity","json":"/paper/2504.13368/citation-record.json","paper":"/paper/2504.13368"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.954658Z","title":null,"venue":null,"work_id":"d875b8dd-a0ec-41da-9079-f89e3d4f31b6","year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.686214Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:ffbf99c2f13d199589c0672278356ca4bcb7b884fa186549dcb933780f3939d0","observation_id":"6b342661-463f-48c8-a8ef-cf03dd5036a1","resolution":{"observed_at":"2026-08-16T12:17:38.958027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-16T12:17:38.616065Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.616065Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:482709fdbecbbb8fc309fedf1826b246b2cee8400a8144b1c8acac0448ca53dc","observation_id":"5ebd34b7-bae4-47c8-8391-03904004dbbe","resolution":{"observed_at":"2026-08-16T12:17:38.616065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.932072Z","title":null,"venue":null,"work_id":"06e319cc-2ddf-4b67-ad98-be8c084dd71e","year":2023},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.692945Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:e28edf30fdd0215d36eadd7a9c71dec459d45fef135b210668a0ea0e182f0357","observation_id":"e1f32b47-c730-41e2-986d-79a27a826be9","resolution":{"observed_at":"2026-08-16T12:17:38.935708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-16T17:07:33.157628Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-16T12:17:38.623944Z","title":"When should we prefer offline reinforcement learning over behavioral cloning? arXiv preprint arXiv:2204.05618,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.623944Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:a202e79f7ed34c8d8f8fc907796795485ffc41535f42b11acfaba4004e385247","observation_id":"c5f9e2b2-8542-4e3f-8f5a-58b6cdc60273","resolution":{"observed_at":"2026-08-16T12:17:38.623944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08957","last_updated":"2022-04-19T15:55:47Z","snapshot_observed_at":"2026-08-18T14:03:18.344581Z","submitted_at":"2022-04-19T15:55:47Z","title":"COptiDICE: Offline Constrained Reinforcement Learning via Stationary Distribution Correction Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08957","snapshot_observed_at":"2026-08-16T12:17:38.627839Z","title":"Coptidice: Offline constrained reinforcement learning via stationary distribution correction estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.627839Z"},"links":{"cited_paper":"/paper/2204.08957","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:f075a95875168b78d926ef5f8bbaacc0358cd7b53e1771e9e1bf90714e41d42f","observation_id":"13d90d0a-18cd-432d-aa92-d9225025a03a","resolution":{"observed_at":"2026-08-16T12:17:38.627839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-19T01:13:02.356644Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-16T12:17:38.631616Z","title":"When data geometry meets deep function: Generalizing offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.631616Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:1b022b22f1401988578a69af66239932e136888fc0dcf3f8490fb28487d5db86","observation_id":"ec01e9ea-5c25-453c-a674-83646d202d6c","resolution":{"observed_at":"2026-08-16T12:17:38.631616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02433","last_updated":"2022-06-18T15:18:17Z","snapshot_observed_at":"2026-08-18T09:05:27.941252Z","submitted_at":"2022-02-04T23:25:03Z","title":"Versatile Offline Imitation from Observations and Examples via Regularized State-Occupancy Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02433","snapshot_observed_at":"2026-08-16T12:17:38.642669Z","title":"Smodice: Versatile offline imitation learning via state occupancy matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.642669Z"},"links":{"cited_paper":"/paper/2202.02433","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:4dd51383ec3704d58aa30c1ef5dd424c8b25b76015759f3fb4b140cd25a0bf2f","observation_id":"bb3934a4-3298-49f8-9965-e07a2f740d3d","resolution":{"observed_at":"2026-08-16T12:17:38.642669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-16T12:17:38.661193Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.661193Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:991134b3a6089b38dc0813a827be9a5967ddf240dc9582fe9292a18fd88c8916","observation_id":"617dfe91-2cec-43d2-8e17-4f1fa250f7b7","resolution":{"observed_at":"2026-08-16T12:17:38.661193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-16T12:17:38.664480Z","title":"A review of off-policy evaluation in rein- forcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.664480Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:4b06ab7cc3bcde1155a42b633245ec60ca1b00418da8f449bf300aa7b75e23f6","observation_id":"01ee2d5f-1c58-4ae7-bb69-e5c3ef572370","resolution":{"observed_at":"2026-08-16T12:17:38.664480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-16T15:44:47.885182Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-16T12:17:38.668063Z","title":"A policy-guided imitation approach for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.668063Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:d834df5e916ebf08cfa055247f22791fb3e3e36d6aba9a1f1958f5e1e04d0589","observation_id":"aa0256fe-b7f8-435e-a6c3-a3eeb64e433b","resolution":{"observed_at":"2026-08-16T12:17:38.668063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.978103Z","title":"State deviation correction for offline reinforcement learning","venue":null,"work_id":"09aa2aac-5bd2-4354-9c4c-3dc7180fafbc","year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.671311Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:4f68b08dab594dcf1b10e5dbf69db09ae50500cafdbe38b8fe60f559ec696c9e","observation_id":"21b7d0b8-9b42-47d7-80de-5d9d625d917b","resolution":{"observed_at":"2026-08-16T12:17:38.982010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12203","last_updated":"2023-01-28T13:57:01Z","snapshot_observed_at":"2026-08-16T15:59:30.749082Z","submitted_at":"2023-01-28T13:57:01Z","title":"SaFormer: A Conditional Sequence Modeling Approach to Offline Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12203","snapshot_observed_at":"2026-08-16T12:17:38.675196Z","title":"Saformer: A conditional sequence modeling approach to offline safe reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.675196Z"},"links":{"cited_paper":"/paper/2301.12203","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:e2d762973a241c95e171028828c40efcc92442b80c64fd6ba7097c62f8e399c1","observation_id":"c2cd90d9-4ab6-4407-bb02-78c47372e643","resolution":{"observed_at":"2026-08-16T12:17:38.675196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01072","last_updated":"2020-01-23T21:38:54Z","snapshot_observed_at":"2026-08-14T16:37:50.521516Z","submitted_at":"2019-05-03T08:38:35Z","title":"Deep Residual Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.01072","snapshot_observed_at":"2026-08-16T12:17:38.678696Z","title":"Gendice: Generalized offline estimation of stationary values","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.678696Z"},"links":{"cited_paper":"/paper/1905.01072","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:7a267347e4af10d817b95a78352aff0a99400f108f0112fe7a3760f4badecf7d","observation_id":"db81075a-fd52-40f1-a1e6-31e9be0ab235","resolution":{"observed_at":"2026-08-16T12:17:38.678696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.966090Z","title":"The regularization term aims at imposing visitation distribution constraints (Nachum & Dai, 2020; Lee et al., 2021; Mao et al., 2024a)","venue":null,"work_id":"b305bf73-ba86-4fd1-976d-02d8e92dcd73","year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.682358Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:19d131119c0cd33a60a50b03cbcb175446cfdc5e1d172ccfb870e24ded7fb660","observation_id":"4a39bd8f-c25c-42fe-a576-4af9b312790f","resolution":{"observed_at":"2026-08-16T12:17:38.970648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.943183Z","title":null,"venue":null,"work_id":"e816cafb-fb05-415a-9536-24ae441d96b8","year":2024},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.689474Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:e4f0d307a668fc25cecbecbc3dc57ff61d1de4a6e0dee36b1a9a2225b08b1add","observation_id":"2af0adbf-4237-492f-ab9e-0cae667c72e1","resolution":{"observed_at":"2026-08-16T12:17:38.946805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.920903Z","title":"The number of total transitions of the noisy dataset is 1, 000,","venue":null,"work_id":"8568e31d-a7a4-4897-916f-e99609eb1e59","year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.696319Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:0f9139a1a742d89e29a84750c3d4ac81e9ef5721dfdbdd4e2c403cc89ca12309","observation_id":"d939c2d7-5ede-4e54-8796-55978a24dd37","resolution":{"observed_at":"2026-08-16T12:17:38.924813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.910024Z","title":null,"venue":null,"work_id":"a0c81f9e-3929-4ca4-9876-e4715aa40a34","year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.700024Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:c4afd4aaad68e927f654c8f4dcff7ff72acdb0f79134c4082007e0a27b1dbaeb","observation_id":"cc305ca4-ba3a-4175-99f7-483d3a5319f4","resolution":{"observed_at":"2026-08-16T12:17:38.913488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00348","last_updated":"2024-02-01T05:30:51Z","snapshot_observed_at":"2026-08-16T14:22:38.167734Z","submitted_at":"2024-02-01T05:30:51Z","title":"ODICE: Revealing the Mystery of Distribution Correction Estimation via Orthogonal-gradient Update","version":1},"cited_work":{"arxiv_id":"2402.00348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.00348","snapshot_observed_at":"2026-08-16T12:17:38.818890Z","title":"ODICE: Revealing the Mystery of Distribution Correction Estimation via Orthogonal-gradient Update","venue":"cs.LG","work_id":"5d32a37e-f11c-4eae-b51e-62815bf5d192","year":2024},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":1960,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.647300Z"},"links":{"cited_paper":"/paper/2402.00348","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:d06a58692cccc05d22f20003cbf948087a11107e0326e07b7dbe6dd4b931f123","observation_id":"954ca0b2-2b1d-4d5c-9fc2-1b06da0667b8","resolution":{"observed_at":"2026-08-16T12:17:38.825428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02013","last_updated":"2024-02-29T03:47:12Z","snapshot_observed_at":"2026-08-16T14:46:10.273639Z","submitted_at":"2023-11-03T16:19:33Z","title":"SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02013","snapshot_observed_at":"2026-08-16T12:17:38.657712Z","title":"Score models for offline goal-conditioned reinforcement learning.arXiv preprint arXiv:2311.02013, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":1970,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.657712Z"},"links":{"cited_paper":"/paper/2311.02013","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:26fbddf024d60f75ce17b0323adf0b30dd468d40941ac1c25b8e4fadb899fa2e","observation_id":"4ba7dc5a-5a45-4db6-ab8b-bca1f4cf824c","resolution":{"observed_at":"2026-08-16T12:17:38.657712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.01866","last_updated":"2020-01-09T19:08:09Z","snapshot_observed_at":"2026-08-11T23:21:08.502885Z","submitted_at":"2020-01-07T02:59:59Z","title":"Reinforcement Learning via Fenchel-Rockafellar Duality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.01866","snapshot_observed_at":"2026-08-16T12:17:38.650706Z","title":"Reinforcement learning via fenchel-rockafellar duality","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.650706Z"},"links":{"cited_paper":"/paper/2001.01866","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:5032afa77beee26887d335778adacae11ef8169b3ff252e61ac8f3b4b4c46eef","observation_id":"03bfdfd2-fe44-4ea7-9718-884314e52c63","resolution":{"observed_at":"2026-08-16T12:17:38.650706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.999771Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"c5ec6fc6-7806-4b7c-970e-1eff18875729","year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.612678Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:a4983af281f0cbbec1c98017aaf8bdb6d64c74d3efc5ed17ddb5160dfc167e7c","observation_id":"b2bb28c8-75ff-49e2-8b63-09e93078fd93","resolution":{"observed_at":"2026-08-16T12:17:39.003582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13085","last_updated":"2023-06-22T17:58:02Z","snapshot_observed_at":"2026-08-18T11:14:49.238328Z","submitted_at":"2023-06-22T17:58:02Z","title":"Harnessing Mixed Offline Reinforcement Learning Datasets via Trajectory Weighting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13085","snapshot_observed_at":"2026-08-16T12:17:38.620256Z","title":"Harnessing mixed offline reinforcement learning datasets via trajectory weighting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.620256Z"},"links":{"cited_paper":"/paper/2306.13085","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:6d4e0f151902624a9740da41be11c8d96149824969a046aca97d3a7dc1874a5e","observation_id":"dc791905-98fc-49e8-b565-b45c55949573","resolution":{"observed_at":"2026-08-16T12:17:38.620256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:39.010941Z","title":"Residual algorithms: Reinforcement learning with function approximation","venue":null,"work_id":"faedc543-cb0b-46de-b777-ce8b43a4e0cf","year":1995},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.608735Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:77144aef042c45e08805476809c13135ad8da0f5970d80954664aea6ecb8397c","observation_id":"bf7dd64b-96ab-44cc-84cf-2c8c0f035a0c","resolution":{"observed_at":"2026-08-16T12:17:39.014454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09329","last_updated":"2024-10-28T23:33:19Z","snapshot_observed_at":"2026-08-16T13:43:14.794834Z","submitted_at":"2024-06-13T17:07:49Z","title":"Is Value Learning Really the Main Bottleneck in Offline RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09329","snapshot_observed_at":"2026-08-16T12:17:38.654314Z","title":"Is value learning really the main bottleneck in offline rl? arXiv preprint arXiv:2406.09329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.654314Z"},"links":{"cited_paper":"/paper/2406.09329","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:9b067b653c369a3cd7c22c9f892a83dcb661d3f4de9c420c783c69cf7f5853be","observation_id":"83c1896e-56f2-4494-997c-83046a098000","resolution":{"observed_at":"2026-08-16T12:17:38.654314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:38.989199Z","title":"Dealing with the unknown: Pessimistic offline reinforcement learning","venue":null,"work_id":"d09ae50a-834f-42d6-a0ee-3b4a87f030b6","year":2025},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.635338Z"},"links":{"citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:50d5f8809e33535c45618eae0358a640237e2374444dcf188dad658b2094ff02","observation_id":"adc30dcd-a736-4d31-8c6a-aa2bc058f138","resolution":{"observed_at":"2026-08-16T12:17:38.992654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02165","last_updated":"2024-08-04T23:23:48Z","snapshot_observed_at":"2026-08-18T09:02:24.553536Z","submitted_at":"2024-08-04T23:23:48Z","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02165","snapshot_observed_at":"2026-08-16T12:17:38.638637Z","title":"Selfbc: Self behavior cloning for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.638637Z"},"links":{"cited_paper":"/paper/2408.02165","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:fdbc5e262eb3ad08435ad176744b4c67f0498a16c98aa92143b14ca580ea438b","observation_id":"62368e0a-39bd-40c5-b908-d52c4694333f","resolution":{"observed_at":"2026-08-16T12:17:38.638637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T09:03:38.560293Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 3 inbound Pith citation observations for arXiv:2504.13368."}