{"as_of":"2026-08-09T09:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af1ccc96114352406861557b435c6bbb2bc02fa1c18b4d7e6fbc59e89bb6ab45","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:46.427182Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.940883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:c2f4b205f2838cd9af11283a36bafc7d0d6dc564988a3f8854e0eaa2f5329c51","observation_id":"369249ae-67b4-40de-85d7-24c8df8067e2","resolution":{"observed_at":"2026-05-13T13:48:36.611406Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-07T14:14:46.427182Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-09T00:05:32.443932Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.427182Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:e571b838f7a3909a6016a608350dfb5cf887548fde3e9788b28aeb0a412fcb13","observation_id":"5795690e-4847-4996-ba18-6a6adf07d008","resolution":{"observed_at":"2026-08-07T14:14:46.427182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2506.05762","last_updated":"2026-05-14T17:01:38Z","snapshot_observed_at":"2026-07-06T21:37:47.215709Z","submitted_at":"2025-06-06T05:41:33Z","title":"BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T10:48:28.980868Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2506.05762"},"observation_digest":"sha256:402515a30b4b64a9b15602b5bd82b90e5124860c922871ecb98d75c246a4813b","observation_id":"0c67fefc-1819-42ba-9415-5af47f1e6ea1","resolution":{"observed_at":"2026-05-19T10:52:15.285443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-07T05:22:27.299725Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.299725Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:915aa4062da3c0c0b5ef3f25225e5e06dee5a2e11452a42f1e342eb3f6f1d563","observation_id":"a73e2a5f-1b28-4238-8d50-5f4e3eb823c2","resolution":{"observed_at":"2026-08-07T05:22:27.299725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization.arXiv preprint arXiv:2303.15810, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-06T17:26:04.405292Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:069dd58273e1584977ab2faad596f2816c28e91f6fde81092fa1bbf653bc7deb","observation_id":"c79745c4-080c-4a8b-9206-447d4de34d79","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:6f817e255741a5920c9f01ece14fff25d25071e6e634256b48acdcb9fd47803b","observation_id":"93f16d80-24d1-46ed-b157-e537401a1850","resolution":{"observed_at":"2026-05-10T13:20:25.622646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:6a0dd00722a21b46c244a66c283b3d9a65cf73cbf390b7fb4d6e14b2e874f21f","observation_id":"9b03b8b9-acfa-4d1a-92c4-483729c5c34a","resolution":{"observed_at":"2026-05-10T06:51:46.618145Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:4b22cff3fdef4d2d3290429f62378c0b9add634dca42ac7d400ce475b2dc8544","observation_id":"48544bef-20c6-44af-af27-d789c3d80a4b","resolution":{"observed_at":"2026-05-11T08:56:00.631554Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:fecc12d9dade0ebfa00c07205775f7ea8d56060887d1ea66fdbeed98b992f1dc","observation_id":"38d69b95-3dee-4ae3-ae56-96d2a6576225","resolution":{"observed_at":"2026-07-01T14:25:45.840469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2605.27877","last_updated":"2026-05-27T02:53:41Z","snapshot_observed_at":"2026-07-06T23:37:31.844094Z","submitted_at":"2026-05-27T02:53:41Z","title":"SPAR: Support-Preserving Action Rectification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T14:34:39.094753Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2605.27877"},"observation_digest":"sha256:6d56a6230d696c47dea7da01ba392c08c75afa38c066a2dd3ba589e8fbf67c9e","observation_id":"8b6381b3-ad22-4a49-82f8-610a1812c1e6","resolution":{"observed_at":"2026-06-29T14:43:30.990694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:5ca2a6fc9da21e3c9a66f080db77ac5a7a1a751195b9d24a47504dcec3e8ccb2","observation_id":"1cf9ae9f-5987-4cd4-9237-5260c287e35d","resolution":{"observed_at":"2026-07-03T04:17:36.942518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2303.15810/citation-record","integrity":"/paper/2303.15810/integrity","json":"/paper/2303.15810/citation-record.json","paper":"/paper/2303.15810"},"outbound":[],"paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2303.15810."}