{"as_of":"2026-08-09T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:587c0341e0280b4490ee45ec0fed2667692d5564cd60c7d1ee32ba877e7916a7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T11:28:31.931515Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":"2303.17396","doi":"10.48550/arxiv.2303.17396","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions","venue":"arXiv (Cornell University)","work_id":"1d0d703a-d9f7-4453-b232-72719ab9dc6b","year":2023},"citing_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-02T08:39:49.062624Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-21T23:39:39.018498Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2507.01679"},"observation_digest":"sha256:2d21a9634da67802ed04e5db0b44d1dfad1e136f044e94dc41e6ce1ed2069fe7","observation_id":"5edb3c11-8fc5-4400-b5af-2af1766ec643","resolution":{"observed_at":"2026-05-21T23:40:46.202696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":"2303.17396","doi":"10.48550/arxiv.2303.17396","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions","venue":"arXiv (Cornell University)","work_id":"1d0d703a-d9f7-4453-b232-72719ab9dc6b","year":2023},"citing_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T05:18:20.960945Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2507.07969"},"observation_digest":"sha256:14ca24eb084dff3cb96adde95f2f0d6946b41f8601a90d30dd468bbdcb096f70","observation_id":"ea6b5855-b0e0-4111-a622-dda54e4e03f6","resolution":{"observed_at":"2026-05-19T05:22:06.420671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":"2303.17396","doi":"10.48550/arxiv.2303.17396","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions","venue":"arXiv (Cornell University)","work_id":"1d0d703a-d9f7-4453-b232-72719ab9dc6b","year":2023},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:e513eb98bad5bd752486f84d4f5da3fdd65cd8d43605dfdca6e7560cba04eb2d","observation_id":"d2898d64-945d-4361-81bc-da44e88c9c50","resolution":{"observed_at":"2026-05-20T13:13:18.014008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":"2303.17396","doi":"10.48550/arxiv.2303.17396","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions","venue":"arXiv (Cornell University)","work_id":"1d0d703a-d9f7-4453-b232-72719ab9dc6b","year":2023},"citing_paper":{"arxiv_id":"2606.13675","last_updated":"2026-06-11T17:59:45Z","snapshot_observed_at":"2026-07-30T00:58:38.369141Z","submitted_at":"2026-06-11T17:59:45Z","title":"Improving Robotic Generalist Policies via Flow Reversal Steering","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T06:20:19.209180Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2606.13675"},"observation_digest":"sha256:b017711a7fe15b1c9114457a774b67b562b49e280608765fa1fb14151b61d818","observation_id":"f41da937-d31d-4bf2-a611-c38b899f92fa","resolution":{"observed_at":"2026-07-03T15:48:35.713169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":"2303.17396","doi":"10.48550/arxiv.2303.17396","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions","venue":"arXiv (Cornell University)","work_id":"1d0d703a-d9f7-4453-b232-72719ab9dc6b","year":2023},"citing_paper":{"arxiv_id":"2606.25527","last_updated":"2026-06-24T08:05:28Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T08:05:28Z","title":"Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:07.735336Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2606.25527"},"observation_digest":"sha256:9e616cddcf8159b1c34b58a852dd4c73d62b178609c482d7d218f989f206788f","observation_id":"7fa6845a-7bf4-4fe6-a75b-8ce07cb021ef","resolution":{"observed_at":"2026-07-04T19:30:07.881241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:bfb0677c9a7c80c759fd033ed2298b1039e5c1d5f82255c672515f515afba5f9","observation_id":"ca81e43d-d058-45b3-b7a0-2de550c049aa","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-07-31T11:28:31.931515Z","title":"Finetuning from offline reinforcement learning: Chal- lenges, trade-offs and practical solutions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24577","last_updated":"2026-07-27T15:46:57Z","snapshot_observed_at":"2026-07-31T11:28:30.949504Z","submitted_at":"2026-07-27T15:46:57Z","title":"Evaluating Fuzz Testing for Reinforcement Learning Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T11:28:31.931515Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2607.24577"},"observation_digest":"sha256:6a33ac77a02222e5cf78690bc06c3c67babd87408e0e4c8eede46a91c32b1173","observation_id":"87b90e74-70a7-421b-87d2-1abcf9db6afc","resolution":{"observed_at":"2026-07-31T11:28:31.931515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.17396/citation-record","integrity":"/paper/2303.17396/integrity","json":"/paper/2303.17396/citation-record.json","paper":"/paper/2303.17396"},"outbound":[],"paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T18:33:38.213288Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2303.17396."}