{"as_of":"2026-08-13T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:280a885c4835c671d9a8363730626401f5b1b8f6d3eebd22bc08322ca7251439","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:52:59.457090Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":17,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":"2204.05618","doi":"10.48550/arxiv.2204.05618","metadata_source":"arxiv_reference","pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When should we prefer offline reinforcement learning over behavioral cloning?","venue":"arXiv (Cornell University)","work_id":"17c26075-7472-4fe0-a8f1-0f95cac4161b","year":2022},"citing_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-11T15:42:16.204049Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T04:42:52.627166Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2210.00030"},"observation_digest":"sha256:7a25e0acd3ca37fc334ff52b0854ad673bb96d11f0965187e4eddfc7e3e70667","observation_id":"77463182-120e-4f61-8947-c6eeeacd2db4","resolution":{"observed_at":"2026-05-15T04:42:52.669484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-12T04:52:59.457090Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00979","last_updated":"2024-12-13T03:31:51Z","snapshot_observed_at":"2026-08-12T20:53:19.792318Z","submitted_at":"2024-12-01T22:02:07Z","title":"Hierarchical Prompt Decision Transformer: Improving Few-Shot Policy Generalization with Global and Adaptive Guidance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:52:59.457090Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2412.00979"},"observation_digest":"sha256:db228b21472503e17af2211dcfc6d9750e428b37e9f4c295cc65ca1cae18d1d1","observation_id":"0f15e62c-e660-4d6f-b89c-22f7e4860177","resolution":{"observed_at":"2026-08-12T04:52:59.457090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-06T15:19:38.190553Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19535","last_updated":"2025-07-22T07:43:38Z","snapshot_observed_at":"2026-08-12T20:58:03.834543Z","submitted_at":"2025-07-22T07:43:38Z","title":"Comparing Behavioural Cloning and Reinforcement Learning for Spacecraft Guidance and Control Networks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:38.190553Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2507.19535"},"observation_digest":"sha256:512ab84cfa679d0e298a063a102605123ed0878c1d37755b5dbbf1653b7e8927","observation_id":"4402ccd8-964b-4536-8a3f-ec8efab2906c","resolution":{"observed_at":"2026-08-06T15:19:38.190553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-05T16:02:25.972654Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19132","last_updated":"2025-08-26T15:34:17Z","snapshot_observed_at":"2026-08-09T20:42:01.029212Z","submitted_at":"2025-08-26T15:34:17Z","title":"Active Query Selection for Crowd-Based Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T16:02:25.972654Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2508.19132"},"observation_digest":"sha256:1ad7065efe5702e7c8f70f1d02bcae2e71a061893e135657b7153fb3b816cf85","observation_id":"e9088da3-274b-425a-af98-145047a21fc7","resolution":{"observed_at":"2026-08-05T16:02:25.972654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":"2204.05618","doi":"10.48550/arxiv.2204.05618","metadata_source":"arxiv_reference","pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When should we prefer offline reinforcement learning over behavioral cloning?","venue":"arXiv (Cornell University)","work_id":"17c26075-7472-4fe0-a8f1-0f95cac4161b","year":2022},"citing_paper":{"arxiv_id":"2602.06603","last_updated":"2026-04-29T10:13:20Z","snapshot_observed_at":"2026-08-11T18:13:30.831339Z","submitted_at":"2026-02-06T11:02:06Z","title":"The hidden risks of temporal resampling in clinical reinforcement learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:16.379996Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2602.06603"},"observation_digest":"sha256:ffac70d8bf7f71101288d70479c8647307d319a8ab76b33ebb918c596b687366","observation_id":"1a9f12ff-d8f8-4824-bcd6-c7886feacac1","resolution":{"observed_at":"2026-05-16T07:07:29.229254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":"2204.05618","doi":"10.48550/arxiv.2204.05618","metadata_source":"arxiv_reference","pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When should we prefer offline reinforcement learning over behavioral cloning?","venue":"arXiv (Cornell University)","work_id":"17c26075-7472-4fe0-a8f1-0f95cac4161b","year":2022},"citing_paper":{"arxiv_id":"2606.24160","last_updated":"2026-06-23T05:28:33Z","snapshot_observed_at":"2026-08-02T08:41:14.568871Z","submitted_at":"2026-06-23T05:28:33Z","title":"An Introduction to Causal Reinforcement Learning","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-06-26T00:17:57.091481Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2606.24160"},"observation_digest":"sha256:dc6e8705b04ed9ace3dd9f325fa0c950c90cc26d47701738c35040ff2fd5c369","observation_id":"6dac577b-bd7e-4190-b731-bf7d2642e43e","resolution":{"observed_at":"2026-07-04T16:49:57.169851Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":"2204.05618","doi":"10.48550/arxiv.2204.05618","metadata_source":"arxiv_reference","pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When should we prefer offline reinforcement learning over behavioral cloning?","venue":"arXiv (Cornell University)","work_id":"17c26075-7472-4fe0-a8f1-0f95cac4161b","year":2022},"citing_paper":{"arxiv_id":"2606.27865","last_updated":"2026-06-26T09:06:04Z","snapshot_observed_at":"2026-08-12T16:36:06.416416Z","submitted_at":"2026-06-26T09:06:04Z","title":"From Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T02:56:52.303152Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2606.27865"},"observation_digest":"sha256:6f2cc5048d559cc7e535a8910e6c1f1c07db0f8d3f8d4313d201e398180a537d","observation_id":"1d99f2f9-11d2-4c26-b1aa-341cf67d56cc","resolution":{"observed_at":"2026-07-01T17:55:51.391002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-06T00:32:42.895141Z","title":"arXiv preprint arXiv:2204.05618 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-12T04:04:41.392209Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:42.895141Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:e64c6e8320d3c603a0cae04bac92701e4167ae8e13fac86f33a89515f0ff9ded","observation_id":"ffaae6f9-1c0e-43c1-97f3-c6c55e8d6f17","resolution":{"observed_at":"2026-08-06T00:32:42.895141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-05T16:13:31.897892Z","title":"When should we prefer offline reinforcement learning over behavioral cloning? In International Conference on Learning Representations (ICLR), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03606","last_updated":"2026-08-04T12:58:17Z","snapshot_observed_at":"2026-08-13T11:14:29.894747Z","submitted_at":"2026-08-04T12:58:17Z","title":"Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T16:13:31.897892Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2608.03606"},"observation_digest":"sha256:7288a8238b335858187f42d092b0c44ecd3bbf95cfb315f5e17987bea6cd19a8","observation_id":"944f50eb-2561-49dc-a84b-812052f33c30","resolution":{"observed_at":"2026-08-05T16:13:31.897892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2204.05618/citation-record","integrity":"/paper/2204.05618/integrity","json":"/paper/2204.05618/citation-record.json","paper":"/paper/2204.05618"},"outbound":[],"paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T16:03:52.537185Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2204.05618."}