{"as_of":"2026-08-09T17:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d39f6e4329f9306f744440178b9e8d70d6cbfedece669459b6d0cec59193cf63","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:57:48.435223Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":537,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T08:51:55.826747Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2108.03298"},"observation_digest":"sha256:596b8f252f511cfe714cd1c585d13c1706cc075b40fbe747b516119addd69876","observation_id":"798f5a8b-a8f1-46a2-afda-7e554d96674b","resolution":{"observed_at":"2026-05-13T08:51:55.904631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T08:47:05.621624Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2110.06169"},"observation_digest":"sha256:16aeb3372d603d9c341e66a69884ee7c8928f254d0b09645a234f007aa38b9b1","observation_id":"114f4217-f920-4a89-86b6-529d4ba6016a","resolution":{"observed_at":"2026-05-12T08:47:05.661694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-07T20:57:48.435223Z","title":"Aviral Kumar, Rishabh Agarwal, Tengyu Ma, Aaron Courville, George Tucker, and Sergey Levine","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.15760","last_updated":"2025-02-13T18:55:14Z","snapshot_observed_at":"2026-08-07T22:34:53.289352Z","submitted_at":"2025-02-13T18:55:14Z","title":"Digi-Q: Learning Q-Value Functions for Training Device-Control Agents","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T20:57:48.435223Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2502.15760"},"observation_digest":"sha256:a132c8f65eae2b7575a6382e3f5d6edef70ebddcecfa56ef9874841f08a9ca44","observation_id":"c4e0a579-b85e-4265-925d-c8e326ac58eb","resolution":{"observed_at":"2026-08-07T20:57:48.435223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-06T17:57:08.426907Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09495","last_updated":"2025-07-13T05:02:43Z","snapshot_observed_at":"2026-08-06T23:14:57.681420Z","submitted_at":"2025-07-13T05:02:43Z","title":"GenAI-based Multi-Agent Reinforcement Learning towards Distributed Agent Intelligence: A Generative-RL Agent Perspective","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T17:57:08.426907Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2507.09495"},"observation_digest":"sha256:261a70dc97b8b74365f5fb9730fa15b062964cdfa3ff2379a444924795af952a","observation_id":"5e093172-a8ce-45df-91fc-d68450c80dea","resolution":{"observed_at":"2026-08-06T17:57:08.426907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-06T11:34:19.197355Z","title":"Conservative Q-Learning for Offline Reinforcement Learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.197355Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:7ba59f2437d9b3b1cc2c2f194fb9e10e0c6a57a7de9edabf16d59df7fad732da","observation_id":"10db63f3-0676-4291-8c36-01bea85205dc","resolution":{"observed_at":"2026-08-06T11:34:19.197355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T11:39:57.868349Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.02458","last_updated":"2025-09-02T16:09:02Z","snapshot_observed_at":"2026-08-05T11:39:57.280530Z","submitted_at":"2025-09-02T16:09:02Z","title":"Generative Sequential Notification Optimization via Multi-Objective Decision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:39:57.868349Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2509.02458"},"observation_digest":"sha256:cd384320157f326c72e74e3b2af0f3ac6c75cf752f9fc88873ebea469c8d286c","observation_id":"aa01e485-bd3b-484b-a935-a74a66b0b451","resolution":{"observed_at":"2026-08-05T11:39:57.868349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2509.19538","last_updated":"2026-05-13T08:29:03Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T20:06:26Z","title":"DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T13:55:16.513839Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2509.19538"},"observation_digest":"sha256:364d23c5382a8057b765dbe27b62bad56c058b99584d2f13ecd8a5e3c30c0377","observation_id":"918ed758-8c20-49ea-bc32-31db1ae7d66e","resolution":{"observed_at":"2026-05-18T13:56:26.127974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-04T11:01:31.063875Z","title":"Conservative q-learning for offline reinforcement learning, 2020 b","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:31.063875Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:f4e48687f0ce3a63be925c07c67207fe05820559675ea50b7cd69b2258e4730d","observation_id":"e8e4e2d1-bdee-42ff-b814-21d6f5458937","resolution":{"observed_at":"2026-08-04T11:01:31.063875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2512.03847","last_updated":"2026-05-06T14:15:19Z","snapshot_observed_at":"2026-08-03T04:49:11.537109Z","submitted_at":"2025-12-03T14:48:38Z","title":"DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T01:46:21.744857Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2512.03847"},"observation_digest":"sha256:ca63917ebc852f88f3d1397bc2ad8923a2034371c4ee54ad310904d714c16388","observation_id":"593a8806-a6e6-448e-b68c-492efa911c48","resolution":{"observed_at":"2026-05-17T01:48:51.003494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2602.06603","last_updated":"2026-04-29T10:13:20Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T11:02:06Z","title":"The hidden risks of temporal resampling in clinical reinforcement learning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:16.379996Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2602.06603"},"observation_digest":"sha256:368750fe6ec1a38a68896ec2d99f8d154010cb2232244905035a62694da15fb8","observation_id":"18072b28-e076-4023-97dd-5c4a920c8b40","resolution":{"observed_at":"2026-05-16T07:07:29.616897Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:9ebcee22307c550402a635fb58dc3d55d2aa40934f62045ffb46b303fcd6cad8","observation_id":"df39f09e-07b6-4ef8-8e75-5515c23b8209","resolution":{"observed_at":"2026-05-15T09:49:54.486151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2604.05845","last_updated":"2026-07-21T08:51:57Z","snapshot_observed_at":"2026-08-08T14:00:49.859098Z","submitted_at":"2026-04-07T13:11:12Z","title":"JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:01.560145Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2604.05845"},"observation_digest":"sha256:8658f3b288e34df25c78f8aa5e58f62ee4883a89586448c53997a9530a77948f","observation_id":"771a535d-9a5a-41fb-b930-f2cd098e19ff","resolution":{"observed_at":"2026-05-11T00:10:52.115427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-02T16:46:55.806545Z","title":"Tucker, and Sergey Levine","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.05845","last_updated":"2026-07-21T08:51:57Z","snapshot_observed_at":"2026-08-08T14:00:49.859098Z","submitted_at":"2026-04-07T13:11:12Z","title":"JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T16:46:55.806545Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2604.05845"},"observation_digest":"sha256:69c2d09ffbbf689ba9f8890ab39050f6dc7a58bd893045145bcb7a9235e1192f","observation_id":"13352aff-ad43-46fa-9169-02517c493e7d","resolution":{"observed_at":"2026-08-02T16:46:55.806545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.01567","last_updated":"2026-05-02T18:37:36Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T18:37:36Z","title":"Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T13:59:40.638085Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.01567"},"observation_digest":"sha256:29e99ca860c2f6c74d151929597c13221cfa93d24dc1c7df03c6f7fae22ef364","observation_id":"9aeb8997-d922-4e50-aa27-2de53b38dbee","resolution":{"observed_at":"2026-05-09T22:29:06.408108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.02112","last_updated":"2026-05-04T00:22:21Z","snapshot_observed_at":"2026-08-08T11:49:37.917380Z","submitted_at":"2026-05-04T00:22:21Z","title":"An adaptive variance estimator for relative sparsity","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-08T19:35:46.097113Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.02112"},"observation_digest":"sha256:e3e471654619863a6c87aacbcf97beb816329764b17e841efe609c553a2856a5","observation_id":"f1446329-990b-4a11-bbe1-7ec26ce075f7","resolution":{"observed_at":"2026-05-09T05:45:22.591920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T02:32:16.746824Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:d5f0cc3c21db3b860f4a69454c5bc8424d40a231ffcf95bcccdbdf34d3cc4442","observation_id":"54b2b2da-a21f-40ea-bfd8-cebf495def48","resolution":{"observed_at":"2026-05-13T02:37:08.274944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T08:53:29.468764Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:0a293eea8103f4d4b8222c55403ed9f148ffb91b903e294df65a8fcf732c270d","observation_id":"6ff6e96e-8a17-48c8-9446-e719ce29eaaa","resolution":{"observed_at":"2026-05-21T08:54:05.817616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.16826","last_updated":"2026-05-16T06:05:27Z","snapshot_observed_at":"2026-08-01T18:34:23.456008Z","submitted_at":"2026-05-16T06:05:27Z","title":"Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T20:49:15.724896Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.16826"},"observation_digest":"sha256:14b60c111e5b455c7eb98ae49cf23047d7a56e0df4e9d8d72ff6d54dd9d54485","observation_id":"363088f6-84cb-4d4c-a516-d248c8a40dcf","resolution":{"observed_at":"2026-05-19T20:52:46.236699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.18320","last_updated":"2026-05-18T12:39:30Z","snapshot_observed_at":"2026-08-03T10:32:13.740060Z","submitted_at":"2026-05-18T12:39:30Z","title":"ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T12:07:21.037980Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.18320"},"observation_digest":"sha256:54f04fb7dc537c8da6441f1f10b2f9808005c3a0e2f98c3764b7e27a2bbdc1f9","observation_id":"43d4de9f-b2d2-4358-b1d2-285c45147a1c","resolution":{"observed_at":"2026-05-20T12:08:15.443271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:ff59609ecb809dac6accf438652ccc78561d184cc37186844ee0ebfd925b77f6","observation_id":"91af34ea-1812-483d-9e44-00cd4875c82b","resolution":{"observed_at":"2026-05-22T07:51:16.575399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.21271","last_updated":"2026-06-19T09:47:38Z","snapshot_observed_at":"2026-07-06T23:56:17.293417Z","submitted_at":"2026-06-19T09:47:38Z","title":"Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:48:19.683101Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.21271"},"observation_digest":"sha256:80cdba24c3d1c5696b8b6356c936eb62d2517032f175054c1c08b3c7d17b9240","observation_id":"1c1e04c5-22b8-4520-ac8b-0185d71fed66","resolution":{"observed_at":"2026-07-04T06:09:37.550272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.27475","last_updated":"2026-06-25T18:52:27Z","snapshot_observed_at":"2026-08-02T12:36:42.748876Z","submitted_at":"2026-06-25T18:52:27Z","title":"Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T01:57:04.293058Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.27475"},"observation_digest":"sha256:31b003d320359ddb89a4eb113d15b5bbc43ab9cc98c3dac30d44f7b4dbdd3f28","observation_id":"96215305-918f-42b4-9869-48c085c7f94f","resolution":{"observed_at":"2026-07-01T18:25:58.742568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.27865","last_updated":"2026-06-26T09:06:04Z","snapshot_observed_at":"2026-08-01T15:37:44.932033Z","submitted_at":"2026-06-26T09:06:04Z","title":"From Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T02:56:52.303152Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.27865"},"observation_digest":"sha256:0fe6cdf6bbdd09c9691c61c9cd0d36de50fdca0c0bcae95764283018f8ee6aee","observation_id":"d5013757-8dfe-4512-a595-49fb8945f0c8","resolution":{"observed_at":"2026-07-01T17:55:51.405173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.30627","last_updated":"2026-06-29T17:56:03Z","snapshot_observed_at":"2026-08-03T18:44:28.040312Z","submitted_at":"2026-06-29T17:56:03Z","title":"Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:46:02.255137Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.30627"},"observation_digest":"sha256:7aa24f95fd0bcde718085a88f8c5cde3f1bb1e1e159930cece051a500ca74215","observation_id":"fb1a7742-8efb-4993-a66b-a3fba610e1ad","resolution":{"observed_at":"2026-06-30T06:54:21.012695Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2607.02092","last_updated":"2026-07-03T08:21:35Z","snapshot_observed_at":"2026-08-07T17:46:16.883174Z","submitted_at":"2026-07-02T12:30:50Z","title":"Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-03T11:50:49.215046Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.02092"},"observation_digest":"sha256:b60c0261c3c7d11933824161d9146cfcba6587a9b0a4380b9ae00bb046661dbc","observation_id":"09c7d9f4-c115-4b28-88b4-ff7706ff3381","resolution":{"observed_at":"2026-07-03T11:58:05.713079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-07-12T08:26:59.428524Z","title":"Conservative q- learning for offline reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02092","last_updated":"2026-07-03T08:21:35Z","snapshot_observed_at":"2026-08-07T17:46:16.883174Z","submitted_at":"2026-07-02T12:30:50Z","title":"Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T08:26:59.428524Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.02092"},"observation_digest":"sha256:23b294fa597150bd745f38e1911aaf1138391387b67e2e75767a3d27d5f3fd4c","observation_id":"43654418-5787-417f-b0a6-d550dd7cc28f","resolution":{"observed_at":"2026-07-12T08:26:59.428524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-01T17:45:13.959321Z","title":"arXiv preprint arXiv:2006.04779 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:13.959321Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:5eb520813eb9b6ebc8999219b4c24892c1e42e56a3974f54107bd93118a21aee","observation_id":"b74f09b0-d2d0-424b-980b-f5c4a16560f2","resolution":{"observed_at":"2026-08-01T17:45:13.959321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-07-31T01:24:20.678068Z","title":"Conservative Q -learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27422","last_updated":"2026-07-29T19:43:40Z","snapshot_observed_at":"2026-08-07T19:28:46.728374Z","submitted_at":"2026-07-29T19:43:40Z","title":"Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T01:24:20.678068Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.27422"},"observation_digest":"sha256:daf13c3d9e25b38c1d759e57a007008575715b85609cb5a773963b6aa139f834","observation_id":"ad055bab-729a-4f67-bdfa-70a49a77e3a4","resolution":{"observed_at":"2026-07-31T01:24:20.678068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-04T19:45:34.852244Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:34.852244Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:a20bfeef3feed9d1b592259a8adcc81bac66d5cc03fc6c98069bdff1be950383","observation_id":"536637ce-d99c-4c05-b02d-56f7c329c78d","resolution":{"observed_at":"2026-08-04T19:45:34.852244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.04779/citation-record","integrity":"/paper/2006.04779/integrity","json":"/paper/2006.04779/citation-record.json","paper":"/paper/2006.04779"},"outbound":[],"paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2006.04779."}