{"as_of":"2026-08-09T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dff64f5a9d35a6174e7996e56bd8bc7d310a86ea853793bfc0c58f24da1896e7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:40:52.852816Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:43:15.128113Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2105.08140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-06-29T08:43:15.128113Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":"c873ffab-0d41-4e45-949f-aeae2e19e89d","year":null},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:1100f1517f38c0863325fa4ea32e11675585e9f5cb0b50eba61d78a93b9954c1","observation_id":"cd89333e-74bc-4e73-9bc8-3c96b01c2613","resolution":{"observed_at":"2026-05-11T08:56:00.734820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2105.08140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-06-29T08:43:15.128113Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":"c873ffab-0d41-4e45-949f-aeae2e19e89d","year":null},"citing_paper":{"arxiv_id":"2605.08202","last_updated":"2026-05-06T01:21:53Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T01:21:53Z","title":"Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T02:17:25.783688Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2605.08202"},"observation_digest":"sha256:c95eed06617d1525e86cea1c20fa68c7e559427ec30f1b2ce94d266dc0cbbd0e","observation_id":"9c4d26f6-1093-42de-b6f9-f4cb7be3b953","resolution":{"observed_at":"2026-05-12T07:41:50.547178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2105.08140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-06-29T08:43:15.128113Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":"c873ffab-0d41-4e45-949f-aeae2e19e89d","year":null},"citing_paper":{"arxiv_id":"2606.07592","last_updated":"2026-05-28T17:05:05Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-28T17:05:05Z","title":"UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T08:39:34.884726Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2606.07592"},"observation_digest":"sha256:f6dee8fe8eeb533a0a0e5a113f13e7bf2bd4689b9eebe4c22dd08cf6d00e9dc5","observation_id":"1273e49c-7c95-4b3f-84d3-f000ba58e8fb","resolution":{"observed_at":"2026-06-29T08:43:15.129743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":176,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3a1ea4c35069bc395df580375f9254b69052b60203b54c569653deca45a73e5f","observation_id":"b02f5f93-5f63-4162-94f2-c034f54f4e04","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-02T08:40:52.852816Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:52.852816Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:d9c4340cef9dc3f20c3aeda26ccee93fdd63ab722154f9e86729745a6bb0082b","observation_id":"3e3ed705-f1f9-4f08-9ccb-495cb2c68033","resolution":{"observed_at":"2026-08-02T08:40:52.852816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-01T14:19:58.343808Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.343808Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:c09e1be423feeb873d55f3db4e477cc5ef12a0040cb3277f4f44477f0815ea1e","observation_id":"a074f1fd-fa65-4776-a518-e65e3bfced2f","resolution":{"observed_at":"2026-08-01T14:19:58.343808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-01T12:41:27.456257Z","title":"Uncertainty weighted actor-critic for offline reinforcement learning.arXiv preprint arXiv:2105.08140, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26599","last_updated":"2026-07-29T08:20:17Z","snapshot_observed_at":"2026-08-09T10:58:11.928926Z","submitted_at":"2026-07-29T08:20:17Z","title":"Uncertainty-Guided LLM Semantic Augmentation for Heterogeneous Treatment Effect Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T12:41:27.456257Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.26599"},"observation_digest":"sha256:d4233c0106f48159af90fef2b86ddb27de0127d60b793f88103f6ed13f128eb3","observation_id":"9b78a919-2db4-40d0-8f21-70201db89ad9","resolution":{"observed_at":"2026-08-01T12:41:27.456257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2105.08140/citation-record","integrity":"/paper/2105.08140/integrity","json":"/paper/2105.08140/citation-record.json","paper":"/paper/2105.08140"},"outbound":[],"paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2105.08140."}