{"as_of":"2026-08-10T06:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dfbe426e0b8f189f17d2024de8f056734678023a34d89717871e854bed35f2cd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:27:10.227715Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:09:37.568122Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":"2110.15191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-07-04T06:09:37.568122Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"159f99e5-ec04-4303-8bf1-15e8885afda7","year":2021},"citing_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T19:28:28.201789Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2310.01889"},"observation_digest":"sha256:54e525cc7e8ab224be5e60dfe9ff1923856fc2fbe3f7e8b7a6a88b1bfdf28275","observation_id":"9675307c-0b74-414e-988a-e6618eb45ad2","resolution":{"observed_at":"2026-05-12T19:28:28.264291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":"2110.15191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-07-04T06:09:37.568122Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"159f99e5-ec04-4303-8bf1-15e8885afda7","year":2021},"citing_paper":{"arxiv_id":"2412.08812","last_updated":"2026-04-19T16:29:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-11T23:02:26Z","title":"Test-Time Alignment via Hypothesis Reweighting","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-23T06:55:54.051821Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2412.08812"},"observation_digest":"sha256:a74e86de986a260def46c0f15bc365eada7584230fef6ba8bdbb9d221300f29a","observation_id":"35c863d3-95c4-454e-86e3-360a5b546cc0","resolution":{"observed_at":"2026-05-23T06:57:40.508112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-08T23:27:10.227715Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04141","last_updated":"2025-02-06T15:20:32Z","snapshot_observed_at":"2026-08-09T14:57:03.566686Z","submitted_at":"2025-02-06T15:20:32Z","title":"Behavioral Entropy-Guided Dataset Generation for Offline Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T23:27:10.227715Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2502.04141"},"observation_digest":"sha256:26635b313e84e02c6e56e1bf55b15a09ed7e6a5bce37172dc255e80a8054eff0","observation_id":"8ec95f17-9622-4bb3-9f8f-e81737bb8dd6","resolution":{"observed_at":"2026-08-08T23:27:10.227715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-07T10:55:20.212381Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-09T01:33:11.458736Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.212381Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:f40596bec3a327ebd66b6560d719f0a9965582cfce9e6aeb27eba80dc8abf549","observation_id":"0ab1fa87-310f-4571-ad83-a3e2d187c08c","resolution":{"observed_at":"2026-08-07T10:55:20.212381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-06T19:32:33.850798Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.850798Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:a23e45797443819901945990133c0410897a7dfb71b1abc4e19d2de87af34d1b","observation_id":"6a562b5b-dfad-4cdb-bdee-9306df3dcf24","resolution":{"observed_at":"2026-08-06T19:32:33.850798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-06T04:39:02.796315Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.796315Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b3c1ad546753561ca688ed3bf3238a27474a401835cb4febab93d016f36f856b","observation_id":"f8ff49ef-a2ff-469f-a26a-7272292de7a0","resolution":{"observed_at":"2026-08-06T04:39:02.796315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":"2110.15191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-07-04T06:09:37.568122Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"159f99e5-ec04-4303-8bf1-15e8885afda7","year":2021},"citing_paper":{"arxiv_id":"2605.20209","last_updated":"2026-07-18T16:31:33Z","snapshot_observed_at":"2026-08-02T16:17:14.559124Z","submitted_at":"2026-04-15T14:51:32Z","title":"NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:07.291649Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2605.20209"},"observation_digest":"sha256:752c10cd1e8c945de2367d5108acc5f6f4347da5ac12cc87ca89ed2130a2113a","observation_id":"c662e91e-b9de-431d-99c9-cec0a371241d","resolution":{"observed_at":"2026-05-21T09:44:05.598956Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-02T16:17:15.518662Z","title":"arXiv preprint arXiv:2110.15191 (2021) 4","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.20209","last_updated":"2026-07-18T16:31:33Z","snapshot_observed_at":"2026-08-02T16:17:14.559124Z","submitted_at":"2026-04-15T14:51:32Z","title":"NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T16:17:15.518662Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2605.20209"},"observation_digest":"sha256:dd5256a4bf67f524c21cf35a00a695a2efce438fe5643de2d5c6de684ad55892","observation_id":"cce5b212-7792-4d4a-8d61-97c5ff9c5260","resolution":{"observed_at":"2026-08-02T16:17:15.518662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":"2110.15191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-07-04T06:09:37.568122Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"159f99e5-ec04-4303-8bf1-15e8885afda7","year":2021},"citing_paper":{"arxiv_id":"2606.21271","last_updated":"2026-06-19T09:47:38Z","snapshot_observed_at":"2026-07-06T23:56:17.293417Z","submitted_at":"2026-06-19T09:47:38Z","title":"Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:48:19.683101Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2606.21271"},"observation_digest":"sha256:9b26d5ced0e463cf77446b8db8dd27ea91342ad9ede1b90e4191bb5145365349","observation_id":"a0e6834c-c95c-428e-a270-b8a75fc44efd","resolution":{"observed_at":"2026-07-04T06:09:37.570048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2110.15191/citation-record","integrity":"/paper/2110.15191/integrity","json":"/paper/2110.15191/citation-record.json","paper":"/paper/2110.15191"},"outbound":[],"paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2110.15191."}