{"as_of":"2026-08-10T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be9affcf58927bc2b1abf0f2804a85d52759fb3a07d6dcbc9aa51313a6de566d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:51:10.088509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.875832Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-08T20:51:10.088509Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05244","last_updated":"2025-02-07T14:29:07Z","snapshot_observed_at":"2026-08-09T14:58:49.748389Z","submitted_at":"2025-02-07T14:29:07Z","title":"Probabilistic Artificial Intelligence","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-08T20:51:10.088509Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2502.05244"},"observation_digest":"sha256:fe434f22ed9be57feca2b0c09bec117b799d655c423304d1e35704bde4eebd65","observation_id":"80094c8b-5b20-472e-8415-45ff012c3829","resolution":{"observed_at":"2026-08-08T20:51:10.088509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-07T05:00:06.317779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09276","last_updated":"2026-07-07T00:07:34Z","snapshot_observed_at":"2026-08-10T04:38:51.578408Z","submitted_at":"2025-06-10T22:27:11Z","title":"Learning The Minimum Action Distance","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:00:06.317779Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2506.09276"},"observation_digest":"sha256:df705eec91b266dba164a951e776ae60e001ab779898ad5794ffdc9b5d249a2a","observation_id":"ddd076b9-b87d-41cc-8f01-81939b16a6cf","resolution":{"observed_at":"2026-08-07T05:00:06.317779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-08-08T08:13:32.220639Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:465e9774db4ac298e8449f4239ca3844405283ce2c8bd8a0288841098f21f475","observation_id":"36b8ca25-01b5-4335-ae96-44d416abfe1e","resolution":{"observed_at":"2026-05-17T21:55:46.344748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T05:18:20.960945Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2507.07969"},"observation_digest":"sha256:778c1b5fd1742ef632285173fde2ba06d033bbc3ef16153f71a537d7834f4fb5","observation_id":"6dff9391-b094-4459-a603-a585e27a868f","resolution":{"observed_at":"2026-05-19T05:22:06.454680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-06T11:03:27.866008Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.866008Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:766821f9f0074f800d27d8971ce5504fde1b25bc4b2136a20d4cbd1c9cf9661a","observation_id":"94b606da-e505-4439-a907-8aea010ac98d","resolution":{"observed_at":"2026-08-06T11:03:27.866008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-04T11:01:32.940364Z","title":"Ogbench: Benchmarking offline goal-conditioned rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:32.940364Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:af95240a2717f148d1738a0d6854495b6f4894bec9d84c49632fddc2bdbe4c44","observation_id":"d9dbfc70-990c-4916-9fce-9c40718e0fdd","resolution":{"observed_at":"2026-08-04T11:01:32.940364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-03T13:13:46.181719Z","title":"Ogbench: Benchmark- ing offline goal-conditioned rl.arXiv preprint arXiv:2410.20092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00126","last_updated":"2026-07-17T22:35:37Z","snapshot_observed_at":"2026-08-09T02:08:45.803046Z","submitted_at":"2025-12-31T22:03:19Z","title":"Compositional Diffusion with Guided Search for Long-Horizon Planning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T13:13:46.181719Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2601.00126"},"observation_digest":"sha256:c27cf7f49f9bda13f3750f8192007c72e9623d68da9ad76d916182e29a1a9c52","observation_id":"fa05d691-ee30-48d1-bca9-55001b0cf89d","resolution":{"observed_at":"2026-08-03T13:13:46.181719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T03:36:09.272019Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:2a84caf206b4c7c989abbb462cfb7fe36b780c61550de2ea52fd3fc02416a318","observation_id":"db0b3ea9-b2d5-4412-942a-55295afb2f63","resolution":{"observed_at":"2026-05-16T03:37:13.925570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-03T02:55:50.664859Z","title":"Ogbench: Benchmarking offline goal- conditioned rl.arXiv preprint arXiv:2410.20092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.664859Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:92bb5c031c54e0c2e9b465946a78d65566df7cfd0fb0f5c7c0df222ac6690ec2","observation_id":"51faad8d-45e9-4094-90c7-8d8b21cb8b97","resolution":{"observed_at":"2026-08-03T02:55:50.664859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-02T20:29:21.761975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23280","last_updated":"2026-05-29T16:05:00Z","snapshot_observed_at":"2026-08-09T10:56:14.300559Z","submitted_at":"2026-02-26T17:53:46Z","title":"Mollified Value Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T20:29:21.761975Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2602.23280"},"observation_digest":"sha256:a5b5a6a77cab60210c1fb614f2a2595936a282dd090d3cd03fc820faafe4f434","observation_id":"a8343163-33b9-4f8f-862e-8bfb86baf7ce","resolution":{"observed_at":"2026-08-02T20:29:21.761975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.03208","last_updated":"2026-06-16T20:46:31Z","snapshot_observed_at":"2026-07-13T13:29:04.173053Z","submitted_at":"2026-04-03T17:32:36Z","title":"Hierarchical Planning with Latent World Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T20:13:58.991298Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.03208"},"observation_digest":"sha256:b02c7f158dc6c48414112bc23f6b58ec6ec14387b6443ee607a1f02e94ae314c","observation_id":"f9df1c76-1628-4832-a185-ad2f45d46095","resolution":{"observed_at":"2026-05-13T20:18:13.774657Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.08960","last_updated":"2026-04-10T05:04:29Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T05:04:29Z","title":"Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:32.839681Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.08960"},"observation_digest":"sha256:4a4e267dfd98275957e3ee55ae62f63b9be6b49cde7e43b1e1cd7d428b0594a2","observation_id":"91efc267-0bc1-469c-b6cb-d890ec779898","resolution":{"observed_at":"2026-05-11T05:20:58.759408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:3bba8888db40e1679d05e8caec6eaa29477d85dae37309106802ae28514d634b","observation_id":"5d64e35e-d665-4b71-82a6-b355254c28fd","resolution":{"observed_at":"2026-05-10T06:51:46.552771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:809ac5d5f419ac2fe9bc3666f8597266bebcbd4027b8aefd41973b55cc7b45b4","observation_id":"52b4f72d-a89e-4d2c-b643-2cc6aaad9b70","resolution":{"observed_at":"2026-05-10T00:24:47.205459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.24729","last_updated":"2026-04-27T17:40:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:40:18Z","title":"SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:01:31.928056Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.24729"},"observation_digest":"sha256:b00aaaec12c2aee66f3a4c714cb8fedc62c12cdec7c882f8541521ec70c7d2cb","observation_id":"f7c41406-3076-4c03-9255-6e26d1176723","resolution":{"observed_at":"2026-05-11T21:51:30.956553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.00333","last_updated":"2026-05-18T20:20:23Z","snapshot_observed_at":"2026-08-02T02:43:02.274304Z","submitted_at":"2026-05-01T01:23:37Z","title":"Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T20:30:51.580075Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.00333"},"observation_digest":"sha256:a5b0e65c407dfb4b50dfdffe08e797b3f58299f1ff38d4a3faa5a1f8b372ba21","observation_id":"16424fe2-24bc-442f-a9c2-c627f70a1b1c","resolution":{"observed_at":"2026-05-11T15:11:06.863014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.00333","last_updated":"2026-05-18T20:20:23Z","snapshot_observed_at":"2026-08-02T02:43:02.274304Z","submitted_at":"2026-05-01T01:23:37Z","title":"Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T00:26:22.118037Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.00333"},"observation_digest":"sha256:ad693370ce95feec987f7c119b0e8fcf8b93bc1c974a645dcc2d0d758b672f37","observation_id":"300624e1-04bc-4ec4-87c6-edc248d7fa68","resolution":{"observed_at":"2026-05-21T00:29:17.301394Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:497ca65f4a2bfbc47b37c944fddbd0c9728fef30466efb98d1615861dc871f00","observation_id":"9466608c-1199-4497-a4b2-077d4b95e77b","resolution":{"observed_at":"2026-05-11T08:56:00.606269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T11:20:19.749415Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:95dab7fd8fb862b3c5611c0731d16163134491f04d1215e56ee4e34fe61db4bb","observation_id":"c88c5716-39f9-4a42-b98f-974e35ff1918","resolution":{"observed_at":"2026-05-11T19:41:07.982348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T05:05:29.984355Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:00e69e45f4a57be09ad6c7eadd662dac54a4b5d4582b3972ae5364eacc929539","observation_id":"6857293c-88d8-4b70-80b9-0634613f7325","resolution":{"observed_at":"2026-05-12T05:41:24.574346Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.07278","last_updated":"2026-05-08T05:43:33Z","snapshot_observed_at":"2026-08-01T00:55:28.214005Z","submitted_at":"2026-05-08T05:43:33Z","title":"Predictive but Not Plannable: RC-aux for Latent World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:26.526418Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.07278"},"observation_digest":"sha256:deeb18572ca309a8034b09f419beaecc57d89fa8c81b96b9ffec889b9054a895","observation_id":"c98f6020-6a6c-44eb-b2a3-6e0cdc916f31","resolution":{"observed_at":"2026-05-11T03:50:57.287755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.09364","last_updated":"2026-05-10T06:27:20Z","snapshot_observed_at":"2026-07-31T06:28:20.350355Z","submitted_at":"2026-05-10T06:27:20Z","title":"Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:37.739085Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.09364"},"observation_digest":"sha256:ecd929c5d41d57ae7cca36ca2c66d5ef0c2f93a2ae77637d1d43b64a3d04f186","observation_id":"e418e201-bd0b-4a2d-a6d1-0865b173542e","resolution":{"observed_at":"2026-05-12T07:16:26.099173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.12416","last_updated":"2026-05-12T17:12:29Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:12:29Z","title":"Aligning Flow Map Policies with Optimal Q-Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:04:22.603786Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.12416"},"observation_digest":"sha256:abcbf6310f616e79e77915619e0511211d4dde71c1d5b3aaf3c11d4b66e13df4","observation_id":"3314f778-70a6-4826-b3a6-9ec994936505","resolution":{"observed_at":"2026-05-13T05:07:17.404995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.13554","last_updated":"2026-05-13T13:58:49Z","snapshot_observed_at":"2026-08-01T19:52:28.213526Z","submitted_at":"2026-05-13T13:58:49Z","title":"Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:12:07.920183Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.13554"},"observation_digest":"sha256:07a23e3fb11eaa973cbd535ed339e79cf35c1dd8ca7b304180ff11f63215da6d","observation_id":"08f062bb-30cb-429b-8b2a-aaa02d3ea330","resolution":{"observed_at":"2026-05-14T20:12:55.160986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:7e35f7e77dc4977b699bf037540a64235aa4673cbf4ce036a333c7d80d7e357a","observation_id":"68eaf269-05be-4142-b8dd-52ae9d8b9432","resolution":{"observed_at":"2026-05-22T07:51:16.424773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.23551","last_updated":"2026-05-22T12:17:09Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:17:09Z","title":"Goal-Conditioned Agents that Learn Everything All at Once","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-25T04:59:48.867927Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.23551"},"observation_digest":"sha256:635c38fc9b494414c232517d3dfc9b998f8e636896163d551a8fb95fe0db84d1","observation_id":"ae08cfba-9d06-4283-8e67-ce8456143eb3","resolution":{"observed_at":"2026-05-25T05:00:21.633420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:250ab1e8af04471e3e361cb194299656ab48ddef9d7c19b440112de293a30367","observation_id":"3d2b2bbc-1993-411f-a147-1022ad6c4c7b","resolution":{"observed_at":"2026-07-03T04:17:36.877597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-11T10:36:56.968032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04978","last_updated":"2026-07-06T12:12:50Z","snapshot_observed_at":"2026-08-07T22:37:57.928894Z","submitted_at":"2026-07-06T12:12:50Z","title":"Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T10:36:56.968032Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.04978"},"observation_digest":"sha256:21c158cfc0618517e7aa9e8a749ac2a81d8bbf31ccecd0d9e56c3f40a5e2b223","observation_id":"eaff6284-3a5b-4e89-951c-191532220092","resolution":{"observed_at":"2026-07-11T10:36:56.968032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-01T16:35:02.963644Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17981","last_updated":"2026-07-20T14:15:03Z","snapshot_observed_at":"2026-08-07T06:41:03.058424Z","submitted_at":"2026-07-20T14:15:03Z","title":"Information-Based Exploration via Random Features for Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T16:35:02.963644Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.17981"},"observation_digest":"sha256:75a0e032e7c212682f2ca10af6fa8bf67005938300ee15fcf7fffe3858441476","observation_id":"bc458cce-5a2c-491f-8fa9-397615687046","resolution":{"observed_at":"2026-08-01T16:35:02.963644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-01T15:40:56.214865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18236","last_updated":"2026-07-20T17:59:41Z","snapshot_observed_at":"2026-08-06T03:29:10.545879Z","submitted_at":"2026-07-20T17:59:41Z","title":"Patch Policy: Efficient Embodied Control via Dense Visual Representations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T15:40:56.214865Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.18236"},"observation_digest":"sha256:dffcdc3f227e90b4c10056cc189004c431e87618806b8fc0a0861dab73df13c2","observation_id":"a760df6e-d248-44ab-bf5f-74b9f08d95af","resolution":{"observed_at":"2026-08-01T15:40:56.214865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-30T17:53:36.995307Z","title":"Arjun Parthasarathy, Nimit Kalra, Rohun Agrawal, Yann Le- Cun, Oumayma Bounou, Pavel Izmailov, and Micah Gold- blum","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23602","last_updated":"2026-07-26T11:11:23Z","snapshot_observed_at":"2026-08-05T10:42:24.747043Z","submitted_at":"2026-07-26T11:11:23Z","title":"Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T17:53:36.995307Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.23602"},"observation_digest":"sha256:26ad3e20f5fe954f5627154685eaea5d0b688e76d7f59c716ec67301e5b66946","observation_id":"dc080992-ec57-4d70-9d2d-b5d554fe735b","resolution":{"observed_at":"2026-07-30T17:53:36.995307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-01T03:05:32.205627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25236","last_updated":"2026-07-28T03:23:47Z","snapshot_observed_at":"2026-08-07T21:03:50.260810Z","submitted_at":"2026-07-28T03:23:47Z","title":"VisualPatchWorld: Code World Models as Latent Structured Representations for Planning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:05:32.205627Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.25236"},"observation_digest":"sha256:c16463776311d6d9026bd380e88b65b8fea3169d98a7bc30c6fa25834406dfff","observation_id":"43b47a63-4c4c-47c9-8f6c-814b4fa5ef8e","resolution":{"observed_at":"2026-08-01T03:05:32.205627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-30T11:06:23.418816Z","title":"Ogbench: Benchmarking offline goal-conditioned rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:23.418816Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:48b941189a6787566c917df93f20ab3d1a49eedda91161b64830305a07fcb506","observation_id":"1f3ce3a4-1cc5-4edc-956c-e0696890dc7f","resolution":{"observed_at":"2026-07-30T11:06:23.418816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-05T04:27:43.918926Z","title":"Ogbench: Benchmarking offline goal-conditioned rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.918926Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8ac375bb27dfaf494d6d1373223bde9e878dea786fcd6bc44a4236b78681b030","observation_id":"59243467-6b8b-404f-be6d-410361a58dae","resolution":{"observed_at":"2026-08-05T04:27:43.918926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-31T01:24:21.144653Z","title":"OGBench : Benchmarking offline goal-conditioned RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27422","last_updated":"2026-07-29T19:43:40Z","snapshot_observed_at":"2026-08-09T23:25:40.671878Z","submitted_at":"2026-07-29T19:43:40Z","title":"Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T01:24:21.144653Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.27422"},"observation_digest":"sha256:4b0349bbea9040a4346c53bf8ff155d363144f42fde7a6d1b042a5b46946a605","observation_id":"f6166a98-0e4f-4829-abdf-68c99f0d7fc2","resolution":{"observed_at":"2026-07-31T01:24:21.144653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.20092/citation-record","integrity":"/paper/2410.20092/integrity","json":"/paper/2410.20092/citation-record.json","paper":"/paper/2410.20092"},"outbound":[],"paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2410.20092."}