{"as_of":"2026-08-17T08:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e649a8eabd09ecb671cac51ab09421a1318a17525dfb048cb93db695598265af","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:27:33.377046Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.05545/citation-record","integrity":"/paper/2509.05545/integrity","json":"/paper/2509.05545/citation-record.json","paper":"/paper/2509.05545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.913438Z","title":"Hindsight experience replay","venue":null,"work_id":"25c000b0-7b0e-4d58-8b97-9533cddce444","year":2017},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.232940Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:7d7bff110a4d8c4417faed2ec00c2599e963475b2ef6e0fa89f50182fefb73f7","observation_id":"05bd76c5-0d52-49fd-a501-51c0239a0ed9","resolution":{"observed_at":"2026-08-15T16:27:33.920035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.895941Z","title":null,"venue":null,"work_id":"0a23e0c7-eb6f-4c1d-b599-99306aedd5ba","year":2013},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.238619Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:730f9c83c4a88ac4435b385ea23291a93855fc6702f7f767902b6f0ca680b33a","observation_id":"e8ad6641-f987-4468-96d9-d0b70a184f94","resolution":{"observed_at":"2026-08-15T16:27:33.900806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.876169Z","title":"Barto and Sridhar Mahadevan","venue":null,"work_id":"59dca174-121d-4e18-82d9-427bd3adae85","year":2003},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.243883Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:ac5169cd2795f00d940cf79f243a46e47233c941e8b15f288c0d34f05a0c4e79","observation_id":"56f1df9e-3bb9-45c8-bc3d-6505cf4d91ed","resolution":{"observed_at":"2026-08-15T16:27:33.882425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.249281Z","title":"Bertsekas and John N","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.249281Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:28e75b65208ff05ba99cc929627cdae8b4d76ff7de0d3418255ab848372ee337","observation_id":"6fc8c6bd-0a98-4c7b-aa32-a0a4be840ef4","resolution":{"observed_at":"2026-08-15T16:27:33.249281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.255041Z","title":"Bertsekas and John N","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.255041Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:b14129b04d64dd60c8010f7228e811680af5ea6b78920c1b4820d834889d4647","observation_id":"96003cee-06a7-4f06-b1a3-47336397cc95","resolution":{"observed_at":"2026-08-15T16:27:33.255041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.829707Z","title":"Near-optimal regret bounds for stochastic shortest path","venue":null,"work_id":"037936bf-70f2-4dcf-bc8a-bb3401f0393b","year":2020},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.260527Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:60d11ee942f71fd29f7fb7446b1074a36d97292372afb346a804a15043eda875","observation_id":"a6181469-524e-429d-9779-8f176f16ae0f","resolution":{"observed_at":"2026-08-15T16:27:33.836185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.808746Z","title":"Improving generalization for temporal difference learning: The successor representation.Neural Computation, 5(4):613–624, 1993","venue":null,"work_id":"260ed306-1fcd-4ae9-a6f7-4ab70e204bca","year":1993},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.266474Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:4b013ce629ad51ac3b30ed5c530f60b7f10b613b33d514eb3768a06d04e37adb","observation_id":"5aed9829-5eba-4702-88a9-9e5474ffe8c5","resolution":{"observed_at":"2026-08-15T16:27:33.815472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.791007Z","title":"Dietterich","venue":null,"work_id":"c4492caf-06c1-4b46-800c-418ed5df05d5","year":2000},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.272000Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:ef7a3c02c9d164f28b5e66f40be5857a2121a3fde378f0f60a95fb304ee5e393","observation_id":"6aa8b705-3a1e-4ab9-b947-46ae8de869db","resolution":{"observed_at":"2026-08-15T16:27:33.796513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.773446Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"1b658d4a-9b77-4e95-9d7d-24e4781357d0","year":2019},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.277163Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:d27c721ac4cab2e1678a12470797249200bce2f75a64389df595e795f9cfc2a9","observation_id":"4a8f384b-3ef5-4401-a2b0-90770e7f07aa","resolution":{"observed_at":"2026-08-15T16:27:33.778644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.755794Z","title":"Contrastive learning as goal- conditioned reinforcement learning","venue":null,"work_id":"1669cc5b-c276-40dd-9269-fe7d34f985b4","year":2022},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.282625Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:b9fa97327f180e2261535d550e40d25ae84c5927539cc864e45b42d84b34a64c","observation_id":"29ad330f-ba64-4167-bcc6-4e73e3819cbb","resolution":{"observed_at":"2026-08-15T16:27:33.761464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.737890Z","title":"Gershman","venue":null,"work_id":"df9e25f0-b13d-4eb9-a352-970738455063","year":2018},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.287910Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:c32ca20363c0a26c96cd54d42b9286c34d48fdf60d9efb526341e67ec7333b24","observation_id":"fc62e767-aa32-4749-87ae-6bf39a49999b","resolution":{"observed_at":"2026-08-15T16:27:33.743477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06088","last_updated":"2020-10-02T19:49:10Z","snapshot_observed_at":"2026-08-13T23:59:03.584749Z","submitted_at":"2019-12-12T17:26:47Z","title":"Learning to Reach Goals via Iterated Supervised Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06088","snapshot_observed_at":"2026-08-15T16:27:33.292977Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.292977Z"},"links":{"cited_paper":"/paper/1912.06088","citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:d35fa50343d73efa071ad8a6e00b8720d020a7c3642c527b3c625b4c801ea227","observation_id":"9577541d-712f-4db9-ae4d-f9326ebcec4f","resolution":{"observed_at":"2026-08-15T16:27:33.292977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.718148Z","title":"Dynamical distance learning for semi-parametric control","venue":null,"work_id":"f45336b0-2cc9-4f52-aa47-ede86d627577","year":2020},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.298878Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:511b90a9ece0d3726d19bbc6a241177c0317bd4ff9e0d9b0d6a994ce7f5d6691","observation_id":"872f54b0-5188-4491-a590-eaaf70df424e","resolution":{"observed_at":"2026-08-15T16:27:33.724725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.700019Z","title":"Finite-sample convergence rates for Q-learning","venue":null,"work_id":"a231f63e-6af8-468a-9604-7c78745b0778","year":1999},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.304257Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:d9e6314d64d53b1b44e31ca8495b2bbc4555a79ccafe06f8611495a1335ad611","observation_id":"587b32ff-c44f-424e-a71a-9ab1179dc598","resolution":{"observed_at":"2026-08-15T16:27:33.706269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.680434Z","title":"Learning multi-level hierarchies with hindsight","venue":null,"work_id":"c4faadca-0744-4e8a-bc07-175641cf71d2","year":2019},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.309289Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:d39423f3e432dd3525256e974a77815f2c4eb9c28a0f0e6ed0ccbbaaa6c20a68","observation_id":"dd3af30b-7977-4a94-bc32-fbb71eeace47","resolution":{"observed_at":"2026-08-15T16:27:33.686190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.663737Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"2780ee58-c1d1-4601-8e4a-7429fb5753d0","year":2016},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.314318Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:f7f9f7d5146c364c265bbd0d4e345225406b1b57640e29040e1090840075578a","observation_id":"03c69c57-e2ca-4da5-bd5d-8cd2f845dd46","resolution":{"observed_at":"2026-08-15T16:27:33.668970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.644232Z","title":"Learning stochastic shortest path with linear function approximation","venue":null,"work_id":"5fe08b2e-a810-4f78-a0d7-f01d51b13949","year":2022},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.319086Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:c7c6704838bffbdf726acab77316794f6eb107d4e5654610f6262ebd47de1097","observation_id":"932a3765-cc86-4ec1-80b2-af34429bbea7","resolution":{"observed_at":"2026-08-15T16:27:33.650598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.624641Z","title":"Data-efficient hierarchical reinforcement learning","venue":null,"work_id":"0a6ac6a6-1710-4d9e-8718-a6467202ae5f","year":2018},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.324260Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:1aae70adfa9a29ba1fc0e6e1c62d4d1780d73f3301b3626b82b24e24483af1e0","observation_id":"84603847-4463-482e-92cf-c1a60ee9a232","resolution":{"observed_at":"2026-08-15T16:27:33.629928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.602531Z","title":"Hierarchical reinforcement learning: A comprehensive survey.ACM Computing Surveys, 54(5):1–35, 2021","venue":null,"work_id":"08c38b46-de7e-4b70-afd3-4572d5e130e1","year":2021},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.330109Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:c78009efd945c021692bf9d5cc52bf617921241ea253105932e78247393b6eca","observation_id":"dab6480a-b62f-455c-835f-06d3add4426f","resolution":{"observed_at":"2026-08-15T16:27:33.609131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.583178Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":"9c241f55-f318-4bba-ac8c-ceb6c3a89215","year":2017},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.335666Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:2f3d338fb09889cc970ca9665acfad7ff7560011bb93596d7e7d9d02d3d6c143","observation_id":"935be90d-192e-467b-b257-59597388b7cf","resolution":{"observed_at":"2026-08-15T16:27:33.589629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.564804Z","title":"Universal value function approximators","venue":null,"work_id":"97316052-0f88-4c97-8be3-e3b8fad42d91","year":2015},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.340887Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:502d3407caab2e05709a93feb84ecb20349aa7f1db918b1c0379e98c028bb917","observation_id":"382b9d60-c1fb-4091-b7d9-79728ea1233e","resolution":{"observed_at":"2026-08-15T16:27:33.570166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.546697Z","title":"Toshev, Sergey Levine, and Brian Ichter","venue":null,"work_id":"850352ae-9f3f-4d8c-b077-4dc561227b58","year":2022},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.346188Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:89b116e60a56b1234b4c2d16865589b71dfb65d19e6833d2e513433493e8d949","observation_id":"66b03e62-c692-42f4-83f3-c9e313735709","resolution":{"observed_at":"2026-08-15T16:27:33.552596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.351379Z","title":null,"venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.351379Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:1bd867efe10354151e7e842c4e83daec374f2e25ac3685c770c30956a7262518","observation_id":"07b67f88-073e-4a8d-8b9e-607a63254adb","resolution":{"observed_at":"2026-08-15T16:27:33.351379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.510706Z","title":"Sutton, Doina Precup, and Satinder Singh","venue":null,"work_id":"69bac1f1-c4d3-46ab-984c-e52bf8c89bf5","year":1999},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.356283Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:299ab88a1ad03b2140d489bca05dfa435f1434ceca295aa373cd5d23ea194d8b","observation_id":"54821549-38df-486b-8da5-b03b789a7aaa","resolution":{"observed_at":"2026-08-15T16:27:33.515944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.493086Z","title":"Morgan & Claypool Publishers, 2010","venue":null,"work_id":"8ecb83f2-9528-4701-9583-1c2f1ca19fe1","year":2010},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.361600Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:4cbdc751720702f54d16a51e1fded7f39084d2d5e9f866fa505380f38afa93b5","observation_id":"9dc56b6d-a174-4c62-adc3-dca78457cbea","resolution":{"observed_at":"2026-08-15T16:27:33.498179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.474869Z","title":"Value iteration networks","venue":null,"work_id":"3a6ed930-afeb-4138-9469-4a9cb617d206","year":2016},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.367104Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:3a80bbf897bd7e70ed5aa362571208dc66806b984fd431c21bdfae873a6f5193","observation_id":"42a9d886-b834-4087-9119-7104e373c288","resolution":{"observed_at":"2026-08-15T16:27:33.480646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.455544Z","title":"Sample complexity bounds for stochas- tic shortest path with a generative model","venue":null,"work_id":"bc5ed253-1c44-4812-a1ad-bcb1865acc2d","year":2021},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.372191Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:7424b740d8ca7ee771b894e1ef2e6b4ebd19bb13fd52877ec7d6aeafb1c4fbaf","observation_id":"c21094b6-4904-447e-928e-071c048c4745","resolution":{"observed_at":"2026-08-15T16:27:33.462195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.433264Z","title":null,"venue":null,"work_id":"38a3bf05-79c5-4693-b350-3ca70a8a6ba9","year":1992},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.377046Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:9b714537c9a8df2ca3fc9aa2939c31e72e21d9c646a53482dfc5decdbaaf4c9c","observation_id":"03cd3234-0a4b-4fbc-9567-7c5636a29d88","resolution":{"observed_at":"2026-08-15T16:27:33.439595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2509.05545."}