{"as_of":"2026-08-10T12:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ef11b8c3f8e5c63bebaee7f49688ea2b25b9eb60e933ad122103398d1e9188f","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:04:22.954743Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:48:14.710291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20036","snapshot_observed_at":"2026-08-03T08:48:14.710291Z","title":"Hierar- chical reinforcement learning and value optimization for challenging quadruped locomotion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15995","last_updated":"2026-07-13T08:09:40Z","snapshot_observed_at":"2026-08-09T20:21:22.211530Z","submitted_at":"2026-01-22T14:16:12Z","title":"PUMA: Perception-driven Unified Foothold Prior for Mobility Augmented Quadruped Parkour","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T08:48:14.710291Z"},"links":{"cited_paper":"/paper/2506.20036","citing_paper":"/paper/2601.15995"},"observation_digest":"sha256:883cdde3cbad891c5c32561afa450dd24dc3c58dbc9ca50968be9a0caf55807e","observation_id":"1f1692dc-f9fe-4483-9ca6-3963e6a63028","resolution":{"observed_at":"2026-08-03T08:48:14.710291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20036/citation-record","integrity":"/paper/2506.20036/integrity","json":"/paper/2506.20036/citation-record.json","paper":"/paper/2506.20036"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.11103","last_updated":"2019-06-19T17:40:58Z","snapshot_observed_at":"2026-07-06T07:23:52.401834Z","submitted_at":"2018-12-26T10:07:13Z","title":"Learning to Walk via Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.11103","snapshot_observed_at":"2026-08-06T23:04:22.748967Z","title":"Learning to walk via deep reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.748967Z"},"links":{"cited_paper":"/paper/1812.11103","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:eb0e4d7188ee28ecdc857bee4669eda4f0bd5fbed776b20f5917ea77cd421957","observation_id":"333d578b-a6ab-4fbd-ba2e-17357ea098cb","resolution":{"observed_at":"2026-08-06T23:04:22.748967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08550","last_updated":"2020-11-03T05:46:51Z","snapshot_observed_at":"2026-08-07T08:54:28.901497Z","submitted_at":"2020-02-20T03:36:39Z","title":"Learning to Walk in the Real World with Minimal Human Effort","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08550","snapshot_observed_at":"2026-08-06T23:04:22.760351Z","title":"Learning to walk in the real world with minimal human effort,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.760351Z"},"links":{"cited_paper":"/paper/2002.08550","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:b0af11616b1ad4791b6e1e633ef386c9e1816bfdf686c7373691dad2c75df85f","observation_id":"daa5474c-f09e-4b37-b8b3-29fe1abf5c44","resolution":{"observed_at":"2026-08-06T23:04:22.760351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.766963Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.766963Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:162d625b751581c3df44862157278a18db599963ed3b7b80aa64c1429cc6ccac","observation_id":"e9d06fc2-df31-45fa-be57-29e1d76e8880","resolution":{"observed_at":"2026-08-06T23:04:22.766963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:25.008620Z","title":"Learning fast adapta- tion with meta strategy optimization,","venue":null,"work_id":"3f1accae-b50f-461a-b02c-246e4d122e61","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.785144Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:1cf19870ed24ac1abad50eee146980a872680e20669bc963a2f05b02907bd3b8","observation_id":"f0bfe37c-3866-452e-8475-47e3d2a54b7e","resolution":{"observed_at":"2026-08-06T23:04:25.169003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.799138Z","title":"Legged locomotion in challenging terrains using egocentric vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.799138Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:e40037f4e2f738506c042b112ce795cbbe8c3e4be4aa99fe2bc321d8aa57cd60","observation_id":"0a0c4285-9394-447e-8d87-277170ab32fd","resolution":{"observed_at":"2026-08-06T23:04:22.799138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03996","last_updated":"2022-05-26T04:39:01Z","snapshot_observed_at":"2026-08-09T20:21:20.570284Z","submitted_at":"2021-07-08T17:41:55Z","title":"Learning Vision-Guided Quadrupedal Locomotion End-to-End with Cross-Modal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03996","snapshot_observed_at":"2026-08-06T23:04:22.808203Z","title":"Learning vision-guided quadrupedal locomotion end-to-end with cross-modal transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.808203Z"},"links":{"cited_paper":"/paper/2107.03996","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:ed54b127051189aa68b5dc8018a34850a9033f6c88525ea2ee7d2ca64c76acdb","observation_id":"fd0a9e0c-9437-4f0f-8f90-e1d92ea97ea1","resolution":{"observed_at":"2026-08-06T23:04:22.808203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.789488Z","title":"Policies modulating trajectory generators,","venue":null,"work_id":"b960f831-53e7-40b0-9ecb-ab106918fe3b","year":2018},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.818994Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:28669fd0206b73a9c9f0a4d591e54099c5e26d5f1b77c1d9a7c05c995a14f095","observation_id":"b0f45bd1-3c9a-43e8-872a-7ac3102dc1b4","resolution":{"observed_at":"2026-08-06T23:04:24.857451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.834747Z","title":"Learning quadrupedal locomotion over challenging terrain,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.834747Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:d92c5a21a7f18848a004137cef3ae19377c90e7fcb6313e07dafc5b7a6857882","observation_id":"8c895a94-052b-4928-9aad-6c3a901fe411","resolution":{"observed_at":"2026-08-06T23:04:22.834747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.561778Z","title":"Visual-locomotion: Learning to walk on complex terrains with vision,","venue":null,"work_id":"f7515d62-a8ca-4245-8a00-aa9f17d742b2","year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.844742Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:81cf0d388f6a4eef1542136dcee6df494b4eb90455ebce71f8e91b31bc0cf37a","observation_id":"0397cb74-f44f-46c3-8611-9b99acfbc0fa","resolution":{"observed_at":"2026-08-06T23:04:24.665324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.05513","last_updated":"2020-11-11T02:10:48Z","snapshot_observed_at":"2026-08-09T20:21:42.114755Z","submitted_at":"2020-11-11T02:10:48Z","title":"Zero-Shot Terrain Generalization for Visual Locomotion Policies","version":1},"cited_work":{"arxiv_id":"2011.05513","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.05513","snapshot_observed_at":"2026-08-06T23:04:23.168814Z","title":"Zero-Shot Terrain Generalization for Visual Locomotion Policies","venue":"cs.RO","work_id":"45140358-5101-4f78-9fff-0304ef109a9c","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.852843Z"},"links":{"cited_paper":"/paper/2011.05513","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:28690bd5c4a07db3742ff03febb6a969158f76b97ef2f9bc5fd36e480714c948","observation_id":"7b72015c-7d05-470d-a77f-4deb24715e94","resolution":{"observed_at":"2026-08-06T23:04:23.198739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.270073Z","title":"Learning agile locomotion skills with a mentor,","venue":null,"work_id":"a8db9d41-4760-4159-b436-8afae2575533","year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.860434Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:164409f607d1706af492f8411aa731c1b04eb69e3be02311197bd8a49178ac7c","observation_id":"c4170442-e519-4122-bfae-8d29ba4a321f","resolution":{"observed_at":"2026-08-06T23:04:24.411864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00784","last_updated":"2020-07-21T00:59:24Z","snapshot_observed_at":"2026-08-09T20:20:31.538108Z","submitted_at":"2020-04-02T02:56:16Z","title":"Learning Agile Robotic Locomotion Skills by Imitating Animals","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00784","snapshot_observed_at":"2026-08-06T23:04:22.865462Z","title":"Learning agile robotic locomotion skills by imitating animals,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.865462Z"},"links":{"cited_paper":"/paper/2004.00784","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:e1effefad601a10a9415b7d052618bc080476d1d005f7ecb9056a12670eb00d3","observation_id":"41f936ba-2ed3-4416-b529-93719e526df9","resolution":{"observed_at":"2026-08-06T23:04:22.865462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.044738Z","title":"Real-time trajectory adaptation for quadrupedal locomotion using deep reinforcement learning,","venue":null,"work_id":"eb480c4c-e80b-456f-aa6f-65335e855c0e","year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.871044Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:9498180e18d26d6840bf907d62795a7f628163c62a0c8a3d9ae4c94aa9a231c8","observation_id":"490190c5-0737-4616-9197-d5aa1f5a7118","resolution":{"observed_at":"2026-08-06T23:04:24.154395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.876052Z","title":"Guided constrained policy optimization for dynamic quadrupedal robot locomotion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.876052Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:7315fc25f8edb4453139ebbb49d57a32e9a74664b001298b91b2747ea6eac2fe","observation_id":"73665f83-3395-4377-966d-2764f7468065","resolution":{"observed_at":"2026-08-06T23:04:22.876052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.880917Z","title":"Deepgait: Planning and control of quadrupedal gaits using deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.880917Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:a115adbc3161e6cf2126547c9624f4eb797d339f9a493120223648a96efe220b","observation_id":"fac83b42-093f-4e70-9f79-15178228f663","resolution":{"observed_at":"2026-08-06T23:04:22.880917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:23.674328Z","title":"Allsteps: Curriculum-driven learning of stepping stone skills,","venue":null,"work_id":"4eac8f61-f13d-4f6f-aa4f-8265a55b8e07","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.887703Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:51a5a77e90e63d6f4e15956530ac9f1f83798b182c2e816f493f518be49e8061","observation_id":"659f3e14-aedc-4fec-a466-17373a2407d6","resolution":{"observed_at":"2026-08-06T23:04:23.744751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:23.562271Z","title":"Learning gen- eralizable locomotion skills with hierarchical reinforcement learning,","venue":null,"work_id":"8b78910d-cfad-4d08-b110-950ed72f2b30","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.892820Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:d4bc019bc7282e6a9984f8158394a75ca4ac72735d49f943b5e063013d3b6c60","observation_id":"2dcdbbc2-1653-43c6-90c6-bc843fb53338","resolution":{"observed_at":"2026-08-06T23:04:23.593917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:23.475748Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation,","venue":null,"work_id":"a48e9190-c221-4a0d-a277-33bf5e6b82b0","year":2018},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.898822Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:ba27e35d97b587374540bfa4767804c0a336d191f26b6be40a49eca4b128f42d","observation_id":"a7aaf8dc-b9aa-4de5-86ba-380b572d6619","resolution":{"observed_at":"2026-08-06T23:04:23.519591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.904750Z","title":"Hierarchical plan- ning through goal-conditioned offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.904750Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:4d8330e19237201df0f5238235bdef41c95eb48fb5ced1adaa02dc525e50f995","observation_id":"c88ac69d-0779-4e24-b38a-7f1f285a8fd8","resolution":{"observed_at":"2026-08-06T23:04:22.904750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:04:22.917740Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.917740Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:b2faf4d714a4d2293036def32b9fa635df7899fc521380af1b01aa9d49bf0658","observation_id":"f58c29f1-7e1f-4e03-8604-376fb57eed20","resolution":{"observed_at":"2026-08-06T23:04:22.917740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T23:04:22.923351Z","title":"High- dimensional continuous control using generalized advantage estima- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.923351Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:5994e20df10e952508156f3ce7fee6fab3dfc823684cb48d57bf954176fc2b82","observation_id":"11e69b46-db17-4390-b2c5-2987336495f1","resolution":{"observed_at":"2026-08-06T23:04:22.923351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T23:04:22.954743Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.954743Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:ca2592ae35c990d726fc2d0d269d592bc4f8ecfe71ae9438056add743a422833","observation_id":"ab0e3be2-9288-4487-aa34-9c158f627305","resolution":{"observed_at":"2026-08-06T23:04:22.954743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T20:21:07.081588Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2506.20036."}