{"as_of":"2026-08-15T01:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5f21490fec0a3c3814fb137145e859185058b96956fc9761e89e4dcbd11f7a5","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:59:56.340266Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:26:21.839155Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:59:55.584141Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"cited_work":{"arxiv_id":"2506.22827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22827","snapshot_observed_at":"2026-07-04T14:59:55.584141Z","title":"Hierarchical vision-language planning for multi-step humanoid manipulation.arXiv preprint arXiv:2506.22827, 2025","venue":null,"work_id":"c04913f3-5ab1-47b6-87f0-8831958b4e5e","year":2025},"citing_paper":{"arxiv_id":"2606.07723","last_updated":"2026-06-05T16:21:27Z","snapshot_observed_at":"2026-08-02T03:37:35.733251Z","submitted_at":"2026-06-05T16:21:27Z","title":"VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:00.330510Z"},"links":{"cited_paper":"/paper/2506.22827","citing_paper":"/paper/2606.07723"},"observation_digest":"sha256:64238cbcdf46273ca4c3369e728d0741d48748d5e01a7d5e70de409d37fc3f5a","observation_id":"a9371fa1-1616-44d4-bff4-09ea5ae26d81","resolution":{"observed_at":"2026-07-02T19:07:18.196604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"cited_work":{"arxiv_id":"2506.22827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22827","snapshot_observed_at":"2026-07-04T14:59:55.584141Z","title":"Hierarchical vision-language planning for multi-step humanoid manipulation.arXiv preprint arXiv:2506.22827, 2025","venue":null,"work_id":"c04913f3-5ab1-47b6-87f0-8831958b4e5e","year":2025},"citing_paper":{"arxiv_id":"2606.26201","last_updated":"2026-06-24T16:28:23Z","snapshot_observed_at":"2026-08-06T02:39:28.047556Z","submitted_at":"2026-06-24T16:28:23Z","title":"OmniContact: Chaining Meta-Skills via Contact Flow for Generalizable Humanoid Loco-Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T02:02:14.858734Z"},"links":{"cited_paper":"/paper/2506.22827","citing_paper":"/paper/2606.26201"},"observation_digest":"sha256:cd149823f28838745ad966566c963f0af115164dd25d6312d8e4210d2db2bd8c","observation_id":"0775e951-af37-4281-8935-448110cc6792","resolution":{"observed_at":"2026-07-04T14:59:55.585553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22827","snapshot_observed_at":"2026-08-01T16:26:21.839155Z","title":"Schakkal, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18016","last_updated":"2026-07-26T09:19:57Z","snapshot_observed_at":"2026-08-14T08:46:42.311148Z","submitted_at":"2026-07-20T14:52:46Z","title":"Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:26:21.839155Z"},"links":{"cited_paper":"/paper/2506.22827","citing_paper":"/paper/2607.18016"},"observation_digest":"sha256:8f0d70a6e01408f56f61c1f93ab44464ec5b961394b856648bd1a5c17016d1bc","observation_id":"1236f92f-c8d7-4e0f-8607-e11f1936bf03","resolution":{"observed_at":"2026-08-01T16:26:21.839155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22827/citation-record","integrity":"/paper/2506.22827/integrity","json":"/paper/2506.22827/citation-record.json","paper":"/paper/2506.22827"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:52.553403Z","title":"Pddl| the planning domain definition language","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.553403Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:1292b2aa7cd5049fc3f7b125e5419ae628461065d460b35e45307bb322fef649","observation_id":"6fb2cb8b-4321-48bb-bdb7-59189996548d","resolution":{"observed_at":"2026-08-06T21:59:52.553403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-06T21:59:52.602106Z","title":"RT-H: Action Hierarchies Using Language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.602106Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:8b327a802ab3fe94b81613b2527fb885c142e83ef6cddb1e4e8000426316db03","observation_id":"61c3af3c-568d-4eba-bff6-0c8e576d3da3","resolution":{"observed_at":"2026-08-06T21:59:52.602106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-06T21:59:52.680174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.680174Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:21d024a46141e170ebae25d17acfb6da580b114817dc0e25b8d867103a07ff72","observation_id":"954d7951-13ec-4c33-b96c-4a1416aeaa52","resolution":{"observed_at":"2026-08-06T21:59:52.680174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T21:59:52.757636Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.757636Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:7bd83e08f6362398b82b10caeeb4fdc541c5b9f78738ca3e52bfb139e611146d","observation_id":"b90758fc-2740-4c65-bc18-a54882e36608","resolution":{"observed_at":"2026-08-06T21:59:52.757636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T21:59:52.812767Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.812767Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:4489cbdc242d52306bb9f037fc3d487e074b613f7dd27848561c7bc55dce97ad","observation_id":"c7e8f828-9987-4e2f-887e-4330e5f0a59c","resolution":{"observed_at":"2026-08-06T21:59:52.812767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16796","last_updated":"2024-03-06T02:19:38Z","snapshot_observed_at":"2026-08-14T10:57:44.231246Z","submitted_at":"2024-02-26T18:09:24Z","title":"Expressive Whole-Body Control for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16796","snapshot_observed_at":"2026-08-06T21:59:52.885794Z","title":"Expressive Whole-Body Control for Humanoid Robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.885794Z"},"links":{"cited_paper":"/paper/2402.16796","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:2efe8fb55530e632b7396024eee1524e5f06d51afcff29fffbc13fbafb26443d","observation_id":"df44942e-909d-4459-8cb2-fe32739980ea","resolution":{"observed_at":"2026-08-06T21:59:52.885794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.500932Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"614be421-43ad-4650-beb7-74da05c3800a","year":2023},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.964765Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:70f791eafa0f2eb12fe32d247c483049f65ac7f59963458c874147543939323b","observation_id":"aaef66cd-2cf1-4ca4-998e-2f2a53c78ebc","resolution":{"observed_at":"2026-08-06T22:00:00.567283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22332","last_updated":"2025-03-10T00:54:50Z","snapshot_observed_at":"2026-08-14T08:14:01.869385Z","submitted_at":"2024-10-29T17:59:55Z","title":"Local Policies Enable Zero-shot Long-horizon Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22332","snapshot_observed_at":"2026-08-06T21:59:53.047409Z","title":"Local Policies Enable Zero-shot Long-horizon Manipu- lation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.047409Z"},"links":{"cited_paper":"/paper/2410.22332","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:1919bd01fc8190d385b94abdb20b650e42bad853d1fdfa6462b97f31ebbd8240","observation_id":"98fa6ea6-affb-4ee6-ba8b-7d2214b656fb","resolution":{"observed_at":"2026-08-06T21:59:53.047409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23254","last_updated":"2024-10-30T17:37:31Z","snapshot_observed_at":"2026-08-14T18:18:02.376240Z","submitted_at":"2024-10-30T17:37:31Z","title":"Keypoint Abstraction using Large Models for Object-Relative Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23254","snapshot_observed_at":"2026-08-06T21:59:53.126948Z","title":"Tenenbaum, Tomás Lozano-Pérez, and Leslie Pack Kaelbling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.126948Z"},"links":{"cited_paper":"/paper/2410.23254","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:4f172c586bb79465f7c808a2d78c91c85f1f3443ba5f49580617884a42444994","observation_id":"a0742abe-62c4-480e-b1da-c1300c4156ac","resolution":{"observed_at":"2026-08-06T21:59:53.126948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10454","last_updated":"2024-06-15T00:41:34Z","snapshot_observed_at":"2026-08-12T23:42:18.867558Z","submitted_at":"2024-06-15T00:41:34Z","title":"HumanPlus: Humanoid Shadowing and Imitation from Humans","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10454","snapshot_observed_at":"2026-08-06T21:59:53.184656Z","title":"HumanPlus: Humanoid Shadowing and Imitation from Humans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.184656Z"},"links":{"cited_paper":"/paper/2406.10454","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:f39663c0367f952e1342c0c9850069b665b2c5e3250e1d62fa6f31249585a70a","observation_id":"82e75abd-4182-4951-81a1-efdbb16c3e01","resolution":{"observed_at":"2026-08-06T21:59:53.184656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02116","last_updated":"2025-04-19T18:59:07Z","snapshot_observed_at":"2026-08-10T22:12:13.064895Z","submitted_at":"2025-01-03T22:00:53Z","title":"Humanoid Locomotion and Manipulation: Current Progress and Challenges in Control, Planning, and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02116","snapshot_observed_at":"2026-08-06T21:59:53.261446Z","title":"Karen Liu, Abder- rahmane Kheddar, Xue Bin Peng, Yuke Zhu, Guanya Shi, Quan Nguyen, Gordon Cheng, Huijun Gao, and Ye Zhao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.261446Z"},"links":{"cited_paper":"/paper/2501.02116","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:dc4770b48935ec035e5e5b48403ae471f854c68d147b88184b5b54340f675fee","observation_id":"f7e3badf-5afc-4f12-9b3b-3ee07fa22b41","resolution":{"observed_at":"2026-08-06T21:59:53.261446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08858","last_updated":"2024-06-13T06:44:46Z","snapshot_observed_at":"2026-08-12T23:43:53.764034Z","submitted_at":"2024-06-13T06:44:46Z","title":"OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08858","snapshot_observed_at":"2026-08-06T21:59:53.340248Z","title":"OmniH2O: Universal and Dexter- ous Human-to-Humanoid Whole-Body Teleoperation and Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.340248Z"},"links":{"cited_paper":"/paper/2406.08858","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:593341d82be5b3c3bf38dfc5b6186cb7b5f01680253826d1e40572fd7d8f997e","observation_id":"771204e5-90fc-4b4a-bf16-e3a2b21619db","resolution":{"observed_at":"2026-08-06T21:59:53.340248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.348550Z","title":"Learning human- to-humanoid real-time whole-body teleoperation","venue":null,"work_id":"cf897abe-d6d8-4cc8-a9a7-735e40c7e2c3","year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.398859Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:6c590698c61e6240b0c405a3b67b60ee45973a3bcdc5a16a16ef45384bd3394f","observation_id":"6d72997c-be56-422c-a291-f6a3cab0315e","resolution":{"observed_at":"2026-08-06T22:00:00.421492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01143","last_updated":"2025-04-26T03:22:14Z","snapshot_observed_at":"2026-08-09T16:22:21.343164Z","submitted_at":"2025-02-03T08:22:46Z","title":"ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01143","snapshot_observed_at":"2026-08-06T21:59:53.456439Z","title":"ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.456439Z"},"links":{"cited_paper":"/paper/2502.01143","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:0b7c0f8d01ccecd07cb81486ba1fb0604ccc25ef4d837e2aca27ca7399cc04aa","observation_id":"bcf186a8-89af-4632-9e27-f9ee2e9c0129","resolution":{"observed_at":"2026-08-06T21:59:53.456439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.212662Z","title":"Learning visual quadrupedal loco-manipulation from demonstrations","venue":null,"work_id":"b070cab4-6c13-4ac9-8628-93b5bc40c728","year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.514574Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:15fd76da46247f7f49e7394f4fb0eea2f22b7c036cfceef53e4fd2bd2446d343","observation_id":"96a3af25-4ddc-41b0-b7bf-b39ca6820c95","resolution":{"observed_at":"2026-08-06T22:00:00.275793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13196","last_updated":"2025-03-12T00:40:43Z","snapshot_observed_at":"2026-08-11T13:17:42.993482Z","submitted_at":"2024-12-17T18:59:51Z","title":"ExBody2: Advanced Expressive Humanoid Whole-Body Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13196","snapshot_observed_at":"2026-08-06T21:59:53.570181Z","title":"ExBody2: Advanced Expressive Humanoid Whole-Body Control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.570181Z"},"links":{"cited_paper":"/paper/2412.13196","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:15a67a1cb770c1660380ebeded79aeb1c1195f540af72caa230bbfd2f9492c10","observation_id":"22d8070d-4f94-4a11-9de5-d8990cee27e2","resolution":{"observed_at":"2026-08-06T21:59:53.570181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T21:59:53.626696Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.626696Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:491ff338d583a744351fdc7e6b3071d7b5da9bf061df9bcafbfd8f06eab51047","observation_id":"af846065-345e-4923-875e-d175eeab42b4","resolution":{"observed_at":"2026-08-06T21:59:53.626696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.085427Z","title":"Hybrik: A hybrid analytical-neural inverse kinematics solution for 3d human pose and shape estimation","venue":null,"work_id":"6e1434af-96fa-4bdd-953a-6a59ca918867","year":2021},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.685269Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:fb6ff695e0f790caf3f26ad72e37b6cb5777b316295b37e2e6631291621399b9","observation_id":"155af230-1722-417a-8b8b-ec423ee91e94","resolution":{"observed_at":"2026-08-06T22:00:00.148900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-08-08T19:05:01.694808Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-06T21:59:53.761474Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.761474Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:c59105d292204a8eb1535beafa1d3089c9656d92cbb3406f52bc0288ba6c4173","observation_id":"654c433f-530d-4754-987c-dae4a4dab890","resolution":{"observed_at":"2026-08-06T21:59:53.761474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.839950Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.839950Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:fb9ef62700adaf3aa7c9a83717d8150dfc67f92ea51877686637b145825af92f","observation_id":"d1a32033-20af-4716-860d-7473735078a3","resolution":{"observed_at":"2026-08-06T21:59:53.839950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T21:59:53.882437Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.882437Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:c01f01db7dc11a50a4539afdf8f11749804a44b353c9058d5a96432c1fb9d085","observation_id":"14e1c1cf-8de8-4721-bcd6-c51dd03aa27b","resolution":{"observed_at":"2026-08-06T21:59:53.882437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:59:53.885543Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.885543Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:f30046f6f2162250554829770927110cc52df7e3e9ec326788d8d262b3b34b0f","observation_id":"b86bce05-1870-42ab-9e99-1f1b7a87789b","resolution":{"observed_at":"2026-08-06T21:59:53.885543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.890452Z","title":"Quantifying representation reliability in self- supervised learning models","venue":null,"work_id":"e4aa2ebf-0d57-43db-9780-5d8bfe61ae40","year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.888056Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:9814e5ae30332f6d44d5fc7c6bcb45ec60de4bf6eb5106c2e8ef46dba365a832","observation_id":"ef144ca4-ad03-40c1-9249-9331a438cd31","resolution":{"observed_at":"2026-08-06T22:00:00.021442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.689889Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"f435a438-1938-4d1e-9af8-f51bfcc8ec80","year":2021},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.890092Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:e42c5d0364cf940f10a366fc56884fe6c44ca670ee6738f251e331956626909c","observation_id":"08e6259e-ca93-45fd-abcd-d066ccba20bc","resolution":{"observed_at":"2026-08-06T21:59:59.754003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T21:59:53.893050Z","title":"Proximal Policy Optimization Algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.893050Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:8a36ca1561b14f001fd14b2f3d0b6020da3732d2709ecaa6f22b0e89d7c2f15a","observation_id":"3cee411b-bb72-4f69-8381-c25a03499276","resolution":{"observed_at":"2026-08-06T21:59:53.893050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.521713Z","title":"Sketching curvature for efficient out-of-distribution de- tection for deep neural networks","venue":null,"work_id":"af1bb423-c97b-4245-bf40-e051ddebf2a3","year":1958},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.921955Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:f00014f6efaa79a399bee18072309d50e0d58f48f0648e497a180f6083a93517","observation_id":"f85ddf26-eb7a-427d-bf0f-3e0cddc54035","resolution":{"observed_at":"2026-08-06T21:59:59.584238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-06T21:59:54.045154Z","title":"Hi Robot: Open-Ended Instruction Follow- ing with Hierarchical Vision-Language-Action Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.045154Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:2af8d3219e2fa3f18e75c8962da51a325c6edb61bc997fd2c765147182eb5745","observation_id":"b65000dd-4e99-4817-8c13-389d6a582cd6","resolution":{"observed_at":"2026-08-06T21:59:54.045154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-06T21:59:54.272484Z","title":"Gemini robotics: Bringing ai into the physical world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.272484Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:69be8edef5451d62557398ede131dc05f3ccd130a3c7045f3eebb98877d81f01","observation_id":"4af1bbd7-6916-4807-9ff2-dc4707d96035","resolution":{"observed_at":"2026-08-06T21:59:54.272484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.322816Z","title":"Guiding Long- Horizon Task and Motion Planning with Vision Language Models","venue":null,"work_id":"5d05e10f-0390-45a9-bf5d-4124b479e1ba","year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.481448Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:44f3afd7ff847dbbfed381ca45a4a7a743831c510ba5619d1c4704bdffcd40e8","observation_id":"d5ab2f0e-c7ce-4c27-b85d-e9c413905bda","resolution":{"observed_at":"2026-08-06T21:59:59.446933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-12T23:41:59.753397Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T21:59:54.651218Z","title":"RoboPoint: A Vision- Language Model for Spatial Affordance Prediction for Robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.651218Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:7abaf6949eeae4908f57a1f80fb93b0f883091bd4b76d181f21d07d2d88c544a","observation_id":"919de7e8-553f-4b0f-a847-4d1c298511a7","resolution":{"observed_at":"2026-08-06T21:59:54.651218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T21:59:54.883464Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.883464Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:a05df2200753ed32869f27164761789552f64f22f6144c755b358a96e1a412c7","observation_id":"4464a284-559b-402b-991d-d6a4a68f3a8e","resolution":{"observed_at":"2026-08-06T21:59:54.883464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.072234Z","title":"Each hidden layer contains 256 units and ReLU activations","venue":null,"work_id":"a6c8a87b-e2bd-4685-b741-2237140ac788","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.019219Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:69c7840cc82a9095d7c1254ea272d955db54a3112fd28f26c286b3003dbb5f91","observation_id":"e0ef84e1-fdca-4791-b012-c098fb6b0de1","resolution":{"observed_at":"2026-08-06T21:59:59.190833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:58.790638Z","title":"Example real-time teleoperation is shown in Fig","venue":null,"work_id":"e369ea7e-77b8-4a09-bf7b-7f2d3ae8c10b","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.135712Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:36b1d8ea61a10785c6e9b92abba541111641184d9cc94713e9e72cdf5a01a10f","observation_id":"dc1640ef-0d2e-4f0b-820a-f15281820a93","resolution":{"observed_at":"2026-08-06T21:59:58.953533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:58.451095Z","title":null,"venue":null,"work_id":"a7fe9ed5-2eab-48d6-ae55-565c4db83624","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.249492Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:f1a6e6af9b2791ccfa8ceb33919b6f27300ad378a39b9026ee68ebc2e360bdd1","observation_id":"cb15ce47-7b67-4c12-9e2f-a726dd32d0cd","resolution":{"observed_at":"2026-08-06T21:59:58.588262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:58.218197Z","title":null,"venue":null,"work_id":"d44f6d2e-ef5d-4f27-bfca-d6961847053d","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.416376Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:2690a4afb900a7d7c9c831f4dd517181a19497c1db46afd6c45ede3edf993f93","observation_id":"3f425a5e-faa2-4428-bcb5-f951bb556e55","resolution":{"observed_at":"2026-08-06T21:59:58.331603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:57.841390Z","title":", πk} based on visual inputs and task prompts","venue":null,"work_id":"dd51c48b-f87b-4c83-b136-49c9c28e3bdb","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.630338Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:68f3f0c76569691849f47266278282a24d12ee8d8c75526c1dae851b730657ba","observation_id":"3cfa29f1-7f4d-4cf3-86ab-01e7025baa78","resolution":{"observed_at":"2026-08-06T21:59:58.060973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:57.509712Z","title":null,"venue":null,"work_id":"36f2c9b1-5bad-45fe-8bde-4553fcb05477","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.799218Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:578837945b27ecf7ab57411920db01aa1926898f764daf29ffc5af6377ea61ff","observation_id":"351fb3b2-1676-4a99-8d22-395d7b7314da","resolution":{"observed_at":"2026-08-06T21:59:57.668140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:57.273756Z","title":"In this example, the monitor verifies whether the object (a) Human operator (b) HybrIK pose detection result Fig","venue":null,"work_id":"60bf97a3-ada3-41fd-b436-1d5a5ec6fcd4","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:56.051191Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:b16464737ee08257a7e7cda06684d8e51c52596d1eb760a05e4dec043d4a10f4","observation_id":"c5251146-6d4b-4e3c-8aeb-3c4fdb171b29","resolution":{"observed_at":"2026-08-06T21:59:57.381780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:56.939274Z","title":"Once the monitor confidently determines the com- pletion of this skill, it signals the transition to the next planned skill","venue":null,"work_id":"1452e3ef-1d25-4b5f-b743-ed133004f7d1","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:56.172913Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:c095916fa1de9b85e3784c5ffdde3d4cf083dd66c59a75bbb0b32fd1430c2837","observation_id":"9c910987-98bf-4326-a7f3-028e31efbba5","resolution":{"observed_at":"2026-08-06T21:59:57.126378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:56.658315Z","title":"skill_name","venue":null,"work_id":"215bc104-8f69-4bd8-84fe-5015ae946416","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:56.340266Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:7d39f1c2742aad9797f3fa659253dd95e38cd56f2caeb2a2b3c435075e3be863","observation_id":"981385a1-158a-47a2-8b43-36019b340246","resolution":{"observed_at":"2026-08-06T21:59:56.764701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2506.22827."}