{"as_of":"2026-08-18T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63ce13555296af96301c6a9e2299c772a2857392de5d4850917a05b3a1dffcc6","coverage":[{"denominator":161,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:33:46.663820Z","state":"measured"},{"denominator":165,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":165,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":65,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:52:38.381035Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T04:16:48.668605Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T18:50:16.766190Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09671","last_updated":"2025-09-11T17:59:07Z","snapshot_observed_at":"2026-08-17T05:00:50.561864Z","submitted_at":"2025-09-11T17:59:07Z","title":"Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:50:16.766190Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2509.09671"},"observation_digest":"sha256:7da9d5cef15d1aeb71113ea1c931247a7eafa75b2ad592791ac32fe56ba0fae0","observation_id":"8b59d164-430f-4446-9e55-2a5eac4ef086","resolution":{"observed_at":"2026-08-04T18:50:16.766190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-15T15:52:38.381035Z","title":"Being-h0: Vision-language-action pretraining from large- scale human videos.arXiv preprint arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21256","last_updated":"2026-07-09T07:54:33Z","snapshot_observed_at":"2026-08-17T18:07:59.276640Z","submitted_at":"2025-09-25T14:49:48Z","title":"BiNoMaP: Learning Category-Level Bimanual Non-Prehensile Manipulation Primitives","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:52:38.381035Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2509.21256"},"observation_digest":"sha256:577a9c5557f3b2d8b37b13ec49c29234cd9c88c38257a3c04652edbe10791940","observation_id":"456959d4-8736-4618-9dfb-3b2ebb6116e2","resolution":{"observed_at":"2026-08-15T15:52:38.381035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T07:00:46.531852Z","title":"Being-h0: Vision-language-action pretraining from large- scale human videos.arXiv preprint arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-15T23:58:56.202296Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.531852Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:c2ddc6a78df8ca53a4324f04ff2a059ef3ac8e2768c3c7cedfb55b4d7f7b12e5","observation_id":"8ea14750-e58d-4048-b56d-b8b74d8d3eb6","resolution":{"observed_at":"2026-08-04T07:00:46.531852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2511.18127","last_updated":"2026-05-15T06:06:57Z","snapshot_observed_at":"2026-08-17T15:14:40.490371Z","submitted_at":"2025-11-22T17:22:24Z","title":"SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T17:53:19.002603Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2511.18127"},"observation_digest":"sha256:b76e551915b6eaedf756834185563988896bbc4a4a5e74c5724c00bc6ac86a70","observation_id":"a8f85282-66ee-412a-84da-64e4d1894b45","resolution":{"observed_at":"2026-05-21T17:54:18.265883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-03T19:11:42.870351Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01715","last_updated":"2026-07-01T14:29:04Z","snapshot_observed_at":"2026-08-17T11:03:42.379278Z","submitted_at":"2025-12-01T14:21:15Z","title":"Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:42.870351Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2512.01715"},"observation_digest":"sha256:7a95eba9048963384b7746f17d0e673f6d3c55bc605e5003fe5a20bce9ff96fd","observation_id":"228ccdd7-920f-40ef-bcab-b572bd8fc53a","resolution":{"observed_at":"2026-08-03T19:11:42.870351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-03T04:18:55.692685Z","title":"Being-H0: Vision- Language-Action Pretraining from Large-Scale Human Videos.Preprint at arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05513","last_updated":"2026-08-17T05:46:30Z","snapshot_observed_at":"2026-08-18T05:16:48.745207Z","submitted_at":"2026-02-05T10:13:34Z","title":"DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:18:55.692685Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.05513"},"observation_digest":"sha256:eea779a1fe6b514859a1d29916db700272f364b09af2bc06817b5b4e08caa1ae","observation_id":"14292983-4c79-4716-84d6-caa3591e71cf","resolution":{"observed_at":"2026-08-03T04:18:55.692685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:100f4edd540642965e2dfa3bebc65bc5e58e5e0a07895073eaadf74666af29b6","observation_id":"ce3dc394-c737-4508-8cc6-ddc2e5d46e0c","resolution":{"observed_at":"2026-05-16T17:02:34.356382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2602.10698","last_updated":"2026-02-11T09:57:32Z","snapshot_observed_at":"2026-08-11T15:16:51.530916Z","submitted_at":"2026-02-11T09:57:32Z","title":"AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T06:01:30.803128Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.10698"},"observation_digest":"sha256:c21393b665b2a81ab7873ad67ef98fa2f9c1bc416278f5817c9a8ff27485ed90","observation_id":"df45d407-7e35-4e6c-ae92-b93786349036","resolution":{"observed_at":"2026-05-16T06:02:24.979717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T23:57:44.645995Z","title":"Being-h0: vision-language-action pre- training from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T23:57:44.645995Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.12215"},"observation_digest":"sha256:87bcff4f1b34673216264a1c8d1c8989f39172fdbdd002b178f8239743a99bc5","observation_id":"4bb248b3-fd46-4cde-a901-5771d349e93c","resolution":{"observed_at":"2026-08-02T23:57:44.645995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-08-10T22:29:48.430468Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T21:22:41.935691Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2603.00110"},"observation_digest":"sha256:913a60ba450112f0720c01216ad594cdf80e912089a6e971b5e4079dcf4e266d","observation_id":"66e903d4-96b3-4591-9df8-7feafe535f33","resolution":{"observed_at":"2026-05-15T21:30:20.893877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-13T21:11:31.022938Z","title":"Being-h0: Vision-language-action pre- training from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.20850","last_updated":"2026-06-08T23:42:26Z","snapshot_observed_at":"2026-08-15T09:04:55.785151Z","submitted_at":"2026-03-21T15:12:57Z","title":"Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T21:11:31.022938Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2603.20850"},"observation_digest":"sha256:10a8d0a55ec6d35839d6773f7c92dad393accd72473a0e7f8000d8c925d0ef1d","observation_id":"995409de-51e6-4c60-8313-a0d448e7afc8","resolution":{"observed_at":"2026-07-13T21:11:31.022938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-08-10T10:03:25.795206Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:41.489995Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:ee3f8a70ce477f1e5e0c5206cd37daf3aee571b02efbc0086c74ab361f3e8ece","observation_id":"3f1506ab-6795-42ac-a247-a675d0621889","resolution":{"observed_at":"2026-05-11T07:35:57.002389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-13T08:25:22.011013Z","title":"Being-h0: Vision-language-action pre- training from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-08-10T10:03:25.795206Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T08:25:22.011013Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:fe9d9e30becee9565b33b7e3b71ee6e981e055ed158665ffbb9ce151496399da","observation_id":"0d1f7b55-f0f4-4ffb-a777-628617c0a3dd","resolution":{"observed_at":"2026-07-13T08:25:22.011013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.10677","last_updated":"2026-04-12T15:02:34Z","snapshot_observed_at":"2026-08-14T02:40:45.565046Z","submitted_at":"2026-04-12T15:02:34Z","title":"LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:36:23.197843Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.10677"},"observation_digest":"sha256:eaab8fdb03f14dcd045ce9e41d45cbd33d23df098e7440093311172323dbd63e","observation_id":"792b1e76-3bab-4a37-bf0e-e6655d513d82","resolution":{"observed_at":"2026-05-11T10:11:03.890345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.13645","last_updated":"2026-04-15T09:14:43Z","snapshot_observed_at":"2026-08-17T03:50:55.250696Z","submitted_at":"2026-04-15T09:14:43Z","title":"A Mechanistic Analysis of Sim-and-Real Co-Training in Generative Robot Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T12:29:38.306670Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.13645"},"observation_digest":"sha256:a86bd43f1c8d3c2c70b647d65b521a4161ff924fd5a138789a9367699f887ac6","observation_id":"64153462-9782-4f60-8a31-79fdad4c8103","resolution":{"observed_at":"2026-05-10T12:30:22.689485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.18000","last_updated":"2026-04-20T09:25:30Z","snapshot_observed_at":"2026-08-03T00:50:48.601549Z","submitted_at":"2026-04-20T09:25:30Z","title":"Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T04:27:18.284698Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.18000"},"observation_digest":"sha256:aa1a3e4fc5f97360a9badaea1350bc83b038f07ea9f174af17f1c92b7a077914","observation_id":"2a2c6c44-858e-4db3-8980-fbea3cac73d0","resolution":{"observed_at":"2026-05-11T11:56:29.409174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.23570","last_updated":"2026-04-26T07:21:15Z","snapshot_observed_at":"2026-08-16T02:29:08.144973Z","submitted_at":"2026-04-26T07:21:15Z","title":"EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T06:19:34.743194Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.23570"},"observation_digest":"sha256:c92b09c1edf2acc6fac703f1a78a067d42708111da17ead7e4afd0b11fe42727","observation_id":"fdef3828-756b-4c33-8992-1d37bb0ebb4b","resolution":{"observed_at":"2026-05-11T21:16:11.740209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-14T15:12:56.831346Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T02:51:27.662262Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:8ee098e0e3aa904ad8948264705698d0fb2b6aa507a35951d1f49f83c56c6095","observation_id":"8fceb112-ea8a-4399-9ffb-052c51f8bd42","resolution":{"observed_at":"2026-05-11T22:26:11.725302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-14T15:12:56.831346Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T11:16:58.104663Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:4a2b7f81bb8e15d2dbc1810af55e820db1d46080cfc3c8ac9707acb098605d8f","observation_id":"17e17457-c4f2-43ba-8fd9-251ff72234fa","resolution":{"observed_at":"2026-05-22T11:21:29.156747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:b778722dfd6b957300e2ed791f3a14d06f13ab1612da4423ba2c0e9997e79076","observation_id":"ced91d16-378a-404b-8909-be2b52314578","resolution":{"observed_at":"2026-05-11T14:56:08.488051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.00080","last_updated":"2026-04-30T14:35:31Z","snapshot_observed_at":"2026-08-04T20:02:32.182599Z","submitted_at":"2026-04-30T14:35:31Z","title":"World Model for Robot Learning: A Comprehensive Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T20:38:12.709629Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.00080"},"observation_digest":"sha256:af92a3e57f53b613a9f499ff293b58bc2a84f03d5518366d3298751a3437de59","observation_id":"13379a2f-4b85-4ade-9d08-19553221a7e8","resolution":{"observed_at":"2026-05-11T15:11:04.931247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.06747","last_updated":"2026-05-07T15:21:58Z","snapshot_observed_at":"2026-08-09T19:59:54.117138Z","submitted_at":"2026-05-07T15:21:58Z","title":"HumanNet: Scaling Human-centric Video Learning to One Million Hours","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T00:51:08.414394Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.06747"},"observation_digest":"sha256:dcdb005bab4305cd2d1e25a969364fcba5686e89986faac7ef4addcd067af4cf","observation_id":"fe5defcd-459a-4c6d-9907-f07a38569958","resolution":{"observed_at":"2026-05-11T05:10:54.148923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:1625933b29b49cad13bc7d6d0ea9bb70dba63aa1625e9a695095ed5b3c2a9b95","observation_id":"a47c22ac-14c5-4628-abbb-cb6baa225d67","resolution":{"observed_at":"2026-05-13T05:07:17.846258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.13925","last_updated":"2026-05-13T15:23:17Z","snapshot_observed_at":"2026-08-11T06:10:13.835449Z","submitted_at":"2026-05-13T15:23:17Z","title":"Towards Robotic Dexterous Hand Intelligence: A Survey","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-15T05:44:23.945064Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.13925"},"observation_digest":"sha256:8de4abbbdd8823f5587df33ccd048fc2a2cbb99509f798bfd3477ca967b7c934","observation_id":"f15d5d9b-626c-4120-bb49-7f6ebdfa7de5","resolution":{"observed_at":"2026-05-15T05:45:06.046963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.15157","last_updated":"2026-05-20T14:31:09Z","snapshot_observed_at":"2026-08-14T14:28:53.120868Z","submitted_at":"2026-05-14T17:51:40Z","title":"Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T03:09:26.858170Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.15157"},"observation_digest":"sha256:bac75b5fc6dbb89d76beaad2948f468239eae2e5d877c33d17e9b09c75795f21","observation_id":"e6258c08-aa48-4067-98fd-59a673b365a8","resolution":{"observed_at":"2026-05-15T03:09:42.122084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.15157","last_updated":"2026-05-20T14:31:09Z","snapshot_observed_at":"2026-08-14T14:28:53.120868Z","submitted_at":"2026-05-14T17:51:40Z","title":"Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T08:31:57.077346Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.15157"},"observation_digest":"sha256:e572eb9326218a5df4d71e23d35d9242fcd743052a233ef7f78e87377fa41188","observation_id":"51ee9ed2-a371-49ed-b5cc-a6fd44d4c33b","resolution":{"observed_at":"2026-05-21T08:34:05.565221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.18722","last_updated":"2026-05-18T17:50:32Z","snapshot_observed_at":"2026-08-15T02:55:18.240634Z","submitted_at":"2026-05-18T17:50:32Z","title":"Dexora: Open-source VLA for High-DoF Bimanual Dexterity","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T09:43:53.032153Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.18722"},"observation_digest":"sha256:109c5cb120e9fd615721993bee2f2a0a0da896da3ce464a2e5757adad32807e0","observation_id":"7b6ac8ad-7cde-43e6-9872-23eaf06c23d0","resolution":{"observed_at":"2026-05-20T09:48:11.778910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.25044","last_updated":"2026-05-24T12:41:34Z","snapshot_observed_at":"2026-08-15T10:46:13.558273Z","submitted_at":"2026-05-24T12:41:34Z","title":"X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T00:18:33.150920Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.25044"},"observation_digest":"sha256:0bfd07265c1cf3f73e6b82619a0932feaaa87aaedd03fe8f95cf73b1ac7820dc","observation_id":"b88443ab-14a4-4068-9482-5c141b4c9267","resolution":{"observed_at":"2026-06-30T00:24:04.188694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.30226","last_updated":"2026-06-06T09:12:27Z","snapshot_observed_at":"2026-08-01T05:57:18.931232Z","submitted_at":"2026-05-28T16:57:47Z","title":"BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T07:18:59.266263Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.30226"},"observation_digest":"sha256:641a74edabd5a290de78023c9e2a5616f2459f4fcd6f6eed1deb043c3314d3c0","observation_id":"3b4d04cf-4c1d-4503-9490-b72a87ba08e3","resolution":{"observed_at":"2026-06-29T07:23:12.768238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:8c0f1dff44edbfa7a83a03f8c2561f33b4fcfc0d3c6815c25f0e3f18e0ce92f5","observation_id":"7ab91d45-1471-4c74-b056-ea02fcfc11e3","resolution":{"observed_at":"2026-06-30T18:55:00.210434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.00110","last_updated":"2026-05-27T03:38:15Z","snapshot_observed_at":"2026-08-06T22:19:24.528783Z","submitted_at":"2026-05-27T03:38:15Z","title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-06-29T13:33:03.368006Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.00110"},"observation_digest":"sha256:fa65cf90a4ac3a898a0ec9edeacc9949335a6989359d93442c26c0109fe26ce1","observation_id":"fd4dd992-0dc2-4880-be98-213785842ab2","resolution":{"observed_at":"2026-06-29T13:33:27.773712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.03868","last_updated":"2026-06-02T16:39:23Z","snapshot_observed_at":"2026-07-06T23:44:05.167767Z","submitted_at":"2026-06-02T16:39:23Z","title":"Unified Video-Action Joint Denoising for Dexterous Action and Data Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T10:28:22.430294Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.03868"},"observation_digest":"sha256:fce80c58716e66aab3f31533f18c1b24d5cbce84d8c2d22e0627300ebaaa556f","observation_id":"e1fb98e0-3d75-4e42-bbdf-70f7cd08c5c7","resolution":{"observed_at":"2026-07-02T02:56:29.363432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.05979","last_updated":"2026-06-04T10:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T10:23:01Z","title":"World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T01:05:26.382826Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.05979"},"observation_digest":"sha256:dd7df92416c7eeeb2b8b2255b04e799d7f1fa2a65f28517f1101dcbb26757938","observation_id":"9bb1aec4-8dd7-4f1e-8274-da739a390b14","resolution":{"observed_at":"2026-07-02T13:46:58.909752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.06033","last_updated":"2026-06-06T19:36:14Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T11:28:23Z","title":"RealDexUMI: A Wearable Universal Manipulation Interface for Dexterous Robot Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T01:44:32.716179Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.06033"},"observation_digest":"sha256:58ccae5aa85db9e7aa0d0aebdf97a8944729251f7c487b3a9b58fdb7e53f3589","observation_id":"389ecd41-aead-427a-bbcc-05e33a2970c7","resolution":{"observed_at":"2026-07-02T12:56:57.100854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T22:25:17.522240Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:3ba6a9896cd999fadc0ad8fc43625bb158ce91dbb7848a98993a2aab0192d525","observation_id":"79d0f620-2bb8-42da-992b-afc11cad27bc","resolution":{"observed_at":"2026-07-02T16:47:09.505386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T07:17:42.045939Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:9dd2979567d0bcab714ab82fa975730ea3d0cae31570c1b974f9e409c19251fd","observation_id":"ca0da9aa-21c0-490f-bec8-32def5ec9703","resolution":{"observed_at":"2026-07-01T08:35:34.493805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.09457","last_updated":"2026-06-24T12:51:19Z","snapshot_observed_at":"2026-08-16T21:09:08.979005Z","submitted_at":"2026-06-08T13:12:56Z","title":"$\\omega$-EVA: Envision, Verify, and Act with Latent Interactive World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T16:10:02.176202Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.09457"},"observation_digest":"sha256:a0381f0447e985ea6c5f68efed3b7d4539b40b20efc3a3b2dd23dca0ed180790","observation_id":"462e6594-bd69-49ee-bb7c-2f578b6c608b","resolution":{"observed_at":"2026-07-03T02:07:33.742396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.11187","last_updated":"2026-06-09T17:59:22Z","snapshot_observed_at":"2026-08-17T18:09:59.650602Z","submitted_at":"2026-06-09T17:59:22Z","title":"Next Forcing: Causal World Modeling with Multi-Chunk Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:53.905704Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.11187"},"observation_digest":"sha256:73a18c57ee6d2d02be90ec8189d5a8f49e58b85a61bb02d4a1269695d6e3ea65","observation_id":"18ae0df7-1766-4f47-9266-4fe04473699e","resolution":{"observed_at":"2026-07-03T04:57:38.513373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.11628","last_updated":"2026-06-10T03:49:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T03:49:01Z","title":"LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T10:02:54.183839Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.11628"},"observation_digest":"sha256:17d51a6e1b35f30b75086e1054f75efb10f16db84952b8bf803d361822e42cf2","observation_id":"bfee454c-5b31-4cba-9671-a3779d34a43c","resolution":{"observed_at":"2026-07-03T10:27:56.220598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-18T04:06:48.500842Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:59.969040Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.17846"},"observation_digest":"sha256:209a89b07f97e2e01854dac0430e7fa8761eb001cd7dbbd065b28ae57b83e84f","observation_id":"67082a9d-78e1-4134-b360-31a571b052fa","resolution":{"observed_at":"2026-07-03T20:48:55.855989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.19333","last_updated":"2026-06-17T17:57:34Z","snapshot_observed_at":"2026-08-12T21:11:47.095223Z","submitted_at":"2026-06-17T17:57:34Z","title":"Do as I Do: Dexterous Manipulation Data from Everyday Human Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T20:51:21.209882Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.19333"},"observation_digest":"sha256:d206d2c15ed127d37e699653ae748b7f8184fa2e9094eb63e4a5199bb60ea92c","observation_id":"b1983b03-9216-4236-8dcf-73e1abbe4232","resolution":{"observed_at":"2026-07-04T00:59:19.497076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.19340","last_updated":"2026-06-19T13:42:23Z","snapshot_observed_at":"2026-08-14T18:46:15.738338Z","submitted_at":"2026-06-17T17:59:56Z","title":"ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:49:01.269513Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.19340"},"observation_digest":"sha256:007be22d65a2bb6d89f693ee1127fe6f5206665ddb87fa757cd8393a8bd36be7","observation_id":"25489053-9cea-4a60-8674-87b32178ba29","resolution":{"observed_at":"2026-07-04T00:59:20.363664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.20521","last_updated":"2026-06-18T17:37:34Z","snapshot_observed_at":"2026-08-15T18:28:04.648671Z","submitted_at":"2026-06-18T17:37:34Z","title":"HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T17:53:24.431287Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.20521"},"observation_digest":"sha256:3f520f41d99f3edbd2271476ba56911e2ccf77ab1fea0d31cd453dcccf856d5b","observation_id":"6ed30d62-4531-400c-b6a4-28aeb16a039e","resolution":{"observed_at":"2026-07-04T03:39:29.683310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.22136","last_updated":"2026-06-23T09:28:18Z","snapshot_observed_at":"2026-08-15T20:23:49.425816Z","submitted_at":"2026-06-20T16:31:40Z","title":"Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T11:47:54.951618Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.22136"},"observation_digest":"sha256:1df7549203a3ee1237da4ea5a7b70a5a5d603a12eb57b622abb17407dca93dd0","observation_id":"73810ba6-6a3f-488b-922b-b89b9011c5fd","resolution":{"observed_at":"2026-07-04T08:19:44.736280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.24448","last_updated":"2026-06-23T11:35:13Z","snapshot_observed_at":"2026-08-03T06:59:21.107836Z","submitted_at":"2026-06-23T11:35:13Z","title":"Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-25T23:57:48.395172Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.24448"},"observation_digest":"sha256:46afdf6842e3554fa22e48b1a5ec28f3a838e29ea51d0675d4bef96bd1ca02fa","observation_id":"8e24bd8d-ec6c-4acb-8ff3-dd8b1f91a3b6","resolution":{"observed_at":"2026-07-04T17:09:58.480120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.28133","last_updated":"2026-06-26T14:34:04Z","snapshot_observed_at":"2026-08-05T12:02:21.397136Z","submitted_at":"2026-06-26T14:34:04Z","title":"Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T04:23:04.622902Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.28133"},"observation_digest":"sha256:611b978ae8596d6d55538f839a132f1ff41fcf9c2b5ad92a25cd68c781978358","observation_id":"d836be21-89c4-4eb5-b6bd-f59877630a17","resolution":{"observed_at":"2026-07-01T16:55:51.368357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.32009","last_updated":"2026-06-30T17:44:16Z","snapshot_observed_at":"2026-08-14T23:46:24.669375Z","submitted_at":"2026-06-30T17:44:16Z","title":"Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T05:02:17.092213Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.32009"},"observation_digest":"sha256:d0ba016cf67eea91498e465ab87be77002c723eb31b4660af1e3aa1f3e5ef95f","observation_id":"a6366124-29b5-4006-a58d-fff533a68f5b","resolution":{"observed_at":"2026-07-01T10:55:41.344117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2607.01067","last_updated":"2026-07-01T15:26:26Z","snapshot_observed_at":"2026-08-12T12:11:04.612463Z","submitted_at":"2026-07-01T15:26:26Z","title":"Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-02T11:18:32.259684Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.01067"},"observation_digest":"sha256:9cacba48c5d13728ddc6f494e3ead961c03a58b75fe763d3920a5e0a0c593689","observation_id":"f5181d8a-4432-4e9d-b577-41cd6ea9a2ff","resolution":{"observed_at":"2026-07-02T11:26:54.003775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2607.06403","last_updated":"2026-07-07T15:33:12Z","snapshot_observed_at":"2026-08-06T21:08:13.002956Z","submitted_at":"2026-07-07T15:33:12Z","title":"From Foundation to Application: Improving VLA Models in Practice","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T07:06:13.473493Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.06403"},"observation_digest":"sha256:e3d105e0139863230f217d5db48e38bac48938664b00be57bd6c28a3cee0c721","observation_id":"c898bc55-29e6-4ff2-b04c-63542be34257","resolution":{"observed_at":"2026-07-08T07:14:45.445289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-10T04:12:29.153764Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:0e140da73d815c59dbcbf42a9050d516ad2e64aace8eabc3ba1ac62204bf949f","observation_id":"caedafdc-980f-48df-93e8-8e0073c6f14a","resolution":{"observed_at":"2026-07-10T04:16:48.670270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T07:53:38.754872Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.754872Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:1d385370116c23c4e5d2bc6f0bce34946196adb70ea68120930f0cec33172b60","observation_id":"f742ffaf-db65-4417-84e8-dc83c1b193ce","resolution":{"observed_at":"2026-08-02T07:53:38.754872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-14T17:30:54.988498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09701","last_updated":"2026-06-21T16:16:02Z","snapshot_observed_at":"2026-08-15T14:58:19.289884Z","submitted_at":"2026-06-21T16:16:02Z","title":"EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T17:30:54.988498Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.09701"},"observation_digest":"sha256:c26d76dbecee0302a7f6e11967dd7400a35f4ed580f1c93763671b41f1c4e855","observation_id":"2766f5a6-6e0c-4c25-8cc5-2eea594df53e","resolution":{"observed_at":"2026-07-14T17:30:54.988498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T03:25:28.115858Z","title":"Being-H0: Vision-language-action pretraining from large-scale human videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14183","last_updated":"2026-07-18T10:02:02Z","snapshot_observed_at":"2026-08-14T11:23:58.254955Z","submitted_at":"2026-07-15T14:49:49Z","title":"Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:25:28.115858Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.14183"},"observation_digest":"sha256:52ed540a688cb486f84f94e54c4522deb6b527a3d6cc83e0fcfbc7a9bb330445","observation_id":"2138be29-39f8-4103-9629-8bd6580c280d","resolution":{"observed_at":"2026-08-02T03:25:28.115858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T00:04:05.119524Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.119524Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5119ae5125f366af71803b0e896d957729b7f063da8bbb70d36fb9971a5851c9","observation_id":"5efc2714-0f33-4327-81ef-d8033792d4ec","resolution":{"observed_at":"2026-08-02T00:04:05.119524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-01T19:06:43.487945Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17097","last_updated":"2026-07-19T06:41:53Z","snapshot_observed_at":"2026-08-17T01:10:36.930445Z","submitted_at":"2026-07-19T06:41:53Z","title":"HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-08-01T19:06:43.487945Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.17097"},"observation_digest":"sha256:cd10e422253a4770cc9149410b357a87e4f0c3c037edb90d43083620d86e96f7","observation_id":"58695d96-07e2-4795-85c2-02cc499f5d1d","resolution":{"observed_at":"2026-08-01T19:06:43.487945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-31T23:29:10.712814Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-13T05:20:17.507917Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.712814Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:70b0b37f65a5be6f4d904275cbbaece0c27ecbffc4535ab41e5da53f7da03dfa","observation_id":"baf6ea43-c392-463e-9ea5-59d2c684839b","resolution":{"observed_at":"2026-07-31T23:29:10.712814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-31T06:18:55.854691Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-08-08T15:15:40Z","snapshot_observed_at":"2026-08-16T11:31:42.282108Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation: A Survey","version":1},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.854691Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:ccdcfe4ea29c744476651ca0c8937d64232b926d8fb9c2f4565ef6f0d27ccbec","observation_id":"fcd9e4a2-c9cb-44ad-a3cb-036e28beb184","resolution":{"observed_at":"2026-07-31T06:18:55.854691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-31T08:51:29.293605Z","title":"Being-h0: vision- language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-16T14:00:04.137627Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":1},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-07-31T08:51:29.293605Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:cea4e8955253892bcbdfd1a476e87b2416dad8bcfc697bc0ec8549560e120fb0","observation_id":"012798cc-eb2f-46ec-a04b-3a3a4f9b30b8","resolution":{"observed_at":"2026-07-31T08:51:29.293605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T01:23:10.898271Z","title":"Being-h0: vision- language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-16T14:00:04.137627Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:10.898271Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:383ca61301845b5324e3f350d59d65b3eea0268c71ae6312ecb300ae8597efc8","observation_id":"719960a9-0211-4c33-8590-b2815129ed21","resolution":{"observed_at":"2026-08-04T01:23:10.898271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T18:35:26.658756Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01905","last_updated":"2026-08-06T13:24:49Z","snapshot_observed_at":"2026-08-14T00:44:43.534745Z","submitted_at":"2026-08-03T08:39:31Z","title":"PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T18:35:26.658756Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.01905"},"observation_digest":"sha256:f5c04e99cfde208d869549aff70e12e3a7c6942909241ff4fe64111eb72b0a99","observation_id":"e0a809f7-8b0d-4924-99dd-b9e9b18e3015","resolution":{"observed_at":"2026-08-04T18:35:26.658756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-07T04:10:14.892153Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01905","last_updated":"2026-08-06T13:24:49Z","snapshot_observed_at":"2026-08-14T00:44:43.534745Z","submitted_at":"2026-08-03T08:39:31Z","title":"PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:14.892153Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.01905"},"observation_digest":"sha256:35cee42df307271b6aa522131b20eacfdebfafacf9d31c5c8a7cf9fabebd9b21","observation_id":"6434a5c5-d393-40ae-b61a-1c6cd850d6d0","resolution":{"observed_at":"2026-08-07T04:10:14.892153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T04:25:52.097084Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02580","last_updated":"2026-08-03T17:52:26Z","snapshot_observed_at":"2026-08-15T12:33:22.938151Z","submitted_at":"2026-08-03T17:52:26Z","title":"Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T04:25:52.097084Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.02580"},"observation_digest":"sha256:d1280a88b412e3d26a32f81fe829994310d3e9d5d6185b8cdabae7ba1906cfe9","observation_id":"67c89dc8-ab09-47eb-9697-ebc544dd42f5","resolution":{"observed_at":"2026-08-04T04:25:52.097084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-05T00:58:35.689675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03127","last_updated":"2026-08-04T04:55:47Z","snapshot_observed_at":"2026-08-09T05:19:16.888543Z","submitted_at":"2026-08-04T04:55:47Z","title":"DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T00:58:35.689675Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.03127"},"observation_digest":"sha256:0f7db8377719ffa67cee6c3797f96127267dbf6db63e6e0b2856cac2871f4931","observation_id":"db8ecbb9-fb0a-4255-93ec-bd6f50059c1b","resolution":{"observed_at":"2026-08-05T00:58:35.689675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-15T14:45:39.903042Z","title":"Being-H0: Vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04196","last_updated":"2026-08-04T19:55:12Z","snapshot_observed_at":"2026-08-18T00:43:08.306555Z","submitted_at":"2026-08-04T19:55:12Z","title":"SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:39.903042Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.04196"},"observation_digest":"sha256:214518a8c9ba43b540906c44b8b106f514d97df79f9b08b9d134577bbf11e0c0","observation_id":"2731ebb9-479e-4c9f-bfcc-0eda9e53a124","resolution":{"observed_at":"2026-08-15T14:45:39.903042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-07T04:08:32.515534Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-17T11:17:24.407157Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.515534Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:8f2eb560f53ad468d7a193d58ef978eb8120d0b9bae9401390d138d13858d092","observation_id":"36d4981d-d08b-4f6a-85bd-92b8aed13ce4","resolution":{"observed_at":"2026-08-07T04:08:32.515534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15597/citation-record","integrity":"/paper/2507.15597/integrity","json":"/paper/2507.15597/citation-record.json","paper":"/paper/2507.15597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:38.030744Z","title":"Review on human-like robot manipula- tion using dexterous hands.Cogn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.030744Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:128773889acf542b34d45e2bd34a542f3077954e4da47152cde79ca1cd859e5b","observation_id":"6f1216af-6b17-4952-b576-49cb6f98da3a","resolution":{"observed_at":"2026-08-06T15:33:38.030744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:38.117746Z","title":"Human- like dexterous manipulation for anthropomorphic five-fingered hands: A review.Biomimetic Intelligence and Robotics, page 100212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.117746Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f46b54fd1fcc117e902f56ce101cd133e260f531ae243c53b09bb4356b2ee7e0","observation_id":"213d718d-a32c-4af2-9165-83202181cc38","resolution":{"observed_at":"2026-08-06T15:33:38.117746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T15:33:38.186546Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.186546Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:bb0e5a2d8b82ea68db369efa07ed475c19d3d5356341c7e0362228898b85376e","observation_id":"7fba0bd0-220a-4636-88c9-994dbfdec581","resolution":{"observed_at":"2026-08-06T15:33:38.186546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T15:33:38.258306Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.258306Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:b74f8b6cf3701a6e50caa1c4bd7ad6be0e44df8ebea9a67280f31781b0cacd0f","observation_id":"6a33fae2-b40e-46a0-9aa4-30f4344c74ec","resolution":{"observed_at":"2026-08-06T15:33:38.258306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T15:33:38.333345Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.333345Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fe1fc27b3f84b0e7a4fcfc44879c99daa67c1c0b881ca93af9dcaa84b3898572","observation_id":"c761ec84-fc8d-4f83-90a1-a10fa9f9c1b3","resolution":{"observed_at":"2026-08-06T15:33:38.333345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T15:33:38.444159Z","title":"corr, abs/2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.444159Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:77e23741db744e894b9267eaf8d48e2169800003dcdc75243b5fc850d4577302","observation_id":"fd76e2bb-41aa-4466-9b3b-2a46499d2114","resolution":{"observed_at":"2026-08-06T15:33:38.444159Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-06T15:33:38.504555Z","title":"A survey on vision-language-action models for embodied ai.arXiv preprint arXiv:2405.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.504555Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:26225dc8b8e206bca47284ca3e5cc25f98f4c987fd84a41d9eb98d17a0bda2d5","observation_id":"c3755938-f091-4b94-bf74-424a6f6857db","resolution":{"observed_at":"2026-08-06T15:33:38.504555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:38.565294Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.565294Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:cd8b72acc643a4fbc4a1c6a7bec98a42f23bda9330001adf2fb2f536f56b0a1a","observation_id":"083d9651-4bab-4508-bd8c-d5c12ae2c2ce","resolution":{"observed_at":"2026-08-06T15:33:38.565294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-06T15:33:38.669232Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.669232Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:60508dd698cf4ad7f568185a335abfc1c4a498244355ccc8f0a06dd13dbf5672","observation_id":"0167b96c-8cbb-478e-8f81-72518a88ed38","resolution":{"observed_at":"2026-08-06T15:33:38.669232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-06T15:33:38.782713Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.782713Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:2adf105845f4172a80be0b741f86aa833086d7b661b658eb6db2d0d8a45bfa2a","observation_id":"15bf4cc7-8ccd-4bf6-85d5-88b7d152e3ca","resolution":{"observed_at":"2026-08-06T15:33:38.782713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T15:33:38.850217Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.850217Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f475678804b8fb1e1b052263360cabd9d03d0f84035bca48cb1a4f986aa43cf0","observation_id":"d16fe479-8fab-4ff1-bafc-196a245d4018","resolution":{"observed_at":"2026-08-06T15:33:38.850217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14747","last_updated":"2024-08-27T02:52:15Z","snapshot_observed_at":"2026-08-16T13:23:38.580255Z","submitted_at":"2024-08-27T02:52:15Z","title":"Benchmarking Reinforcement Learning Methods for Dexterous Robotic Manipulation with a Three-Fingered Gripper","version":1},"cited_work":{"arxiv_id":"2408.14747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14747","snapshot_observed_at":"2026-08-06T15:33:52.196422Z","title":"Benchmarking Reinforcement Learning Methods for Dexterous Robotic Manipulation with a Three-Fingered Gripper","venue":"cs.RO","work_id":"7ffd0bfd-b94c-4ac9-8ef5-86dffee09b0a","year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.935193Z"},"links":{"cited_paper":"/paper/2408.14747","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:0e6d4095554ce371d5adac2649cfb8859ff67210c484aa349f977d77aa0282f0","observation_id":"f6b63b9f-f0e5-4395-9dc3-3f997dcb7cb8","resolution":{"observed_at":"2026-08-06T15:33:52.228371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.037596Z","title":"Dexterous manipulation through imitation learning: A survey.arXiv preprintarXiv:2504.03515, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.037596Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c0ff2ae896641102fa1cd0bb8121acd382795990295b44fa54c0ca1caac4b656","observation_id":"85fbd045-d31a-4aeb-8290-96b34abab5cf","resolution":{"observed_at":"2026-08-06T15:33:39.037596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05821","last_updated":"2024-12-08T06:54:43Z","snapshot_observed_at":"2026-08-16T13:03:04.430366Z","submitted_at":"2024-11-04T18:01:34Z","title":"Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05821","snapshot_observed_at":"2026-08-06T15:33:39.082418Z","title":"Benchmarking vision, language, & action models on robotic learning tasks.arXiv preprint arXiv:2411.05821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.082418Z"},"links":{"cited_paper":"/paper/2411.05821","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:45ac05afad08256e36e07c68f75ad4f21c61ef5398ccffd99b0ca35239becab2","observation_id":"9ca9382e-bac0-4847-b679-5c588f9d4f30","resolution":{"observed_at":"2026-08-06T15:33:39.082418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.147164Z","title":"Scaffolding dexterous manipulation with vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.147164Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:518c250322a1703c6d5d6dea614defb16082f6a35254aad7d8bbd88978251c1d","observation_id":"491785a3-b285-43a1-84bd-44dd8f44e829","resolution":{"observed_at":"2026-08-06T15:33:39.147164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.204910Z","title":"Unidexgrasp: Universal robotic dexterous grasping via learning diverse proposal generation and goal-conditioned policy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.204910Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:90d5d3bb36fec09077c970a9212ad86be15e891be9aea2296a26e845674460c4","observation_id":"184e660e-cae0-459c-a0b8-4082e56b2734","resolution":{"observed_at":"2026-08-06T15:33:39.204910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.260785Z","title":"Unidexgrasp++: Improving dexterous grasping policy learning via geometry-aware curriculum and iterative generalist-specialist learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.260785Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4535555c19a9a75fcd173bd2d7964bb1f11868191f30de3b44302c1c27158ef1","observation_id":"6029deac-11f4-4de2-8f49-475f5190838a","resolution":{"observed_at":"2026-08-06T15:33:39.260785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.321889Z","title":"Dexgraspvla: A vision-language-action framework towards general dexterous grasping.arXiv preprint arXiv:2502.20900, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.321889Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:192e5f52debe5d7a4cad19142567c95286b83ccc6c1d8b0b1775f20de38eb7dd","observation_id":"9012a185-501a-4aa7-b078-aa123dc4d97a","resolution":{"observed_at":"2026-08-06T15:33:39.321889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02747","last_updated":"2025-07-03T16:05:25Z","snapshot_observed_at":"2026-08-14T05:54:08.465536Z","submitted_at":"2025-07-03T16:05:25Z","title":"DexVLG: Dexterous Vision-Language-Grasp Model at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02747","snapshot_observed_at":"2026-08-06T15:33:39.445246Z","title":"Dexvlg: Dexterous vision-language-grasp model at scale.arXiv preprint arXiv:2507.02747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.445246Z"},"links":{"cited_paper":"/paper/2507.02747","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:b0283c098780b761e3f672348f954fd3eb1c2f7b6ca03e8013bd394b12d94244","observation_id":"9c96aaab-977f-4a81-9243-af342b15fcf0","resolution":{"observed_at":"2026-08-06T15:33:39.445246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.511611Z","title":"Efficient residual learning with mixture-of-experts for universal dexterous grasping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.511611Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ed07f3bb143278b85253bb39430666dfe63e72ccbab44c8d8ddee18144040caa","observation_id":"ddc36849-c43d-428b-b6ad-a01e4bd224c4","resolution":{"observed_at":"2026-08-06T15:33:39.511611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-06T15:33:39.565406Z","title":"R3m: A universal visual representation for robot manipulation.arXiv preprint arXiv:2203.12601, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.565406Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:90a0f42344d497fc6ec0a29551450cdd1d05ce2f3bafd0165912783f2ebcbb26","observation_id":"13d52d96-73ba-4d36-b6ac-1a52ae2cc874","resolution":{"observed_at":"2026-08-06T15:33:39.565406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.683285Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.683285Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c0a63a02cc7f94e01d8568b9bcf14ed8507f7cdc660ff3d773e8fcc99ae861ac","observation_id":"1c462fb1-22bf-4e43-905f-15c05c20b67a","resolution":{"observed_at":"2026-08-06T15:33:39.683285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-06T15:33:39.742191Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.742191Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ba5fc491995c8bed3fd81097d10179ec4fd217769fa948dc62268d93ca491a1d","observation_id":"135da890-1f3d-4ffa-a1a0-76593fa951cf","resolution":{"observed_at":"2026-08-06T15:33:39.742191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.817847Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.817847Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:17ea626d21f8f39d7be0652cd1b012076150414e7ddc3a863ad0aa561fa1bafb","observation_id":"d704d37f-98f8-4199-a36d-79442114c205","resolution":{"observed_at":"2026-08-06T15:33:39.817847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.886667Z","title":"Humanoid policy˜ human policy.arXiv preprint arXiv:2503.13441, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.886667Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:108a3b5204b6e5e3f3558036090a47e17739cfdc59708347b18804c2b03caba7","observation_id":"2097f02f-9b4a-4ef1-aa62-ffc549579545","resolution":{"observed_at":"2026-08-06T15:33:39.886667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.964864Z","title":"Integrated linkage-driven dexterous anthropomorphic robotic hand.Nature communications, 12(1):7177, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.964864Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f51655fa3b5a29b35a195b35e49f683d33b5544e8577a8529ff62f512c07fe89","observation_id":"741b91a3-801d-4279-96aa-da1d43cc7a09","resolution":{"observed_at":"2026-08-06T15:33:39.964864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.066734Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.066734Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c33621f7eb0f8514f19dbe1e3959450485cca3f0ef35d7f7e3630d789e28161a","observation_id":"e8b02f06-166e-421e-ad27-2187dbe4f505","resolution":{"observed_at":"2026-08-06T15:33:40.066734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.128808Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.128808Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:a44ad413f4143eed15a2c361da427e4fd87ee56be336115edf7458cb5648e61f","observation_id":"19f3022c-e89f-4ee9-bf75-12b6dc9d4e00","resolution":{"observed_at":"2026-08-06T15:33:40.128808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-16T15:35:40.710158Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-06T15:33:40.225699Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec.arXiv preprint arXiv:2305.02765, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.225699Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:9de5cebbcd85cc924529f16f5971a8397a2180c10c265919e340ae846e3b48db","observation_id":"acbb01f9-ab9e-405a-9aaf-dc55f47d8d26","resolution":{"observed_at":"2026-08-06T15:33:40.225699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.309722Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.309722Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fe4e7d9327cdef5033ce221200d8f125165d7f55cb16f994dc4733b66d0ffca3","observation_id":"2ea0e8ec-bf17-403b-accf-af76bacde7dc","resolution":{"observed_at":"2026-08-06T15:33:40.309722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.390951Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.390951Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f638d9d8d2000042aa3636519f1e4c1f7d7105c3c29551f16d92a3ed8f8efe37","observation_id":"1988342e-245c-4e46-b539-17e5a62fccee","resolution":{"observed_at":"2026-08-06T15:33:40.390951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.524143Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.524143Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d2865ed4383dc40d1a0624038877975e9cf3e0acd8cf3f8d5ca83dafb65b3e27","observation_id":"5ed2d5c7-ac6d-4597-bfd7-852ab5fb44e2","resolution":{"observed_at":"2026-08-06T15:33:40.524143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.627678Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.627678Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:530f1d87a504658f58a14981d2e9a35d3993964fd0390fc0e208c35af076946a","observation_id":"97e4cffd-b982-4108-a1c4-743565f197b9","resolution":{"observed_at":"2026-08-06T15:33:40.627678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T15:33:40.742365Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.742365Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:2aa1ffc2407e213154a6bf1f73056f7b8bcd0f51105cf1b18876e6187057e9a2","observation_id":"60782969-dfa1-4753-9d7f-d8d02d600f00","resolution":{"observed_at":"2026-08-06T15:33:40.742365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T15:33:40.877665Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.877665Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:8d96702bb69f4098f089e17789f0663591a5263ced58ccba09f04aebfb5614f7","observation_id":"4374b8c0-d9c7-49ff-b2cb-24044a597685","resolution":{"observed_at":"2026-08-06T15:33:40.877665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09072","last_updated":"2024-03-14T03:29:58Z","snapshot_observed_at":"2026-08-16T14:09:58.150946Z","submitted_at":"2024-03-14T03:29:58Z","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.09072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09072","snapshot_observed_at":"2026-08-06T15:33:51.834697Z","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","venue":"cs.CV","work_id":"9429ca83-bf0a-4d42-95b3-8bc891500a4f","year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.966946Z"},"links":{"cited_paper":"/paper/2403.09072","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:868ed00d83adea62e338489d17869f4507ef3b947180968768146e0bef776c31","observation_id":"8c0f0ddd-94f6-4668-a86d-3723dcc5bfa3","resolution":{"observed_at":"2026-08-06T15:33:51.856771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.028548Z","title":"From pixels to tokens: Byte-pair encoding on quantized visual modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.028548Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:8c55c861055a167734e0954643418dd75f33611488b4a237b80837541d11f192","observation_id":"deb167aa-01ee-46b0-9fbd-898b7204f23c","resolution":{"observed_at":"2026-08-06T15:33:41.028548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.136954Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.136954Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:79fdf894b79b193d1c577142ce4868ba4fbc7f75c052f0a923bc10fc709b72bf","observation_id":"adf0c352-4347-4667-bd28-45f795d9c910","resolution":{"observed_at":"2026-08-06T15:33:41.136954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:33:41.212733Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.212733Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:210c3b2d9540abbd465f849264a58bc39caf9a7b73242afd5038a3f46fe4521c","observation_id":"066c0331-e95b-4295-b5a3-562d86f09264","resolution":{"observed_at":"2026-08-06T15:33:41.212733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T15:33:41.297194Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.297194Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:656d1b711793de151fddd41f4b923f07cb59f80dbf3768fc256f1637b50527af","observation_id":"0342fd5e-004f-42f7-ac47-d2370206bec7","resolution":{"observed_at":"2026-08-06T15:33:41.297194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T15:33:41.390792Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.390792Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:431d27d310d5651fceb4e95f7d70668f7b51ed4adfda3c99733f58c182ecd2be","observation_id":"ad47a498-55cc-41c1-8ab6-3ddd7213b88d","resolution":{"observed_at":"2026-08-06T15:33:41.390792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.519049Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.519049Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c43b1c5af374af91cf4f4a371a5610f8fb0919bcf2bcf439f74132ac111ebca3","observation_id":"16384af9-1a5c-4ebf-8af8-82e3d0a36ef1","resolution":{"observed_at":"2026-08-06T15:33:41.519049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.612755Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.612755Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fef3271f9bf4ad44728e03a9537aa2bc3b3b82d7efdd25aee6cf2cf933966593","observation_id":"4aa01e2e-e516-487d-b31b-24f3b03e132d","resolution":{"observed_at":"2026-08-06T15:33:41.612755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.653621Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.653621Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:79d74e56b9276af222399b33ac84549389ba6e3165bf4735e8d97a1ef313f135","observation_id":"795e4fc5-e425-4936-b631-b248f5c0f6af","resolution":{"observed_at":"2026-08-06T15:33:41.653621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09958","last_updated":"2023-09-18T17:30:46Z","snapshot_observed_at":"2026-08-16T14:59:43.062152Z","submitted_at":"2023-09-18T17:30:46Z","title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09958","snapshot_observed_at":"2026-08-06T15:33:41.744204Z","title":"An empirical study of scaling instruct-tuned large multimodal models.arXiv preprint arXiv:2309.09958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.744204Z"},"links":{"cited_paper":"/paper/2309.09958","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:be3e16d6baa3e01ac45e98ab86aa8d0dcdc709d601b02ed6bb209ef44630d2ae","observation_id":"73eea413-02bd-4805-9e29-ebe6079d4b4b","resolution":{"observed_at":"2026-08-06T15:33:41.744204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T15:33:41.848263Z","title":"Ferret: Refer and ground anything anywhere at any granularity.arXiv preprint arXiv:2310.07704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.848263Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:9d3c0b4c3c2e245fa41918761a262cbe81fdf2a8a5425482ab44d97573d3ad20","observation_id":"4e4c7e95-305b-4de5-a648-8eb8351a6023","resolution":{"observed_at":"2026-08-06T15:33:41.848263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.991890Z","title":"Otter: A multi-modal model with in-context instruction tuning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.991890Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d1061714b91c85f14ce7f9b03ec38d3b3f2d94a1b3e2c277e04afda435f09e46","observation_id":"2c79e090-2cd3-4c00-8792-c604cdfd504e","resolution":{"observed_at":"2026-08-06T15:33:41.991890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T15:33:42.059251Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.059251Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:af9d0d88dfbc5142f9431b9a11191dc2bab81c7d4f03233566b1da4b2a3c3c9b","observation_id":"ae659049-9bdc-4c7c-a9a9-ae018ab13db5","resolution":{"observed_at":"2026-08-06T15:33:42.059251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13255","last_updated":"2023-12-07T05:36:26Z","snapshot_observed_at":"2026-08-16T14:50:30.500414Z","submitted_at":"2023-10-20T03:22:05Z","title":"Steve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in Open Worlds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13255","snapshot_observed_at":"2026-08-06T15:33:42.174500Z","title":"Steve-eye: Equipping llm-based embodied agents with visual perception in open worlds.arXiv preprint arXiv:2310.13255, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.174500Z"},"links":{"cited_paper":"/paper/2310.13255","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:246e28a91e21819d92cb5fb92e7b9198fb2ff0f8f8c7f7673f659e700725c372","observation_id":"27a8bc03-cdfb-4104-b4c7-46b0ec370c46","resolution":{"observed_at":"2026-08-06T15:33:42.174500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":"2411.16156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-06T15:33:51.653731Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","venue":"cs.CV","work_id":"3a2b9abd-e110-4484-bac3-2c95c835e65a","year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.245773Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:e425ac43cd669278e7c0dae6baef67b707acd711090315eb7673faa314b7b318","observation_id":"dc1b8b98-c779-4bba-ba14-eacaaf7e8583","resolution":{"observed_at":"2026-08-06T15:33:51.694013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07002","last_updated":"2025-03-10T07:32:53Z","snapshot_observed_at":"2026-08-16T12:51:38.659338Z","submitted_at":"2025-03-10T07:32:53Z","title":"Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07002","snapshot_observed_at":"2026-08-06T15:33:42.364931Z","title":"Taking notes brings focus? towards multi-turn multimodal dialogue learning.arXiv preprint arXiv:2503.07002, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.364931Z"},"links":{"cited_paper":"/paper/2503.07002","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:444e9831ebe134c26555ae26b857f761ab345f91c511e8a5749020e1d375575c","observation_id":"38d25635-d466-4879-9c91-7c7a075b8501","resolution":{"observed_at":"2026-08-06T15:33:42.364931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T15:33:42.485380Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.485380Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ad4301173b346fab7ffd7abb6e03cce5f1fd82a11f7c1ad471777f9ea4df8e30","observation_id":"f2b40deb-04fd-4eac-9224-ba01623ceca6","resolution":{"observed_at":"2026-08-06T15:33:42.485380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-06T15:33:42.589633Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.589633Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:701850fa2113e8bf2631e0c2a01aba536dbec3b7c3011c9f91ad8d7703e32494","observation_id":"4144850f-7008-4400-b3f4-71b67d53e5f1","resolution":{"observed_at":"2026-08-06T15:33:42.589633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:33:42.732915Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.732915Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:1671866d727a35884902dadcf94d44e7f5929345ce9e9db00e096ae11aea6f66","observation_id":"7303ebdd-6754-4c31-abb3-8adc9def0a10","resolution":{"observed_at":"2026-08-06T15:33:42.732915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T15:33:42.826045Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.826045Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:5a4fad933cf78c956cc4fd7ddd9ca9df04f6a8a1073a476e8737afe7a9ffaa51","observation_id":"0d05e1ec-5676-4ae6-8442-5ff22a4731f8","resolution":{"observed_at":"2026-08-06T15:33:42.826045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T15:33:42.934724Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.934724Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:3d59b7f1ad250d84e96cecada52b1436db1812d55e69658d2919f4483bcd1eb6","observation_id":"2359026e-9846-4af3-baa0-3e9031579db4","resolution":{"observed_at":"2026-08-06T15:33:42.934724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T15:33:43.026591Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.026591Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:cb5de073825d303d74e241ecffcf4bb5234593f8f5e245366923b5891d7a52b5","observation_id":"bdbd68bd-fb7c-474d-b25b-d70e32d48fb4","resolution":{"observed_at":"2026-08-06T15:33:43.026591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.146808Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.146808Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:28cd646928620d20093063b48c67e90903dfabe7403f00e18cf2f55b67be5f76","observation_id":"d9fe530f-52cd-4c1a-99ab-7acedadf48b7","resolution":{"observed_at":"2026-08-06T15:33:43.146808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.239350Z","title":"The kit motion-language dataset","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.239350Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:e7523e46ad98244e3c7d0329c2f5756908535e9ea3ce1babf9114709d24cca50","observation_id":"edecf294-eb4f-4955-bde3-9c9d01281c77","resolution":{"observed_at":"2026-08-06T15:33:43.239350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.309159Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.309159Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:dbd3335aa401d9405f394b7e0fd81b40b35cb22d7f02020272f3b8e966337c19","observation_id":"6faaf8af-74e8-4ad0-a2a7-ccd77fdca5b5","resolution":{"observed_at":"2026-08-06T15:33:43.309159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.383085Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.383085Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f013f5f180300434b862ef2e68643300e61a4f2a52329bd4ae8103f76e60414d","observation_id":"d53026f1-1d85-4640-81e7-8aba6ff3d6ff","resolution":{"observed_at":"2026-08-06T15:33:43.383085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.482132Z","title":"Babel: Bodies, action and behavior with english labels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.482132Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:9d8432f41c6da85f2e2a83aae93a1437d784d7205c24074e3295a6814e2bd4db","observation_id":"60971193-2d7b-4864-a387-f741b9783ea8","resolution":{"observed_at":"2026-08-06T15:33:43.482132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.571970Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset.Advances in Neural Information Processing Systems, 36:25268–25280, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.571970Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:cd6641eedd1748c4e430d707e91a9c8dd05af16e7c19edc0e2245740c301497c","observation_id":"5ee93827-7900-4bec-87d3-aa21d56eef54","resolution":{"observed_at":"2026-08-06T15:33:43.571970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.663928Z","title":"Egobody: Human body shape and motion of interacting people from head-mounted devices","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.663928Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4c35d0cd7bd6d068dfb55b3b9ad7abc0a36392d29c336194d3b96fe3c6278dcb","observation_id":"1e470422-15ee-460f-a820-a5e001100406","resolution":{"observed_at":"2026-08-06T15:33:43.663928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.756773Z","title":"Nymeria: A massive collection of multimodal egocentric daily motion in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.756773Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:346ed966aae749b5f6b239e608bdabf1cb9b68314c966d1c13438946c6c3a8af","observation_id":"18c5d703-6a66-4c4d-aba1-7872741a2f59","resolution":{"observed_at":"2026-08-06T15:33:43.756773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.859592Z","title":"Scaling large motion models with million-level human motions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.859592Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:eb7d30d82a64f44bc0fd284c6844c50d2c247eaa88636e7249366e46a06c44dd","observation_id":"5a028043-3caf-45a2-948c-f1761def8109","resolution":{"observed_at":"2026-08-06T15:33:43.859592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.946231Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.946231Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:972ba2497deb89a34cae02456b69abdafa905d29d908f5d6b5de453bf98e85b1","observation_id":"9e5e0376-e134-4548-85f5-bed4f8b76961","resolution":{"observed_at":"2026-08-06T15:33:43.946231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.086686Z","title":"Expressive body capture: 3d hands, face, and body from a single image","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.086686Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:17f786fbb32c4b8d3f4bcc9fff6b09eeab8c2edc89c09a3958f1bbda26f948ef","observation_id":"8bfadaba-b22d-4fbc-9e10-e9213c25b9d1","resolution":{"observed_at":"2026-08-06T15:33:44.086686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-08-12T18:48:37.916493Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-06T15:33:44.187290Z","title":"Human motion diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.187290Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:e831308eae66f8d5bcb12642a678471a87660ca3bc37f19154e565b5cc304fbd","observation_id":"1d7f0419-75a2-4b7a-8313-4339200e13ea","resolution":{"observed_at":"2026-08-06T15:33:44.187290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.341154Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model.IEEE transactions on pattern analysis and machine intelligence, 46(6):4115–4128, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.341154Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f4289b88b67d1d336543444d115fc1e4c728cf016bbdbe8d119f0c596b35c6be","observation_id":"f64da1b0-6537-49c6-ad33-c267df7b40fb","resolution":{"observed_at":"2026-08-06T15:33:44.341154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.449291Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.449291Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:0f6acfcccdbe16325cd9e55cd69b2dfbd3115d9d121c6621cc70ea755dd47b36","observation_id":"b1483f9c-a7ff-4d5e-9aaf-a978a0a6bfe8","resolution":{"observed_at":"2026-08-06T15:33:44.449291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.595272Z","title":"Physdiff: Physics-guided human motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.595272Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:017ab78ac10ac5c25e6263044e47824c9e8bcc6c82ee61b0f158fb8613858d9b","observation_id":"4e06db4b-fddb-477f-9953-fcfc76856df7","resolution":{"observed_at":"2026-08-06T15:33:44.595272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.691840Z","title":"Remodiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.691840Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fe57e8578313c6c523b2cdaea0cc6a90b23259ddeacc72163b35e65148514e63","observation_id":"0acc39f5-fa8f-453b-8df1-d67450ec27dd","resolution":{"observed_at":"2026-08-06T15:33:44.691840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01372","last_updated":"2023-09-04T05:43:48Z","snapshot_observed_at":"2026-08-16T15:03:36.215792Z","submitted_at":"2023-09-04T05:43:48Z","title":"DiverseMotion: Towards Diverse Human Motion Generation via Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01372","snapshot_observed_at":"2026-08-06T15:33:44.817249Z","title":"Diversemotion: Towards diverse human motion generation via discrete diffusion.arXiv preprint arXiv:2309.01372, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.817249Z"},"links":{"cited_paper":"/paper/2309.01372","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:3c3d34a70f8eeb673358f719d55b6756cf6658f4e149711814dedf43a02a8cf6","observation_id":"59819418-f3cb-4b2b-a203-e1ee2f99d6bc","resolution":{"observed_at":"2026-08-06T15:33:44.817249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.965632Z","title":"Large motion model for unified multi-modal motion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.965632Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c688c502cac2b0b5a5ac92207c19292b80aa3ba72f9143cc8c00b540cc04c826","observation_id":"682795f0-2e56-4979-9ad7-04e47722f7b2","resolution":{"observed_at":"2026-08-06T15:33:44.965632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.087540Z","title":"Neural discrete representation learning.Advancesinneuralinformation processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.087540Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:660057fc6387d491c75bd165948b0059df5ce4dd0f56c14f4ba01e516c48f5c5","observation_id":"3781b643-41af-4e61-9e88-dfb34367abfe","resolution":{"observed_at":"2026-08-06T15:33:45.087540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.136041Z","title":"Generating human motion from textual descriptions with discrete representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.136041Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:a346e241580976c97ca39a391367417e7c14c395ad87ee3e70add4b4620c9afc","observation_id":"f2ca6c3c-e873-4be6-8e5a-76ab3fc3d47e","resolution":{"observed_at":"2026-08-06T15:33:45.136041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.196778Z","title":"Momask: Generative masked modeling of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.196778Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f07ea5d2aa96a3e88172f926b4d1315e255269cfe497226249a9f69827478914","observation_id":"faaf87c1-c4a7-4048-ae4f-ba422cd2cc71","resolution":{"observed_at":"2026-08-06T15:33:45.196778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.323096Z","title":"Locally hierarchical auto-regressive modeling for image generation.Advances in Neural Information Processing Systems, 35:16360–16372, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.323096Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:741ea611f59a3889cdc05f59c106db86905bd7514b227526ca848aa14c4d09f9","observation_id":"a6c50ce6-706c-492e-82a5-fb1296c08074","resolution":{"observed_at":"2026-08-06T15:33:45.323096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12978","last_updated":"2023-10-19T17:59:46Z","snapshot_observed_at":"2026-08-16T14:50:36.616004Z","submitted_at":"2023-10-19T17:59:46Z","title":"HumanTOMATO: Text-aligned Whole-body Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12978","snapshot_observed_at":"2026-08-06T15:33:45.392908Z","title":"Humantomato: Text-aligned whole-body motion generation.arXiv preprint arXiv:2310.12978, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.392908Z"},"links":{"cited_paper":"/paper/2310.12978","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:3aa62defc54aa4da7300df6f805946dc6c305f52fdf181858769d6f96f529c26","observation_id":"cabb6102-fbb4-441b-a064-d4dd6e18247c","resolution":{"observed_at":"2026-08-06T15:33:45.392908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T15:33:45.489989Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.489989Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:1368c5100b0f107698ebc8336239166effc564e8121101e79bdaa7aab233067c","observation_id":"9fde13bd-7364-46ce-a8b4-bf498e37734b","resolution":{"observed_at":"2026-08-06T15:33:45.489989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T15:33:45.572085Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.572085Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:dec2bf1f8faf2c6d0018890750daa9482adeda412c98434dcab4b2948d1598d0","observation_id":"42a3761b-fb1e-4cd7-9020-57caeba12fd1","resolution":{"observed_at":"2026-08-06T15:33:45.572085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.640936Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.640936Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4c08e8625b8e12154ac90ba68d63edd24e232c4367674ae34c1e995a76d14fdf","observation_id":"c9e1c9c6-8b7c-45e9-8f6f-66736c3c6272","resolution":{"observed_at":"2026-08-06T15:33:45.640936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-16T13:05:06.623461Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-06T15:33:45.729880Z","title":"Motiongpt-2: A general-purpose motion-language model for motion generation and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.729880Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4bc414fe8b3acc54784f7586969a6f420df93f3cccba318a3f6051913f85a30d","observation_id":"df7acbec-d0c8-4121-9b14-ad743b74c024","resolution":{"observed_at":"2026-08-06T15:33:45.729880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-16T13:47:37.897675Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-06T15:33:45.839617Z","title":"Motionllm: Understanding human behaviors from human motions and videos.arXiv preprint arXiv:2405.20340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.839617Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:3fbd18d81884a65862c286ab586b3bf98b5c8f8f488efbba280c81fc64879e09","observation_id":"f7cd73b6-a9aa-41d4-97c9-144cc1f960c5","resolution":{"observed_at":"2026-08-06T15:33:45.839617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.967329Z","title":"Avatargpt: All-in-one framework for motion understanding planning generation and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.967329Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4e77020b9d64c8c70aa5b0f948822f730c60ac5361779d55c51b6b22a6be91f2","observation_id":"bfed5262-2915-4001-b16e-cc2be9cb474e","resolution":{"observed_at":"2026-08-06T15:33:45.967329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.024326Z","title":"Motionchain: Conversational motion controllers via multimodal prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.024326Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:17f59dfcb092f505ba7ba4e4291a7f4406561743d17b3987f6bdf56f7b7e7927","observation_id":"ba2656d6-4ed0-42c8-92a0-fb815962cbee","resolution":{"observed_at":"2026-08-06T15:33:46.024326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07093","last_updated":"2025-03-08T06:09:23Z","snapshot_observed_at":"2026-08-16T13:11:00.570195Z","submitted_at":"2024-10-09T17:33:03Z","title":"LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07093","snapshot_observed_at":"2026-08-06T15:33:46.059708Z","title":"Lamp: Language-motion pretraining for motion generation, retrieval, and captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.059708Z"},"links":{"cited_paper":"/paper/2410.07093","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:e04129b8dc3364b71d90934e827a2adb6d0c19e157580d1a0b2c4c926cef1d14","observation_id":"e9b8a8fc-126e-426a-913b-64b2385a169d","resolution":{"observed_at":"2026-08-06T15:33:46.059708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.130864Z","title":"Human motion instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.130864Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:25b0f3655adee91bd49984f8e524d086bddd27d30631d222fb8e769a5de0a613","observation_id":"5d245ff8-9b14-45cf-bd77-9f159ac67b35","resolution":{"observed_at":"2026-08-06T15:33:46.130864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12769","last_updated":"2025-06-15T08:39:49Z","snapshot_observed_at":"2026-08-09T22:12:27.434429Z","submitted_at":"2025-06-15T08:39:49Z","title":"RL from Physical Feedback: Aligning Large Motion Models with Humanoid Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12769","snapshot_observed_at":"2026-08-06T15:33:46.196891Z","title":"Rl from physical feedback: Aligning large motion models with humanoid control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.196891Z"},"links":{"cited_paper":"/paper/2506.12769","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:2bc013cb6727b5fe1c720f391dae6b481667e653a666fe6c4bdc3fbe0166dc0b","observation_id":"8a7212e1-8afc-45b2-a49d-cba95fb4f3e0","resolution":{"observed_at":"2026-08-06T15:33:46.196891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.255945Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.255945Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:2a115762cc2057cf90dc2daf9fc3e015a3ac6f2f6ce122abfa4d9cb7638d7fa5","observation_id":"4a9fdfc3-20bd-4aa5-a976-0eb87aef1e2c","resolution":{"observed_at":"2026-08-06T15:33:46.255945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13196","last_updated":"2025-03-12T00:40:43Z","snapshot_observed_at":"2026-08-11T13:17:42.993482Z","submitted_at":"2024-12-17T18:59:51Z","title":"ExBody2: Advanced Expressive Humanoid Whole-Body Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13196","snapshot_observed_at":"2026-08-06T15:33:46.336690Z","title":"Exbody2: Advanced expressive humanoid whole-body control.arXiv preprint arXiv:2412.13196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.336690Z"},"links":{"cited_paper":"/paper/2412.13196","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d63bb9d45ba5e7afafc8c3aca2655a0d1ae7889d0f9a5a92e0331ac637f20b7b","observation_id":"2b6f6754-fb9c-4da2-ac3d-db188e302e23","resolution":{"observed_at":"2026-08-06T15:33:46.336690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.386963Z","title":"Reindiffuse: Craft- ing physically plausible motions with reinforced diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.386963Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:cbccd0ff612ffb66790fd6c5eb8835d65d0fa64229aa073d92a97a79a0ef116f","observation_id":"6dad6a80-a450-43de-b8e7-b6141c91e102","resolution":{"observed_at":"2026-08-06T15:33:46.386963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.451798Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.451798Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:9af2d11fef3ba2230359add6468cf49e552926fc3c4816462d8cc155f07976c9","observation_id":"ae8d7db9-e877-4a54-8368-084b19507e00","resolution":{"observed_at":"2026-08-06T15:33:46.451798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.508374Z","title":"Hand-object contact consistency reasoning for human grasps generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.508374Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ad800f5c04c3989a4069cce58a9b9307df74f135ac371f6b33e0b4a62e4683d9","observation_id":"900fbd39-23f3-426f-9049-b2f95871ed97","resolution":{"observed_at":"2026-08-06T15:33:46.508374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.541539Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.541539Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:5c5ce57bf5e54c3324369f8d696056898f70b910e721f75eb336d15107f1fc47","observation_id":"91a3701f-955f-4d51-b7f4-43fe3e148d98","resolution":{"observed_at":"2026-08-06T15:33:46.541539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.564839Z","title":"Hot3d: Hand and object tracking in 3d from egocentric multi-view videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.564839Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:415a315276a395efde059ede696b76c0c8fefe55ca0f5dfaf919cacb72456a13","observation_id":"079824de-be87-4b1b-97ba-a373f732fc17","resolution":{"observed_at":"2026-08-06T15:33:46.564839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.641803Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.641803Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:74ec1fc0dbc5ae8093d4b9a0bde50d25ce3b649f31dcc7fd84848ab603ef3a4a","observation_id":"b19ece4c-6d3d-4fda-867d-6e11e371444c","resolution":{"observed_at":"2026-08-06T15:33:46.641803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.644330Z","title":"Oakink2: A dataset of bimanual hands-object manipulation in complex task completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.644330Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:1b7f908328e53b3a736856a8848f5f5dcdfc1b61b33bc55a988f9d0f25016f08","observation_id":"e9bcd271-54de-4248-a716-a2d7b3e2b4a0","resolution":{"observed_at":"2026-08-06T15:33:46.644330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.663820Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.663820Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:3f5fe17ade2482677bdfdf9b9dc93cb4dd6dbe69c4797933f2f243fa91153947","observation_id":"21d286b6-3268-443e-8562-e447361b5c5f","resolution":{"observed_at":"2026-08-06T15:33:46.663820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":161},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 161 outbound references and 65 inbound Pith citation observations for arXiv:2507.15597."}