{"as_of":"2026-08-12T16:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:735caf7c9ac6e0e3a9e00a019e3d80ca2ba479d5a32b45fab32427da549d080a","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:11:53.760420Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:32:20.472823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:08:03.086630Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:af621f9470f205f454cab82b5fe53aa33cbb9e8c40fdd05aec3a7d02e05eb930","observation_id":"997d3490-1325-4a65-8c76-7513290a445c","resolution":{"observed_at":"2026-05-17T20:28:16.118267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-08-11T00:39:38.533421Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:56aaca83d543581049a0d6785e2099c2ff92f795d91602601b9d3b4b64df92d7","observation_id":"e8d5e4cc-5464-4f4e-af06-f03fa3161f38","resolution":{"observed_at":"2026-05-15T22:06:43.006415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-14T21:59:30.885343Z","title":"arXiv preprint arXiv:2506.00411 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12939","last_updated":"2026-07-10T06:29:36Z","snapshot_observed_at":"2026-08-08T09:27:58.499255Z","submitted_at":"2026-03-13T12:34:26Z","title":"RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T21:59:30.885343Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2603.12939"},"observation_digest":"sha256:227ae63ff49b1e7e4ea63f41df8b31ac0eacb852c22c8299a9a2c3ddae3e5672","observation_id":"fec2673b-f60e-44eb-bda3-4d0186d6a3ea","resolution":{"observed_at":"2026-07-14T21:59:30.885343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2604.02965","last_updated":"2026-04-03T10:55:51Z","snapshot_observed_at":"2026-08-11T02:34:07.052638Z","submitted_at":"2026-04-03T10:55:51Z","title":"Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:17.852646Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.02965"},"observation_digest":"sha256:04ce31f84949b07d95dec86b461960fe63a98a193acab2ac294af98875092281","observation_id":"828b5d19-bd5e-441f-8931-da55b7502848","resolution":{"observed_at":"2026-05-13T19:48:11.475227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-10T21:49:41.150073Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T17:59:48.877783Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:a2d2bd011afef2b56527e74efd4b883ecae1c5a4d66803cfbf7ff1a67b7b70b6","observation_id":"6dc473a3-1204-429a-bf56-f4debac64faa","resolution":{"observed_at":"2026-05-11T05:41:00.470165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-08-04T05:32:20.472823Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-10T21:49:41.150073Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T05:32:20.472823Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:ee9839baf2bbb44eb931fcc538c7d74ca975fb5327a44c07961a04859aba6cdc","observation_id":"fc4d610d-b7e9-4f44-91bd-fa748b1f2c2e","resolution":{"observed_at":"2026-08-04T05:32:20.472823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2604.17880","last_updated":"2026-04-20T06:48:47Z","snapshot_observed_at":"2026-08-01T03:28:42.182562Z","submitted_at":"2026-04-20T06:48:47Z","title":"ST-$\\pi$: Structured SpatioTemporal VLA for Robotic Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:21.784769Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.17880"},"observation_digest":"sha256:a06a41369117007654ac2d5c79c9488dba9965b77074f8cf7240bb164a8de8e8","observation_id":"d3e491ca-6df3-4e6a-8276-241a1931768e","resolution":{"observed_at":"2026-05-10T11:40:19.846507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2605.13119","last_updated":"2026-05-13T07:40:34Z","snapshot_observed_at":"2026-08-11T00:24:03.156824Z","submitted_at":"2026-05-13T07:40:34Z","title":"Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:35:22.595183Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2605.13119"},"observation_digest":"sha256:634970c4339b890f65a0a1850cc1d0f5f2e877c45f0878bc02aa955c60bf8bb9","observation_id":"e6720793-1822-43d3-89f0-542ec16861f6","resolution":{"observed_at":"2026-05-14T18:37:35.551039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2606.05660","last_updated":"2026-06-04T03:43:09Z","snapshot_observed_at":"2026-08-08T10:35:54.242394Z","submitted_at":"2026-06-04T03:43:09Z","title":"Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation","version":1},"reference_index":280,"source":"arxiv_source","source_observed_at":"2026-06-28T01:46:36.081851Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2606.05660"},"observation_digest":"sha256:3ec07d0119870d7911273431e30ff1222f4dbd77efb46245e6d4d026f40f3462","observation_id":"fb1f5b37-0eb1-4e8f-8cfb-d3a8159b8376","resolution":{"observed_at":"2026-07-02T12:56:56.738255Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2606.12402","last_updated":"2026-06-10T17:58:49Z","snapshot_observed_at":"2026-07-06T23:51:22.219590Z","submitted_at":"2026-06-10T17:58:49Z","title":"DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T09:42:17.813126Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2606.12402"},"observation_digest":"sha256:09115d60d9e62b8b829efc9c655f315cba6a9fce93e00eba59e68e323177ff99","observation_id":"402cf453-63ce-463a-b2f4-a06344575e19","resolution":{"observed_at":"2026-07-03T11:08:03.088305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2606.12497","last_updated":"2026-06-10T13:26:40Z","snapshot_observed_at":"2026-08-05T05:15:21.338433Z","submitted_at":"2026-06-10T13:26:40Z","title":"$\\mu$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T10:50:55.866910Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2606.12497"},"observation_digest":"sha256:cfe84971f3569d1bfd58cb4f82f37d209c8b78d0d170a9cb77c073b41d304dfa","observation_id":"4e08cc78-0e59-4138-aeab-62b2d17b03af","resolution":{"observed_at":"2026-07-03T08:17:45.702600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-08-01T12:14:50.679321Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19633","last_updated":"2026-07-22T00:05:00Z","snapshot_observed_at":"2026-08-10T13:39:03.661358Z","submitted_at":"2026-07-22T00:05:00Z","title":"LENS: LLM-guided Environment Simplification for Planning and Control in Clutter","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:14:50.679321Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2607.19633"},"observation_digest":"sha256:8ca90927a5d3f1d5144cefcf40a8a225f54e51aad7ce67b7c86916f6bd12cb5d","observation_id":"6307be61-d675-45f9-a719-c1b73bd6ef7b","resolution":{"observed_at":"2026-08-01T12:14:50.679321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00411/citation-record","integrity":"/paper/2506.00411/integrity","json":"/paper/2506.00411/citation-record.json","paper":"/paper/2506.00411"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T12:11:50.402461Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.402461Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:291f19264a47b753349ee7701a7da1dd338f1fde8991a0d29a9072fb3499eb95","observation_id":"4a2af5aa-9214-4678-b52c-ff461c051d81","resolution":{"observed_at":"2026-08-07T12:11:50.402461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.464311Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.464311Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:74f63c3eb0b60e8c2b7ce9374e777abd81a8d71d9f02edefd0bc58a5077c24a6","observation_id":"a77ad4cb-596c-4755-9d43-0fc6784262a7","resolution":{"observed_at":"2026-08-07T12:11:50.464311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T12:11:50.538884Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.538884Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:95f4a35a566a5d0680138cc5c70677af01c32a2f6fa4842503640fbc7b39231e","observation_id":"611eeb08-4644-4e15-a778-1ea7082f4471","resolution":{"observed_at":"2026-08-07T12:11:50.538884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-07T12:11:50.638916Z","title":"Rt-h: Action hierarchies using language.arXiv preprint arXiv:2403.01823, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.638916Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:33f8ecd8a95afb576e0171a210dd96716bdd313d9cfcc67e2f6b58f8fe7ce5bb","observation_id":"cff18067-3996-452b-bbe3-4b916fb73641","resolution":{"observed_at":"2026-08-07T12:11:50.638916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T12:11:50.724857Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.724857Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:3144ff70f246680a901c71e3137c772d1fff335aa5017ceaabeaa7a6c4ae82fd","observation_id":"2625f32f-eb50-44d3-b841-6476248aa767","resolution":{"observed_at":"2026-08-07T12:11:50.724857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:11:50.793559Z","title":"π0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.793559Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:047f87cf15d0aa5502940a718d393eaba0763475702ae53365929a4a553a8354","observation_id":"f68be341-bf14-4d2a-a232-7818b06184ca","resolution":{"observed_at":"2026-08-07T12:11:50.793559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T12:11:50.866410Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.866410Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b1920d9e9f4213f79e5e33589fd13e081cb0e555fbe6e4fa07173200b52358f0","observation_id":"95deca43-e5e2-464d-9bda-785345e02078","resolution":{"observed_at":"2026-08-07T12:11:50.866410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T12:11:50.945418Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.945418Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:ec58aa723b9522cec3c07dfce92a9c42ad1df72d35139bc1e9662cf0014603d4","observation_id":"95e8f96c-6bd4-4f52-ad50-8481b3b626d0","resolution":{"observed_at":"2026-08-07T12:11:50.945418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03966","last_updated":"2024-09-06T01:29:35Z","snapshot_observed_at":"2026-07-06T19:11:18.410415Z","submitted_at":"2024-09-06T01:29:35Z","title":"Automating Robot Failure Recovery Using Vision-Language Models With Optimized Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03966","snapshot_observed_at":"2026-08-07T12:11:51.017370Z","title":"Automating robot failure recovery using vision-language models with optimized prompts.arXiv preprint arXiv:2409.03966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.017370Z"},"links":{"cited_paper":"/paper/2409.03966","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:0e156cf3753579858670f3730545f719cca39ee4f8619a52d238dd5d00887f2c","observation_id":"2bce84f4-9a64-4654-ab50-1a81f0449008","resolution":{"observed_at":"2026-08-07T12:11:51.017370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-09T14:40:36.849154Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-07T12:11:51.104029Z","title":"Pali-3 vision language models: Smaller, faster, stronger.arXiv preprint arXiv:2310.09199, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.104029Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:01c80f8be6ec9dc713ae82f8cf23ca2a52ca56085e20e6407aa735d7e7fd23f7","observation_id":"e027e3ac-455f-4719-bcb7-ec0c4b1b4b45","resolution":{"observed_at":"2026-08-07T12:11:51.104029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:11:51.175126Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.175126Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:4a871a775f065b659db7420190262611bb16a65c44f5145925f8640c749576dc","observation_id":"396dad35-108d-4f25-beea-2953d1be9b1d","resolution":{"observed_at":"2026-08-07T12:11:51.175126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14674","last_updated":"2024-09-23T02:50:33Z","snapshot_observed_at":"2026-08-12T07:36:50.809697Z","submitted_at":"2024-09-23T02:50:33Z","title":"RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14674","snapshot_observed_at":"2026-08-07T12:11:51.255771Z","title":"Racer: Rich language-guided failure recovery policies for imitation learning.arXiv preprint arXiv:2409.14674, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.255771Z"},"links":{"cited_paper":"/paper/2409.14674","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:7b78e1ca68d5befa53fa26e5aa25911243f29bd3e481624e359a547302ec4739","observation_id":"1948774a-2fca-4c78-93aa-6210970583db","resolution":{"observed_at":"2026-08-07T12:11:51.255771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.332588Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.332588Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:ea329657d5f2f1a22745e1346b721b46f09a2e55dac17761b4fbdafa4773fae6","observation_id":"a3fc4e88-3361-40d0-9bef-a5335e1f2455","resolution":{"observed_at":"2026-08-07T12:11:51.332588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.411720Z","title":"A survey of embodied ai: From simulators to research tasks.IEEE Transactions on Emerging Topics in Computational Intelligence, 6(2):230–244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.411720Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:a288230ddc1da75fa6a1142b0e8d03d15b75415f509561a95a81d108cd1b3e9f","observation_id":"f21d51c6-ae7e-4ddd-b8f0-221e2238bedd","resolution":{"observed_at":"2026-08-07T12:11:51.411720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09572","last_updated":"2025-04-22T17:56:22Z","snapshot_observed_at":"2026-08-07T20:22:20.692339Z","submitted_at":"2025-03-12T17:40:52Z","title":"Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09572","snapshot_observed_at":"2026-08-07T12:11:51.503670Z","title":"Plan-and-act: Improving planning of agents for long-horizon tasks.arXiv preprint arXiv:2503.09572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.503670Z"},"links":{"cited_paper":"/paper/2503.09572","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:8c38c136228072d80ac0230083200d561c221979b1afaba987953d4fcc81ab8a","observation_id":"494d03c6-01c8-4a84-bd5f-6d0f74311564","resolution":{"observed_at":"2026-08-07T12:11:51.503670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16768","last_updated":"2024-08-29T17:59:45Z","snapshot_observed_at":"2026-08-12T04:39:01.327508Z","submitted_at":"2024-08-29T17:59:45Z","title":"SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16768","snapshot_observed_at":"2026-08-07T12:11:51.580798Z","title":"Sam2point: Segment any 3d as videos in zero-shot and promptable manners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.580798Z"},"links":{"cited_paper":"/paper/2408.16768","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:a9d46c8122ee6bc7f1775e05188ca754b3c01a97a96a440d2fcadb259295cc1b","observation_id":"e0d22152-43ea-4d7b-a36d-d572447164f7","resolution":{"observed_at":"2026-08-07T12:11:51.580798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.657514Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1 (2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.657514Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:a97295ddef6a0d05654bcb9fb3cd0666bf6968fb21f2f5298af82d44c8263955","observation_id":"6c15d737-1812-4af8-ba9e-405a1fe6fea4","resolution":{"observed_at":"2026-08-07T12:11:51.657514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-11T17:12:55.474717Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-07T12:11:51.749872Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning.arXiv preprint arXiv:2311.17842, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.749872Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:314bbc46f502905ae192d70add2228861937769cbda87a8cb75cdd5bb7f6a742","observation_id":"5d3a4d0f-abc1-438d-8dbb-3e89c20b1864","resolution":{"observed_at":"2026-08-07T12:11:51.749872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T12:11:51.808027Z","title":"Inner monologue: Embodied reasoning through planning with language models.arXiv preprint arXiv:2207.05608, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.808027Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:8704f9be306e1189764fc506317dea56bd68d4616b99e797de3ce2b73b9223e8","observation_id":"f686ef96-63b8-4e2e-bac4-d26f9da7dd92","resolution":{"observed_at":"2026-08-07T12:11:51.808027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T12:11:51.879427Z","title":"π0.5: a vision- language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.879427Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:bc19f9ab5301f500252e9ec07618717b5f58f3ce2bd4412c3404f585c808dd84","observation_id":"557ec476-913e-47e3-8b7f-4c041f2747f7","resolution":{"observed_at":"2026-08-07T12:11:51.879427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.933742Z","title":"Rlbench: The robot learning benchmark & learning environment.IEEE Robotics and Automation Letters, 5(2): 3019–3026, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.933742Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:c99e69f55550bc66e1c6dfe84094e9bb41f483c9f6762a0d723ab15744470139","observation_id":"8c84b103-0336-4f5d-8135-47005bbcd31d","resolution":{"observed_at":"2026-08-07T12:11:51.933742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-07T12:11:51.991716Z","title":"Vima: General robot manipulation with multimodal prompts.arXiv preprint arXiv:2210.03094, 2(3):6, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.991716Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:61b849070918ca0faf78aad42a54fca5914c3ef386d4f41833be8d4d8490f030","observation_id":"820a1bc0-e137-4067-9af1-de82658f6d3c","resolution":{"observed_at":"2026-08-07T12:11:51.991716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.049828Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.049828Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:1b2f751999e35f3a9c69a4b4e3c03276c38bbff3599f63cf19722e55d7c7534d","observation_id":"65712fe7-bfe9-44b7-b52b-5f09f8b515d4","resolution":{"observed_at":"2026-08-07T12:11:52.049828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:11:52.108675Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.108675Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:8b96a014c9a3eb47172aab446c6f9c9fdbb064b931e6e752573de928ab05f194","observation_id":"fb2a4c9e-8674-4c17-9c5b-62aca763dcf9","resolution":{"observed_at":"2026-08-07T12:11:52.108675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10645","last_updated":"2025-02-08T20:22:08Z","snapshot_observed_at":"2026-08-11T10:08:17.136108Z","submitted_at":"2023-10-16T17:59:12Z","title":"Interactive Task Planning with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10645","snapshot_observed_at":"2026-08-07T12:11:52.169199Z","title":"Interactive task planning with language models.arXiv preprint arXiv:2310.10645, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.169199Z"},"links":{"cited_paper":"/paper/2310.10645","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:96b163184ee37a57244b05e35b532943227c459bcd0dd90ea276b82e176cd474","observation_id":"3e511f46-d589-4f42-b24f-5c5beb0ba397","resolution":{"observed_at":"2026-08-07T12:11:52.169199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-07T12:11:52.234021Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.234021Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:7dbf8aaa423a3c26cca4cec419b291c8fa0970c607ffa7e0ce01acdf57da556f","observation_id":"3b256970-321e-4233-a30c-d662d2bc37dd","resolution":{"observed_at":"2026-08-07T12:11:52.234021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-08-08T19:05:01.694808Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-07T12:11:52.289000Z","title":"Hamster: Hierarchical action models for open-world robot manipulation.arXiv preprint arXiv:2502.05485, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.289000Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:466b617023f803e853283f60a630f2686cb8c3c99f75086c6586e4fd8b46ec0b","observation_id":"ae26849b-d5ab-43d1-9fc1-9ea2f5737a9c","resolution":{"observed_at":"2026-08-07T12:11:52.289000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.345413Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.345413Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:6928b7d7660488905e687bd9da653eb72e642cedd706d083772e22e4d34ae2cd","observation_id":"f6a8cf29-9d17-40d7-bbfd-907b591e9eae","resolution":{"observed_at":"2026-08-07T12:11:52.345413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.417895Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.417895Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:3b1150d1328a7c3793487cc29f35e8e3bfd1ef19bea2f8ec8427173c283d901b","observation_id":"7cedec1a-53b2-46fd-b1a4-90fde3db3aa3","resolution":{"observed_at":"2026-08-07T12:11:52.417895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-07T12:11:52.474356Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai.arXiv preprint arXiv:2407.06886, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.474356Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:bad033c52bcd00a7199f42bd653d8d80c72720b8610c952f2c007692bab5826e","observation_id":"d2b24dac-6fca-4be1-be34-5526efb36c12","resolution":{"observed_at":"2026-08-07T12:11:52.474356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:11:52.542027Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.542027Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:79aa3d69856209c8e2947753bd15a40a8c0bdc86c050f2d96013d37da7f7dc84","observation_id":"3386d76e-45b7-452b-8eaf-5b90a4ccebaf","resolution":{"observed_at":"2026-08-07T12:11:52.542027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21969","last_updated":"2025-08-21T02:16:40Z","snapshot_observed_at":"2026-08-07T16:31:39.152125Z","submitted_at":"2025-03-27T20:32:58Z","title":"Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation","version":3},"cited_work":{"arxiv_id":"2503.21969","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.21969","snapshot_observed_at":"2026-08-07T12:11:53.996299Z","title":"Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation","venue":"cs.RO","work_id":"8fa81a1c-a0ee-4db8-93b6-da6b7652cfad","year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.605689Z"},"links":{"cited_paper":"/paper/2503.21969","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:f1122e240f89015d4020821d13165b2eab44bdf02af262a83d01b42bb0cb4288","observation_id":"27dcc32e-f1f9-41ff-82c6-e4dcf848fd98","resolution":{"observed_at":"2026-08-07T12:11:54.106121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-07T12:11:52.663287Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms.arXiv preprint arXiv:2402.07872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.663287Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:c328bdebe2534deece2ab80fabbffc4aa5a49173f195af58fc04897be55f3a5b","observation_id":"19d7957c-ead7-4c6a-af9c-1d95c5e5b4f9","resolution":{"observed_at":"2026-08-07T12:11:52.663287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.737739Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.737739Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:32cf1f80111e52b849dd49692f1f1f3845a15dbba00a5e7245a2111ca7314499","observation_id":"926c4d49-089e-447c-ae47-79f582e9e696","resolution":{"observed_at":"2026-08-07T12:11:52.737739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.813700Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.813700Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:9973dcdd24a3d43f5846212aa55f654888cff4e665a0bac532846c26ee5616aa","observation_id":"8482fb7b-520f-41f1-9783-1f9b55ce32c6","resolution":{"observed_at":"2026-08-07T12:11:52.813700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.870099Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.870099Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:545d97695f46e8ebc08c168a2e922f021944cc174aee419d6ce540d48020986f","observation_id":"adf29dd0-4804-45d4-b563-50b5267c01ba","resolution":{"observed_at":"2026-08-07T12:11:52.870099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12910","last_updated":"2024-03-19T17:08:24Z","snapshot_observed_at":"2026-08-04T09:24:08.528569Z","submitted_at":"2024-03-19T17:08:24Z","title":"Yell At Your Robot: Improving On-the-Fly from Language Corrections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12910","snapshot_observed_at":"2026-08-07T12:11:52.939905Z","title":"Yell at your robot: Improving on-the-fly from language corrections.arXiv preprint arXiv:2403.12910, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.939905Z"},"links":{"cited_paper":"/paper/2403.12910","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:2083391b36bf5ce42c313f0c208bc6e6afb35249e892092c2590a14c3db3364f","observation_id":"1e9729c2-9d0d-48c4-a8b2-d8135faa509e","resolution":{"observed_at":"2026-08-07T12:11:52.939905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.996432Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.996432Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:8b3fba8b396f419c3c173d76e4e59641d6255f456d0ce9099a807b843c7034e9","observation_id":"f5a57f0c-fb57-4e52-a7ed-b5d87fcc5baa","resolution":{"observed_at":"2026-08-07T12:11:52.996432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T12:11:53.054561Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.054561Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:22be72e0b39f5b48a88a653a3d29f8b225758490c0217bbbfaaae29d797c7d0d","observation_id":"62ae627e-101d-4083-93a9-756881a0c8a7","resolution":{"observed_at":"2026-08-07T12:11:53.054561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:11:53.109639Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.109639Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:e3e55d55bed8bea7fe4e3d20a9364466c45003eb957b3007d37f95c90ba5ea1f","observation_id":"26fcc7d7-4dd4-4a28-b637-5c9c9505445e","resolution":{"observed_at":"2026-08-07T12:11:53.109639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14908","last_updated":"2025-03-21T01:58:00Z","snapshot_observed_at":"2026-08-09T09:21:42.293084Z","submitted_at":"2024-09-23T11:02:46Z","title":"KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14908","snapshot_observed_at":"2026-08-07T12:11:53.136088Z","title":"Karma: Augmenting embodied ai agents with long-and-short term memory systems.arXiv preprint arXiv:2409.14908, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.136088Z"},"links":{"cited_paper":"/paper/2409.14908","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:186f221e19ff5af65ad05897cdba9dbe055abe4d2bfb642a38d39dbe83614c89","observation_id":"1333bbd0-2651-4b57-b84e-918508fb06b2","resolution":{"observed_at":"2026-08-07T12:11:53.136088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:53.156816Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.156816Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b8372146045ebc26e07ae6461e36da9587e78c997bfc60dc65c3a997478dbee8","observation_id":"267028b0-7e69-49df-8662-1eedb1064a11","resolution":{"observed_at":"2026-08-07T12:11:53.156816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-12T14:04:58.697808Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T12:11:53.176992Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.176992Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:e7a8a5d0671e6c15a6ead7d76908d1ff0d0e3dd950eb7ad2c2e4e24e8cb93225","observation_id":"7ecbe182-66c7-4eb9-b7b9-233a0db0521f","resolution":{"observed_at":"2026-08-07T12:11:53.176992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-07T12:11:53.199045Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control.arXiv preprint arXiv:2502.05855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.199045Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:98ed0a6643c1669215a5871b5fd772013851ce5e064ca588318859b5dd8fa70e","observation_id":"6d1168fb-ecff-4995-826c-eccec69fc6f6","resolution":{"observed_at":"2026-08-07T12:11:53.199045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01848","last_updated":"2023-07-04T17:58:25Z","snapshot_observed_at":"2026-08-06T10:55:32.798065Z","submitted_at":"2023-07-04T17:58:25Z","title":"Embodied Task Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01848","snapshot_observed_at":"2026-08-07T12:11:53.224883Z","title":"Embodied task planning with large language models.arXiv preprint arXiv:2307.01848, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.224883Z"},"links":{"cited_paper":"/paper/2307.01848","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:f51c1397484e666eaf479c49e896d42292b7676b5cfde0d88cfadc0341f5d2c1","observation_id":"b0777f90-df48-4f56-927b-3d6696670cd4","resolution":{"observed_at":"2026-08-07T12:11:53.224883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-06T03:27:47.616528Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-08-07T12:11:53.248800Z","title":"Guiding long-horizon task and motion planning with vision language models.arXiv preprint arXiv:2410.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.248800Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:19c161a5d080d44da2fe0eecba99983e261c5c1fb48de1e2e5975b9c895948a1","observation_id":"1dadc5fd-e2b5-4f32-a48f-cc3b5ba8e226","resolution":{"observed_at":"2026-08-07T12:11:53.248800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:53.279922Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.279922Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:a2e440e34166f4e74a5b1af7fd8052d7a4d3fb2383f89425783b86b3a3c3b469","observation_id":"d053f5ef-cf53-42ef-8fd1-0ad9ef18c56b","resolution":{"observed_at":"2026-08-07T12:11:53.279922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T12:11:53.309841Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.309841Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b20c610ab3d090cad2821a3f33a0b3bc022f9cf36072b25beaf5aaa0f77d1f67","observation_id":"99ab15d2-1cd4-40ce-95ac-854b15e2e5fd","resolution":{"observed_at":"2026-08-07T12:11:53.309841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:53.341794Z","title":"Transporter networks: Rearranging the visual world for robotic manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.341794Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:460ccd7312e1224fc20e70041f3afe1f152529fcaf73fec643aaf841bde1e60d","observation_id":"32a1e977-58cf-4ec1-aef5-422dc7c48f00","resolution":{"observed_at":"2026-08-07T12:11:53.341794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12020","last_updated":"2023-10-23T12:29:33Z","snapshot_observed_at":"2026-08-11T19:13:34.429497Z","submitted_at":"2023-10-18T14:53:14Z","title":"LoHoRavens: A Long-Horizon Language-Conditioned Benchmark for Robotic Tabletop Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12020","snapshot_observed_at":"2026-08-07T12:11:53.410773Z","title":"Lohoravens: A long-horizon language- conditioned benchmark for robotic tabletop manipulation.arXiv preprint arXiv:2310.12020, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.410773Z"},"links":{"cited_paper":"/paper/2310.12020","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:7564be3d72a89ce382ce3005773d2631dafe9227332deebd736c22553fef7d09","observation_id":"029dc6b2-2290-4ed4-a692-683e44f7cde3","resolution":{"observed_at":"2026-08-07T12:11:53.410773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-11T04:54:18.910403Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18194","snapshot_observed_at":"2026-08-07T12:11:53.465809Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks.arXiv preprint arXiv:2412.18194, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.465809Z"},"links":{"cited_paper":"/paper/2412.18194","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:49c9f1d6cc48b60c6b4c3d89e264b2c2897c0730b2e4d27a5de7d132c450bdef","observation_id":"04cad5a2-d5bb-4cd1-aa82-961911dc6ef4","resolution":{"observed_at":"2026-08-07T12:11:53.465809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:54.637990Z","title":"Erra: An embodied representation and reasoning architecture for long-horizon language- conditioned manipulation tasks.IEEE Robotics and Automation Letters, 8(6):3230–3237, 2023","venue":null,"work_id":"3f07147f-9606-41de-a380-2d6d1652f6b5","year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.529912Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:ce7cf6f910746df347f41d6c4a34e4fe8231150387c06ea235a9cae26ce880c8","observation_id":"1c0fcf83-bbca-43ca-b251-01076d826155","resolution":{"observed_at":"2026-08-07T12:11:54.804295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-11T02:04:51.188806Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-07T12:11:53.612115Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models.arXiv preprint arXiv:2503.22020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.612115Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:a9d5112cb86037179383003c89c038aa44419294e9bf053e17078a39b350005b","observation_id":"7b5230cb-1021-4eb9-8fd9-e7342d94e7e3","resolution":{"observed_at":"2026-08-07T12:11:53.612115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:54.412043Z","title":"Isr-llm: Iterative self-refined large language model for long-horizon sequential task planning","venue":null,"work_id":"decb7777-e47a-4dfe-a0d2-1f57263b9b87","year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.679712Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:7e14a2b46581f8be94592408f21d63f75406662f4b311eb2e2fba8044d9e0add","observation_id":"d5853545-59f4-46b9-b4bb-6d32d1843908","resolution":{"observed_at":"2026-08-07T12:11:54.486441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-08-07T12:11:53.760420Z","title":"Put the [OBJ] on the [OBJ]","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.760420Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:6eef5fba7273152adee1417fab36094bcc054665ac3bf0b029e6818b5f3d0daa","observation_id":"2fe3bc54-3dad-47d6-97a8-3fb0fa87f083","resolution":{"observed_at":"2026-08-07T12:11:53.760420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 12 inbound Pith citation observations for arXiv:2506.00411."}