{"as_of":"2026-08-10T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da83d2d7b24d4217ba54e3e17847dd8c62fb0dc98bcd06bf9123163aa03abef7","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:13:14.953745Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:56:57.921843Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:19:38.145306Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-09T10:56:57.921843Z","title":"Up-vla: A unified understanding and prediction model for embodied agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02853","last_updated":"2025-05-13T03:02:42Z","snapshot_observed_at":"2026-08-09T21:37:24.641188Z","submitted_at":"2025-02-05T03:13:04Z","title":"Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation","version":5},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T10:56:57.921843Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2502.02853"},"observation_digest":"sha256:da40ebbf0643c250dce461b21fdef2ea88a5c27e275c15546d0255bffc376371","observation_id":"ecc36a3e-f8ec-4747-9324-290292a2c573","resolution":{"observed_at":"2026-08-09T10:56:57.921843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-07T14:23:17.797242Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T05:22:15.938376Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.797242Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:b7d9b413c4b1dd7b08733d2f851b2d77bc1b6a92bf4ca6ca8b271d5de05e99ee","observation_id":"19898cd3-2219-4907-9f3d-17d2f2cee578","resolution":{"observed_at":"2026-08-07T14:23:17.797242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:edbb9ff564adc7e049dc9f1b9af9c3d3637741981a5f8096844ce9c2e9ba5177","observation_id":"0bbf6716-25e6-401d-bc0f-69f035bbb1ee","resolution":{"observed_at":"2026-05-16T15:42:41.525266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-06T05:00:00.281156Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02405","last_updated":"2025-08-04T13:29:26Z","snapshot_observed_at":"2026-08-10T05:37:28.771633Z","submitted_at":"2025-08-04T13:29:26Z","title":"Improving Generalization of Language-Conditioned Robot Manipulation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:00:00.281156Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2508.02405"},"observation_digest":"sha256:a020e36885ac3220853d9068ff2af43669a5f5f8c11d2602f17e0dbb862ca141","observation_id":"1834e392-4731-4b51-b42b-5e7fecf03bef","resolution":{"observed_at":"2026-08-06T05:00:00.281156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-05T20:35:47.885219Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-09T19:01:56.593721Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:47.885219Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:09a8432c937b7867e6e8defb597ab9bdf233cdda4aa0e8889292580cdfc60465","observation_id":"5017bbf7-2e89-4a9d-94ce-046ac81d647c","resolution":{"observed_at":"2026-08-05T20:35:47.885219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-05T20:38:45.491893Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-08T01:00:17.824912Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:45.491893Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:06f2c68b29e0aad14338d362baef6f35f47c8a27363a381bdaee2c6647558932","observation_id":"13d393e9-8b69-4fe8-8a73-c3a3660eb217","resolution":{"observed_at":"2026-08-05T20:38:45.491893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T01:14:10.174044Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2510.10125"},"observation_digest":"sha256:0e0018e542e58ef5e9f31f99ef98f5b83f8e4bba8739143454f592b62d6c95cd","observation_id":"1cea0819-f384-45cc-824d-f912b80e0671","resolution":{"observed_at":"2026-05-16T01:14:10.412898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T23:01:13.910539Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2512.09928"},"observation_digest":"sha256:b47f21882f671463b480249ea887eb211fb37630e157222c7a5c40d8e93251a3","observation_id":"3d7c705f-3896-4d61-92be-52552f46fe2b","resolution":{"observed_at":"2026-05-16T23:01:20.326259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-03T12:30:33.889361Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.889361Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:bf15763abfb62cdafc09e242f7fbf8141990b9bfad1defa0c93acb7719f8c921","observation_id":"82e66e5a-afd9-4728-95eb-7f7b46bde77d","resolution":{"observed_at":"2026-08-03T12:30:33.889361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-08T17:47:58.330839Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:5042511ff2b56fb9d4534035967a1b90d0df986e12de27636aa6ed2c3213c616","observation_id":"fc62d89c-84fb-4888-a78c-81b968be093b","resolution":{"observed_at":"2026-05-16T15:08:02.045723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:0ba6780e58064efb050f29cff665c395f9414411d4768014cac26eeb71235e68","observation_id":"a5932355-278d-421b-aec1-1ead141326b3","resolution":{"observed_at":"2026-05-21T13:24:11.167790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-02T20:18:04.971064Z","title":"Up-vla: A unified understanding and prediction model for embodied agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-08T06:33:40.080560Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.971064Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:e6f5e7a6de995ae185e6c1f8deaaf135264c641e9f6ed08507521ce6f358d48f","observation_id":"c8cd7914-b628-4f76-a057-a5d7f4368dd6","resolution":{"observed_at":"2026-08-02T20:18:04.971064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:35.706107Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2603.25661"},"observation_digest":"sha256:c2571ab127b004958f5a06f0664f8858c1b3fdb34ab462a779caef029fef3528","observation_id":"8c502b30-011a-4097-8701-a4f775628619","resolution":{"observed_at":"2026-05-15T00:28:23.112425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2603.26320","last_updated":"2026-08-06T10:15:07Z","snapshot_observed_at":"2026-08-09T23:09:35.875614Z","submitted_at":"2026-03-27T11:38:43Z","title":"DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T22:59:21.473359Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2603.26320"},"observation_digest":"sha256:5ad4843b8f13ee415882a802f6a6d458b0d4100d00337938019a55672c9db625","observation_id":"fe21e7e9-76b4-4ea2-bf6f-c929037bf61d","resolution":{"observed_at":"2026-05-14T22:59:34.036536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2604.04502","last_updated":"2026-04-06T07:57:52Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T07:57:52Z","title":"Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T20:10:54.362107Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2604.04502"},"observation_digest":"sha256:f78ddb9b2df5e5cfa8cf3845e8e807a443b8d776cc45e03a35830ec6f22c4ac4","observation_id":"215344d3-9b62-4ee6-90c6-e167ac1d2ca6","resolution":{"observed_at":"2026-05-10T22:10:49.501816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2604.17800","last_updated":"2026-04-20T04:46:20Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T04:46:20Z","title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:38.517652Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2604.17800"},"observation_digest":"sha256:16e06697119b04a5093fa15e7133b9789ce9bd66dfd8dbe82dae395f62bd9458","observation_id":"6a9b6c95-3c09-4cdd-bcbb-b2b4d9df7eac","resolution":{"observed_at":"2026-05-10T09:48:48.368301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T03:39:41.090350Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:05ba6be42028bfd0d69f84899170f5fcccd371114bff3a919bdcde73a48e201d","observation_id":"bbe15e70-d9c6-4266-b018-17bf1e4020f0","resolution":{"observed_at":"2026-05-11T03:40:53.701218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T02:53:54.608425Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:c2bfe56f2851eed3d2bda021bac8f505bc1358f4a2822c3b9caa039992b669ae","observation_id":"a546ed1d-8b0c-41fb-96f5-371f64fb4702","resolution":{"observed_at":"2026-05-12T07:26:29.199579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T06:16:48.180290Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:f47783fb7bb48240f42f15b6a24ecfec750b5d3047d8c17698d709faddbf531c","observation_id":"1e489c8a-6af9-4c50-bf3b-8b25fb7bb44d","resolution":{"observed_at":"2026-05-15T06:19:49.907080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T04:14:54.885244Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:7ccb177bb14a08b295251eb593e5c03b765a3dadd9a9b73a802e97cdddf3ded7","observation_id":"eed7992c-03d2-4756-9207-b9e06610f666","resolution":{"observed_at":"2026-05-12T06:26:26.881607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T21:14:56.501485Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:d543c2d5ecf74a53c0053cf3cd13b4e80c1e17439a848c8f9769f3180f866b74","observation_id":"06681ab4-54d2-4ec5-9873-e7dee94d86a3","resolution":{"observed_at":"2026-05-14T21:17:59.541966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-02T14:25:58.642997Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:43.222818Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:373916385683b6b8755926dad76befabb2e42604064482abe5b078cb4f22c2f9","observation_id":"8a60aa44-b1bc-419a-abb0-009de18a24d1","resolution":{"observed_at":"2026-05-12T06:36:25.755642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-02T14:25:59.846732Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-02T14:25:58.642997Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:25:59.846732Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:9c2321e8d314bdf32e50411357288452ddc7932a934b9902454d2be83b02b63b","observation_id":"bbf4990f-9cc8-4f36-8c36-7d5d8f5c96cf","resolution":{"observed_at":"2026-08-02T14:25:59.846732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.15735","last_updated":"2026-05-18T07:08:58Z","snapshot_observed_at":"2026-08-05T15:39:24.495350Z","submitted_at":"2026-05-15T08:45:37Z","title":"UAM: A Dual-Stream Perspective on Forgetting in VLA Training","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T19:24:57.339949Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.15735"},"observation_digest":"sha256:b583f843ed830d98ee556a2fc4e490a0607d911b7729f02395158f95fd0cc79b","observation_id":"244fea20-afda-4dff-920c-68fe5a1cf106","resolution":{"observed_at":"2026-05-20T19:28:55.072771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:b798cba727e279b386f22204bbcde31a7f5c8b059fb1bad23b0e638f891bef00","observation_id":"a7ccadef-7dfe-4e6e-8a80-ae221c8a6dec","resolution":{"observed_at":"2026-05-22T06:21:10.582695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:52.461348Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:f21bbee182b4f1caa69e1bb98e1512f1a558820f0f506711d0b60da262b886bf","observation_id":"a635d8f1-ac24-40cf-a4fe-0205460e94f5","resolution":{"observed_at":"2026-05-22T06:06:08.671326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T16:52:05.565650Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:bada20010ea7cfdb33ed94eac398ad82d1283138021d332ebee744b46848afc0","observation_id":"d45834e8-781a-4585-a3e2-d40fe382e7bb","resolution":{"observed_at":"2026-06-30T16:54:58.304885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:db371eaa626e90037405508739fb44ee3e752eaff3481086467ef0d45aecee44","observation_id":"0e610237-103c-4e29-85ab-bfb040883cc3","resolution":{"observed_at":"2026-06-29T13:43:28.812492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:135c8ce72de8bd30ce7279c362cfc8d41e383ed2f264098f7a77ba754504a5dc","observation_id":"0c011b33-cf82-4e6a-acac-4920df51827d","resolution":{"observed_at":"2026-07-02T13:16:59.243402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.12403","last_updated":"2026-06-10T17:59:08Z","snapshot_observed_at":"2026-08-01T17:35:24.729614Z","submitted_at":"2026-06-10T17:59:08Z","title":"World Pilot: Steering Vision-Language-Action Models with World-Action Priors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:02.137152Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.12403"},"observation_digest":"sha256:505444efbc36e32d2570461e0509b466a7e37aa99be6bdd84a972ecb8335f462","observation_id":"b5e73954-1eb4-493a-b5d1-a114cc96fe0c","resolution":{"observed_at":"2026-07-03T11:18:03.287276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.21088","last_updated":"2026-06-19T04:35:18Z","snapshot_observed_at":"2026-08-06T05:03:39.968585Z","submitted_at":"2026-06-19T04:35:18Z","title":"MV-WAM: Manifold-Aware World Action Model with Value Augmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:36:42.051049Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.21088"},"observation_digest":"sha256:4034118f576bbf7b054e306e58b162efea6558d4c418378bd794b41790b0d993","observation_id":"5fe65f78-e8ee-401e-8667-7858116c64e6","resolution":{"observed_at":"2026-07-04T06:19:38.147129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.29384","last_updated":"2026-06-28T13:19:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-28T13:19:11Z","title":"Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T07:01:48.330369Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.29384"},"observation_digest":"sha256:edba4440dd701ecc219ce0b3268f0aec01705210b4910c8984b6d64dedf7537d","observation_id":"e6920ae1-14bf-43af-b651-170eb1996765","resolution":{"observed_at":"2026-06-30T07:04:21.013976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18867/citation-record","integrity":"/paper/2501.18867/integrity","json":"/paper/2501.18867/citation-record.json","paper":"/paper/2501.18867"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:13:14.865706Z","title":"H., and Krishnan, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.865706Z"},"links":{"citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:4ec8951ab3c9574128f32970145c1e3a62d1f9326bcf7a85d6a95d8c9f1f4b50","observation_id":"77eed692-b15f-48b4-a948-a61c91b532c8","resolution":{"observed_at":"2026-08-09T22:13:14.865706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-09T22:13:14.881237Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.881237Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:2d014bc7996f4f06386b775d9e88667a831f07f05845fb0deffdf4fdf05522c2","observation_id":"8dbec790-398b-4e18-97f4-da94819ecf35","resolution":{"observed_at":"2026-08-09T22:13:14.881237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-09T22:13:14.870144Z","title":"Black, K., Nakamoto, M., Atreya, P., Walke, H., Finn, C., Kumar, A., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.870144Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:8b65833d4a79815610f2ddfec7e28d0d6d4729ed7fbcc1f09ee40c8543d51d36","observation_id":"3d99890c-6af2-4d2e-94e9-b759edc8c961","resolution":{"observed_at":"2026-08-09T22:13:14.870144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-09T22:13:14.887809Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.887809Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:b6f637a3830730b7da81e8fb5620b2cab9eb185ee036d762c7ba6d2970bc7b2b","observation_id":"f78bd75c-6e8c-4692-8777-791cbb8c8c34","resolution":{"observed_at":"2026-08-09T22:13:14.887809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-08-07T15:49:25.272514Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-08-09T22:13:14.890752Z","title":"Openhelix: A short survey, empirical analysis, and open-source dual- system vla model for robotic manipulation.arXiv preprint arXiv:2505.03912,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.890752Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:2349183912dcd57799d6b274afd3c3dcfb1a47e2c9af4ad6095572fd9876580c","observation_id":"6dad2403-9e6c-4961-8cd5-023ef2f1750e","resolution":{"observed_at":"2026-08-09T22:13:14.890752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14795","last_updated":"2025-02-21T08:09:14Z","snapshot_observed_at":"2026-08-08T12:11:17.544790Z","submitted_at":"2025-02-20T18:17:11Z","title":"Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14795","snapshot_observed_at":"2026-08-09T22:13:14.893941Z","title":"Humanoid-vla: Towards universal humanoid control with visual integration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.893941Z"},"links":{"cited_paper":"/paper/2502.14795","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:2f8741ab91bcf076292bcadb311562b5ea3b08163092cf76984d60885cd8adf3","observation_id":"0d62aff4-d491-4305-9aa0-840ef2e1fef0","resolution":{"observed_at":"2026-08-09T22:13:14.893941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18179","last_updated":"2024-11-27T09:54:58Z","snapshot_observed_at":"2026-08-09T02:02:35.001770Z","submitted_at":"2024-11-27T09:54:58Z","title":"Prediction with Action: Visual Policy Learning via Joint Denoising Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18179","snapshot_observed_at":"2026-08-09T22:13:14.907035Z","title":"Prediction with action: Visual pol- icy learning via joint denoising process","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.907035Z"},"links":{"cited_paper":"/paper/2411.18179","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:089f40e985a2c514e8885c1ff6367d89f92dec22dc638f026f539c40c8957bde","observation_id":"90af2f4f-1696-482c-84af-1a7fd36358b2","resolution":{"observed_at":"2026-08-09T22:13:14.907035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-09T22:13:14.910522Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.910522Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:2190b7faf07db2b724d0d4085f2b89e9f6c610d61b77c639542a68af3fc71b9c","observation_id":"553fc887-2af7-46bc-90c0-23c0867ebc63","resolution":{"observed_at":"2026-08-09T22:13:14.910522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-09T22:13:14.913213Z","title":"Open- vla: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.913213Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:19cb8ff93bfa61c1c7d1633958088bf12dcafca71646e4c554d026a205dce839","observation_id":"699109ef-510d-4910-b3df-9cb8b1a9da89","resolution":{"observed_at":"2026-08-09T22:13:14.913213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-09T22:13:14.916949Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.916949Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:814d3deed46d13f7bb55de09d8649e190ff0b1b6cc3acbe7cbf47275aa4b66a3","observation_id":"55ed24c6-9829-42df-af65-7ad72d392227","resolution":{"observed_at":"2026-08-09T22:13:14.916949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-09T22:13:14.919949Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.919949Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:32f03a27e79765f32e9c8e8de31cc153c58fd650d12dc3baabba2b438635da30","observation_id":"f3f94546-5816-4fac-b698-69929c7201dd","resolution":{"observed_at":"2026-08-09T22:13:14.919949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:13:14.922693Z","title":"Accelerating vision-language- action model integrated with action chunking via parallel decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.922693Z"},"links":{"citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:dcc78733a6e41eb09051dc1a21eda52bd71f9eb23e3f62fcd1aec98476450df1","observation_id":"623b1317-64fc-4abc-8b21-ebd5b20cb4ec","resolution":{"observed_at":"2026-08-09T22:13:14.922693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-09T06:43:33.951821Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-09T22:13:14.925841Z","title":"K., Singhal, S., Som, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.925841Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:2b263722ceb2abcca86c03d966b683f5052aeef4e8a7123d8b2025402b2dfe5d","observation_id":"fe9d8718-a2b9-42bd-a1d4-48c7ef5940a9","resolution":{"observed_at":"2026-08-09T22:13:14.925841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09969","last_updated":"2024-10-15T17:04:20Z","snapshot_observed_at":"2026-07-06T16:20:04.775700Z","submitted_at":"2023-09-18T17:50:17Z","title":"Prompt a Robot to Walk with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09969","snapshot_observed_at":"2026-08-09T22:13:14.928657Z","title":"Prompt a robot to walk with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.928657Z"},"links":{"cited_paper":"/paper/2309.09969","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:96f1c2ac01b1db50971a2c77b411b22e956daab501d750fa9d0d1a3c5231de8b","observation_id":"2d464b53-e88e-47cb-9843-f6611725bd91","resolution":{"observed_at":"2026-08-09T22:13:14.928657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00729","last_updated":"2024-03-01T18:25:26Z","snapshot_observed_at":"2026-08-10T01:48:30.397214Z","submitted_at":"2024-03-01T18:25:26Z","title":"Can Transformers Capture Spatial Relations between Objects?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00729","snapshot_observed_at":"2026-08-09T22:13:14.931442Z","title":"Can transformers capture spatial relations between objects? arXiv preprint arXiv:2403.00729,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.931442Z"},"links":{"cited_paper":"/paper/2403.00729","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:7908224010cf75a942f4b25fe51fe22ab967cf8c4e4e187e582ab93774b6ae1e","observation_id":"a3b1ce49-df06-450e-a414-5f1214e1d452","resolution":{"observed_at":"2026-08-09T22:13:14.931442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-09T22:13:14.934241Z","title":"Unleashing large-scale video generative pre-training for visual robot manipula- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.934241Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:4b0215831b7b853c647573b38d6741c0bcb94175409817a9061c9c9981c2059d","observation_id":"e083b778-7dab-482e-9eaa-034822cd5605","resolution":{"observed_at":"2026-08-09T22:13:14.934241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-09T22:13:14.936924Z","title":"J., Wang, W., Lin, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.936924Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:f86782562199951d90e480c7e0adc536dc765f9f587da5189624a51f17c892b3","observation_id":"a9781eb8-61ae-479b-99b4-4a922375f0e5","resolution":{"observed_at":"2026-08-09T22:13:14.936924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05273","last_updated":"2025-02-03T04:07:37Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-09-12T09:18:09Z","title":"HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05273","snapshot_observed_at":"2026-08-09T22:13:14.939639Z","title":"Hirt: Enhancing robotic control with hierarchical robot transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.939639Z"},"links":{"cited_paper":"/paper/2410.05273","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:a8f244ee4e5f7ffc591528b9876f9d7061514b72cacfeaf9a2f3c8f9cf8507ee","observation_id":"99fb6199-f6c6-47af-84d5-8ca35ad1d99f","resolution":{"observed_at":"2026-08-09T22:13:14.939639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13508","last_updated":"2025-02-21T07:01:56Z","snapshot_observed_at":"2026-08-07T18:06:23.081376Z","submitted_at":"2025-02-19T07:53:45Z","title":"VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13508","snapshot_observed_at":"2026-08-09T22:13:14.942425Z","title":"Vlas: Vision-language-action model with speech instructions for customized robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.942425Z"},"links":{"cited_paper":"/paper/2502.13508","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:71b469bda2aebd4a0d0d494be1c8d0fa7a9d01805b171632a3bb38e6b9834df0","observation_id":"9e98d851-58a3-499e-ae3a-cf331b776022","resolution":{"observed_at":"2026-08-09T22:13:14.942425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-09T22:13:14.945152Z","title":"3d-vla: A 3d vision-language-action gen- erative world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.945152Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:d98be301aff6ed147e39dd314c299b96f7f139b7b6b3d9e3bd5d79a26fa0eaec","observation_id":"73dd6cfd-4145-4c5a-acc3-baefae20e169","resolution":{"observed_at":"2026-08-09T22:13:14.945152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15734","last_updated":"2024-06-11T15:42:29Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-24T17:25:00Z","title":"LM4LV: A Frozen Large Language Model for Low-level Vision Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15734","snapshot_observed_at":"2026-08-09T22:13:14.948139Z","title":"Lm4lv: A frozen large language model for low-level vision tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.948139Z"},"links":{"cited_paper":"/paper/2405.15734","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:93b571f185dda5c3e06b9d889e95709bbc9750dd0211187a9623292da2bb4b69","observation_id":"02e68723-079a-4f88-9eea-7a6834eb22ec","resolution":{"observed_at":"2026-08-09T22:13:14.948139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:13:15.455934Z","title":null,"venue":null,"work_id":"4e0555c8-7b83-4edb-8fe8-a226bf0d2492","year":2021},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.951056Z"},"links":{"citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:a899b71c4850914059806500ae621ce77405885445c485ddbfd6d90b65ee7434","observation_id":"4e8b2b7d-6acd-473d-b090-163027680419","resolution":{"observed_at":"2026-08-09T22:13:15.458913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:13:15.444604Z","title":"In the pretrain stage, we train UP-VLA for 20k steps with batch size of 64 on future prediction and vision-language understanding tasks","venue":null,"work_id":"119ec4fc-17d1-4abb-8419-832518f8f4bb","year":2021},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.953745Z"},"links":{"citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:18c022dfd49520507ac6e1472893912adc9af4d998de8eff725fd9c4a7efb86b","observation_id":"04a94bc3-df9d-4118-b767-c6e296a3f6a4","resolution":{"observed_at":"2026-08-09T22:13:15.450405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-09T22:13:14.900822Z","title":"S., Lynch, C., Chowdhery, A., Ichter, B., Wahid, A., Tompson, J., Vuong, Q., Yu, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.900822Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:3d73eecc27c1bf8f8b2db02000b5d9019a6187c4300646e601cdd0c13e273c07","observation_id":"7b03bc9e-3174-43f4-900d-afce1b94102a","resolution":{"observed_at":"2026-08-09T22:13:14.900822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-09T22:13:14.904105Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.904105Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:9a44a3f4f7ed8df29ea0a2dfdcb6c72041c648558f6d867dd620b85fbfda3092","observation_id":"6ed69bac-7427-4159-8b12-0d9b8f1089d6","resolution":{"observed_at":"2026-08-09T22:13:14.904105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-09T22:13:14.884489Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.884489Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:b89d9af0c13bea8c217325033fee887d6e79c6533de01311997316eb8a403d03","observation_id":"5fe9fc33-9155-48f2-9798-ee2289527e9b","resolution":{"observed_at":"2026-08-09T22:13:14.884489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-09T22:13:14.873806Z","title":"pi 0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.873806Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:8606a91ebf28ec652079b107b78b7b01ccf94be41ef39629d63ee61886549f71","observation_id":"aab743bb-bcb1-406d-9ee6-346babc795ae","resolution":{"observed_at":"2026-08-09T22:13:14.873806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-09T22:13:14.877303Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.877303Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:b6b3ec2356654d157f1475555b7b64b4ec4e22bd2761d7e371b3b5a455869178","observation_id":"2e2ae1f0-01e1-4d1f-9c33-b3b3e0b42e19","resolution":{"observed_at":"2026-08-09T22:13:14.877303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T22:13:14.896801Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.896801Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:fa5fd934d667d1245866115bfc98e3c5068cec32b8e641e4faecc68f24d25f23","observation_id":"a06a7741-d030-48f9-9def-c6d402693429","resolution":{"observed_at":"2026-08-09T22:13:14.896801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 32 inbound Pith citation observations for arXiv:2501.18867."}