{"as_of":"2026-08-15T17:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78dbdd117ebdfc2792ba93a1b066e9b263f3b9694449ce8c253e330e0edd98e7","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:04.383484Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:43:04.565021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:49:46.316884Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:9494c4a67d5086dd000153176d1c9f5791e39ae769fd253e9d86985de367d721","observation_id":"7b90b889-cb7a-4be7-bbaf-b74925dd9442","resolution":{"observed_at":"2026-05-17T21:37:50.657904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:6b359b55a92ecd01461fbe0cf5189538f61e42b50dfa38b66daf344482a405f9","observation_id":"a0e2b8c1-28e1-46ef-bed6-456df92c9d11","resolution":{"observed_at":"2026-05-23T01:32:22.586386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-07T04:24:46.040172Z","title":"Vision-language- action model with open-world embodied reasoning from pretrained knowledge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-15T12:12:43.799681Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.040172Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:7ad106e3ab68098dcc3de583aa42984373e3445792795317e7fd9640fd65707f","observation_id":"3d798a09-016e-4b4a-badf-e51fd4ed9225","resolution":{"observed_at":"2026-08-07T04:24:46.040172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:f0490e35f7c09d51996fc85c696b90ada33978492d665e01a74bf2c3ef80d4ac","observation_id":"91bd68e6-817b-4383-90fe-56f24360044f","resolution":{"observed_at":"2026-05-17T20:28:16.346015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-03T13:53:28.034660Z","title":"Vision-language-action model with open-world em- bodied reasoning from pretrained knowledge.arXiv preprint arXiv:2505.21906, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.22539","last_updated":"2026-08-07T13:52:17Z","snapshot_observed_at":"2026-08-14T15:03:39.725206Z","submitted_at":"2025-12-27T09:40:54Z","title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T13:53:28.034660Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2512.22539"},"observation_digest":"sha256:6ede8894cf85c1f0777f2a4baedeefb30c8c0cceaabdcaac406dff9c0398c65a","observation_id":"6cb31c1a-69ee-47cd-914e-be08a3b32bd5","resolution":{"observed_at":"2026-08-03T13:53:28.034660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-15T15:43:04.565021Z","title":"Vision- language-action model with open-world embodied rea- soning from pretrained knowledge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02533","last_updated":"2026-01-28T07:50:30Z","snapshot_observed_at":"2026-08-15T15:37:29.900193Z","submitted_at":"2026-01-28T07:50:30Z","title":"HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:04.565021Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2602.02533"},"observation_digest":"sha256:5094201464a20ea49b7ec053db549d58438ba65020438831c2fd3bc9b34f8dfa","observation_id":"c9324eb2-2f2d-4205-b7c6-30da002c49fb","resolution":{"observed_at":"2026-08-15T15:43:04.565021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-08-15T02:14:17.838458Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:31.988002Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2602.20231"},"observation_digest":"sha256:57787a030201eae8f97387ebcfa0f6a9c73b407859e3799a5f57eaf925f10126","observation_id":"6a9e238f-c452-44a9-ac56-732d17bd6da2","resolution":{"observed_at":"2026-05-15T20:20:17.693054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2604.25459","last_updated":"2026-08-04T10:54:55Z","snapshot_observed_at":"2026-08-11T14:02:24.100057Z","submitted_at":"2026-04-28T10:05:39Z","title":"GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-07T16:12:45.211236Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2604.25459"},"observation_digest":"sha256:61703d6fd9f85820ec17c93316dd5316e877a325022f6bab1500eaa15870e875","observation_id":"4cfccbd2-71cf-4a53-9f38-40d77c92705b","resolution":{"observed_at":"2026-05-11T23:51:17.365848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2605.00321","last_updated":"2026-06-10T16:22:35Z","snapshot_observed_at":"2026-08-15T01:59:24.131363Z","submitted_at":"2026-05-01T01:00:00Z","title":"Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-09T19:45:10.232982Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2605.00321"},"observation_digest":"sha256:fee9ea66496f9137a27adef90b7bd07f2a157e8ac45b40c74c2eff08cd98f91d","observation_id":"51b4255c-f5d1-4777-b590-5064be053c6e","resolution":{"observed_at":"2026-05-11T15:31:21.135705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2605.01191","last_updated":"2026-05-28T05:36:20Z","snapshot_observed_at":"2026-08-11T09:21:10.471962Z","submitted_at":"2026-05-02T02:10:54Z","title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T15:14:03.865035Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2605.01191"},"observation_digest":"sha256:817322c1653bcfa460f367019423aad8e629f20e065d97f4f576a5d947566e94","observation_id":"20f8ca47-5f32-4d55-89c2-651193f0b6ff","resolution":{"observed_at":"2026-05-11T16:46:04.954056Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2605.01191","last_updated":"2026-05-28T05:36:20Z","snapshot_observed_at":"2026-08-11T09:21:10.471962Z","submitted_at":"2026-05-02T02:10:54Z","title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T01:10:48.111387Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2605.01191"},"observation_digest":"sha256:1cbad00bf85ac2d7724fc407712a11333555de74bcb730265db6718e39b4beb1","observation_id":"1eb1fddc-ed36-443c-8628-0548704f57c9","resolution":{"observed_at":"2026-07-01T13:05:45.083383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2605.01194","last_updated":"2026-05-02T02:13:11Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T02:13:11Z","title":"VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T15:10:16.533927Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2605.01194"},"observation_digest":"sha256:94d1b7fbf4072a8ab107456cdb09a761b944bc3777a1522f98e7fce5c90d34cf","observation_id":"999a750d-1f10-4cbf-95c6-c0e76e5ec01a","resolution":{"observed_at":"2026-05-11T16:46:06.282356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2605.15298","last_updated":"2026-05-14T18:11:47Z","snapshot_observed_at":"2026-08-13T05:42:06.884854Z","submitted_at":"2026-05-14T18:11:47Z","title":"PhysBrain 1.0 Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T16:34:44.204055Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2605.15298"},"observation_digest":"sha256:8ca190ae087f60322071444296bb4d42f195e385ec22714f392ad05ae821b011","observation_id":"c4fedb81-ba07-4d9a-9aef-731750d8ad25","resolution":{"observed_at":"2026-05-19T16:37:39.958760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-08-14T14:33:05.464547Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:64a9942ee763f1664410105315a285cc8400a5eb9369b05fd88e768d1b135c5a","observation_id":"39aa038f-dc04-48fb-a73a-f3a8e39bc85b","resolution":{"observed_at":"2026-05-20T12:43:17.242721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2606.00229","last_updated":"2026-06-08T17:22:58Z","snapshot_observed_at":"2026-08-13T14:46:14.192143Z","submitted_at":"2026-05-29T18:02:09Z","title":"Continuous Reasoning for Vision-Language-Action","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T22:07:07.401335Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2606.00229"},"observation_digest":"sha256:cb798ad3e2df16c2e68a737624d4ede7398c1853f5659f1b89d78152b6382b15","observation_id":"e79f361a-6613-4805-b7cc-5660a41a7c0e","resolution":{"observed_at":"2026-07-01T19:46:10.541501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2606.02565","last_updated":"2026-06-01T17:55:05Z","snapshot_observed_at":"2026-08-15T11:34:54.940552Z","submitted_at":"2026-06-01T17:55:05Z","title":"Policy-based Foveated Imaging and Perception","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-28T15:23:48.688620Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2606.02565"},"observation_digest":"sha256:124e5560c4050709b79a6734e6ffd9beba6bc3d1cdc053090556b55da2ebf837","observation_id":"13aab588-7370-48d8-8881-0bc4931c2e1e","resolution":{"observed_at":"2026-07-01T22:26:17.704616Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2606.03392","last_updated":"2026-06-02T09:34:08Z","snapshot_observed_at":"2026-08-08T02:32:41.958431Z","submitted_at":"2026-06-02T09:34:08Z","title":"OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T09:31:56.289129Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2606.03392"},"observation_digest":"sha256:397a0935c429f03a44cb8744925d840645913b064d858271025b396624102ebe","observation_id":"12d49e0d-37ca-4ab3-97e5-d7c91875184a","resolution":{"observed_at":"2026-07-02T03:56:35.237371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2606.23157","last_updated":"2026-06-22T11:01:56Z","snapshot_observed_at":"2026-08-06T06:07:16.816129Z","submitted_at":"2026-06-22T11:01:56Z","title":"Bridging Semantics and Kinematics: A Modular Framework for Zero-Shot Robotic Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T08:28:33.173481Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2606.23157"},"observation_digest":"sha256:f140963a50fcb617432a5807414d7afa51ad1723ca296d5b156ed0fe3189c086","observation_id":"668abe37-031f-4b57-9a78-5655687e2540","resolution":{"observed_at":"2026-07-04T10:49:46.318532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-11T19:52:24.975588Z","title":"arXiv preprint arXiv:2505.21906 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04352","last_updated":"2026-07-05T15:16:44Z","snapshot_observed_at":"2026-08-09T21:47:03.422034Z","submitted_at":"2026-07-05T15:16:44Z","title":"Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-11T19:52:24.975588Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2607.04352"},"observation_digest":"sha256:5bb6844f7f64818e40b162b39c21e017fb72136b7b6089ed852ac7fb719308de","observation_id":"89823bb4-2bfc-4161-b2cc-78d9df11fd8a","resolution":{"observed_at":"2026-07-11T19:52:24.975588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-02T05:16:43.005296Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-14T22:24:29.635626Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:43.005296Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:022d7db27daf2ab749842cac424c79e0f81ab8e4e7505fd37d706ef59218ffba","observation_id":"731e90b9-b286-469b-b613-037f883a850c","resolution":{"observed_at":"2026-08-02T05:16:43.005296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-15T15:08:10.115509Z","title":"arXiv preprint arXiv:2505.21906 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-15T15:01:29.095276Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.115509Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:87462e82ee36cbd6c82afc3506b7b19ceb406facec171e0f731388c75a4aa50b","observation_id":"7182c33b-5725-4bcf-a650-ddc8ef32db45","resolution":{"observed_at":"2026-08-15T15:08:10.115509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21906/citation-record","integrity":"/paper/2505.21906/integrity","json":"/paper/2505.21906/citation-record.json","paper":"/paper/2505.21906"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T13:25:56.965076Z","title":"pi_0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:56.965076Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:5010f8e3ec855077d7b27f087de3c8c0c792f88c0fb5e909aaf3a3ec4f2bc728","observation_id":"6d21ea7c-2866-435c-973f-a3dd8583ba81","resolution":{"observed_at":"2026-08-07T13:25:56.965076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-07T13:25:57.008943Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control.arXiv preprint arXiv:2502.05855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.008943Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:9ff234a84db6fcba0467a2a96a87ba458ae923b1b177a58f651cd1d0975dc713","observation_id":"7d0d4bab-577a-4f16-9761-867515298871","resolution":{"observed_at":"2026-08-07T13:25:57.008943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T13:25:57.109866Z","title":"pi0.5: a vision- language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.109866Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:9bcc0cf844fdff1ff7214408f780af8fdeaba6dd17568beb744ede9264ed6e7e","observation_id":"2eb6be59-bc76-4caf-92a2-b347b7b136a4","resolution":{"observed_at":"2026-08-07T13:25:57.109866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19250","last_updated":"2025-02-28T15:17:11Z","snapshot_observed_at":"2026-08-14T18:15:28.871426Z","submitted_at":"2025-02-26T15:56:36Z","title":"ObjectVLA: End-to-End Open-World Object Manipulation Without Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19250","snapshot_observed_at":"2026-08-07T13:25:57.204158Z","title":"Objectvla: End-to-end open-world object manipulation without demonstration.arXiv preprint arXiv:2502.19250, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.204158Z"},"links":{"cited_paper":"/paper/2502.19250","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:3fc7ab7fdd41f47f48a55c851df59bb3798622fcdd5c53b5305423809193643f","observation_id":"b7ff553a-31a7-429b-a864-bd232afe9cda","resolution":{"observed_at":"2026-08-07T13:25:57.204158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T13:25:57.263110Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.263110Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:6d3d5c35acb14bbd3df6b4b37f09ab73692666954a909f4beefe93fbcbe0b7c0","observation_id":"c8acab03-d2af-4d4d-9344-82a6bb1694e4","resolution":{"observed_at":"2026-08-07T13:25:57.263110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:25:57.337520Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.337520Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:ab22b9d1274d15b4225ce2ada3e1ce37ffd8b9249fd854e82e9e74d319c9dc59","observation_id":"3e18183a-1248-4276-82f8-ec2f5c3291ae","resolution":{"observed_at":"2026-08-07T13:25:57.337520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14420","last_updated":"2025-02-21T07:28:36Z","snapshot_observed_at":"2026-08-13T05:13:05.757972Z","submitted_at":"2025-02-20T10:16:18Z","title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14420","snapshot_observed_at":"2026-08-07T13:25:57.438562Z","title":"Chatvla: Unified multimodal understanding and robot control with vision-language-action model.arXiv preprint arXiv:2502.14420, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.438562Z"},"links":{"cited_paper":"/paper/2502.14420","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:8866ef9d6615ffb3905ed6e35564365652d04a03ae63d07c08c503bca39e969c","observation_id":"226371c4-8467-4e3d-a7c1-017f7d6f1c8c","resolution":{"observed_at":"2026-08-07T13:25:57.438562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:57.561396Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting.Advances in Neural Information Processing Systems, 36:74952–74965, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.561396Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:c0090e7f290a7cb427c5518ee357baae33a82dc438bdcc0b828cba6e7d7b9171","observation_id":"e2c7eacb-e3b7-463d-8742-a214e14fb596","resolution":{"observed_at":"2026-08-07T13:25:57.561396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-07T13:25:57.600571Z","title":"Reasoning models can be effective without thinking.arXiv preprint arXiv:2504.09858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.600571Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:618a449a3e67d6184413425d86b648a4dbf3adee9ab056b8a63b0df3d80a24e9","observation_id":"a6947f35-87a2-46e3-a53d-f8d9265340f5","resolution":{"observed_at":"2026-08-07T13:25:57.600571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:07.692912Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"3f482953-20f3-47aa-af5e-a8e6fe51b7d4","year":null},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.679874Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:00351322eccc622ea5e659dc84346a5b1aa9e3b1a76625a603735b28c2436fd1","observation_id":"33193132-135f-45ea-9ddc-72f63e163e57","resolution":{"observed_at":"2026-08-07T13:26:08.242054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:57.744476Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.744476Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:b9b772386d847d83a36579a8c287c09ff923681ceb920ee1389749c1413058e4","observation_id":"55827294-2694-4182-b4dd-68de7dac08c1","resolution":{"observed_at":"2026-08-07T13:25:57.744476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:07.240843Z","title":"Visual reinforcement learning with self-supervised 3d representations.IEEE Robotics and Automation Letters, 8(5):2890–2897, 2023","venue":null,"work_id":"34a2c77a-3193-4003-ac9d-e2e89a6719a6","year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.799763Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:fba11f466525fff29be3fd628e88e97e2a2fc4674b3a824868782ecd3788e0b8","observation_id":"548aeeac-794b-4726-977f-088f427409c4","resolution":{"observed_at":"2026-08-07T13:26:07.416228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18707","last_updated":"2025-03-21T16:30:58Z","snapshot_observed_at":"2026-08-13T08:07:33.523904Z","submitted_at":"2024-09-27T12:50:52Z","title":"Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18707","snapshot_observed_at":"2026-08-07T13:25:57.876058Z","title":"Discrete policy: Learning disentangled action space for multi-task robotic manipulation.arXiv preprint arXiv:2409.18707, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.876058Z"},"links":{"cited_paper":"/paper/2409.18707","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:d4f6e7eedaa5eae6e49cd58182e4ebcb7276dc22f5d96b6813792cf00f593a10","observation_id":"82d8ebb0-3fe7-4a9c-8a86-7b1672f396dc","resolution":{"observed_at":"2026-08-07T13:25:57.876058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T13:25:57.945809Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:57.945809Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:e60c6eba7cb4a28e925a9b8a8a8ca9004746d22b35bba9a05db33d9130a32763","observation_id":"746f057e-c8de-4848-a8d1-5f557a1b7376","resolution":{"observed_at":"2026-08-07T13:25:57.945809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.958228Z","title":"Any2policy: Learning visuomotor policy with any-modality.Advances in Neural Information Processing Systems, 37:133518–133540, 2024","venue":null,"work_id":"8de74fad-b66f-4e75-8ddc-d4f8e0ded2e3","year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.024745Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:9b43fc6cb7720c8250916fb002574aa13e603b3bfa4f5740396cc4eff546e884","observation_id":"21d30c9c-8d72-4997-8f6e-6fced690ce5d","resolution":{"observed_at":"2026-08-07T13:26:07.045644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-07T13:25:58.104075Z","title":"Any-point trajectory modeling for policy learning.arXiv preprint arXiv:2401.00025, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.104075Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:2b81085d157e983466223a05887cc5bd14cd2ff783a6be987f050621044f7be1","observation_id":"0fc88331-e5bd-4b89-86b6-6607624c4309","resolution":{"observed_at":"2026-08-07T13:25:58.104075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:58.168750Z","title":"Retrieval-augmented embodied agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.168750Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:c67d7928fd1224d5f2445a7e17afbe950f472dedb76d56983d75685ebd7a2ced","observation_id":"695fd35d-8c9e-4a2a-9aff-31d95383513d","resolution":{"observed_at":"2026-08-07T13:25:58.168750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T13:25:58.193106Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.193106Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:a0b30db670ab3af9fce1664190383e9c5e5fc130c8bcf4bb1837de3059a2d1d2","observation_id":"52a0c22d-9591-43c9-b18b-14c2a596b3f8","resolution":{"observed_at":"2026-08-07T13:25:58.193106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.729127Z","title":"Rt-affordance: Affordances are versatile intermediate representations for robot manipulation, 2024","venue":null,"work_id":"5a2fdb92-ba9f-4240-a5cd-6ca1ae44dfce","year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.264752Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:72f43978a72736ad55a9a3fb724cfd7fec6ef819ca973437f7a1b912398a451b","observation_id":"91f2e76f-3719-4539-ae8b-4878063b1871","resolution":{"observed_at":"2026-08-07T13:26:06.837973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T13:25:58.334777Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.334777Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:f13e6323fae447618f679298035d525ce055d54fd9c5b7038e57545937c9983d","observation_id":"a6aaff8d-86cc-47f4-928e-d0788e7ca553","resolution":{"observed_at":"2026-08-07T13:25:58.334777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18623","last_updated":"2024-12-14T18:38:03Z","snapshot_observed_at":"2026-08-12T10:57:30.698813Z","submitted_at":"2024-11-27T18:59:52Z","title":"Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18623","snapshot_observed_at":"2026-08-07T13:25:58.416037Z","title":"Lift3d foundation policy: Lift- ing 2d large-scale pretrained models for robust 3d robotic manipulation.arXiv preprint arXiv:2411.18623, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.416037Z"},"links":{"cited_paper":"/paper/2411.18623","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:070f810eb4e03bf68eb5a0c2261d99f95798daaae1297846239b5b32233bbfe8","observation_id":"7dab7c23-ac78-4632-82d9-6c8438b81bed","resolution":{"observed_at":"2026-08-07T13:25:58.416037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-08-15T09:21:12.808847Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-07T13:25:58.459946Z","title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation.arXiv preprint arXiv:2412.13877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.459946Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:ae6755ea9ee0b9ba828b26bd7199f273a7978a8d6794b6b7a6eaf5f1c0a97bf3","observation_id":"b8c7d9c8-7e39-4594-be27-af871733f963","resolution":{"observed_at":"2026-08-07T13:25:58.459946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.523978Z","title":"Mail: Improving imitation learning with selective state space models","venue":null,"work_id":"b5801611-b8f9-41f8-ae21-140933f6a882","year":null},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.524746Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:6688de30e2350913ee5139601ac2570a9a11843af2196789078a63addfe862d3","observation_id":"adcd24dd-49c7-46ca-b096-e49bb0e0f592","resolution":{"observed_at":"2026-08-07T13:26:06.587781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T13:25:58.704747Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.704747Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:fb9210d0eed2d15738dbe4a69a7ca48530462811ef5f64a4bff24101f5413a09","observation_id":"a59c795f-e8ad-4785-b17f-5edc3faddf78","resolution":{"observed_at":"2026-08-07T13:25:58.704747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T13:25:58.804742Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.804742Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:71712023cf476e72fd26a8a7a68a70f8bfdcea1eeb893e20fc66cc21a468fd67","observation_id":"7b8e407a-0420-49b2-a79f-b764eee9cfff","resolution":{"observed_at":"2026-08-07T13:25:58.804742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.371521Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"0d79df59-74b1-4145-a9a6-9f6d470e1feb","year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.854746Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:5424c9ddc537958916e11a1a7e50b40c2b7d3bbcf61e3a2ed711e5983d2ad29b","observation_id":"6abf7fac-59dc-445e-9a07-4e67f2b4dee9","resolution":{"observed_at":"2026-08-07T13:26:06.454384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-07T13:25:58.919499Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation.arXiv preprint arXiv:2409.12514, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.919499Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:1155e20290312f99c29ca131d9d36370680fda1fc1b88c5374b5351d052584f1","observation_id":"81db2c8e-c22d-4e86-922d-84ed3e3cf046","resolution":{"observed_at":"2026-08-07T13:25:58.919499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T13:25:58.994292Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.994292Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:9cdb11bebc03cf8a78b5764b0215ef8a37d90c307b6559b2e55bb18fb16c0a04","observation_id":"36c10730-9e37-41bf-b368-2dfca4b73650","resolution":{"observed_at":"2026-08-07T13:25:58.994292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:59.088384Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.088384Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:4509d2ac60fa2a360f186b7d8e1078b768ea6e6b2193af5eed8b0051a807b559","observation_id":"b796f4bb-a1f0-4644-a7fa-f65ecb5fcd9a","resolution":{"observed_at":"2026-08-07T13:25:59.088384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T13:25:59.190957Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.190957Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:a5123bf39fe26c0e0f43ea86d10dd17a07d5295f6c268b0929fd1f5db9eb2eba","observation_id":"ff4ebc0e-ca74-4e34-8d29-d2164948b1de","resolution":{"observed_at":"2026-08-07T13:25:59.190957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-07T13:25:59.326038Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.arXiv preprint arXiv:2303.04137, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.326038Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:70827cbb93579921603d3a2ef4b9fa1192da54b3c716f74d83f41eba4674465d","observation_id":"1c4177d1-3793-4444-824e-03d8bf31e882","resolution":{"observed_at":"2026-08-07T13:25:59.326038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01531","last_updated":"2024-10-24T22:01:44Z","snapshot_observed_at":"2026-08-15T13:45:34.825273Z","submitted_at":"2024-07-01T17:59:56Z","title":"Sparse Diffusion Policy: A Sparse, Reusable, and Flexible Policy for Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01531","snapshot_observed_at":"2026-08-07T13:25:59.434850Z","title":"Sparse diffusion policy: A sparse, reusable, and flexible policy for robot learning.arXiv preprint arXiv:2407.01531, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.434850Z"},"links":{"cited_paper":"/paper/2407.01531","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:78613ad936367956d6e26d8cce50efea050876dd004bfcb6d9ca83bc9ef42b32","observation_id":"a1ddc19d-7136-4002-968a-9f7bb5a87959","resolution":{"observed_at":"2026-08-07T13:25:59.434850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07503","last_updated":"2024-06-28T21:56:25Z","snapshot_observed_at":"2026-08-13T00:09:10.628885Z","submitted_at":"2024-05-13T06:53:42Z","title":"Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07503","snapshot_observed_at":"2026-08-07T13:25:59.481710Z","title":"Consistency policy: Accelerated visuomotor policies via consistency distillation.arXiv preprint arXiv:2405.07503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.481710Z"},"links":{"cited_paper":"/paper/2405.07503","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:4b61ee2433cb585114f1f8f22d05435a154a8f20097ea5ac6a646fa6de9c2423","observation_id":"dfc82a78-bea8-472f-b61d-6ecc9759d7a4","resolution":{"observed_at":"2026-08-07T13:25:59.481710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T13:25:59.546972Z","title":"Training diffusion models with reinforcement learning.arXiv preprint arXiv:2305.13301, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.546972Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:a2ecb19929fae6b0c31d63c3c9771a8281d3807f8889d5d7e53ebaee3a42603f","observation_id":"c055702b-42d5-45a5-8da6-aebad243287c","resolution":{"observed_at":"2026-08-07T13:25:59.546972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-07T13:25:59.631774Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models.arXiv preprint arXiv:2310.10639, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.631774Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:e152cad8367bb5e8d3d8260bf4ea2ffff2dcaedd83fdb938220f87d42d0783de","observation_id":"e7560aca-d665-465d-8b2a-f544313c6dcc","resolution":{"observed_at":"2026-08-07T13:25:59.631774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10088","last_updated":"2024-10-14T02:02:54Z","snapshot_observed_at":"2026-08-12T22:24:11.323384Z","submitted_at":"2024-10-14T02:02:54Z","title":"The Ingredients for Robotic Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10088","snapshot_observed_at":"2026-08-07T13:25:59.736105Z","title":"The ingredients for robotic diffusion transformers.arXiv preprint arXiv:2410.10088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.736105Z"},"links":{"cited_paper":"/paper/2410.10088","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:92cc5b158504d4cb83731da54931b82c4f6e2f8d617506b6144e078ff171c092","observation_id":"be950bdd-6c22-4ced-8164-733187ea9338","resolution":{"observed_at":"2026-08-07T13:25:59.736105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.128588Z","title":"Data scaling laws in imitation learning for robotic manipulation, 2024","venue":null,"work_id":"65fa09cb-c9d4-443e-a77b-3379be980378","year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.815324Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:76b920fab4492375de4226f5e7e627320fecd7c4cffd583c8d143754703d824c","observation_id":"e91f4925-a14b-4183-be26-c6967b0680d2","resolution":{"observed_at":"2026-08-07T13:26:06.268768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.012574Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"59dc9622-620c-494a-893e-24e90689de9f","year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.947567Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:ff318cca5f9be280ffad6ab8d769b8e2069c92a90bc80cb3b5ad19f89da3ab9d","observation_id":"20673b07-97a8-47c7-8149-8c6dcc97bac2","resolution":{"observed_at":"2026-08-07T13:26:06.066280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.877057Z","title":"Aloha unleashed: A simple recipe for robot dexterity","venue":null,"work_id":"a9c32aef-4a1b-4357-9309-6c8fe32f9b09","year":null},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.024746Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:0d0601ab31bcc45fa2cbab713f4f35c73f4217286828a7211aa503f8a02ed0a1","observation_id":"c40028a2-2dd3-4dc3-9500-aae8fa2059bb","resolution":{"observed_at":"2026-08-07T13:26:05.930052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-08-13T04:12:17.261671Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-08-07T13:26:00.168043Z","title":"Fine- tuning of continuous-time diffusion models as entropy-regularized control.arXiv preprint arXiv:2402.15194, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.168043Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:772bb581b3485abfd03634dfc59d894d71a306e1d6ed8a1aa25c1129cf64ff47","observation_id":"33c41de6-8225-42ea-b84a-a0d2332fb78f","resolution":{"observed_at":"2026-08-07T13:26:00.168043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16359","last_updated":"2024-07-18T08:21:54Z","snapshot_observed_at":"2026-08-13T04:10:18.627858Z","submitted_at":"2024-02-26T07:24:32Z","title":"Feedback Efficient Online Fine-Tuning of Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16359","snapshot_observed_at":"2026-08-07T13:26:00.311389Z","title":"Feedback efficient online fine-tuning of diffusion models.arXiv preprint arXiv:2402.16359, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.311389Z"},"links":{"cited_paper":"/paper/2402.16359","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:5348736ef4d47a930fbb8f45a5e4c27e79596893d5179d5c87bee1fc4370e646","observation_id":"7a657ba2-5406-4fa1-a63d-7a7ebe6c9e00","resolution":{"observed_at":"2026-08-07T13:26:00.311389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T13:26:00.434117Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.434117Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:9652e72afac24e652420234bdafa2a970028350449a093ace3dddf2bdc7e89fd","observation_id":"17512fd7-14bc-4572-bf21-f5f0627d553b","resolution":{"observed_at":"2026-08-07T13:26:00.434117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14795","last_updated":"2025-02-21T08:09:14Z","snapshot_observed_at":"2026-08-08T12:11:17.544790Z","submitted_at":"2025-02-20T18:17:11Z","title":"Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14795","snapshot_observed_at":"2026-08-07T13:26:00.512531Z","title":"Humanoid-vla: Towards universal humanoid control with visual integration.arXiv preprint arXiv:2502.14795, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.512531Z"},"links":{"cited_paper":"/paper/2502.14795","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:1be5170bb87968b8aee51481e94c10a0844f24a330ef12a3539fa458da099619","observation_id":"f5564302-9a1c-45ad-88cd-5fc42a2d1342","resolution":{"observed_at":"2026-08-07T13:26:00.512531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-08-07T15:49:25.272514Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-08-07T13:26:00.558392Z","title":"Openhelix: A short survey, empirical analysis, and open-source dual-system vla model for robotic manipulation.arXiv preprint arXiv:2505.03912, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.558392Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:68d7ac83ffd1ac8f1016a505af39afb168ee152b07a1e72a6bf4d9a201bf025b","observation_id":"370bbd6c-6ff8-4ac2-b488-f84ef934979a","resolution":{"observed_at":"2026-08-07T13:26:00.558392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:00.681860Z","title":"Quar-vla: Vision-language-action model for quadruped robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.681860Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:bdc53106e26ffb6fa331f373da745ed8b31e5dfd990c9d712154d45d49ae9d7b","observation_id":"83bca668-757d-4639-8e0b-39db868c162f","resolution":{"observed_at":"2026-08-07T13:26:00.681860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-07T13:26:00.781836Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model.arXiv preprint arXiv:2503.10631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.781836Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:03e890ebac31f2d0598f1fd1ac01241111711ab248eddf4b526c001a946c66cb","observation_id":"dd9caa4d-7dad-4310-b342-57f2e7c467e9","resolution":{"observed_at":"2026-08-07T13:26:00.781836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-12T22:26:15.509923Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-07T13:26:00.871918Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.871918Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:510e81be9378d124fd257d60df38b4c4cd0ff10c6fc9d81ae6b3634497521996","observation_id":"b01c3a5a-9fba-4a2f-9007-4fd83e3b3deb","resolution":{"observed_at":"2026-08-07T13:26:00.871918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-07T13:26:01.016059Z","title":"Univla: Learning to act anywhere with task-centric latent actions.arXiv preprint arXiv:2505.06111, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.016059Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:dca96833b5c514d3d8fccea68f3617d3b49a6d1fda8d2634c12a0d93ae4ac958","observation_id":"3795b51a-6f3b-4b44-b2ac-45e454f1f574","resolution":{"observed_at":"2026-08-07T13:26:01.016059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.740550Z","title":"Robomamba: Efficient vision- language-action model for robotic reasoning and manipulation.Advances in Neural Information Processing Systems, 37:40085–40110, 2024","venue":null,"work_id":"ea4ddc5d-495a-41d1-bf5b-08de9455a650","year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.112089Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:805d5e581d1e5cefdaaf448097729c83d015db41ae608fe84a3247c2486dbf47","observation_id":"13683616-8f83-449b-9bcf-61f3e9db0953","resolution":{"observed_at":"2026-08-07T13:26:05.810394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:01.201975Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution.Advances in Neural Information Processing Systems, 37:56619–56643, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.201975Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:af4a7bd67f6ff25bee146fd0d068538883b773eb1d7e1fac03c1dd8eb96331d4","observation_id":"aebf1c98-049a-45c9-abfe-6ebad3420eea","resolution":{"observed_at":"2026-08-07T13:26:01.201975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-07T13:26:01.430507Z","title":"Graspvla: a grasping foundation model pre-trained on billion-scale synthetic action data.arXiv preprint arXiv:2505.03233, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.430507Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:365c3f94a482e312203bfdd5fe1bf07b346d41adef13640154158cc1bcaae86f","observation_id":"0e2c2f74-258b-4012-91f4-fda7d7938d15","resolution":{"observed_at":"2026-08-07T13:26:01.430507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-07T13:26:01.814858Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.arXiv preprint arXiv:2412.06224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.814858Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:f65236e034a727d460e23e63e5648e1cee0e3ba855460657c4c0d1d92f75ef94","observation_id":"d02f426d-edf6-4864-a9e6-ae8c32b90383","resolution":{"observed_at":"2026-08-07T13:26:01.814858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05450","last_updated":"2025-04-14T04:53:32Z","snapshot_observed_at":"2026-08-13T03:32:13.088185Z","submitted_at":"2025-02-08T05:01:17Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05450","snapshot_observed_at":"2026-08-07T13:26:02.337833Z","title":"Con- rft: A reinforced fine-tuning method for vla models via consistency policy.arXiv preprint arXiv:2502.05450, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:02.337833Z"},"links":{"cited_paper":"/paper/2502.05450","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:45172e49436d939a87603dc93c35c9005cac531d6af290001423bfd0eba74492","observation_id":"1bee1918-1f07-4b6a-b3bd-1b580917c248","resolution":{"observed_at":"2026-08-07T13:26:02.337833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:03.207138Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.207138Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:0a2ecd1755415f8cdeb911f85ab0046e6885f843fcd2e04d84060ea659ad7fdb","observation_id":"fc454b8e-d899-488d-9009-45f1e0e41b7c","resolution":{"observed_at":"2026-08-07T13:26:03.207138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T13:26:03.647132Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.647132Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:db79fe9f1cd9d2ef362779cf97d3a6f00f0bb559846b2b57333ff5e4e41a9cc6","observation_id":"483ba450-c5cf-441a-b022-761b421380c2","resolution":{"observed_at":"2026-08-07T13:26:03.647132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-14T04:57:05.550863Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-08-07T13:26:03.787816Z","title":"Improving vision-language-action models via chain-of-affordance.arXiv preprint arXiv:2412.20451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.787816Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:d5bc13582b05058b01b1bf33f788f6358c2a034ffd73899f6ecb174bba8a89ee","observation_id":"e40c096e-f28b-4109-bf45-bfaee6bd7b19","resolution":{"observed_at":"2026-08-07T13:26:03.787816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-11T02:04:51.188806Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-07T13:26:03.827165Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models.arXiv preprint arXiv:2503.22020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.827165Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:2282a02c3f836fa3a71febd1109c160f345db55c971c31e5413d3967e2597ea1","observation_id":"f450f948-70e7-4198-8484-78173268b6a4","resolution":{"observed_at":"2026-08-07T13:26:03.827165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-08-13T21:27:22.538668Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-07T13:26:03.866819Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations.arXiv preprint arXiv:2412.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.866819Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:5aba1e0a03e24eebb5d651bc0e2f1ae6d1edb9bfaa65a7cd9a0e7f7637f0e696","observation_id":"0b71bc9a-7055-4762-b6ba-40edfcfacf0e","resolution":{"observed_at":"2026-08-07T13:26:03.866819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-15T01:35:58.775756Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T13:26:03.902047Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.902047Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:3272096431ee205e964ae68fa8aad8622661d2bff020130c30e976120589cc28","observation_id":"e2f290be-f8a1-46c1-8e1c-654bbba7905d","resolution":{"observed_at":"2026-08-07T13:26:03.902047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:26:03.935938Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.935938Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:bc8a7af09a3ee65e94f4f14c41cc8982b13083582ec63d154961232620fef58a","observation_id":"b1a9f423-8651-4a84-80f2-4494d6b44898","resolution":{"observed_at":"2026-08-07T13:26:03.935938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14411","last_updated":"2024-11-14T11:59:09Z","snapshot_observed_at":"2026-08-12T22:40:11.927535Z","submitted_at":"2024-09-22T12:14:16Z","title":"Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14411","snapshot_observed_at":"2026-08-07T13:26:03.982384Z","title":"Scaling diffusion policy in transformer to 1 billion parameters for robotic manipulation.arXiv preprint arXiv:2409.14411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.982384Z"},"links":{"cited_paper":"/paper/2409.14411","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:b14499def0e426086b2b271def621cbcfb499caa59beafc5974b887f1e4d37f8","observation_id":"4971d5ef-374a-449f-8a17-49f31795baf1","resolution":{"observed_at":"2026-08-07T13:26:03.982384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T13:26:04.068620Z","title":"Deepseekmoe: Towards ultimate expert specializa- tion in mixture-of-experts language models.arXiv preprint arXiv:2401.06066, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.068620Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:bc2d18ce9e02a19969237e47faec961246e16eca36253967dd23cefaa230ba6d","observation_id":"c35bd5b3-604d-40bf-8062-347a8b121928","resolution":{"observed_at":"2026-08-07T13:26:04.068620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-07T13:26:04.124888Z","title":"Pointvla: Injecting the 3d world into vision-language-action models.arXiv preprint arXiv:2503.07511, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.124888Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:2fb85927248d22841bf1fcb81ff8f85e593e709c3a6e5d5b4932927f82097abb","observation_id":"dcd4bf35-08f6-4584-8d82-ba1130d069e3","resolution":{"observed_at":"2026-08-07T13:26:04.124888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T13:26:04.195405Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.195405Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:2e42adad4c812ed831b88434946f956f67640d661199965be3159ccc92249783","observation_id":"98c2a8d3-5339-4cca-98f9-0c01eec39b24","resolution":{"observed_at":"2026-08-07T13:26:04.195405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.538113Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"36f7f8f2-a0c6-4c6d-9332-cd19ae951f76","year":2014},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.228991Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:881c1d42cbb1a6e2b1510c4afaf2c71f0d3844a9c23c9db1ed42a177c0a30427","observation_id":"282edde4-87b7-421b-92d2-41e24090bf53","resolution":{"observed_at":"2026-08-07T13:26:05.650792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.362622Z","title":"Towards vqa models that can read","venue":null,"work_id":"36a9f864-653c-4d72-8d55-e9fd8ace6055","year":2019},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.282209Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:200d2f900515bd1365f57fce991c814b64608cf100d68706ec588d26947905fc","observation_id":"04eea78b-1e08-4379-92fc-403f3015ca81","resolution":{"observed_at":"2026-08-07T13:26:05.480969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:04.344657Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.344657Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:8791638d9000e9e94c2b64840e7374621da7684efcdf567377c9b98a8fdea28c","observation_id":"61f29ec0-7e88-4d1d-985f-f887751adcd3","resolution":{"observed_at":"2026-08-07T13:26:04.344657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.197349Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"0486b721-5a35-494b-89a1-3e882cd2ab1b","year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.383484Z"},"links":{"citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:2c0051973dce569f6bd22f1aa05a822559b4926d8b9443aa6b98292de5e2d2a6","observation_id":"4f543ec4-7f8f-4b01-ba79-aae7b6ba8950","resolution":{"observed_at":"2026-08-07T13:26:05.274977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 21 inbound Pith citation observations for arXiv:2505.21906."}