{"as_of":"2026-08-10T06:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c8b403f73a4447403ae7947babdf11cc0d3739c77083a5e2e6c395c28f414eb","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:19:50.356389Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04633/citation-record","integrity":"/paper/2608.04633/integrity","json":"/paper/2608.04633/citation-record.json","paper":"/paper/2608.04633"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:46.396151Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.396151Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:5d773ea7f66cf0051a156214781149b0a8f1bbfdf69d77a0b5ff0edc0d5cc186","observation_id":"26f9b6b8-c9c3-4892-ab74-7105435e5b9f","resolution":{"observed_at":"2026-08-06T20:19:46.396151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T20:19:46.446123Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.446123Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:b6e03207d9b147830bb4aac5fd93c2e1f7cbce94f348ce9221c2b48d172471db","observation_id":"3f472e05-b48c-4833-8843-c2850544695d","resolution":{"observed_at":"2026-08-06T20:19:46.446123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T20:19:46.520992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.520992Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c791c88c6c139a9189152df04938b73d03e012f744a38a3bb91917a3c7b6d412","observation_id":"b922b83f-7d15-4061-8911-9e7cd6d05b4e","resolution":{"observed_at":"2026-08-06T20:19:46.520992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T20:19:46.577353Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.577353Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c1e048764f75b07b75f84403771af5fed4a8decf615fb385bb769b6ba8f7573f","observation_id":"e68b6461-d7a1-4051-8dcd-6f2b3aea963b","resolution":{"observed_at":"2026-08-06T20:19:46.577353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.772175Z","title":null,"venue":null,"work_id":"b60d27c6-f4e0-460d-8279-68e1719ae45c","year":2026},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.671171Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:03901c1090700649327cd49d5807d1fa6cb20a6ea3a9b3f6c0052f2249ee6f2d","observation_id":"5194fd60-de51-48a8-aec8-e97196c28576","resolution":{"observed_at":"2026-08-06T20:19:52.863591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-06T20:19:46.803171Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.803171Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:16a56c8a423d4dcab8cb7340dd98b8336401d5ede39d2709623f70b445abefab","observation_id":"db459a88-3610-46fd-9aaa-6187dbaf2234","resolution":{"observed_at":"2026-08-06T20:19:46.803171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:46.923578Z","title":"Singh, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.923578Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:9e5120212136085cdb993966edf08a03866cbabaf5ead723c7385b10ce4a163c","observation_id":"9cd5a458-dec3-4ee2-b750-754efc5b8c04","resolution":{"observed_at":"2026-08-06T20:19:46.923578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.003040Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.003040Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:a8d75e729578b419c7e0ea7e82a19fe6e5aabce23d81b26bb62cd947d5edf683","observation_id":"92770e72-495c-422f-923d-8c5a48bad184","resolution":{"observed_at":"2026-08-06T20:19:47.003040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.078147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.078147Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:25fd73746a2deec352c786b5596a3c6d2a6c6f07af8518bb67ca29895574f210","observation_id":"13e9efc7-a1bd-46c6-8d49-60b75febcc95","resolution":{"observed_at":"2026-08-06T20:19:47.078147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.521227Z","title":null,"venue":null,"work_id":"c4e0898e-ffcd-407b-a085-e8be80197239","year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.155194Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:fe4dde3ca01eade766ab522050b7edf8b782a15638ee72739512fba68407a66e","observation_id":"ab78dc4e-908e-443f-8b81-016d8a0891fd","resolution":{"observed_at":"2026-08-06T20:19:52.636357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.208817Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.208817Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c4bf81f73bb8952e2da3f99286a6410c5ff1c174aae3d29ade8c91583dfb9135","observation_id":"1e5c079e-cc74-487e-944a-c312cd13ca68","resolution":{"observed_at":"2026-08-06T20:19:47.208817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T20:19:47.275991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.275991Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c42d10d404e9d3bd9b4a0c3d42cfead9ee20442e7fe125dc264e8c8f4d8e8caa","observation_id":"1f34d831-2310-4095-a423-78be06bfecb4","resolution":{"observed_at":"2026-08-06T20:19:47.275991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.321746Z","title":null,"venue":null,"work_id":"c48adf06-c4dd-422e-847f-d6b156e89772","year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.359540Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:9dbe64cd92524f798e0e04a287e419956f0eb0a5c84752b8375712bb36013ed4","observation_id":"677ce944-fbae-4bbe-babe-38852f0f9f5e","resolution":{"observed_at":"2026-08-06T20:19:52.408288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T20:19:47.403646Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.403646Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c765c072e1df98e981cb28fdda3af96470dfadd488e74b4c7d2bd565695f6154","observation_id":"6238bce0-fabf-42d2-a31d-6f4a6730eef1","resolution":{"observed_at":"2026-08-06T20:19:47.403646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.113954Z","title":"O’Neill, A","venue":null,"work_id":"e1073c33-7927-4298-869f-5d081888432a","year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.510694Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:5f44aecef7cbd0decb2ea0d18c569aac5c80f7540e6b6339e8c01817041affb6","observation_id":"def2df4a-59f4-4fa3-9f90-ec4a4a19695f","resolution":{"observed_at":"2026-08-06T20:19:52.215031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-06T20:19:47.572949Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.572949Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:70504b4cf96d2a3d4b9ea9b00c36c2315b28c4847e24fd5207c568c06e0d6fd6","observation_id":"567b9100-3b8f-489b-9b99-5978f5f252dd","resolution":{"observed_at":"2026-08-06T20:19:47.572949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-06T20:19:47.653884Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.653884Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:f234917231aa561aab090cdf52e2e410c801dc0becc4bb732d8346ae2c910475","observation_id":"a909a4b9-f254-43ae-83a7-e22beb324557","resolution":{"observed_at":"2026-08-06T20:19:47.653884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-06T20:19:47.739039Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.739039Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:a794e7528f7b08605fb399905855666443f1795b87c35345534747143551ca64","observation_id":"29970e42-475e-44e3-9b81-74697dd96599","resolution":{"observed_at":"2026-08-06T20:19:47.739039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-06T20:19:47.832939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.832939Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:dd6a68f954e26dd41e871b147870c9825c19853a66b8791203ba7e610d88dd50","observation_id":"22e3fb0a-6958-4a39-a54f-fa6f9591b62a","resolution":{"observed_at":"2026-08-06T20:19:47.832939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.896250Z","title":"Shridhar, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.896250Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:91cce1b174969c8085f0a1d0772e128c05bae7a4df7023dd295bd80ffc5e6177","observation_id":"d55763d2-e79f-4c5a-aa60-919c89b1877a","resolution":{"observed_at":"2026-08-06T20:19:47.896250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17817","last_updated":"2023-10-19T19:36:31Z","snapshot_observed_at":"2026-07-06T15:48:55.605324Z","submitted_at":"2023-06-30T17:34:06Z","title":"Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17817","snapshot_observed_at":"2026-08-06T20:19:47.935248Z","title":"Gervet, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.935248Z"},"links":{"cited_paper":"/paper/2306.17817","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:3d20a3de425328be5109e7161cc93e8ad1f412deb64394d285c5727658a5cafb","observation_id":"5947d0b1-08dc-443b-a0ca-54017e52ee19","resolution":{"observed_at":"2026-08-06T20:19:47.935248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:48.011334Z","title":"Goyal, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.011334Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:9e31ccceb9a587d42c10173732a12b90abe9c0dc1b7d2cbfdcf95dd373f7f280","observation_id":"43fa7b85-4d46-44ac-9aa4-378678dda7dc","resolution":{"observed_at":"2026-08-06T20:19:48.011334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08545","last_updated":"2024-06-12T18:00:01Z","snapshot_observed_at":"2026-08-08T15:01:31.827555Z","submitted_at":"2024-06-12T18:00:01Z","title":"RVT-2: Learning Precise Manipulation from Few Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08545","snapshot_observed_at":"2026-08-06T20:19:48.095191Z","title":"Goyal, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.095191Z"},"links":{"cited_paper":"/paper/2406.08545","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:71dd3a77f9567ef848dcdaf70cf62ff32a6618ed1501351134acaa18e1eb6e75","observation_id":"3da0a491-2e47-4f1f-95f8-48f090164ce9","resolution":{"observed_at":"2026-08-06T20:19:48.095191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-06T20:19:48.187917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.187917Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:6a1a2a5bb453970db6d477650b94f78953ba98877d900efc77d74ffad3ba0cc1","observation_id":"e1e07334-0fca-48ef-b91e-2331ec311f7d","resolution":{"observed_at":"2026-08-06T20:19:48.187917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00807","last_updated":"2026-05-14T15:06:31Z","snapshot_observed_at":"2026-08-09T17:12:35.323632Z","submitted_at":"2026-01-31T16:34:52Z","title":"Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00807","snapshot_observed_at":"2026-08-06T20:19:48.268018Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.268018Z"},"links":{"cited_paper":"/paper/2602.00807","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:4ab0d7d21b8a5efa725948fbb4b8e45babb09e446932af9898d28dcb7d610afe","observation_id":"b1fd0a23-d6f6-41c7-a9e3-d7f7e487a763","resolution":{"observed_at":"2026-08-06T20:19:48.268018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-08-06T20:19:48.331513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.331513Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:352428b8e5aea93dea2feb024aeb26e99505bb59aeac212d439139998d2da711","observation_id":"752060ec-438d-4d3c-ad9e-06c242fde276","resolution":{"observed_at":"2026-08-06T20:19:48.331513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.900072Z","title":null,"venue":null,"work_id":"738ef9a1-acbd-4bb7-a7e2-7da18994edff","year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.393864Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:270853c84a2ec766b8b1f4f66de1e169a2266d966192cc0ef3da3d36aabed555","observation_id":"c046748c-8091-4aee-bbdd-93269d49b7a9","resolution":{"observed_at":"2026-08-06T20:19:51.983253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14836","snapshot_observed_at":"2026-08-06T20:19:48.478639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.478639Z"},"links":{"cited_paper":"/paper/2510.14836","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:aead63e8d25c913f23c10070841035c7abc0ebc465db0e27cf34e2ef0ccf884e","observation_id":"cc182fc0-0a71-483b-a2dc-10046dc23220","resolution":{"observed_at":"2026-08-06T20:19:48.478639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-06T20:19:48.534851Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.534851Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:1224bd8f8ae0b5f38f4d92c9bd8892059903c36a522338e60582c722152b6a64","observation_id":"25f249e9-f40e-49e6-b0ef-f99092c85327","resolution":{"observed_at":"2026-08-06T20:19:48.534851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-08T17:47:58.330839Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07060","snapshot_observed_at":"2026-08-06T20:19:48.590609Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.590609Z"},"links":{"cited_paper":"/paper/2601.07060","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:6edb2a476124b8a93944ca16144b7bca6109d71b0dc7184de6bccbc869d0f9d9","observation_id":"767aec74-c80d-4bca-8b52-692215445dc4","resolution":{"observed_at":"2026-08-06T20:19:48.590609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07982","snapshot_observed_at":"2026-08-06T20:19:48.667454Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.667454Z"},"links":{"cited_paper":"/paper/2507.07982","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:a6cc92628a6fc5253ef79e4343682c5ae6324a332d7ec86389c0b07c39221afe","observation_id":"a8669714-812a-40b7-8883-a0c45c288110","resolution":{"observed_at":"2026-08-06T20:19:48.667454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:48.767277Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.767277Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:7bb4a6c8ec115709ebe47019455789b994e65e9a0e21d9c188184b6608d83276","observation_id":"cd9d14f8-9612-487f-8ec8-2cde133f0f58","resolution":{"observed_at":"2026-08-06T20:19:48.767277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:48.843593Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.843593Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:12523ccdefadd9508ff2e66313f62b9e3e571bddc58469d8dc6635f296dd433d","observation_id":"06563ac3-47a8-4429-baa6-b30e995206c1","resolution":{"observed_at":"2026-08-06T20:19:48.843593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:19:48.975765Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.975765Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:9abb1e4541fedf349781b8c62ddfef98fb77182081696ed9c982c27991cda1f5","observation_id":"d672b3e2-c805-4b58-81a8-5925afb5e535","resolution":{"observed_at":"2026-08-06T20:19:48.975765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-06T20:19:49.097273Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.097273Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:22841aeb26be0224ede981d0549705526a5ba787883bf8c9919129c2c7474cb2","observation_id":"cc9f1646-a4c2-418a-b34c-61d6444f36c1","resolution":{"observed_at":"2026-08-06T20:19:49.097273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.645138Z","title":"Rombach, A","venue":null,"work_id":"8e7f3b74-3a0b-43d2-a202-3a2e5d551e32","year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.191361Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:a97d8e922e348b42df096ea704250b6426829cccb3137863ea4cda86f24aa319","observation_id":"23102af3-4a0e-486f-b583-ba540c05c04d","resolution":{"observed_at":"2026-08-06T20:19:51.738404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:49.316462Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.316462Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:8f546ce349164d7e996cc86c46d06e2ef6c6e2cd8c2e3390d8b72a19321b34de","observation_id":"1c149296-e834-440a-89e7-1cfb36079b83","resolution":{"observed_at":"2026-08-06T20:19:49.316462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:49.424569Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.424569Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:b9c5219ff5c5dc6664c42bfaa2bda2db001aff303a9b97e88057b6c8e9b057fd","observation_id":"1a4a7068-291a-4154-a9ff-248e47bae85a","resolution":{"observed_at":"2026-08-06T20:19:49.424569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.421833Z","title":null,"venue":null,"work_id":"3ed9577c-6179-4188-b530-8d0e2872fb99","year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.557016Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:4671ac1c26ea5b85e58b01045edb64d72869acf040ec52c241a46f1227d7baaa","observation_id":"37bcff39-8ec9-46f8-838f-803038cf6f9b","resolution":{"observed_at":"2026-08-06T20:19:51.501211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-06T20:19:49.656649Z","title":"Shukor, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.656649Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:34bb73678fec2f8b40d20e8e818db4da8950cf7199776278e857f8dbe0cbee57","observation_id":"d46dfc98-2a71-4997-be37-2ba63028c1af","resolution":{"observed_at":"2026-08-06T20:19:49.656649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:49.758226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.758226Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:3a33c94d424c7f1a299c414efc80a3621bc799ab99d7db32f2db5261e33f4e51","observation_id":"ef3bd510-365b-4b64-a3ab-bce873a810f5","resolution":{"observed_at":"2026-08-06T20:19:49.758226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-06T20:19:49.893880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.893880Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:1626ce82e703d5923b3a767dad3b34a14a2a325cefb5a831170702dc12ebdc87","observation_id":"c004a486-b24f-41c0-8c5f-aa26d8d09415","resolution":{"observed_at":"2026-08-06T20:19:49.893880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.212359Z","title":null,"venue":null,"work_id":"9569f5ee-e87c-4a4e-9b3c-d8fc08d046ff","year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.988923Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:d117b809325f2be776cf2376f41425f5f09c0954e5583f3e55ae200e39dc187c","observation_id":"58340e5a-1563-48b3-8529-a965af4e892c","resolution":{"observed_at":"2026-08-06T20:19:51.283184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-04T13:24:32.760498Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-06T20:19:50.092976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:50.092976Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:b2a3a18c37722579021e03d807e156e7c5124c39d96eaca121b800d802df4283","observation_id":"479ab36c-5a63-4a51-90f5-cdbe56196a57","resolution":{"observed_at":"2026-08-06T20:19:50.092976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:50.211537Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:50.211537Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:db00655d31f1c3f8106582fd75b5c1d73572c12f5cd9c2ad7bd8311a8e1136b3","observation_id":"6e930a4c-d7e0-4273-b5c3-18d9d8fce342","resolution":{"observed_at":"2026-08-06T20:19:50.211537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-06T20:19:50.356389Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:50.356389Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:ef17735cd0bb60c1183a024b3a2cd71f06424057346d082f8f9f8e3934b67cfd","observation_id":"c57b9e74-d5e7-4767-8b1f-30d0aa36d0b2","resolution":{"observed_at":"2026-08-06T20:19:50.356389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2608.04633."}