{"as_of":"2026-08-07T07:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba173e5d93a310012ed9047fa6078bda1501c67b19bb363e8d28b1a86ad7db27","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:18:05.074641Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.23721/citation-record","integrity":"/paper/2602.23721/integrity","json":"/paper/2602.23721/citation-record.json","paper":"/paper/2602.23721"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T20:18:03.450845Z","title":"Openvla: An open -source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.450845Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:02b4795f0526cc62384259b7ead5d3362eb5c41268c9218bcee1bd095d997921","observation_id":"1e7f9b65-7ac1-4643-abde-cebf0f1662b3","resolution":{"observed_at":"2026-08-02T20:18:03.450845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:03.508441Z","title":"Joshi, Ryan Ju lian, Dmitry Kalashnikov, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.508441Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:eb88cb2a54a47474f473e69f83c9fe1604654e67b0ff765ee6e96850070281fa","observation_id":"cbfa63d4-0c29-4e5d-9237-ae9f1f273746","resolution":{"observed_at":"2026-08-02T20:18:03.508441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:03.581910Z","title":"Embodiedgpt: Vision -language pre -training via embodied chain of thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.581910Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:bf11af5f4494fa529fac0368a00d4405529602179d3c6ccb30ea0efe420c8672","observation_id":"30bdf333-dc13-4753-94d7-3fd28fcf000e","resolution":{"observed_at":"2026-08-02T20:18:03.581910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:03.610428Z","title":"Learning man ipulation skills 17 through robot chain -of-thought with sparse failure guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.610428Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:c78dcca0e032767259491867f2a41405c3bbb1485d622b92531b73f91b5322db","observation_id":"9bf22649-03f4-426f-89cb-e4ab87cf6680","resolution":{"observed_at":"2026-08-02T20:18:03.610428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:03.676641Z","title":"Robotwin: Dual -arm robot benchmark with generative digital twins","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.676641Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:3e6ab72b2a1335437a50b94e4fad60d5b21c34ea37ee2d6a02ca29320df7bf97","observation_id":"2b1745af-5682-4d0b-88f1-967fe4873be7","resolution":{"observed_at":"2026-08-02T20:18:03.676641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13966","last_updated":"2024-10-09T08:59:55Z","snapshot_observed_at":"2026-07-06T19:19:06.790588Z","submitted_at":"2024-09-21T01:06:39Z","title":"ScissorBot: Learning Generalizable Scissor Skill for Paper Cutting via Simulation, Imitation, and Sim2Real","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13966","snapshot_observed_at":"2026-08-02T20:18:03.745987Z","title":"Scissorbot: Learning generalizable scissor skill for paper cutting via simulation, imitation, and sim2real","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.745987Z"},"links":{"cited_paper":"/paper/2409.13966","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:961e44e57c2f5a8f298f2012b70de943d872c5375873bf600f8b48382dff20b3","observation_id":"7652a522-3584-4c3a-a5af-b0e15b82ebcf","resolution":{"observed_at":"2026-08-02T20:18:03.745987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:03.846413Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.846413Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:540eac92a6d8677df07aee2b45c151fd1376bb279365340caf2f5bbbfe97271c","observation_id":"90c90874-ddf0-4f14-b451-50dcbd0a5662","resolution":{"observed_at":"2026-08-02T20:18:03.846413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T20:18:03.950185Z","title":"Octo: An open -source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:03.950185Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:a5b0bdae33a1589e4a9c1a1a312460657f53e02e4939e68ce829c42b7c97c615","observation_id":"909cf3f7-a003-4757-8026-73c9a3ac6d0a","resolution":{"observed_at":"2026-08-02T20:18:03.950185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.104267Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.104267Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:88c2c022e54233396aa594bff67a517d71d6c9da89dab240b29393320e11d57f","observation_id":"78ac52c3-b240-4701-b864-ccd4b8d6fff9","resolution":{"observed_at":"2026-08-02T20:18:04.104267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.217696Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.217696Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:8a0cd2fa1fb206b912933bdb1c3bc77492e734abae8184edadc69a9c1b00ec08","observation_id":"bc9485fa-6219-4cfe-866e-769d957b8ef4","resolution":{"observed_at":"2026-08-02T20:18:04.217696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-02T20:18:04.300469Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.300469Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:53c1b2816a98e351283e86701700e475adad9031b10f1518da3b81ad7af1fdff","observation_id":"f064819c-76c3-44ea-82c3-1336c4c75be5","resolution":{"observed_at":"2026-08-02T20:18:04.300469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-05T12:05:09.343843Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-02T20:18:04.411902Z","title":"Prismatic vlms: Investigating the design space of visually -conditioned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.411902Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:a23a9c2db3aecdd6d3b23dad81e5f3872eb874906d0d300c87ffbf0eab5045a7","observation_id":"5921040e-8d6d-4937-8a54-344361682922","resolution":{"observed_at":"2026-08-02T20:18:04.411902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-02T20:18:04.500583Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.500583Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:88cbe747ffe8a1d5d3d95843f874a742d497a5afde84c2984efc8d3911574009","observation_id":"3fbf0f40-924e-4d9c-88a6-62798d7b7426","resolution":{"observed_at":"2026-08-02T20:18:04.500583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.608311Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.608311Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:9b1c235e14e91a62b5aa1ff251947b8da3f842ad82e93bf41c383136dd89a3aa","observation_id":"e8f7c67c-294d-43c4-abd9-0d4bf78fa1ef","resolution":{"observed_at":"2026-08-02T20:18:04.608311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T20:18:04.718646Z","title":"pi0: A vision -language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.718646Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:48b39ab4a9dd2cbe13e702bf34b028cece4976e5bd9799fc27cf66525e673725","observation_id":"8923ce87-c679-4116-b4d4-04d5b2c5308e","resolution":{"observed_at":"2026-08-02T20:18:04.718646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.781328Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.781328Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:3edd39371d62e19dbb21166a18e4017dd2b499fb701de37fc328ecd61fdb7129","observation_id":"0913954d-f737-4d18-a8d4-c57a5269c5d8","resolution":{"observed_at":"2026-08-02T20:18:04.781328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T20:18:04.850888Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.850888Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:fac750b4491ece03b5f4343fdc1deaab5cd780951224e89435aea3c35fea4aca","observation_id":"6098eb69-1345-472c-a857-7143b4121e82","resolution":{"observed_at":"2026-08-02T20:18:04.850888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-02T20:18:04.939146Z","title":"Towards generalist robot policies: What matters in building vision-language-action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.939146Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:22a2a3ce0488ea6ffa1aa6cfed932dc3ff337fa571e08bfdea7813ea58cb9fd6","observation_id":"87aaae01-72b2-4596-833b-9378e6f387a7","resolution":{"observed_at":"2026-08-02T20:18:04.939146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.943501Z","title":"Flower: Democratizing generalist robot policies with efficient vision -language action flow policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.943501Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:5e6c2787a0a82626608235a6f4f42fdd88ff14341b4310c071d9d09390969b69","observation_id":"084fe1bf-f199-42c7-be6f-d739ecef2c2b","resolution":{"observed_at":"2026-08-02T20:18:04.943501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-02T20:18:04.947501Z","title":"Video Prediction Policy: A Generalist Robot Pol icy with Predictive Visual Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.947501Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:d6a3b195e0228d9a5d20c79c6939d56ccfcd79888f69658a5b33697b6f1cd987","observation_id":"606138cf-ce84-4313-9db3-340f266a5d47","resolution":{"observed_at":"2026-08-02T20:18:04.947501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.951644Z","title":"Rt -trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.951644Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:a0bcff87ddbb535658e8937a6ce4026f319918555ab0e98f8a9620b1a1c5861f","observation_id":"d4b24b7b-723d-4b18-8249-1e491be764bc","resolution":{"observed_at":"2026-08-02T20:18:04.951644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.955986Z","title":"Pivot -r: Primitive -driven waypoint -aware world model for robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.955986Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:566fbe51ef794d1590bff434b3ab1dc7dacf481b442c520ef8febc689612bb7a","observation_id":"8804f380-13be-4d91-b5d0-bca1c2acb3ab","resolution":{"observed_at":"2026-08-02T20:18:04.955986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-02T20:18:04.960054Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.960054Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:c1d651cb0ce417f9df7b46d60fdce1460de66633cffc5ae1b976c3d13c4ac132","observation_id":"618d9953-7972-404f-886b-27fd379a01ee","resolution":{"observed_at":"2026-08-02T20:18:04.960054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-08-02T20:18:04.963693Z","title":"Dreamgen: Unlocking generalization in robot learning through neural trajectories","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.963693Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:b8d53f3821b033316434082ff373e0143db35c5ac85b318e3fbf991dbe3987eb","observation_id":"395e1886-863e-4193-a17a-3b0831c7a8b4","resolution":{"observed_at":"2026-08-02T20:18:04.963693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11528","last_updated":"2025-09-12T13:58:52Z","snapshot_observed_at":"2026-07-06T21:25:13.481613Z","submitted_at":"2025-05-13T04:42:14Z","title":"LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11528","snapshot_observed_at":"2026-08-02T20:18:04.967400Z","title":"Ladiwm: A latent diffusion -based world model for predictive manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.967400Z"},"links":{"cited_paper":"/paper/2505.11528","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:3a7fe8ccae84ff55ff0f0de3ff43a4dc22fac2ce272ac979bde07384910da2fb","observation_id":"6ced7e81-5fed-4373-b3d5-fc5d535c9873","resolution":{"observed_at":"2026-08-02T20:18:04.967400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-02T20:18:04.971064Z","title":"Up-vla: A unified understanding and prediction model for embodied agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.971064Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:d6f7064b2e82886aafc125e555f331f240113f2cae75b76029b2a9886ecd323b","observation_id":"c8cd7914-b628-4f76-a057-a5d7f4368dd6","resolution":{"observed_at":"2026-08-02T20:18:04.971064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-02T20:18:04.975201Z","title":"Cot -vla: Visual chain -of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.975201Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:5f35cf73c4361c2e9ccbe81be5db7e283447ab12195cbc23edd474e7c103fbd6","observation_id":"20150314-224b-4869-811b-611245e27024","resolution":{"observed_at":"2026-08-02T20:18:04.975201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07395","last_updated":"2025-05-12T09:48:03Z","snapshot_observed_at":"2026-07-06T21:22:26.020959Z","submitted_at":"2025-05-12T09:48:03Z","title":"ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07395","snapshot_observed_at":"2026-08-02T20:18:04.979225Z","title":"Reinbot: Amplifyin g robot visual -language manipulation with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.979225Z"},"links":{"cited_paper":"/paper/2505.07395","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:c7be1b7516cfc152458f3c209a304cbbbaa3b68e1ac5a01d4dcd4ec62a13f030","observation_id":"321b86d1-5eed-46f6-a098-d73b5d0b554c","resolution":{"observed_at":"2026-08-02T20:18:04.979225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.982966Z","title":"Shapellm: Universal 3d object understandi ng for embodied interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.982966Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:f390892d6d6a1d9ee95baa2bdd36d6270a9c7943c58766784126e22ad0d00948","observation_id":"94347f0e-5c55-40da-b219-b9dd290ba06a","resolution":{"observed_at":"2026-08-02T20:18:04.982966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.990360Z","title":"Navid: Video -based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.990360Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:bdd36cdea75d9196c65a5fdbafb364393ab07a329dd280f6be5310b01fc9fd9e","observation_id":"98b084a0-3c45-48bc-b394-b6f44d0e959c","resolution":{"observed_at":"2026-08-02T20:18:04.990360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-02T20:18:04.994004Z","title":"Uni -navid: A video -based vision-language-action model for unifying embodied navigation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.994004Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:242beaca1176d548c9fb589de0f617b2d60d300ca879dfcdede65d005ba446bd","observation_id":"75f13b23-9f66-44ec-a973-67f421241755","resolution":{"observed_at":"2026-08-02T20:18:04.994004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T20:18:04.998053Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.998053Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:d7e61e1b9d7fc570c511eb2bc973367e784896dbebb6669974d0ed488d262604","observation_id":"0726e0ed-c6ae-45ef-9731-0cd6a1677d2e","resolution":{"observed_at":"2026-08-02T20:18:04.998053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.001781Z","title":"Openaio3ando4 -minisystem card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.001781Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:eaea340fcdd84202a5f94a3a44e06565b6f953740dc2a5610c0ea24b8e1ba504","observation_id":"2fb56b77-2533-4c5a-8b65-606833ff27dd","resolution":{"observed_at":"2026-08-02T20:18:05.001781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.005534Z","title":"DreamLLM: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.005534Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:fb40ded1f97340d002542bac1eba98145f4fcdd43efb620c540c19603a078e40","observation_id":"9de293f5-89e8-4ded-81ed-12a26a464d49","resolution":{"observed_at":"2026-08-02T20:18:05.005534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-08-02T20:18:05.009025Z","title":"Bridge data: Boosting generalization of robotic skills with cross-domain datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.009025Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:ec66f1d878cec19a1ee95dee894a4e7ddfaf373490c60a44528d946a8d500830","observation_id":"01514cb3-0424-4a99-80d8-0ba8944d8162","resolution":{"observed_at":"2026-08-02T20:18:05.009025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11651","last_updated":"2025-03-14T17:59:47Z","snapshot_observed_at":"2026-07-06T20:52:55.699004Z","submitted_at":"2025-03-14T17:59:47Z","title":"VGGT: Visual Geometry Grounded Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11651","snapshot_observed_at":"2026-08-02T20:18:05.012742Z","title":"VGGT: Visual Geometry Grounded Transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.012742Z"},"links":{"cited_paper":"/paper/2503.11651","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:bb717875ced45ca859861f27b5e316608d351d092c553d40bccd3c5e9fead286","observation_id":"c84d68c7-2e32-440c-81b3-6844818041ff","resolution":{"observed_at":"2026-08-02T20:18:05.012742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-02T20:18:05.016538Z","title":"Graspvla: a grasping foundation model pre-trained on billion-scale synthetic action data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.016538Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:43d325abe674e05d17b75505b30aa6dc6be1e092b89d424f2955cb5ac0c0933b","observation_id":"54b63741-d1b0-4da9-9223-423895f78d7c","resolution":{"observed_at":"2026-08-02T20:18:05.016538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.020315Z","title":"Tran, RaduSoricut, Anikait Singh, Jaspia r Singh, Pierre Sermanet, Pannag R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.020315Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:3c00464e74b6bd53ce2e406050199ea0682318b8311481262069b1297f0f7f01","observation_id":"b7fd9e90-8197-4df9-aa5e-c31a549271e5","resolution":{"observed_at":"2026-08-02T20:18:05.020315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-02T20:18:05.023640Z","title":"Hybridvla: Col laborative diffusion and autoregression in a unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.023640Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:96a4154229d63492f749275a26923523555c9c2ca5ae6856957fcd7cdc6b5877","observation_id":"774e5b71-a8ab-4319-bebe-d637b2c8a2f7","resolution":{"observed_at":"2026-08-02T20:18:05.023640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T20:18:05.027150Z","title":"pi0.5: a vision language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.027150Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:880cac62b2b5840b37a90c60035bb8b6c7953e2a27756cb6b93380a15928ccda","observation_id":"203de78f-01e3-4723-a92f-d0d450987076","resolution":{"observed_at":"2026-08-02T20:18:05.027150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-06T13:30:51.904858Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T20:18:05.030889Z","title":"Hume: Introducing system -2 thinking in visual -language action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.030889Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:3c6b32763cf882adb12440d99b40daa5e85283cf44e09ba76897fbbd357a5962","observation_id":"150d728d-7652-4a3c-bc24-46f9e1ba84ac","resolution":{"observed_at":"2026-08-02T20:18:05.030889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.034752Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.034752Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:510a4a32316afb0307c32460f7d28befef8e69c39c16040ae480315c9c545882","observation_id":"6076b4c8-a8d6-499a-97b8-44d67fef01f6","resolution":{"observed_at":"2026-08-02T20:18:05.034752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-07-06T20:58:27.929311Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-02T20:18:05.038317Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.038317Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:473bc196571cb072cd41659b2041786bcf03e843374758f456d6b4644e22ced0","observation_id":"7f3888f9-e553-430c-aa38-42c8124f6990","resolution":{"observed_at":"2026-08-02T20:18:05.038317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-02T20:18:05.041939Z","title":"Rdt -1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.041939Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:7a3a9eca46fa39464406917c7960c515e126f8da381155cc0c9e2110dde1721b","observation_id":"5f5aed65-ba22-42e8-810a-6e8f0cf1c86d","resolution":{"observed_at":"2026-08-02T20:18:05.041939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.046023Z","title":"3d diffusion policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.046023Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:911f2cd7fadf278674858953e77a5f163fce3a1be0684a0f7760dcfdaff81747","observation_id":"1c77afcd-0230-4624-8cc2-b75bbbbdefe3","resolution":{"observed_at":"2026-08-02T20:18:05.046023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.049583Z","title":"Calvin: A benchmark for language -conditioned policy learnin g for long -horizon robot manipulation tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.049583Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:7aab4e41edf773a5f1a67e6640391aa02b16c8c2bba90059313b6195997b9532","observation_id":"c81b74bb-33a3-4b6b-8475-0a65ca3cdb35","resolution":{"observed_at":"2026-08-02T20:18:05.049583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-02T20:18:05.052950Z","title":"Zero -shot robotic manip ulation with pretrained image -editing diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.052950Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:55c333f4f3cb7212649e2e91b065dca4600be9e70a9d0e665c5ce81291888e3e","observation_id":"3fa5d9a2-08b7-48f7-bc86-b4584ae0e0c8","resolution":{"observed_at":"2026-08-02T20:18:05.052950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-04T13:24:32.760498Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-02T20:18:05.056655Z","title":"Towards synergistic, generalized, and efficient dual -system for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.056655Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:c8225eac5f3788698de56143b3bc27b5feeef191b5bd8f6363088d80d9b4c155","observation_id":"ed39de5d-5c00-446f-8612-24bf79080585","resolution":{"observed_at":"2026-08-02T20:18:05.056655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-02T20:18:05.060322Z","title":"Univla: Learning to act anywhere with task -centric latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.060322Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:5cef19cee7fd324e7752058d830eb56686aaa492c0b263438c70f281db63160b","observation_id":"13cf5b98-598f-4cab-8cfc-324181841f03","resolution":{"observed_at":"2026-08-02T20:18:05.060322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09016","last_updated":"2024-10-16T08:38:07Z","snapshot_observed_at":"2026-07-06T19:15:08.847236Z","submitted_at":"2024-09-13T17:45:07Z","title":"Closed-Loop Visuomotor Control with Generative Expectation for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09016","snapshot_observed_at":"2026-08-02T20:18:05.064158Z","title":"Closed -loop visuomotor control with generative expectation for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.064158Z"},"links":{"cited_paper":"/paper/2409.09016","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:fbc7eeee4f5420cad338bddf74083eb6e59d74862cae42e03e4afb8e3cce4e57","observation_id":"cc921bac-ba23-479b-bddc-a337264d2d39","resolution":{"observed_at":"2026-08-02T20:18:05.064158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.067919Z","title":"LIBERO: benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.067919Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:912af50bca9f7bcd97abd98316bc82ce04e4b7c03da232e47ac96d10e085efe1","observation_id":"4fd9bc63-4a2a-4dd1-a853-da566f77e283","resolution":{"observed_at":"2026-08-02T20:18:05.067919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.071271Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.071271Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:1c6b68f0fafd231511cd26252eb8486f0b09b9e350d1a499fe77b0a29e2cf076","observation_id":"ca160281-d00d-4ac7-878c-a2a8755c02bc","resolution":{"observed_at":"2026-08-02T20:18:05.071271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:05.074641Z","title":"OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.074641Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:96d04a1d36c68ae9f6f27863a30951e6ffe647a792a80962fb2c2bc5d3c3934a","observation_id":"d9c0341f-9bb3-4bbb-ac8b-a4f62381251d","resolution":{"observed_at":"2026-08-02T20:18:05.074641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:18:04.986810Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.986810Z"},"links":{"citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:224b8727181eb3180a6ad1f42ff4a8bf47320e1c6f53178e32e56796d8e19865","observation_id":"9be7d474-c644-42f4-bac5-c1cbc7faa9e4","resolution":{"observed_at":"2026-08-02T20:18:04.986810Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2602.23721."}