{"as_of":"2026-08-09T08:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2144ce6b3279ab975662a3a79ecb3519292bc7bf25b2e3360ed63f70d1b6ced8","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:10:40.200125Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25912/citation-record","integrity":"/paper/2607.25912/integrity","json":"/paper/2607.25912/citation-record.json","paper":"/paper/2607.25912"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.102909Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.102909Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:5a0b833e588f7f32ec97b866f76f5d1517f2d82bbcf3c530b01db24a3d9eb58e","observation_id":"f9b47728-85aa-4a8e-8b48-c26083e9d56a","resolution":{"observed_at":"2026-08-01T01:10:40.102909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-01T01:10:40.106343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.106343Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:b3279f456fc0b3ae2bb932a2ea5dd701213056146ce65dd001b7820d3aeef86f","observation_id":"27760aed-a112-4af9-bbd2-e15a8dbfec68","resolution":{"observed_at":"2026-08-01T01:10:40.106343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-01T01:10:40.109888Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.109888Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:1a57ca3aa0fbea711b4b49c97913261155feda79ce6b86b5335390e0c3a57d4e","observation_id":"bc986768-a5ab-4140-adf4-43315332ba83","resolution":{"observed_at":"2026-08-01T01:10:40.109888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.113205Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.113205Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:a8b842c821edb046dd13cffbdaeacebf926c1981b6ba667ffc847ebcefd11ce0","observation_id":"9be2b2fc-bd62-46eb-8169-9c83cf4d5a62","resolution":{"observed_at":"2026-08-01T01:10:40.113205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.115844Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.115844Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:dcd3d130b8bd1044d39aa2db8c9e9adf409f2895108f9ea4a6b996caf869b1fc","observation_id":"ab2bafee-13a8-4bf7-8d8e-b74bbbefc86f","resolution":{"observed_at":"2026-08-01T01:10:40.115844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-01T01:10:40.118599Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.118599Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:7be12f106aecbde949e98a5a2a00222027d0cf45ee3ea4bebdb803a1c472ce5a","observation_id":"049d2ea7-780b-4e41-95b4-8a945fbce450","resolution":{"observed_at":"2026-08-01T01:10:40.118599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.121713Z","title":"Bhat, Y .-H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.121713Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:6be55c17cbbf49d1641ea438970fb6c3c2b884eeccf211b9a1fa3a7b2dd31a18","observation_id":"aad7ab35-4b68-4575-a5ae-183916bfffdf","resolution":{"observed_at":"2026-08-01T01:10:40.121713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-01T01:10:40.124096Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.124096Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:56c2dd443034d57d40c959e81f6f0fe31c6de68dbc94d27c2bb2e3ed66c6e47a","observation_id":"f1080c70-9833-4418-89c5-b72e8bd8f799","resolution":{"observed_at":"2026-08-01T01:10:40.124096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.126781Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.126781Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:15d87e107e08e5b48d32a26a4cf56e0476164c8ac3c8e222b3de1073a8cb174a","observation_id":"431e785a-d9ec-49e7-aa57-0106eb0b4c1a","resolution":{"observed_at":"2026-08-01T01:10:40.126781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.129172Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.129172Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:938512725a04aeababc72eeddce9caf967cd688be20b6e2127861c3e032f64af","observation_id":"3be9b8c4-7713-4e79-881f-2450b4768d7a","resolution":{"observed_at":"2026-08-01T01:10:40.129172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.131486Z","title":"Huang, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.131486Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:c473983608e1a3118cb4e559c41e5d56dd76d630db3cf140ab86c2197f9c15ac","observation_id":"62de5176-d4a4-4cdd-a1ef-79eafa25777e","resolution":{"observed_at":"2026-08-01T01:10:40.131486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-01T01:10:40.134136Z","title":"Zawalski, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.134136Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:c60852ba283ff0ff2127c442be354275d039620718b56a0eab9200094a4d8339","observation_id":"e115d3a9-05f0-4858-ad5e-b3d1fd615bfd","resolution":{"observed_at":"2026-08-01T01:10:40.134136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-01T01:10:40.136851Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.136851Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:db8430981ab6620c28da72a5d5b10a450a36408a7b51ff6a4e9ede78ba386403","observation_id":"2091e141-aefd-4515-af83-d6179b472d4e","resolution":{"observed_at":"2026-08-01T01:10:40.136851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.139574Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.139574Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:cd4125d7f4c0132a5d9db0ae50b6331dfddd7ec104f657c1c42407aeaddd9e6b","observation_id":"67e41da3-ee85-4716-b25f-7c70574be88f","resolution":{"observed_at":"2026-08-01T01:10:40.139574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.141872Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.141872Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:dd387d3e7944903e49e87ad8c5a5539e11616948be7b512a20f8fd2d8beb658b","observation_id":"a0fb4ec2-5e6d-4f89-863d-63a04889ff2f","resolution":{"observed_at":"2026-08-01T01:10:40.141872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.144116Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.144116Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:1681fabaecb949fe9d3341fcccafc12a646007e9f878c09fa6052301f3ba662f","observation_id":"7cf48ecd-1b5a-4196-acfb-d6c9dbd161f2","resolution":{"observed_at":"2026-08-01T01:10:40.144116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-08-07T21:29:04.973616Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-08-01T01:10:40.146441Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.146441Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:5f7e6783a0d441e9f3e8bf4aac771261cdd28e973ea21ac71784575b986552d6","observation_id":"c16f8416-d102-44e1-a2f7-520ceedcd094","resolution":{"observed_at":"2026-08-01T01:10:40.146441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07169","last_updated":"2025-02-11T17:59:49Z","snapshot_observed_at":"2026-07-06T19:30:39.426499Z","submitted_at":"2024-10-09T17:59:06Z","title":"VIP: Vision Instructed Pre-training for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07169","snapshot_observed_at":"2026-08-01T01:10:40.148941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.148941Z"},"links":{"cited_paper":"/paper/2410.07169","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:12e364366b834d2ab50e921b50253cf23cce64e3bcb6b554576b4976dff07fca","observation_id":"6cdbaf04-bf46-4dd2-bfe6-fa145b8f6949","resolution":{"observed_at":"2026-08-01T01:10:40.148941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.151458Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.151458Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:8970d0a43eaa81e0ee269f12831333226a8a5fdc9f061ea53568fb2efce090b9","observation_id":"0a0180ab-96ff-426a-9064-105ee0e32d87","resolution":{"observed_at":"2026-08-01T01:10:40.151458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.153918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.153918Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:2a59471f2979aee7ad68c746a04d2bfeb967e2c0bda3939d19e2df1dc5aff736","observation_id":"75f353df-1fc8-4dd3-8a75-93efb4a95704","resolution":{"observed_at":"2026-08-01T01:10:40.153918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-01T01:10:40.156771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.156771Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:629140d75cf072d7087e83f5b7e889a440efb531421a860c975c24840072711b","observation_id":"1c55d410-5acf-4526-8e05-b4be602f9ae4","resolution":{"observed_at":"2026-08-01T01:10:40.156771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.159404Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.159404Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:e6264f098633b8f58492f367db776bf8e05c2f8b0b2e9e954b8171fb5a65e8d9","observation_id":"6b4b9364-b8f9-4685-82da-18b0a3f0f857","resolution":{"observed_at":"2026-08-01T01:10:40.159404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-01T01:10:40.161685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.161685Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:3ba29d74db8edd34f8ed0dfa21e91de42e2a7765b7739b35399bfacda82db678","observation_id":"7ba769b1-3295-47e8-a877-8787e928f4e8","resolution":{"observed_at":"2026-08-01T01:10:40.161685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.164343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.164343Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:56d3a179b22e79921b357d6bbdc31af4d3849bcdaca4d82644e897fe426f366c","observation_id":"68c54edf-0794-480e-9003-5c803535bde7","resolution":{"observed_at":"2026-08-01T01:10:40.164343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.166745Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.166745Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:6fe7513157c438492b01c54d5f4c754cc3c52d873ccc16f88fea1004936e41a0","observation_id":"99e16ea8-b851-4c80-9981-371ddb825808","resolution":{"observed_at":"2026-08-01T01:10:40.166745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-01T01:10:40.169601Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.169601Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:3cf8b62b35512be39ac6ab44459e9e76d9deb85852c9049667d1615e9a25ca7c","observation_id":"9b526807-35df-40e9-a3c6-5c35b9d057e2","resolution":{"observed_at":"2026-08-01T01:10:40.169601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-01T01:10:40.172354Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.172354Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:a54e384e9cb87d790acd40b5990c84389bfaa0e340565a02f99d2a675ce5e67d","observation_id":"d32e23bb-208e-4487-9b1a-476539386289","resolution":{"observed_at":"2026-08-01T01:10:40.172354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.175213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.175213Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:8eb502727a9dbcd6738b9f9c9d8afa51d963c6c6bf51b27ede00822212d3d3d3","observation_id":"89440d1b-d0a1-4d02-88da-2122b4bfb887","resolution":{"observed_at":"2026-08-01T01:10:40.175213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.177651Z","title":"Black, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.177651Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:be310af6733d3d36e7c19d6205f0736df6a2f7e9eceeeb5fe2222851377c6772","observation_id":"33e72ab6-0ccf-4a3a-a589-adf63c88fd6e","resolution":{"observed_at":"2026-08-01T01:10:40.177651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.180101Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.180101Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:9b8358b80134600a8f85eb5fb984d2273591b5238b3fbb7ee2af36857fcfcae8","observation_id":"d26aa7d4-064b-4a1a-81bb-a48d1e6ae817","resolution":{"observed_at":"2026-08-01T01:10:40.180101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.182428Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.182428Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:be385d0a4adf16e5dc70bcaf4f650f3d07155ea16861f37b793b6807319ff88b","observation_id":"5ffd282e-aefc-4377-9a88-2529f3a825d9","resolution":{"observed_at":"2026-08-01T01:10:40.182428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.184676Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.184676Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:3f752b97489d7ec15b7d255fc63f8c800bd8561c8f405dddfb6149e2a7f268b6","observation_id":"23d3caf7-e7cb-4732-a068-5a7a0f1a6861","resolution":{"observed_at":"2026-08-01T01:10:40.184676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.187561Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.187561Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:771f710a0b7029e436c3c8eadbcf7443517e85c5a85c845790b900b7ed2d9f00","observation_id":"6ecf604e-6f0a-4d1b-b3f5-24a28ad0458f","resolution":{"observed_at":"2026-08-01T01:10:40.187561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.189839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.189839Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:b61df92d2541494793e9f4f3b6a0eb15c400f6bab3ffe00b25dc0bc458a39be5","observation_id":"2b429260-bea3-4286-b104-f05940df1976","resolution":{"observed_at":"2026-08-01T01:10:40.189839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.192119Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.192119Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:6b4ead109783492a5549ff66cea4a753f57183cea6682ace5f93d2bfe3a9f768","observation_id":"0a25bfd7-d69f-4928-9926-c038e9ca963f","resolution":{"observed_at":"2026-08-01T01:10:40.192119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.194599Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.194599Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:9461475cb749e037b5778d086e05447cc603fc0e6ce21e801b99601be57c227f","observation_id":"7aa847ec-1903-4536-9a25-f2cac94fcc36","resolution":{"observed_at":"2026-08-01T01:10:40.194599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-01T01:10:40.196971Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.196971Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:4051262244cf8c9a2aa5b2700a206b118582b3f22f6d810fbff8ea73ed320f04","observation_id":"cdd87683-1ec7-42f4-82a9-e00ccab2b446","resolution":{"observed_at":"2026-08-01T01:10:40.196971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:10:40.200125Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.200125Z"},"links":{"citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:14082f8e03dd8cef21921cb506becc838fd1cfb83ea0d9f1f40164ab1ccd4986","observation_id":"eb1d4d05-de6e-41c3-ba46-ca098be694a5","resolution":{"observed_at":"2026-08-01T01:10:40.200125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2607.25912."}