{"as_of":"2026-08-10T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:875eaca688c6cadfcf81030afea7ee3c4f77c826a8a118acf9d3aaaa1ed2b16b","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:16:50.651526Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:19:46.803171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:38:43.940925Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T20:43:24.417901Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2508.19236"},"observation_digest":"sha256:0127788f78c7e9ff189a972313dae8cc0cf301462fc7837e0d2194b1c4379c6f","observation_id":"62c69a0d-4cd7-467b-b9d5-3b8d2080edb3","resolution":{"observed_at":"2026-05-15T20:43:24.471673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T06:20:01.885711Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:abe32c9edc0fd36d874178a3fd8181e543d78381028e1be0d65a072a051ade6c","observation_id":"a014a169-5699-4e65-b9f4-7d9f9f2c16aa","resolution":{"observed_at":"2026-05-17T06:20:02.012837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-04T11:38:55.445345Z","title":"Geovla: Empowering 3d representations in vision-language-action models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T11:38:55.445345Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:7cc20eae10c9c6deb742dbfb98e591c05fe44b10cc8389a1e2a3da0535f674e9","observation_id":"1e1e29c0-0145-4860-8940-ad6e07cf9bed","resolution":{"observed_at":"2026-08-04T11:38:55.445345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-04T09:34:44.272979Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:44.272979Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:157ca6cb0865bc33272a5d49636206180919ab7ed3f013b3ece6e6b9f2f0f9b2","observation_id":"8d85dd0d-8aee-4bdf-875b-303f0b8d2231","resolution":{"observed_at":"2026-08-04T09:34:44.272979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T21:16:59.712007Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2601.18692"},"observation_digest":"sha256:74110d8b190961be07eed547ed5fa029648ee6e58ad5a4a7ad4642fdbf45beb0","observation_id":"71d97c6e-4e7d-4b10-b9ff-f83eedfed65a","resolution":{"observed_at":"2026-05-16T21:16:59.751177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T20:21:45.365156Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:f342782d3ac3473d4386dd6aa3a9841531177c09ffed0ff57ee8347b723186ee","observation_id":"83ff0ae9-ccf5-42c4-9dee-05e79c17ddda","resolution":{"observed_at":"2026-05-10T22:00:48.382348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2604.05484","last_updated":"2026-04-07T06:24:41Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:24:41Z","title":"CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:12.286456Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2604.05484"},"observation_digest":"sha256:256b020fb5b4888b80ad3b187f4a7b24c153b48ccecfe8049da47451266b6026","observation_id":"7d9bab16-e82e-41f8-93dc-9dcfc1d2a85d","resolution":{"observed_at":"2026-05-10T22:55:52.326722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2604.12908","last_updated":"2026-04-14T15:57:16Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:57:16Z","title":"Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \\rightarrow G$): Vision-Geometry Backbones over Language and Video Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:20:47.418874Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2604.12908"},"observation_digest":"sha256:610b9140becb0baf5b6caf4111c525b50faa1443e4efb1f1c95610327e643fc8","observation_id":"48bd2dfc-665b-498f-8670-62cde3646a6f","resolution":{"observed_at":"2026-05-11T10:46:01.810013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2604.15281","last_updated":"2026-04-16T17:50:37Z","snapshot_observed_at":"2026-08-02T21:20:28.291912Z","submitted_at":"2026-04-16T17:50:37Z","title":"R3D: Revisiting 3D Policy Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T10:57:54.273960Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2604.15281"},"observation_digest":"sha256:620e9ee885182fa3b16987e3ee3f52f87e88e32965fcebf89be625b9dce58fa6","observation_id":"3c4e72ad-2694-47f3-8c08-22e5abc0a37c","resolution":{"observed_at":"2026-05-10T11:00:04.200200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2604.20834","last_updated":"2026-04-24T16:37:03Z","snapshot_observed_at":"2026-08-02T06:38:24.634185Z","submitted_at":"2026-04-22T17:58:19Z","title":"PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T00:04:16.073230Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2604.20834"},"observation_digest":"sha256:3af047c3090adb2598588a5de543a2ad87ed5e96574ab4c23ca28a5526900a59","observation_id":"e8d9e6ef-2437-443e-abcf-a7a7f98caced","resolution":{"observed_at":"2026-05-10T00:29:47.564969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T10:40:04.767657Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:9c6e6e46937a7703bcc4a4d67125bcf58932b4ba94651ba916447a98ad8b2f4c","observation_id":"19e63f52-6734-438b-a66a-4cbef4048519","resolution":{"observed_at":"2026-05-12T09:31:26.281607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T03:20:04.435904Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:6e2de20f3a728d7e5da489017bb4f1e56f32d1594b20b8d34ec4619edd5b3571","observation_id":"d57c6f33-91f7-46fa-97f4-0e8527a07f2e","resolution":{"observed_at":"2026-05-11T22:11:12.310771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.05126","last_updated":"2026-05-06T16:55:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:55:44Z","title":"ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-08T16:40:19.057979Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.05126"},"observation_digest":"sha256:caf8a99ec5f3e142adfaab1c09a631d7160083e5bce5ab0d57fa3e894e170430","observation_id":"fa371804-0d82-4488-a3c2-42452d784ade","resolution":{"observed_at":"2026-05-11T18:06:06.398109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.10485","last_updated":"2026-05-11T12:44:26Z","snapshot_observed_at":"2026-08-08T19:42:48.305031Z","submitted_at":"2026-05-11T12:44:26Z","title":"VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T05:09:21.028373Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.10485"},"observation_digest":"sha256:a8ec19012d90f32ee630088f80d88ca896233d75754fca64cb5a66cb29868d23","observation_id":"27f97e89-9f07-455e-b991-4f3b9dbc9460","resolution":{"observed_at":"2026-05-12T05:31:26.179579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:9b09b4d1035d76fae4168c613775ee61bdbe845764148bf2a05c4b87035b8bd6","observation_id":"4fcfcc17-bca0-4983-90e1-8e69f46bb3db","resolution":{"observed_at":"2026-05-13T05:27:18.495377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.12162","last_updated":"2026-05-12T14:13:06Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:13:06Z","title":"X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:07.792757Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.12162"},"observation_digest":"sha256:f46d296866d8ad7c84a4e2fab8f20f18076dd1b4578fec74d0d74fbb68020a31","observation_id":"230cea23-6c8d-4fe1-8421-db1277ed9a20","resolution":{"observed_at":"2026-05-13T04:52:17.039700Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T03:57:10.338617Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:efe2f65016ddff5bc4be2ff221c386b3dd042cf462326a60fa0571d75e58f59b","observation_id":"af347835-7fd8-4fa8-b65a-10715cf232bb","resolution":{"observed_at":"2026-05-13T03:57:12.743980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:6d296cfd74660e9b07bd1455e9f1190993082da1d56ec77f2ccdeae96bc8134a","observation_id":"02fd77d4-1ee8-499e-9500-af46074635e6","resolution":{"observed_at":"2026-07-01T14:15:46.741680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.21414","last_updated":"2026-05-20T17:10:31Z","snapshot_observed_at":"2026-07-06T23:31:51.443407Z","submitted_at":"2026-05-20T17:10:31Z","title":"PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T03:36:23.117616Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.21414"},"observation_digest":"sha256:6e73c41e2740a28a6bcf1facebaabb4dcc333d45820a57954280135ad7d54c1d","observation_id":"ff736a69-2844-4053-9402-17fddd5d9379","resolution":{"observed_at":"2026-05-21T03:39:29.563473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:b374b86ee14213397a49a5ce39286dadd27caec1c69dfb9a05b71168897e7073","observation_id":"cdff4942-d152-4ee1-bdc1-672ff08d89e0","resolution":{"observed_at":"2026-06-29T07:13:15.294796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.02274","last_updated":"2026-06-06T05:27:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T14:01:11Z","title":"Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T14:41:50.084254Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.02274"},"observation_digest":"sha256:e517481d92a3030c22cd490b3bf860c61f924036ab9e8727bd1ae7eecc500ec1","observation_id":"774ff56d-cb86-4531-ac0a-e37f7093b0b8","resolution":{"observed_at":"2026-07-01T23:06:20.364540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.03240","last_updated":"2026-06-02T07:01:18Z","snapshot_observed_at":"2026-07-31T03:23:10.872093Z","submitted_at":"2026-06-02T07:01:18Z","title":"GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T10:04:10.627420Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.03240"},"observation_digest":"sha256:7f031de53db2ce0a52790c43c76bb6df9ca3f5654232d21b81bcc8e94e2a2442","observation_id":"f163582c-b0d7-43c9-905a-83044c62c510","resolution":{"observed_at":"2026-07-02T03:26:29.193553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.04436","last_updated":"2026-06-03T04:34:07Z","snapshot_observed_at":"2026-08-02T19:43:14.201593Z","submitted_at":"2026-06-03T04:34:07Z","title":"3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T07:20:40.998337Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.04436"},"observation_digest":"sha256:72d62ee81ebf6d0c8f0e95c02f3212d662f85acb72f28cf8a68e11699f88332e","observation_id":"3fcff667-0757-4581-994a-7d30ee88679a","resolution":{"observed_at":"2026-07-02T06:36:44.079773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.06556","last_updated":"2026-06-04T10:43:14Z","snapshot_observed_at":"2026-08-09T06:57:25.072034Z","submitted_at":"2026-06-04T10:43:14Z","title":"Robots Need More than VLA and World Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T01:01:33.530167Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.06556"},"observation_digest":"sha256:7ae10fdf5e1e2f94a89e8baf17941bb1a83594c0e9d436696a4fa477145a25b0","observation_id":"3921b61e-cb8c-4e63-85b0-ca7ec9126dd7","resolution":{"observed_at":"2026-07-02T13:46:59.303478Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:f2370dfa36bd3dab418a6a5b2e467517417118a12ae665055123fcdf24036c29","observation_id":"8e4205c0-1ddb-4ee1-8255-a97cdf6b1ef5","resolution":{"observed_at":"2026-07-02T21:57:25.707491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.09827","last_updated":"2026-06-08T17:59:53Z","snapshot_observed_at":"2026-08-02T03:40:52.111546Z","submitted_at":"2026-06-08T17:59:53Z","title":"MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T16:13:19.238535Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.09827"},"observation_digest":"sha256:69b458ce74bcb7388d8e8e04a5daa13d48541aedbd1e4a65d0b245e470d9b388","observation_id":"9143f34f-a725-4658-85f3-38421e58cb5e","resolution":{"observed_at":"2026-07-03T01:57:32.294172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.10568","last_updated":"2026-06-09T08:31:59Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:31:59Z","title":"VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T12:47:35.314486Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.10568"},"observation_digest":"sha256:3a85f654ca9d7411c7b103ad8f8a0547513085c479544a850708041992684674","observation_id":"deb79e72-96fd-4fb6-a5db-a938de7c19f2","resolution":{"observed_at":"2026-07-03T06:17:41.839593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.13394","last_updated":"2026-06-11T14:25:09Z","snapshot_observed_at":"2026-08-06T00:19:24.282471Z","submitted_at":"2026-06-11T14:25:09Z","title":"GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:37:21.516021Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.13394"},"observation_digest":"sha256:b1dcd32536639af0beca417e1ee94d0f911c39c999f7167261d736291dc150d6","observation_id":"a0f12d5f-9ade-463e-ac63-4ee602e7259a","resolution":{"observed_at":"2026-07-03T15:18:33.009592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.17046","last_updated":"2026-06-22T21:44:31Z","snapshot_observed_at":"2026-08-02T21:41:56.182346Z","submitted_at":"2026-06-15T17:58:03Z","title":"Geometric Action Model for Robot Policy Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T03:59:17.983035Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.17046"},"observation_digest":"sha256:a3940d3d1874ba27eb5dfd6008f318bc24f9cba9d6b6d193c4c6032e87cb0515","observation_id":"51bb3c66-f216-4640-a45b-a17b4c375d58","resolution":{"observed_at":"2026-07-03T17:38:43.942419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-11T14:23:57.266710Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05468","last_updated":"2026-07-06T07:10:22Z","snapshot_observed_at":"2026-08-07T22:19:34.813872Z","submitted_at":"2026-07-06T07:10:22Z","title":"Learning 4D Geometric Priors for Inference-Efficient World Action Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-11T14:23:57.266710Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2607.05468"},"observation_digest":"sha256:29320b9f8402fc6d53c461b5ce43150b4479d3df85bd8f565a2fc01334292b58","observation_id":"d36d26c3-0f0d-41e6-8210-ae9cac506e7e","resolution":{"observed_at":"2026-07-11T14:23:57.266710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-14T05:11:57.092685Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11498","last_updated":"2026-07-13T12:50:32Z","snapshot_observed_at":"2026-08-06T19:17:49.055959Z","submitted_at":"2026-07-13T12:50:32Z","title":"See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T05:11:57.092685Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2607.11498"},"observation_digest":"sha256:1cb3a2fb6ef4018ec42d73a7290d114563009837b891933f400599b2c9bcaa3c","observation_id":"f7dcc86c-a1b0-4b2b-a6fb-29884bb9807e","resolution":{"observed_at":"2026-07-14T05:11:57.092685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-02T06:36:26.629789Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-06T22:26:58.903585Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.629789Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:3b6e8b3c57eab7cf145af0acbc96bfb30ec696515c893fe389d5da42b2126752","observation_id":"856e1487-93bc-4916-9ee1-2bf9a0884165","resolution":{"observed_at":"2026-08-02T06:36:26.629789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-01T01:10:40.118599Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25912","last_updated":"2026-07-28T16:05:32Z","snapshot_observed_at":"2026-08-08T03:07:41.948453Z","submitted_at":"2026-07-28T16:05:32Z","title":"SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T01:10:40.118599Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2607.25912"},"observation_digest":"sha256:7be12f106aecbde949e98a5a2a00222027d0cf45ee3ea4bebdb803a1c472ce5a","observation_id":"049d2ea7-780b-4e41-95b4-8a945fbce450","resolution":{"observed_at":"2026-08-01T01:10:40.118599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-04T03:21:35.555813Z","title":"arXiv preprint arXiv:2508.09071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02598","last_updated":"2026-08-03T17:59:01Z","snapshot_observed_at":"2026-08-09T02:04:15.720456Z","submitted_at":"2026-08-03T17:59:01Z","title":"VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T03:21:35.555813Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2608.02598"},"observation_digest":"sha256:d04c1d93250fea8d6bbf0a5f98e9f54389b924d1ddb4fe6d4ddc5445f4d59728","observation_id":"7dd3cd96-9da4-4c72-b559-74a2723c3c96","resolution":{"observed_at":"2026-08-04T03:21:35.555813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-06T20:19:46.803171Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.803171Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:16a56c8a423d4dcab8cb7340dd98b8336401d5ede39d2709623f70b445abefab","observation_id":"db459a88-3610-46fd-9aaa-6187dbaf2234","resolution":{"observed_at":"2026-08-06T20:19:46.803171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-06T11:59:27.996941Z","title":"arXiv preprint arXiv:2508.09071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04996","last_updated":"2026-08-05T16:04:23Z","snapshot_observed_at":"2026-08-08T23:13:45.217141Z","submitted_at":"2026-08-05T16:04:23Z","title":"DreamWAM: Beyond RGB Future Prediction for World Action Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:59:27.996941Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2608.04996"},"observation_digest":"sha256:bce44dfa5d62f414dc87f3583b9e14824ce4b6c0da30e835789c24eefb6a2511","observation_id":"b7df52d0-2bea-422c-a38b-49f06c97be77","resolution":{"observed_at":"2026-08-06T11:59:27.996941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09071/citation-record","integrity":"/paper/2508.09071/integrity","json":"/paper/2508.09071/citation-record.json","paper":"/paper/2508.09071"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18623","last_updated":"2024-12-14T18:38:03Z","snapshot_observed_at":"2026-08-07T12:30:58.035292Z","submitted_at":"2024-11-27T18:59:52Z","title":"Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18623","snapshot_observed_at":"2026-08-05T21:16:50.631795Z","title":"Lift3d foundation policy: Lifting 2d large-scale pretrained models for robust 3d robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.631795Z"},"links":{"cited_paper":"/paper/2411.18623","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:f0a6168c03c6f188aca073d576d53f0128d7920d36d18cea0dae0ca825ce8dbb","observation_id":"044b3559-17b0-4d81-81da-b5245e869a54","resolution":{"observed_at":"2026-08-05T21:16:50.631795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-05T21:16:50.637420Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.637420Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:7202c66d5d9fa2aef64b3a750f68e7e4bec65ff6eadf42e5d274008f175d5835","observation_id":"3f75680b-eb5e-4213-93c0-4d7397703433","resolution":{"observed_at":"2026-08-05T21:16:50.637420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T21:16:50.640176Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.640176Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:906432caf7ca1ad383668f87d1b1b1d50d68a2c78699c47579ce0e0ebbd92c96","observation_id":"19dc6192-36bc-4fbf-995e-a2ea50decd90","resolution":{"observed_at":"2026-08-05T21:16:50.640176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-05T21:16:50.642960Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.642960Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:fb29ed9eff91eab8a1392dd3329976843e82c17ecb297f426d5d948e4a0a5e1d","observation_id":"0953712d-9267-4135-882f-c3bfcbf75c5f","resolution":{"observed_at":"2026-08-05T21:16:50.642960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:16:50.736043Z","title":null,"venue":null,"work_id":"24033011-1f83-4532-9492-62bc18728048","year":2025},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.651526Z"},"links":{"citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:e07e67ac89b4963f66f26aefffcbffa11f592f738a930448cb060dbceeb78558","observation_id":"4a3bf52f-d29f-42f7-a82d-f45e792260a3","resolution":{"observed_at":"2026-08-05T21:16:50.739395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T21:16:50.647280Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.647280Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:fb0184b641cf0b53a6d5a3f00f7b2acc59e95d0a0a84457d0c31f60a17980b4b","observation_id":"cc1f00d7-649d-4957-920c-df764718e823","resolution":{"observed_at":"2026-08-05T21:16:50.647280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-07T23:35:09.059226Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-05T21:16:50.649376Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.649376Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:ca589589bf2adc933c948b97e6604eeab404ad949b61738d020336bb1b3a47e9","observation_id":"8fb6f571-f63e-4466-985d-9a52c58cb6d2","resolution":{"observed_at":"2026-08-05T21:16:50.649376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T21:16:50.629382Z","title":"Dita: Scaling diffusion transformer for generalist vision-language- action policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.629382Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:5538d6bb614ebc6e29ce3afe187ffd641a1c9c631674e8e4880b2d81db1d16a7","observation_id":"8779decc-64d5-427b-a144-f8ce6795cb08","resolution":{"observed_at":"2026-08-05T21:16:50.629382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T21:16:50.623102Z","title":"Qwen technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.623102Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:3dc8b60eec03393a092b63402f49994f0ae16ccb07a33675818992b513aedf77","observation_id":"845a691d-df31-4f89-9d08-7449379b87df","resolution":{"observed_at":"2026-08-05T21:16:50.623102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05199","last_updated":"2026-04-28T04:08:50Z","snapshot_observed_at":"2026-08-02T18:14:47.156862Z","submitted_at":"2025-06-05T16:11:57Z","title":"DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05199","snapshot_observed_at":"2026-08-05T21:16:50.645267Z","title":"Ground- ing beyond detection: Enhancing contextual understanding in embodied 3d grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.645267Z"},"links":{"cited_paper":"/paper/2506.05199","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:79fd188b9ba3842a4433e57f8b578dbbbd872634aab3d29a1149163df6e7de2c","observation_id":"75752dd1-39ad-493c-888b-7bad0658224e","resolution":{"observed_at":"2026-08-05T21:16:50.645267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-05T21:16:50.635037Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.635037Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:b0c42a444c5ea68e873d8ea5c07aa454551646f26842fbb5e30bd2dde9ab34e1","observation_id":"f9c6fa5d-81b5-4426-873a-e0eae9c2790e","resolution":{"observed_at":"2026-08-05T21:16:50.635037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T21:16:50.626399Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.626399Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:f872cb0588b73db52588f9952869337b66ad96a7f8e66c18dac70864c177f45e","observation_id":"48171647-2b2b-4126-b3c1-14667dfd248c","resolution":{"observed_at":"2026-08-05T21:16:50.626399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 36 inbound Pith citation observations for arXiv:2508.09071."}