{"as_of":"2026-08-09T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e5b676f3bf61c9a40a150d89daf86b56fdc93755c31c21efa7ff132169b321d","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:44:18.247570Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05042/citation-record","integrity":"/paper/2608.05042/integrity","json":"/paper/2608.05042/citation-record.json","paper":"/paper/2608.05042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:11.836856Z","title":"OpenVLA: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:11.836856Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:b48140011758c0a31afde441bbec72e513fb9c848041cd6d1f18ff9382ebe255","observation_id":"da635c3e-14ba-454c-ad3a-f0147571b3d3","resolution":{"observed_at":"2026-08-06T10:44:11.836856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-06T10:44:11.920374Z","title":"π0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:11.920374Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:f59ee2f3b9bf374324c969c0366acb3fe4cbe2ee850f32c449c0599bf2007531","observation_id":"30ef66ac-b196-4113-845a-b1c1b5b72135","resolution":{"observed_at":"2026-08-06T10:44:11.920374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30877","snapshot_observed_at":"2026-08-06T10:44:12.106434Z","title":"W ALL-OSS-0.5 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.106434Z"},"links":{"cited_paper":"/paper/2605.30877","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d453240e7ff27e9b2e67f41f5f705400ac6b4fca9716819dde76a0005c4a93a8","observation_id":"4c4286e5-ac21-4ebc-becb-0504efc4af64","resolution":{"observed_at":"2026-08-06T10:44:12.106434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.052466Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":"8e9697cd-210c-4604-acaf-7c308276c715","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.235379Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:9fb8493bc1fed2119b92e5adebd0a88c613887a6b91827ebb4fff71c4a7ffa97","observation_id":"9ae2648e-564a-4774-8ef4-35d5a4bf726b","resolution":{"observed_at":"2026-08-06T10:44:19.055685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.042432Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"0382dc55-c8a7-4627-b6c9-16c05c15a7c3","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.390934Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c99152293d776d1f6d7224c81fe141335e28ece51e4c85e97870de3eaeec3e94","observation_id":"72f95a25-9bc3-4002-aaa5-25cae51bd56a","resolution":{"observed_at":"2026-08-06T10:44:19.046255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.033150Z","title":"Perceiver-Actor: A multi-task transformer for robotic manipulation,","venue":null,"work_id":"383440fb-edbe-4d56-9ce9-f85682a06fdc","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.523105Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:0b94aae2ee69ffe720c54e9f8dac945f2f60dbac827f84c736cea794f4880872","observation_id":"36ec393a-1107-4976-8e73-5b110a128bc7","resolution":{"observed_at":"2026-08-06T10:44:19.036180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.024698Z","title":"3D Diffuser Actor: Policy diffusion with 3D scene representations,","venue":null,"work_id":"6380d134-55c2-4a26-ba07-e2feef47cade","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.644589Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6e2152b0ba8004403dfb4d3e34cc0075c94be949cfaf0b6c197973c6b4d3e0a6","observation_id":"62fa746e-6e30-4d58-bd9a-fbd27cc63775","resolution":{"observed_at":"2026-08-06T10:44:19.027748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.016317Z","title":"Act3D: 3D feature field transformers for multi-task robotic manipulation,","venue":null,"work_id":"c7423f55-113f-4397-ac14-0c60c274f25f","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.852518Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:1f4c5366ba23fa88162d43b07fcc37481f9acd060a467fb4f05011d5c7f3e902","observation_id":"8b5524d3-a092-490e-a37f-9b0b724fa9be","resolution":{"observed_at":"2026-08-06T10:44:19.019261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.007509Z","title":"RVT: Robotic view transformer for 3D object manipulation,","venue":null,"work_id":"d7d9f822-8704-4f4f-9dbb-eb94b6ca8183","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.979457Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:33eb4b20d4d3ba41c42163701404d417dc2de3a389ef46a4552083243ff0e64e","observation_id":"c172a669-c510-4cd3-84cc-a552d268c8b2","resolution":{"observed_at":"2026-08-06T10:44:19.010416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.998863Z","title":"RVT-2: Learning precise manipulation from few demonstrations,","venue":null,"work_id":"4aaf2ce1-77ab-43cd-b074-7b7a05647354","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.078472Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:f9400ecd8aefc9fa51f488a561fd9768ed3f8f95f7a47499c0af3fb432758b14","observation_id":"132b4569-ec0d-4f4b-9f54-2f83a980c37f","resolution":{"observed_at":"2026-08-06T10:44:19.001863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.990186Z","title":"3D-VLA: A 3D vision-language-action generative world model,","venue":null,"work_id":"c4ab96b3-793f-489f-86f4-1bf89d5d0794","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.210283Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:f2a56b783a1053945cc05c048077dd49eac3812fb3fec0edac9ba88ade9663dd","observation_id":"111db71a-e83c-4bf4-ae07-e402e17c8359","resolution":{"observed_at":"2026-08-06T10:44:18.993333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.981810Z","title":"SpatialVLA: Exploring spatial representations for visual- language-action models,","venue":null,"work_id":"caae2ee0-1e40-482d-bea9-4ad4f99556b5","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.350018Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:805d6254b993723bb869f1ecc305def7d543ed0a4b77872959179a5f98e88571","observation_id":"abec4001-6626-4f0a-aa60-e1d5f1aae51a","resolution":{"observed_at":"2026-08-06T10:44:18.984740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.973452Z","title":"RLBench: The robot learning benchmark & learning environment,","venue":null,"work_id":"fc1c4efc-0da6-403b-93cb-f79aec30344f","year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.499499Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:be23bb7167b742ae453324a0a81637f56c2cd76a7ae47db0efb3795bd8b55f26","observation_id":"e7176949-b0a9-44bd-8dc7-6660c0d0d8c7","resolution":{"observed_at":"2026-08-06T10:44:18.976335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08191","last_updated":"2024-05-28T00:37:02Z","snapshot_observed_at":"2026-08-05T06:18:26.955637Z","submitted_at":"2024-02-13T03:25:33Z","title":"THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08191","snapshot_observed_at":"2026-08-06T10:44:13.672028Z","title":"The Colosseum: A benchmark for evaluating generalization for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.672028Z"},"links":{"cited_paper":"/paper/2402.08191","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:797081fc5d0c572e7fde2439730ca3f28e4be02a27c52d13353822bf21d6ace3","observation_id":"edbb9f7e-c70c-4f75-96bf-10ee976757d3","resolution":{"observed_at":"2026-08-06T10:44:13.672028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.963516Z","title":"Towards generalizable vision- language robotic manipulation: A benchmark and LLM-guided 3D policy,","venue":null,"work_id":"ef14d54e-7142-424a-8432-735e360f8eea","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.754442Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:e570f5d97485bb1420187c9bf3d22a973ef394f10f2bd442dee664ac8d076f88","observation_id":"6973dddc-827f-46de-a672-d9483518cd54","resolution":{"observed_at":"2026-08-06T10:44:18.966940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01229","last_updated":"2026-07-30T17:55:22Z","snapshot_observed_at":"2026-08-08T09:48:57.974249Z","submitted_at":"2026-03-01T18:59:59Z","title":"RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01229","snapshot_observed_at":"2026-08-06T10:44:13.849049Z","title":"RMBench: Memory-dependent robotic manipulation benchmark with insights into policy design,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.849049Z"},"links":{"cited_paper":"/paper/2603.01229","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:574eb3c2e629cdc1cf712cbe93869028471f30ac70c87f32e6c654fe40a7bea4","observation_id":"fe57631e-5ac7-41f1-a37f-d84c9630ec0d","resolution":{"observed_at":"2026-08-06T10:44:13.849049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.953100Z","title":"SAM2Act: Integrating visual foundation model with a memory architecture for robotic manipulation,","venue":null,"work_id":"d566cde2-19d7-4d67-ac22-a6910065c974","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.970866Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d2672f39781bb863bceea5be93eac9fb349774858e573357d0956e0ea22a7d1d","observation_id":"10fe969f-77ba-4af8-8513-e8fb104d71cf","resolution":{"observed_at":"2026-08-06T10:44:18.956456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.942610Z","title":"BridgeVLA: Input-output alignment for efficient 3D ma- nipulation learning with vision-language models,","venue":null,"work_id":"dc594c98-f752-4cbf-b29c-00722ba9e31d","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.064287Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d699e33c1a2fe9b105fe9b1dd49f647ac9c0730c7832f43c8914fd484e7c343a","observation_id":"496c8dc8-a445-49a6-8865-e1fe4a147bc7","resolution":{"observed_at":"2026-08-06T10:44:18.945963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.931754Z","title":"RT-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":"b26e7fe9-bc09-4ca8-ab22-81f2ccae4e55","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.135586Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:254fa296bdde0a96a262fac556c345f072701ef8775becb6f025cda1106fb59c","observation_id":"b4bcc8d6-2459-47ba-b90b-71f01c45a501","resolution":{"observed_at":"2026-08-06T10:44:18.935088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.921436Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":"41ca0265-aa82-428b-a624-4db7601331a2","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.302562Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:1d17643d1344aa00f8059c3756c714dda2b444ab93afc9db61de028a4dfc6b01","observation_id":"a9af96c5-bcb5-4b3d-a666-3695f9e631c1","resolution":{"observed_at":"2026-08-06T10:44:18.924717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.909948Z","title":"FAST: Efficient action tokenization for vision- language-action models,","venue":null,"work_id":"f4d30865-9532-48bd-b0ea-7f4e424f8076","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.470124Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:01cade7ffd141a23ec7e5ad8e1b3f2076bdc62745cf7758f410ded0976b7511f","observation_id":"371af7de-dfa1-40a4-806f-f70e409abec5","resolution":{"observed_at":"2026-08-06T10:44:18.914178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-06T10:44:14.652245Z","title":"π ∗ 0.6: a vla that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.652245Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6e3f4d9067cd2fed2a2e3c4a35f32c486fb6b15f670f87656e9c52fdd807b6b8","observation_id":"2c2b5ade-1432-48d0-830c-4575e227a1bf","resolution":{"observed_at":"2026-08-06T10:44:14.652245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-06T10:44:14.797218Z","title":"π 0.7: a steerable generalist robotic foundation model with emergent capabilities,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.797218Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c098bd8d95a1bee5df5ffb616599be400a4156774e1d20b73690634a9f6d1bbb","observation_id":"371df10c-c4af-4cec-bc5e-716115ee111e","resolution":{"observed_at":"2026-08-06T10:44:14.797218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.899318Z","title":"GEN-0: Embodied foundation models that scale with physical interaction,","venue":null,"work_id":"23820865-8b4e-49c7-bdbf-dbea534d4d6b","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.955267Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d09e0707fe01937ba1076251243eec3ac1277c2d4fd4591027415cc51a89c2be","observation_id":"8cf5754c-5969-4399-95a6-b3c9f23c9da4","resolution":{"observed_at":"2026-08-06T10:44:18.902689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.888776Z","title":"GEN-1: Scaling embodied foundation models to mastery,","venue":null,"work_id":"0f67cfcc-18f6-4c0f-b66d-c3f8aea5515a","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.131468Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:9305d5b938a2b24d7d88015ac7c73a8932339e94b05c18823daea0e5ebcedc08","observation_id":"5ddf7257-1253-40f0-a59d-5e17719dbaa1","resolution":{"observed_at":"2026-08-06T10:44:18.892286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.878377Z","title":"GENE-26.5: Advancing robotic manipulation to human level,","venue":null,"work_id":"fcc17c2f-2801-4abc-8246-919370d39086","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.233329Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:8883ded18a5299dd381b0f3575c68df31f1f6f77d25ef6eae58c712df75d0653","observation_id":"ec1cd722-0cfb-4adb-babe-5a00236107cd","resolution":{"observed_at":"2026-08-06T10:44:18.881643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.867401Z","title":"ACT-2 preview: Generalizing reliability,","venue":null,"work_id":"8da5c5ff-878f-454c-b606-e63ab98367d1","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.384527Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:43d16a13fe25522266214e04043b1849a88f544ea558450e514b57821a315426","observation_id":"821c082a-2eb8-4751-a1ee-4bec48253783","resolution":{"observed_at":"2026-08-06T10:44:18.871047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.856173Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models,","venue":null,"work_id":"92bb61dc-c686-4778-b4e7-ead893732260","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.548311Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:8c55cac9c5f7ea420eb2e586056578be25690bd14a4f02c2e7fc3d08bad64de1","observation_id":"e1484038-fc1c-4daa-839f-7bfc9bf6ca4f","resolution":{"observed_at":"2026-08-06T10:44:18.860168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.845160Z","title":"PolarNet: 3D point clouds for language-guided robotic manipulation,","venue":null,"work_id":"4056d87a-fd07-4bd3-8df2-51bc47fe5ae5","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.653628Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:ee49525c415c9f7830204bfe14b857b8f294b2c5695f24e80fde724d6996fece","observation_id":"cd1f516d-f3ef-42f3-9164-897156e98ac9","resolution":{"observed_at":"2026-08-06T10:44:18.848674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.833749Z","title":"M2T2: Multi-task masked transformer for object-centric pick and place,","venue":null,"work_id":"7dccfa41-1a24-470f-b042-da7ecbcade2d","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.829628Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:9fd3d3c1bd06e6c5c2e05815b09b766302ac5c45cf2ccee0a70872461ed21752","observation_id":"eb140a8d-ce8b-4c83-9b44-15e09803f790","resolution":{"observed_at":"2026-08-06T10:44:18.837170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08950","last_updated":"2025-03-11T23:01:08Z","snapshot_observed_at":"2026-08-07T17:11:34.321061Z","submitted_at":"2025-03-11T23:01:08Z","title":"FP3: A 3D Foundation Policy for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08950","snapshot_observed_at":"2026-08-06T10:44:16.040209Z","title":"FP3: A 3D foundation policy for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.040209Z"},"links":{"cited_paper":"/paper/2503.08950","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:7819af653192fede6d12bba520dc6dfe075737158e0e93cc90bad5d2507446a2","observation_id":"c4caa6bb-3519-40db-92e1-62c5f229d026","resolution":{"observed_at":"2026-08-06T10:44:16.040209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.822780Z","title":"Coarse-to-fine Q- attention: Efficient learning for visual robotic manipulation via discreti- sation,","venue":null,"work_id":"35e083a1-2ab9-4d5f-bd28-5150230b980a","year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.225713Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:b3b92f96f6ba0a7c5f1aef65b036eadf62e96e122e3649771fdf60a73b6d0024","observation_id":"12c3079f-f9fd-4bd7-b466-94c5828442f2","resolution":{"observed_at":"2026-08-06T10:44:18.826462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.810974Z","title":"PointVLA: Injecting the 3D world into vision-language-action models,","venue":null,"work_id":"ceb45008-0961-44bd-b6e7-295b620ad888","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.363898Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:b7eef5dc268925b4c13b67ec851f8a3009f48a4ee8361bbcf25282961f0f3f25","observation_id":"deeacec7-9962-42cf-ab9b-33007842f9c6","resolution":{"observed_at":"2026-08-06T10:44:18.814607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.799819Z","title":"Lift3D policy: Lifting 2D foundation models for robust 3D robotic manipulation,","venue":null,"work_id":"0916f5fa-a662-40a7-9334-c20567232d78","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.530929Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:0b74107e1ff57c4a62095f7996ca5963dbdaea7f5b95168347a0ed9973cc8a64","observation_id":"518fea34-2208-4803-80f6-e2a854ba2e3a","resolution":{"observed_at":"2026-08-06T10:44:18.803293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.788400Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":"2ede7e06-8fb5-454c-a744-1b6645731f03","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.777096Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:8c7406bb3f3aa02f403814d984f4c2e5f636b62bb61b91c7582bf78e84387bd0","observation_id":"deb3e36c-995d-4e7d-9f68-269b8fdf977a","resolution":{"observed_at":"2026-08-06T10:44:18.791935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:16.921827Z","title":"OG- VLA: Orthographic image generation for 3D-aware vision-language action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.921827Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:927511121e21be32e4e749e6f142b1da122bd36cf847b347d64642014d01616d","observation_id":"dd8f4b74-cad6-4f31-b450-c15e922ec900","resolution":{"observed_at":"2026-08-06T10:44:16.921827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:17.011327Z","title":"Instruction-driven history-aware policies for robotic manipulations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.011327Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:854c50270bd20fae68fd99fed7286d1cc701aa4c697e55b8205a4aa71402df02","observation_id":"0c222d1c-b006-4f1c-a73e-1d935006267a","resolution":{"observed_at":"2026-08-06T10:44:17.011327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-06T10:44:17.098344Z","title":"Causal world modeling for robot control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.098344Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:f4b379da07429ba41d809293e18cf751b9bf8582727fd8c92a2ac6cd9b512d79","observation_id":"e8352d45-348c-455d-9e25-5fba4dab6404","resolution":{"observed_at":"2026-08-06T10:44:17.098344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05979","last_updated":"2026-06-04T10:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T10:23:01Z","title":"World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis","version":1},"cited_work":{"arxiv_id":"2606.05979","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.05979","snapshot_observed_at":"2026-08-06T10:44:18.470160Z","title":"World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis","venue":"cs.RO","work_id":"640ad13f-fe94-4971-90f6-9b65ecddb769","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.241212Z"},"links":{"cited_paper":"/paper/2606.05979","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:881c35aa1bde237c3b9a40a155d83b45c3d95d260d82500bd8c194f912c35202","observation_id":"19f9ba14-2da4-423f-9532-901e793b4ed8","resolution":{"observed_at":"2026-08-06T10:44:18.473850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20562","last_updated":"2026-06-18T17:59:51Z","snapshot_observed_at":"2026-07-06T23:55:43.830896Z","submitted_at":"2026-06-18T17:59:51Z","title":"MemoryWAM: Efficient World Action Modeling with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.20562","snapshot_observed_at":"2026-08-06T10:44:17.373966Z","title":"MemoryW AM: Efficient world action modeling with persistent memory,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.373966Z"},"links":{"cited_paper":"/paper/2606.20562","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:29e0653de4b9685a53e34d93e66fb8b607f88be77f7d901518df19eb2b8029e4","observation_id":"f0b9dd4f-6e94-459e-9229-cbfa958934ba","resolution":{"observed_at":"2026-08-06T10:44:17.373966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.768884Z","title":"TraceVLA: Visual trace prompting enhances spatial- temporal awareness for generalist robotic policies,","venue":null,"work_id":"b0fa72d3-925e-4ca1-aa33-cfa7e228dbff","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.477048Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:a238aac2f5ae6a6061b087b97746a6f13ee019f868c7aeec7fe1580b72e70b27","observation_id":"0e8265e4-ae1c-47cd-b236-f55b4fc3419c","resolution":{"observed_at":"2026-08-06T10:44:18.773326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:17.604914Z","title":"RoboMemory: A brain-inspired multi-memory agentic framework for interactive environmental learning in physical embodied systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.604914Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:0e58614e63e615ac3fd6266961d99e33d0944c5409570cc65158b3b9faecd4de","observation_id":"f3038fbd-6cc5-4a77-a2eb-dfc5a65702df","resolution":{"observed_at":"2026-08-06T10:44:17.604914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.757852Z","title":"MemoryVLA: Perceptual-cognitive memory in vision- language-action models for robotic manipulation,","venue":null,"work_id":"9ac6a798-4272-4089-b1c0-9dd48e888207","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.711839Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:8dd78987bf04f545b8db2650780562927763b11f20040bfdc623527a980497d7","observation_id":"066b05a7-3096-4d78-a0b3-e3387bb86b98","resolution":{"observed_at":"2026-08-06T10:44:18.761545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18933","last_updated":"2026-08-03T20:19:45Z","snapshot_observed_at":"2026-08-07T23:09:24.166578Z","submitted_at":"2026-04-21T00:14:50Z","title":"Gated Memory Policy: In-Context Memorization and Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18933","snapshot_observed_at":"2026-08-06T10:44:17.858828Z","title":"Gated memory policy,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.858828Z"},"links":{"cited_paper":"/paper/2604.18933","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:1800426d0ed0da787518017cae8a0ef71e50ca9e4157f32a5ce8382779979f35","observation_id":"f8a91fcd-be30-4561-8774-439ae3e83a76","resolution":{"observed_at":"2026-08-06T10:44:17.858828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.746515Z","title":"You only scan once: A dynamic scene reconstruction pipeline for 6-DoF robotic grasping of novel objects,","venue":null,"work_id":"2c7526a1-bf7e-4485-b28a-b612ca83d6d2","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.940226Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6b362e599bd1d1d17186306d3ccc8b855afc88baba7d2463c3faa45cc6d3815a","observation_id":"b26ee186-b1d0-4ab4-8c02-0d0e5df61fff","resolution":{"observed_at":"2026-08-06T10:44:18.750220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18960","last_updated":"2026-06-18T07:33:11Z","snapshot_observed_at":"2026-08-01T14:33:56.926730Z","submitted_at":"2026-06-17T11:42:00Z","title":"Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2606.18960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.18960","snapshot_observed_at":"2026-08-06T10:44:18.368232Z","title":"Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation","venue":"cs.CV","work_id":"f9cf5836-ec25-4d1a-be32-fade63c6e332","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.000401Z"},"links":{"cited_paper":"/paper/2606.18960","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:bc2ffd4690ac43c881d57891839288fff5a1297e14b2db0698454676e4f9a280","observation_id":"3619bfb8-af15-4b3b-91be-2ab580a5fb28","resolution":{"observed_at":"2026-08-06T10:44:18.373945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.103744Z","title":"Coarse-to-fine imitation learning: Robot manipulation from a single demonstration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.103744Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:3053e659471944942bbfd16bf190e64d60dd82d06b88811ebee06cc2d8c4c36b","observation_id":"62d4a375-70d3-4ef6-b231-9adb322ae235","resolution":{"observed_at":"2026-08-06T10:44:18.103744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T10:44:18.160988Z","title":"RoboPoint: A vision-language model for spatial affordance prediction for robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.160988Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:88e2b9a9c8b8170dea8c7c2c2992f8462a9eb7966f51bd93c029658e508effe4","observation_id":"c7340192-801b-4d8f-bdc4-a939dbc5ee48","resolution":{"observed_at":"2026-08-06T10:44:18.160988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T10:44:18.188176Z","title":"PaliGemma: A versatile 3B VLM for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.188176Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d2dd5341cd8027f4b89896c9a75b57055c3218b1305126615fe82d395ce80904","observation_id":"501a8a7a-ba8b-4f0f-b121-2bf46dfbbda3","resolution":{"observed_at":"2026-08-06T10:44:18.188176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.200108Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.200108Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d57b642a92e5980739370f871eeb4ab60b48ff4ff0c400af3961c0528bf5c4b5","observation_id":"1bcbf714-17a6-4890-b530-0d816e21e272","resolution":{"observed_at":"2026-08-06T10:44:18.200108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T10:44:18.203663Z","title":"Gemma: Open models based on Gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.203663Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:0b74a4058bdff1646d66816a9285b7f017594a5627c678b17322f9348f95d731","observation_id":"2bea7c9e-b7be-4b08-bd06-822a2d3a4ac7","resolution":{"observed_at":"2026-08-06T10:44:18.203663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.719175Z","title":"RAFT: Recurrent all-pairs field transforms for optical flow,","venue":null,"work_id":"9bce15db-f6a6-4e25-8c53-e83056f6f36e","year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.207095Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:e2109780fa760c3b096ee268aa188e5fe69f0854f39772aa41caf057bc7241dd","observation_id":"3db468e6-720e-4258-be7d-34058747e6b7","resolution":{"observed_at":"2026-08-06T10:44:18.722936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.210377Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.210377Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:0f89d029377b3d88888474a01f17995321a4bfc1863227598db7e2055774f0bf","observation_id":"6b10100f-42fc-4a01-b8d3-4adf5a1fce6c","resolution":{"observed_at":"2026-08-06T10:44:18.210377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.213450Z","title":"On the continuity of rotation representations in neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.213450Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6981557b691ee5b6cafb3e49b23ccde6333126b8827242bb4c5b6244340b55d7","observation_id":"2ffc9fc0-45bf-4d03-b590-220ec82989dc","resolution":{"observed_at":"2026-08-06T10:44:18.213450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.690860Z","title":"V-REP: A versatile and scalable robot simulation framework,","venue":null,"work_id":"d9df76de-e4a8-44a9-b8b0-698fa588c643","year":2013},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.216594Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:7a70375273740649486994a5bc3d5aace4b506d542a90056fd23f9dffdc88e68","observation_id":"06e3c500-0a7f-4650-bbef-286b2a71ad30","resolution":{"observed_at":"2026-08-06T10:44:18.694734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.679175Z","title":"Perceiver IO: A general architecture for structured inputs & outputs,","venue":null,"work_id":"c44a91f8-d892-4670-96f3-54191b99f561","year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.220226Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c443c688e51180aa97818cf5619d6e7110621d8be236f178b953e33a153aadd2","observation_id":"ad897fab-5612-4722-991c-6aaf338a20a4","resolution":{"observed_at":"2026-08-06T10:44:18.682780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.667052Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":"8c76a2d8-3970-4996-af39-9d4ee4de141d","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.223196Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:4ac116192869651645dd4f1ef7f2cb454e6b77e5dcac93a526dee3d6cbaf8476","observation_id":"ec093242-9c4c-44f6-a66a-7587bc53cf7c","resolution":{"observed_at":"2026-08-06T10:44:18.670900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.226213Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.226213Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d42f6a82dd17ec292bddc2780c9a2448f21e0c0a1b96ec88fec1adbe12d846f6","observation_id":"e2fd6278-b836-44b6-b6a4-eb6503c2a138","resolution":{"observed_at":"2026-08-06T10:44:18.226213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-06T10:44:18.229394Z","title":"X-VLA: Soft-prompted transformer as scalable cross- embodiment vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.229394Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:deff4dce0a239ed6b8a263ef86265b958c9966d9f65d5484ff7cd9db3508c8b4","observation_id":"78055c9f-cb59-46fe-bac4-338dfdddb5e7","resolution":{"observed_at":"2026-08-06T10:44:18.229394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-06T10:44:18.232308Z","title":"Fast-W AM: Do world action models need test-time future imagination?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.232308Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:a228ba1f0356f64947fc3b6663c44c79b194fb169a7ed28c5cc16db776fb72f0","observation_id":"748933a2-7d86-4b24-82ee-7c8ab8cb267d","resolution":{"observed_at":"2026-08-06T10:44:18.232308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-06T10:44:18.235552Z","title":"R3M: A universal visual representation for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.235552Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:0e15adf3d5427c665b9f2c5e84f259dd651f0d4405955afc12747ea4d46d9d72","observation_id":"5477a936-baab-46d6-8daf-b8bae834b0e5","resolution":{"observed_at":"2026-08-06T10:44:18.235552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-06T10:44:18.238620Z","title":"Masked visual pre- training for motor control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.238620Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:059958a3c9c27971b06e6847f240abfd82a90222675c78f96d0af3038e2e7ec4","observation_id":"222af3a0-3646-46b8-a56f-b3f57fb18cd0","resolution":{"observed_at":"2026-08-06T10:44:18.238620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-06T10:44:18.241421Z","title":"RoboTwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipu- lation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.241421Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c2518eaab34f8c80b9cecbe1730359138bddb46892029643e2b7381f3ac3c3f8","observation_id":"e3908d42-3017-427a-bc38-7ad0c4f92bfd","resolution":{"observed_at":"2026-08-06T10:44:18.241421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.647027Z","title":"SAPIEN: A simulated part-based interactive environ- ment,","venue":null,"work_id":"3c60e13c-2e3d-458f-950b-63a6923c47e6","year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.244590Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:fafa302da57685fe06b448c5ff8d508ca0084e415cf1eb2de7e4cabea2c73297","observation_id":"09676efc-b973-4a1e-b88d-813e430e0d34","resolution":{"observed_at":"2026-08-06T10:44:18.650643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.634879Z","title":"Point transformer V3: Simpler faster stronger,","venue":null,"work_id":"74e29941-60e1-4526-b8d8-9e5295ab1bdf","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.247570Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:5c29effa7d5848a342d0b77ac2c4c49c73e8878fb2ec93c973d5cbcd752ccb23","observation_id":"884d5e23-93a0-4550-b4cc-d1e6055735fa","resolution":{"observed_at":"2026-08-06T10:44:18.638849Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T23:13:49.825945Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2608.05042."}