{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7887e7c89870e60c3454972049927cb3dc08164834cd672700aa52814841115","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:21:15.562904Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:56:37.191428Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:59:46.871127Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T23:56:37.191428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15645","last_updated":"2025-06-18T17:14:07Z","snapshot_observed_at":"2026-08-07T21:48:56.620256Z","submitted_at":"2025-06-18T17:14:07Z","title":"Demystifying the Visual Quality Paradox in Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:56:37.191428Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2506.15645"},"observation_digest":"sha256:748b974535e8887ab1246f2ff274ed3e93553869071595c7382f1f94553f8c9e","observation_id":"3958f27a-cd4c-4d43-a2c9-5896bb4b176d","resolution":{"observed_at":"2026-08-06T23:56:37.191428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T22:49:07.721472Z","title":"arXiv preprint arXiv:2505.15517 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-09T16:42:30.828660Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.721472Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:d0b67af8e9fcf6c2e40c676d7c6ebc1392c651795d63f36298b7dae778ae7520","observation_id":"71e0cde9-4a6e-48b7-bf08-c46222e1b4e5","resolution":{"observed_at":"2026-08-06T22:49:07.721472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T17:43:53.200688Z","title":"Robo2vlm: Visual question answering from large-scale in-the-wild robot manipulation datasets,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-09T16:03:14.420559Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.200688Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:8873257c1ed93433666d4836ca998dc5812fa193358f5cc257fbe60d099f4660","observation_id":"b5371277-8e79-4797-ab8d-c1eabf6250ec","resolution":{"observed_at":"2026-08-06T17:43:53.200688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-03T13:29:54.177769Z","title":"Robo2vlm: Visual question answering from large- scale in-the-wild robot manipulation datasets,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-08T10:23:37.779496Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:54.177769Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:ce01528d87a6c76b5d96bafcae4330ca191881115a604c7fe9231862fa02ec0b","observation_id":"84347f74-b78d-436e-b668-2d701380c58b","resolution":{"observed_at":"2026-08-03T13:29:54.177769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"R., and Goldberg, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-06T10:59:04.687049Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:3975b1992dea7d9b7c73f0e3e82d702b239478719b27954905d0002a06516876","observation_id":"ab07615c-fe48-4386-9ebc-e6962892d043","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2604.20012","last_updated":"2026-04-21T21:40:58Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T21:40:58Z","title":"EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:16:08.687340Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2604.20012"},"observation_digest":"sha256:95ec093679b6ed053a08815bcf4bb39a0d08fdefd543470bdaf8dca643ad4787","observation_id":"db4d926e-04c7-4446-82ee-35e3b02bbd32","resolution":{"observed_at":"2026-05-11T13:11:03.769973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.13119","last_updated":"2026-05-13T07:40:34Z","snapshot_observed_at":"2026-08-01T14:15:33.557028Z","submitted_at":"2026-05-13T07:40:34Z","title":"Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T18:35:22.595183Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.13119"},"observation_digest":"sha256:7282cdd0a8114125cfc39a8560b9cd6c33da1c7390fb75e96355911c4b2fffe2","observation_id":"7d10b362-674a-4162-8a8b-2ffdfcf7c6aa","resolution":{"observed_at":"2026-05-14T18:37:35.557834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.19328","last_updated":"2026-05-19T04:07:24Z","snapshot_observed_at":"2026-08-03T19:21:56.538777Z","submitted_at":"2026-05-19T04:07:24Z","title":"RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T05:05:42.451746Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.19328"},"observation_digest":"sha256:4d88432f25a933c0742994c8e18cf53d49952e9141b56fe19e63bafa9ba0d44c","observation_id":"6597ac9a-428c-4f63-81ed-4b8b7612e738","resolution":{"observed_at":"2026-05-20T05:08:05.177944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.25802","last_updated":"2026-05-25T12:51:35Z","snapshot_observed_at":"2026-08-05T08:07:09.530165Z","submitted_at":"2026-05-25T12:51:35Z","title":"Rethinking VLM Representation for VLA Initialization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:29.733181Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.25802"},"observation_digest":"sha256:4e1712ba4439cb6b5d025d6cf178ff7305e5c4dd31023e5159f202c081901fbf","observation_id":"13d6f012-16b6-44f1-a40d-981388de4813","resolution":{"observed_at":"2026-06-29T22:24:00.128773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-09T12:02:18.891438Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:0f1d443ae226820a8096eb8eb6c143301a74a2f377d60040d588f59426816b96","observation_id":"69813e01-6f70-4049-8b54-9152fed034f7","resolution":{"observed_at":"2026-06-29T21:33:58.981062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:92a82da1c714bb67711d2a559990f1934965f0624215234344f19863fb5df7f1","observation_id":"78ecdf25-e94e-4225-b0d2-a12583a15c8c","resolution":{"observed_at":"2026-06-29T13:43:28.939856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:00.258436Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.30877"},"observation_digest":"sha256:7e81c2b3abf5f258758b86bc83d07ffa3a416bca30205f102f537f3fed0d30cd","observation_id":"6657bccb-16d3-4b2f-b549-c6a75779ff99","resolution":{"observed_at":"2026-07-01T19:26:00.530454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:2ffa48e743e85d7e63102d81f3b7c2f376460da0f1bcc7d021c285cc3b5ea84b","observation_id":"6d129ccf-4039-44f3-a1d0-427ab9ba868a","resolution":{"observed_at":"2026-07-02T22:57:26.630648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T06:26:32.209719Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:cd8bc50fdcb2184d217e510efbf0b3733b14f303d5c869ca0a58b7ad184b6df0","observation_id":"ea05806d-e451-4a73-87e4-ebb4d88fd28c","resolution":{"observed_at":"2026-07-03T15:28:34.770570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-02T11:43:49.379947Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:43:49.379947Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:0828026876bc69b1883c0d4a505c9615bb6d41c4bc8849577807462798929ebf","observation_id":"93a450d5-0507-48c7-8596-c619c4fb2a52","resolution":{"observed_at":"2026-08-02T11:43:49.379947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:733d34ecdb404d8d7552501fe88ba9b9e28d0ef4039861ea9cd5901622f5f664","observation_id":"e9149a18-0ed3-4570-b74c-381e2a561269","resolution":{"observed_at":"2026-07-04T04:29:35.736977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.23881","last_updated":"2026-06-22T19:27:00Z","snapshot_observed_at":"2026-08-03T12:04:36.736234Z","submitted_at":"2026-06-22T19:27:00Z","title":"Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-26T08:12:14.829556Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.23881"},"observation_digest":"sha256:9c8534cfc82d50841db523b3cb4175ceb5cc8230a3e38fdf95c946f81faef5ab","observation_id":"974cc6a3-9b1b-4118-884a-d95e485da3ce","resolution":{"observed_at":"2026-07-04T10:59:46.873792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-14T17:30:54.988498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09701","last_updated":"2026-06-21T16:16:02Z","snapshot_observed_at":"2026-08-01T23:36:03.315592Z","submitted_at":"2026-06-21T16:16:02Z","title":"EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T17:30:54.988498Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.09701"},"observation_digest":"sha256:9fd644944d9376ea8280fbd15ad26e43a3f7ab196e73d5f8b1d4c35c9f36f521","observation_id":"a99f9c32-9729-45bf-81f1-806a6e7e4970","resolution":{"observed_at":"2026-07-14T17:30:54.988498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-02T05:16:35.354226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-07T12:37:37.871440Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.354226Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:d04f5fd6d3a9f23083c29d54f0adf641aa2a53135ed0d73be5cfca36028560de","observation_id":"f7c34079-fe85-4677-91b1-0d98d1ed7f7e","resolution":{"observed_at":"2026-08-02T05:16:35.354226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-01T16:32:46.402572Z","title":"Robo2vlm: Visual question answering from large-scale in-the-wild robot manipulation datasets.arXiv preprint arXiv:2505.15517, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-06T12:49:54.995384Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:32:46.402572Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:9bf36d0aea92c3f2b9449b3ed39b7a230280764d9909fd020521be85dbf5f7e4","observation_id":"0ac0bafc-1318-471d-8f61-4b03a1718018","resolution":{"observed_at":"2026-08-01T16:32:46.402572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-03T01:57:27.437916Z","title":"Robo2vlm: Visual question answering from large-scale in-the-wild robot manipulation datasets.arXiv preprint arXiv:2505.15517, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-06T12:49:54.995384Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T01:57:27.437916Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:e6867079b99150e0716c029619e67a422359b12290bc38e2bc041ce97f38b345","observation_id":"21826f6d-47ea-4d4c-be0f-410311188457","resolution":{"observed_at":"2026-08-03T01:57:27.437916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15517/citation-record","integrity":"/paper/2505.15517/integrity","json":"/paper/2505.15517/citation-record.json","paper":"/paper/2505.15517"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.661547Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.661547Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:e4285f0407581e3d2fdac09a6da926a066e926b62b02aa407b6989afdd29c1cb","observation_id":"2810f855-b6ec-49ef-bff6-84e1f1ed0461","resolution":{"observed_at":"2026-08-07T15:21:10.661547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.774245Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.774245Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:32fa5ebca8906f94c05600556d7d7ea9492db23dc15419ef352104b5902260eb","observation_id":"46b306a3-2f10-4c8b-aeca-419db50ceaf2","resolution":{"observed_at":"2026-08-07T15:21:10.774245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:21:10.925490Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.925490Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:480a5dba651a3ef871a3d4c573aed608f2918ae61964294134e18ad7678db8c0","observation_id":"a6f7afe0-db68-498b-9577-5941013cbed1","resolution":{"observed_at":"2026-08-07T15:21:10.925490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.987905Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.987905Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:075bda50fe496e40691e413b8a1366ee766203437a2f20d94483b6efd33289be","observation_id":"b283527a-94e2-4907-8815-859bfbf2d01c","resolution":{"observed_at":"2026-08-07T15:21:10.987905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.720533Z","title":"Claude 3.5 Sonnet","venue":null,"work_id":"0c6420e1-5bbf-4572-b5ce-370f3006e80f","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.067543Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:0f7a504b4be7a36d8e6b6feef479672cf58a2051d43ea71a8e05952b3ee87e5b","observation_id":"c42254d0-0d1d-4b9c-8e6f-866eea83b1ce","resolution":{"observed_at":"2026-08-07T15:21:21.793205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.561774Z","title":"GPT-4o System Card","venue":null,"work_id":"b89cf26b-5367-4914-a900-5b247840df45","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.157025Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:6ed5ff72a6a220ddf1d16a9f562773ed1b55fdb73482bea26f7f7e7f183f87b2","observation_id":"d9087d7c-72a7-4cd8-a609-f6258e7b940c","resolution":{"observed_at":"2026-08-07T15:21:21.645637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.426951Z","title":"Gemini 2.5: Our most intelligent AI model","venue":null,"work_id":"58163245-c433-4a43-94ae-95aebf4df7af","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.248985Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:b355ded8e987f651b9dcb503c4c109145e9e8030891bfc15e744a1b414862275","observation_id":"88ad1e3c-4542-4184-9ad1-b9195e891e99","resolution":{"observed_at":"2026-08-07T15:21:21.474603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:11.317851Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.317851Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:410d8d5e3f6f0c29d793c42445e41f94b00a74dd8b8288545a0ed08716132a3a","observation_id":"fc579134-c768-4c91-bc3b-cbe21cff9066","resolution":{"observed_at":"2026-08-07T15:21:11.317851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:11.431731Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.431731Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:5954e463caadef42afcad66f0b24485603d0812f37a3272c72baa2d024a15312","observation_id":"ef00d9c1-6dce-42c5-9560-73ebf9d79a41","resolution":{"observed_at":"2026-08-07T15:21:11.431731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T15:21:11.524858Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.524858Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:7cdcf49775323882ecd42a0f96f44ad867f3a919b2244c8ef584820451deb537","observation_id":"5c840a04-665a-46c8-86d0-de2aaf072892","resolution":{"observed_at":"2026-08-07T15:21:11.524858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.277466Z","title":"Gemini robotics: Bringing ai into the physical world, 2025","venue":null,"work_id":"228383eb-e149-4876-9811-56f381d0aeeb","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.617361Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:ce9276fe56d9634c4ac47fcb6450c220829f573291f57fb9c4aea0adc3e6f452","observation_id":"37ae5ddd-834d-4fde-8be4-6d2b444708e5","resolution":{"observed_at":"2026-08-07T15:21:21.320767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:11.717767Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.717767Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:7e0d94cbee834d28a9b31a104d33113137d93ac270b2dbcf93bb90b8403655fe","observation_id":"e53a4628-f2d8-499f-a70b-27291e9247b3","resolution":{"observed_at":"2026-08-07T15:21:11.717767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.072091Z","title":"EQA-MX: Embodied question answering using multimodal expression","venue":null,"work_id":"6fdae6e5-184a-43cb-a1a9-35b06de7f0c3","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.843051Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:0c188ef1fefba09ce879d30ecceefa0090a7ed84e07e871664b2a8a366c8a7cc","observation_id":"49756c7c-1796-49b5-ac41-6576e0eeaaac","resolution":{"observed_at":"2026-08-07T15:21:21.177361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-07T15:21:11.971065Z","title":"EM- BODIEDBENCH: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.971065Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:98d3366935ae1bd8f6fcf7b325005478ab2dfbd2fa710ab3aa2a727da02cdc9a","observation_id":"d5486305-0b77-41c1-abe9-ad1f99cd4ad6","resolution":{"observed_at":"2026-08-07T15:21:11.971065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.901803Z","title":"Embodied agent interface: Benchmarking LLMs for embodied decision making","venue":null,"work_id":"2750fad6-96d2-4817-a0e5-03dd8b714d3b","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.071017Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:4276e26182b1ebbb0ea45ecf6453068b6303b5723d80ed96d04e68f90b922140","observation_id":"a19ba6cb-a6b2-49fa-9a97-67f7ed454784","resolution":{"observed_at":"2026-08-07T15:21:20.976649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.701713Z","title":"ALFRED: A benchmark for interpreting grounded instructions for household robots","venue":null,"work_id":"5ea7e002-9273-4b52-91c0-dbd9bbabb910","year":2020},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.204644Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:cd7cf67671d4e6416458cfafb1247f650cf0d39b6cc3a992fec3c2b4d82e44a3","observation_id":"0e4dabe6-a413-4a42-a05a-e30dad133706","resolution":{"observed_at":"2026-08-07T15:21:20.803252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.532514Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":"25d18b52-49bd-4f7a-939b-494248df5a69","year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.307005Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:72c074f787772b4ae1eb8494cdfc93f6f4fdebebb0dc8ab4a4618789db28bd6c","observation_id":"4a5b6fda-a852-4c0e-87a3-444df8ed09ab","resolution":{"observed_at":"2026-08-07T15:21:20.597082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-07T15:21:12.433304Z","title":"AI2-THOR: An interactive 3d environment for visual AI","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.433304Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:08033ecf3942a1e1c899b2ece2b6e20c133b2d131e1b71f11a91b26afbc3d2df","observation_id":"89fac9a5-be2f-424e-96fa-2ecab99ce51e","resolution":{"observed_at":"2026-08-07T15:21:12.433304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00899","last_updated":"2023-11-01T23:40:07Z","snapshot_observed_at":"2026-07-06T16:41:56.099361Z","submitted_at":"2023-11-01T23:40:07Z","title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00899","snapshot_observed_at":"2026-08-07T15:21:12.537196Z","title":"Joshi, Pete Florence, Wei Han, Robert Baruch, Yao Lu, Suvir Mirchandani, Peng Xu, Pannag Sanketi, Karol Hausman, Izhak Shafran, Brian Ichter, and Yuan Cao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.537196Z"},"links":{"cited_paper":"/paper/2311.00899","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:6b6f277e400c56c0cc7fc8472bfbcd534dcfc4565d613aa2e1538e4c53509afe","observation_id":"28ffec7f-042f-4d23-a4be-d9ff5dd7e60b","resolution":{"observed_at":"2026-08-07T15:21:12.537196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.324158Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":"f4fa45d2-ca19-4d18-9689-dc65252691a9","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.635029Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:46705d834ef6f0e5392bd40cd1cbd4cc9e997df9b768583d5131da1c5d1c27f8","observation_id":"fbbefaac-f9b0-4556-84d0-13326ffaa9a0","resolution":{"observed_at":"2026-08-07T15:21:20.429334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:12.705074Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.705074Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:c8a67adbf8dde67208b577d279134dcf22102ffeb5962668a20a7eae8adb525d","observation_id":"8b530ecd-9b84-45c7-abe9-90bc9fa4d57f","resolution":{"observed_at":"2026-08-07T15:21:12.705074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:12.758835Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.758835Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:eaa4021a3aa774a5e286ecd6e7484ef7e64c4693f0a475a36f3b0438dd211e08","observation_id":"b8bb77a2-732e-4716-a7e7-3ec37fe1b30c","resolution":{"observed_at":"2026-08-07T15:21:12.758835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.116244Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"059735af-97cc-4d65-9938-a1753de305c8","year":null},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.855366Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:541c0f9a6b73621db8fab42fbcc4ebfe0ae39b4c393d23dead277dfc99dd5201","observation_id":"7cb2f140-4df4-4fd6-8fd0-da4d723b5616","resolution":{"observed_at":"2026-08-07T15:21:20.205356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T15:21:12.929203Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.929203Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:a9286e282de8b40ae22ac4e115756d9915f5d4a8adaf7ffe30104ecd38715a83","observation_id":"fadc7e27-88de-4086-9c27-191a49deb0b7","resolution":{"observed_at":"2026-08-07T15:21:12.929203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:19.895659Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":"f3428cb1-0d73-41cd-a09f-0074cf4cc3c3","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.048192Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:6f7aa9e2a7fcbfa34c061ee0bd5041c56a2ca648cb11a5a96858470f90de6d48","observation_id":"70eef0d6-9a22-4c5e-9eeb-66ec350dfdf6","resolution":{"observed_at":"2026-08-07T15:21:19.989185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:19.551631Z","title":"Remix: Optimizing data mixtures for large scale imitation learning","venue":null,"work_id":"cab4a1e8-f8ac-4392-b948-08e9d9275fda","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.138606Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:9d26ca3bcf54975186aa26c81c41edeb882cc2332a08321ebd768ca34b9bbbcd","observation_id":"d8c58291-f7e2-482e-bbb5-1a69728bb5fa","resolution":{"observed_at":"2026-08-07T15:21:19.661846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01894","last_updated":"2023-10-03T09:03:34Z","snapshot_observed_at":"2026-08-06T05:58:01.917319Z","submitted_at":"2023-10-03T09:03:34Z","title":"Waveform Manipulation Against DNN-based Modulation Classification Attacks","version":1},"cited_work":{"arxiv_id":"2310.01894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01894","snapshot_observed_at":"2026-08-07T15:21:15.669653Z","title":"Waveform Manipulation Against DNN-based Modulation Classification Attacks","venue":"cs.CR","work_id":"c20350ab-d16b-405c-8047-5d0b10a1e9bf","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.327764Z"},"links":{"cited_paper":"/paper/2310.01894","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:8c2ad7e1b5a00840e09f135354539b3eae1547cd97d1480341d2fb65e5604c82","observation_id":"570b1f98-6c35-4d47-b7b7-fefbbd8c99e2","resolution":{"observed_at":"2026-08-07T15:21:15.736057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:19.296870Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":"425b5c3a-808f-46a9-a302-5367193d311e","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.602732Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:e7bb52cd6be81c1c175f7584c54c3c0801353d591dcaf7b4f184eb7629c307fc","observation_id":"677fab60-abfd-4446-93b7-ff132fdf478e","resolution":{"observed_at":"2026-08-07T15:21:19.434336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.973540Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023","venue":null,"work_id":"1772cde4-b1c4-4a82-8edb-39be7a7c9e80","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.799507Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:30640e280b0087addbc3b31d8c6cd1e09fcd8978308e8bea48914be8a2a1a05e","observation_id":"2536aae8-b720-4680-bf63-10254c34c0d8","resolution":{"observed_at":"2026-08-07T15:21:19.132362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.640078Z","title":"https://physicalintelligence.company/blog/pi0, 2024","venue":null,"work_id":"2c040f86-4ef2-4897-a461-1abd7c6afd91","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.879589Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:93f56c613e894e3c487d483172e511f4e0046e60bd3c31455684a3a9b96296fc","observation_id":"f0380f50-e9a3-4b7f-9da8-cb92844a76ed","resolution":{"observed_at":"2026-08-07T15:21:18.775799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.326739Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":"da5bb159-b037-4693-a6fe-b39ec94f59d3","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.987722Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:06085035730e83fd61581e113c241c74f1c1564a8e89e6299a5f7eccae9f49aa","observation_id":"7139a414-069e-42f3-816c-a11d6f3d5eb5","resolution":{"observed_at":"2026-08-07T15:21:18.499528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.114749Z","title":"Latent plans for task agnostic offline reinforcement learning","venue":null,"work_id":"b1e443a8-53b0-4a45-8f45-ee17d66425f9","year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.087953Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:972b09f40b3c6c90a8a32b5f5ad02ad12f1c3c2a6f0e5d2b6488348fcb91e352","observation_id":"f0516040-c53b-4e48-83ed-da47be961464","resolution":{"observed_at":"2026-08-07T15:21:18.204100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.185224Z","title":"Grounding language with visual affordances over unstructured data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.185224Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:b2601e168b94576f90778dbfeb7da81e0bf9450b34ee024a374c859636a64f07","observation_id":"4707bcc1-3f63-47b7-b916-875eb7225b2d","resolution":{"observed_at":"2026-08-07T15:21:14.185224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.870412Z","title":"Making sense of vision and touch: Self-supervised learning of multimodal representations for contact-rich tasks","venue":null,"work_id":"38bf12ea-0004-4520-a284-8cceb3ab2048","year":2019},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.254802Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:718856ca7fd266f8d180bee9966260ee9449c961e6bec7bced4d9981d0738dfa","observation_id":"723865a2-2ef1-487b-850f-bfe2f1c56e39","resolution":{"observed_at":"2026-08-07T15:21:17.966793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.336434Z","title":"Berkeley UR5 demonstration dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.336434Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:881a15a669bece0dc7ac24cbafae5d265347f4d7ab2d41b42b35c671a690991d","observation_id":"721a2928-b8d1-4200-824a-7be393c81ebd","resolution":{"observed_at":"2026-08-07T15:21:14.336434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.431315Z","title":"Robot learning on the job: Human-in-the-loop autonomy and learning during deployment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.431315Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:151209710305e640f6ae5eb440422fa1477d6dfbb49b8229972c8737f453d799","observation_id":"75e9d37e-1a9e-40d1-b3bd-f87294bb7b31","resolution":{"observed_at":"2026-08-07T15:21:14.431315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.603418Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":"2956f6cd-845d-4ef6-a279-27574523ee5c","year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.499268Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:9120a92861ab99f15f3d32e0170fde338faf15282f9db992c20fdbeb118f1b3b","observation_id":"3a37763b-cb4e-483e-bcb7-c240ec7642cd","resolution":{"observed_at":"2026-08-07T15:21:17.727657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.425699Z","title":"The surprising effectiveness of representation learning for visual imitation, 2021","venue":null,"work_id":"ef9ad527-2fcf-4d25-95e6-8d9986e49783","year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.577357Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:bc568f1eb487ea0c1b6b6e8d5d377549ebfe30737be73148d7b8bed91f07e527","observation_id":"401421ae-7219-4c66-a579-481f77a0dbed","resolution":{"observed_at":"2026-08-07T15:21:17.481239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.640236Z","title":"Fanuc manipulation: A dataset for learning-based manipulation with fanuc mate 200id robot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.640236Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:f758fbc78196b80630ba28f113b972154988a403e7bcc1c1b3fc486bb29ea9c3","observation_id":"6e486d93-47b0-470d-92b1-8d69a030be3b","resolution":{"observed_at":"2026-08-07T15:21:14.640236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.279945Z","title":"Modularity through attention: Efficient training and transfer of language-conditioned policies for robot manipulation","venue":null,"work_id":"e78fd68e-05aa-4329-833a-c97abf0335e6","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.737882Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:47b8d18ba245cea65eb8c0f297f5b639feb24ed02325ab7baa0495bf0f9bcd18","observation_id":"f58f7461-6395-421a-b962-82b99b8a7214","resolution":{"observed_at":"2026-08-07T15:21:17.381341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.030068Z","title":"Learning modular language-conditioned robot policies through attention","venue":null,"work_id":"463528fc-c6c5-49f0-b907-b22e5a16f188","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.840403Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:dd959c8340bc130e4af339d6cc50b1c594937c1a5180a173c73dc97c4a1e7099","observation_id":"caa322b1-315a-47a2-8d3b-be8fcd050494","resolution":{"observed_at":"2026-08-07T15:21:17.152797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.824671Z","title":"Viola: Imitation learning for vision-based manipulation with object proposal priors","venue":null,"work_id":"15cf0d43-8595-4c6a-98c3-fd53cf9638c1","year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.915362Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:2d64cc3588cc157047b3cf95267c42090773504909b9b0a7e2b034c7c033d72b","observation_id":"3d21542a-2063-4be4-b112-479ab68a7519","resolution":{"observed_at":"2026-08-07T15:21:16.924497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.975665Z","title":"Bottom-up skill discovery from unsegmented demonstrations for long-horizon robot manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.975665Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:cc62b032c8e85f62426f37c79429805117313315533b1d49ad1d54b6a06e2d2a","observation_id":"fada99ea-02d1-4d8e-afe3-83c6258a0d68","resolution":{"observed_at":"2026-08-07T15:21:14.975665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.555506Z","title":"Watch and match: Supercharging imitation with regularized optimal transport","venue":null,"work_id":"da91022d-40b3-432a-8d12-6fe13e81e530","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.034438Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:3365aed94544856f739b4e6b4a86f3cfd9b30a5acf0696875608d2c975e92de5","observation_id":"b2c6f6d8-9800-4059-a84c-c4873317280e","resolution":{"observed_at":"2026-08-07T15:21:16.689000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.093700Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.093700Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:21e7c55b491d471354bef0489d5fec4c0e0bdb2c714254f31bbb311826b0443c","observation_id":"2c736d5f-51b0-4d83-b430-8bb752612624","resolution":{"observed_at":"2026-08-07T15:21:15.093700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.171551Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.171551Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:3041b63a46e80aaae9f76eadf2e95ce5db68d11489044e8d8fef295cb70840ab","observation_id":"8d6a418f-6093-407c-94c2-7a97097d269f","resolution":{"observed_at":"2026-08-07T15:21:15.171551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02671","last_updated":"2022-05-05T14:25:46Z","snapshot_observed_at":"2026-08-09T18:05:35.448857Z","submitted_at":"2022-05-05T14:25:46Z","title":"What is Right for Me is Not Yet Right for You: A Dataset for Grounding Relative Directions via Multi-Task Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02671","snapshot_observed_at":"2026-08-07T15:21:15.234679Z","title":"What is right for me is not yet right for you: A dataset for grounding relative directions via multi-task learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.234679Z"},"links":{"cited_paper":"/paper/2205.02671","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:a2fa4792a44ecba518e0d8f453f360ac5c7192595dffa57206900edeed8e0d5e","observation_id":"9a429751-fb69-4ff3-b70e-16c03ab4fd54","resolution":{"observed_at":"2026-08-07T15:21:15.234679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.421271Z","title":"Embodied question answering","venue":null,"work_id":"37b9f44e-b158-470c-9b3e-f9ef755725df","year":2018},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.307972Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:07bbf5405983ae2346d23bb15b3c81b242d316c160983273d128e61be75f74f2","observation_id":"aa95f25d-8413-4f1c-bdc6-dff3c0d17766","resolution":{"observed_at":"2026-08-07T15:21:16.492098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.237663Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"514c2983-3e4a-4d62-98e4-8805c6c16adb","year":2018},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.362252Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:3d7707a82453df4823f438ea76670fc358c369b70cd47fa0b3adc09003465133","observation_id":"d9b0369e-a073-456f-96b9-c14cb3d243d3","resolution":{"observed_at":"2026-08-07T15:21:16.324862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.037070Z","title":"Christensen and Gregory D","venue":null,"work_id":"3cb803eb-e7a1-48f5-8fe0-0ea96acb6d05","year":2016},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.406161Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:7affbc54838fc03afc2748b6e1178b881f1fbf02ac144a91bf9bdae7a6c9bd44","observation_id":"2320ef47-b91b-4d3a-a440-3a5a62ef015f","resolution":{"observed_at":"2026-08-07T15:21:16.140182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.503226Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.503226Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:0aa36ba9db1029bc39dd1fd5d957eb1d281a4ec7cd04f1aeac4e03f8800b4a35","observation_id":"8c0dbc78-7d6e-4cc4-8b85-fdebb3c0ba27","resolution":{"observed_at":"2026-08-07T15:21:15.503226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.878280Z","title":"Configuration D","venue":null,"work_id":"4c73c330-729f-4ead-8e80-2523fc743b1f","year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.562904Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:9b643a8c88ab85e33c852d92a20dc6a6c2db6e687a1c7407f9d270d0ff6a9800","observation_id":"323bc312-f722-403f-a991-2854cc6ed622","resolution":{"observed_at":"2026-08-07T15:21:15.955382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 21 inbound Pith citation observations for arXiv:2505.15517."}