{"as_of":"2026-08-16T19:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2dc9a601a1255dc9b353ab7c3d1336610c5ade5fa668747618563765759c15ec","coverage":[{"denominator":112,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:16:15.718768Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:47:29.605186Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:28:34.757769Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-06T20:47:29.605186Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.605186Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:a5b9dee621e7a906d60d8bf650cd05ee62bd02a581f49277a288977493c61f05","observation_id":"92387108-7980-4289-8454-b5ce4b3b9582","resolution":{"observed_at":"2026-08-06T20:47:29.605186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2508.12043","last_updated":"2025-08-16T13:37:11Z","snapshot_observed_at":"2026-08-02T08:29:05.396468Z","submitted_at":"2025-08-16T13:37:11Z","title":"Talk Less, Fly Lighter: Autonomous Semantic Compression for UAV Swarm Communication via LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T07:37:38.901354Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2508.12043"},"observation_digest":"sha256:39be0c85481212f9532863b8536872df420500ea7e0a5d283344dfed8ada4317","observation_id":"6253ce52-1ae4-49db-9f13-5e9949c949b3","resolution":{"observed_at":"2026-05-25T07:40:29.157371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-05T18:48:03.418621Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces.arXivpreprintarXiv:2506.00123, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.14157","last_updated":"2025-08-19T18:00:00Z","snapshot_observed_at":"2026-08-16T01:33:20.077537Z","submitted_at":"2025-08-19T18:00:00Z","title":"The high-speed X-ray camera on AXIS: design and performance updates","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T18:48:03.418621Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2508.14157"},"observation_digest":"sha256:857ec95e71bf397629b7d7575af3a8d5e3ba4ef43aa22bb7b0f736fc17f082a8","observation_id":"cc80ffac-da6b-477b-bd31-f75cdccac3fc","resolution":{"observed_at":"2026-08-05T18:48:03.418621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-04T12:55:07.932813Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces.arXiv preprint arXiv:2506.00123,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-13T20:53:39.091470Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.932813Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:86fbcfad0fceda713dc249a93723d5c971078d3aa1afce19fd912a107febdc40","observation_id":"8684ed19-c732-44f0-b64a-6561ec1fe91b","resolution":{"observed_at":"2026-08-04T12:55:07.932813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:5f18025cf5d0348ecdd3ca5a0898f1d0ab4aa55cf9bffff018a342c776dcc114","observation_id":"80a4f563-9ab0-4a4d-96c2-d8e8d525ba01","resolution":{"observed_at":"2026-05-14T20:09:39.833644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-08-13T19:00:10.952463Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:2ceab067c84a70ebb27401263dd555b50955176dd03f65172591466350aad6e8","observation_id":"35c55ac7-b8a4-4f5b-ab32-c4361e29ce64","resolution":{"observed_at":"2026-05-17T20:42:05.714505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-15T09:17:29.929096Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:47f3402edacd33ea5e65eea31390d8abb1f6b8ed4786379541c2e15797541cc8","observation_id":"189a4e30-35d9-47ed-9375-7da26e19f9ba","resolution":{"observed_at":"2026-05-13T21:08:17.373521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2604.08645","last_updated":"2026-04-09T17:57:35Z","snapshot_observed_at":"2026-08-14T18:29:34.539620Z","submitted_at":"2026-04-09T17:57:35Z","title":"3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:51:52.063238Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2604.08645"},"observation_digest":"sha256:830842e797fc4bad43553bf87500311e1c611b097798177a9456c809b216b318","observation_id":"a7ea5a71-deb2-4e97-9c2b-897a4aad0f53","resolution":{"observed_at":"2026-05-11T05:56:00.254914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.16713","last_updated":"2026-06-11T14:17:29Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:52:11Z","title":"GeoWorld-VLM: Geometry from World Models for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T17:57:00.909897Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.16713"},"observation_digest":"sha256:7611f450b9d3daca13aeeb3eb16869676bdd0d1908ec1a28daeed6eca1d97b9e","observation_id":"0749cb87-7f03-44c0-bac1-e3af4955cb14","resolution":{"observed_at":"2026-05-20T17:58:49.605881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.16713","last_updated":"2026-06-11T14:17:29Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:52:11Z","title":"GeoWorld-VLM: Geometry from World Models for Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T19:02:05.125937Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.16713"},"observation_digest":"sha256:b962e81c57dd91b2546331c00b85ecdf19efc19e7bcc833b1be6ab7f1a78eb4f","observation_id":"37aa5277-49f8-4b04-8a43-0d65279cff87","resolution":{"observed_at":"2026-06-30T19:05:00.582050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.22536","last_updated":"2026-06-26T09:22:26Z","snapshot_observed_at":"2026-08-13T07:11:08.972396Z","submitted_at":"2026-05-21T14:25:15Z","title":"SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T06:24:30.669956Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.22536"},"observation_digest":"sha256:0ee01b8a2860095b3aabd2007c401489ebe583e48e2dcc131276ba77e88b7954","observation_id":"319808e9-17f6-4ce6-90d6-8db16d291176","resolution":{"observed_at":"2026-05-22T06:24:40.387049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.22536","last_updated":"2026-06-26T09:22:26Z","snapshot_observed_at":"2026-08-13T07:11:08.972396Z","submitted_at":"2026-05-21T14:25:15Z","title":"SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:07:49.005419Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.22536"},"observation_digest":"sha256:3fc67aa570e3b3b7f4ba15c688ea1d31fd18ddb9086e64a35fe34d47c9099e5d","observation_id":"63e8f605-6c9f-4107-bda1-eca7581de84b","resolution":{"observed_at":"2026-06-30T17:14:57.282353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-12T17:22:45.772096Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:1d543612f27b662e0c44346ffce18d988ae8a1c9e1ce2965fd3d584ba14a78d9","observation_id":"f8731dac-224d-47d0-9833-45ab6014a0b7","resolution":{"observed_at":"2026-06-29T21:33:58.950221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0218663a9a9801fb4ae109a5a48393a695a198bfe0d9fa09b35ac63b96ad039c","observation_id":"b4b13735-5d8f-4332-935e-4cce4db729cf","resolution":{"observed_at":"2026-06-29T13:43:28.937015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.03890","last_updated":"2026-06-02T16:51:32Z","snapshot_observed_at":"2026-07-06T23:44:05.167767Z","submitted_at":"2026-06-02T16:51:32Z","title":"OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:07.122615Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.03890"},"observation_digest":"sha256:ad07bf43f96ec629470d8727ae776893ce0f700b5d88f4443e6a496170cc0a1e","observation_id":"cdae8602-7c06-4f94-b73c-6ab9c10f8ddd","resolution":{"observed_at":"2026-07-02T02:16:27.075845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T12:55:47.754632Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:92017bb2f07b03f4ac3cea1a6612d8dbcdfc4c813a5e15df79e5596f7fa7e68b","observation_id":"8b86d7ef-1904-4510-9c25-e011c7353b06","resolution":{"observed_at":"2026-07-03T06:07:41.154508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:4332c36c2bd1733285d7e9f14085f808a700725675f9da0418cfbb53bb2c24b1","observation_id":"ad9c88a9-defe-4f09-9434-36ed67cab158","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-13T13:59:55.459417Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T06:26:32.209719Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:19e972cda0907a250fcccc8f298de4786586302809e140fddee87f5bf1cb547f","observation_id":"be10cee9-94d9-40db-a399-91baf0cabd54","resolution":{"observed_at":"2026-07-03T15:28:34.760148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-02T11:43:49.639057Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces.arXiv preprint arXiv:2506.00123, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-13T13:59:55.459417Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T11:43:49.639057Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:7fd350fa006c186f5de8cbcc2416fd83d90020879ee9da444eb8f79b25b77d41","observation_id":"ca74376b-ee0f-4340-892e-ef46ed4806a6","resolution":{"observed_at":"2026-08-02T11:43:49.639057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.13497","last_updated":"2026-06-11T15:46:28Z","snapshot_observed_at":"2026-08-14T06:17:42.515809Z","submitted_at":"2026-06-11T15:46:28Z","title":"SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T06:28:14.694168Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.13497"},"observation_digest":"sha256:cc7a2a95d9efc19f16b0f43b44fba19610240c57bc428d5c3b7d24eae4c1e2ef","observation_id":"e7ce9633-15b2-48d6-adad-d5b498358984","resolution":{"observed_at":"2026-07-03T15:28:34.351453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T11:17:48.279808Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:d14b193d9f5df94ce4294d9e6d4bd9d8768d45886ac69993ce67eac286f894c2","observation_id":"880ac1a5-6849-4c80-8dfe-753e815bd6bb","resolution":{"observed_at":"2026-06-30T11:24:38.366106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-02T11:20:26.553333Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T11:20:26.553333Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:e4ed7cbb78f0fb6c1405126f5b3c17bbbed41c70848b4d3bdbcdfaacf6e40488","observation_id":"9d610a94-38fe-468c-b91c-69837c2cc378","resolution":{"observed_at":"2026-08-02T11:20:26.553333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-12T13:31:45.799876Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:c21b4d4fa3cdc3d69dda41ffa0ac05d83687ace1528afebf3e3c91fcee68e039","observation_id":"5ca3a554-d397-484d-9748-597a412c8479","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-01T14:39:39.709300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-16T19:36:52.307904Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:39.709300Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:1fa109c18ac45716abbcacfb49f7c08919acb49b11b346fd5e4a182a511282c8","observation_id":"e0899ac6-ff62-4be6-bdbd-271e62038c2b","resolution":{"observed_at":"2026-08-01T14:39:39.709300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00123/citation-record","integrity":"/paper/2506.00123/integrity","json":"/paper/2506.00123/citation-record.json","paper":"/paper/2506.00123"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:16:08.094257Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.094257Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:df3c80ef52562ba9d9c5a7ac35d0000aca7699354521222f6df246c25670895d","observation_id":"1ee2d789-c94a-4f9b-a676-0cb0ed3ee942","resolution":{"observed_at":"2026-08-07T12:16:08.094257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T12:16:08.184567Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.184567Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:ba90d4f22a06ba6c910fbd8b439f6424931a2b88a6b18592ececaa661846155c","observation_id":"0674a851-2993-401b-9646-6fb3e9800e24","resolution":{"observed_at":"2026-08-07T12:16:08.184567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.271878Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Karén Simonyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.271878Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:be09184fd967cd0d7039d3b02e8b839768aec46fbd99cb900e10f776a63a0456","observation_id":"8518c5f4-2e1c-4473-9f98-374b29f9bc36","resolution":{"observed_at":"2026-08-07T12:16:08.271878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.351375Z","title":"Claude 3.5 sonnet.https://www.anthropic.com/news/claude-3-5-sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.351375Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9b4b1a356a6f97106176b9f45fc8228b8c089dcb2d57878a82a44d1df9a0b802","observation_id":"cb545fed-1e29-4216-b41d-865137d9a172","resolution":{"observed_at":"2026-08-07T12:16:08.351375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T12:16:08.414785Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.414785Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4cc5a7a7b28d2077115703ef9aff342510cebba9c741861dddf57690aa7c0250","observation_id":"0e05a99f-c97b-4d81-8e45-9c47448f95e1","resolution":{"observed_at":"2026-08-07T12:16:08.414785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.495975Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.495975Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:ee72c305b0772dedce3ea50c746f136dc37bf7b4ef4627f359c4cfdd1c468e78","observation_id":"fc79de96-659e-4e20-85b5-93b6aabad814","resolution":{"observed_at":"2026-08-07T12:16:08.495975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T12:16:08.566118Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.566118Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:268e6a8cf066246f8792fab00a299acad59c88449c2f6bc1cb9819d8bbdae7df","observation_id":"e5e7458e-0d66-4212-a353-de4c5255c4d4","resolution":{"observed_at":"2026-08-07T12:16:08.566118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:16:08.626048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.626048Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:adafa51b20ad6179ecc79a6f08cf43a0f7985b833ea813cd0a2d2f0107b32793","observation_id":"3d9a7022-2f3a-407a-8a0b-fd1d9156406f","resolution":{"observed_at":"2026-08-07T12:16:08.626048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:16:08.701912Z","title":"arXiv preprint arXiv:2410.24164 , 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.701912Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e9587b7ebe42f01f21befdaf74ab4a06c0fe108e8a35b3ebcb7494c89bead33b","observation_id":"c32fc78d-0066-4baf-b491-4b4462ee1345","resolution":{"observed_at":"2026-08-07T12:16:08.701912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T12:16:08.777108Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.777108Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a7e09fd1d537cababf4b47384831994c6a5d4f369eec41fa79969b901380ae3e","observation_id":"38f2732e-a4a2-4351-b414-6069c7abdd9b","resolution":{"observed_at":"2026-08-07T12:16:08.777108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T12:16:08.844533Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.844533Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:abe7868211ebb91799fd6f0291005c9766bdbdf38870659bcf58915db3a745ec","observation_id":"a0719468-b015-4571-b5ab-ce5ab0cee77c","resolution":{"observed_at":"2026-08-07T12:16:08.844533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.930024Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.930024Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:f3b46c1d3e13107d176f099c849c28a9b1f63717a9644bfcea9042d0cc75ef56","observation_id":"696b5cb8-bf54-4657-aabd-a0663a8265c3","resolution":{"observed_at":"2026-08-07T12:16:08.930024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02666","last_updated":"2024-07-02T21:00:30Z","snapshot_observed_at":"2026-08-16T13:37:35.619748Z","submitted_at":"2024-07-02T21:00:30Z","title":"Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02666","snapshot_observed_at":"2026-08-07T12:16:09.000071Z","title":"Com- monsense reasoning for legged robot adaptation with vision-language models.arXiv preprint arXiv:2407.02666 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.000071Z"},"links":{"cited_paper":"/paper/2407.02666","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3bc8103f81348452d261384ce51732e7fb41ddd5e1d3bea037cc3c3245d83161","observation_id":"0b5be8d8-f62e-46fc-830e-a9989623dece","resolution":{"observed_at":"2026-08-07T12:16:09.000071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.066166Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.066166Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:fc7999fd9007a71f82adad23da5c3e908cfd550a538ad7967e47acaa300fc571","observation_id":"105cfb30-dcb7-4e70-8984-d9e75ec5ad05","resolution":{"observed_at":"2026-08-07T12:16:09.066166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.119149Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.119149Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:90b555e273674d31bf995c51585fb9448a84bebf7940a49ad43da5c0205c5e45","observation_id":"8675d496-772e-46a3-bca9-59a9e49115ab","resolution":{"observed_at":"2026-08-07T12:16:09.119149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T12:16:09.213009Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.213009Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:ba946846c80397f7fdf6beffc6183fab9c58cfead0f3b085a796a512e255c044","observation_id":"1e55fa0c-5216-4a00-976a-ae8b94f5868f","resolution":{"observed_at":"2026-08-07T12:16:09.213009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.277793Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.277793Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:8830ef615189cccdd8e14a0fb16f00a52e9d6a02e1c339f929d52753c90c15f2","observation_id":"a4876270-6c15-403f-a4a6-07c8cb24c66d","resolution":{"observed_at":"2026-08-07T12:16:09.277793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T12:16:09.351955Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.351955Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b526e5ecc865450d487062346f30e57aed33335648282b6a2df29f4bc60ecc26","observation_id":"d1407922-9ad2-4d3f-a646-e4f4e64c2731","resolution":{"observed_at":"2026-08-07T12:16:09.351955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T12:16:09.427092Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv: 2312.14238 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.427092Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3eeaf12f7b34ceee969888da2f67136cd64b1bedfd0dbf797d5ac1838e823368","observation_id":"3984c22a-1ba4-4e61-8e53-46502b5649fb","resolution":{"observed_at":"2026-08-07T12:16:09.427092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:16:09.508644Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.508644Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:29246d0c6cc124cc1fe7cc2667e24bf36d8eb629f90e18fa5e871b41e5548496","observation_id":"faf511ce-2e13-437b-8378-3041049502fe","resolution":{"observed_at":"2026-08-07T12:16:09.508644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T12:16:09.590815Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.590815Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:6a6b7a4480238deb65830d4f5970e845c19cce61e266723f94be564fb3514ba2","observation_id":"89df5c1a-f92d-4388-af89-4fa46b24b6bb","resolution":{"observed_at":"2026-08-07T12:16:09.590815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-16T08:53:28.359170Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:16:09.666040Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.666040Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:bae02f513622fa89082914174618db07ab4b4d28b3d67260ec084bc5bedc560f","observation_id":"38816cc3-5d58-4c66-9782-0b54dcd0d5d0","resolution":{"observed_at":"2026-08-07T12:16:09.666040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15160","last_updated":"2024-03-01T00:58:50Z","snapshot_observed_at":"2026-08-16T14:15:59.432216Z","submitted_at":"2024-02-23T07:46:30Z","title":"Spatially-Aware Transformer for Embodied Agents","version":3},"cited_work":{"arxiv_id":"2402.15160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15160","snapshot_observed_at":"2026-08-07T12:16:18.353166Z","title":"Spatially-Aware Transformer for Embodied Agents","venue":"cs.LG","work_id":"e28dcb0d-f57a-4169-bbb9-5ba3eed7d927","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.736172Z"},"links":{"cited_paper":"/paper/2402.15160","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3d239e4b24495f1d29869767c6b6a97973a877a29acbf95f9ac324ce5213f3a3","observation_id":"75ef2d6e-407d-4877-85d3-9cfbbaa58328","resolution":{"observed_at":"2026-08-07T12:16:18.467967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.802384Z","title":"Local all-pair correspondence for point tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.802384Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e63d6eaefb8dcf854239b78149a4c2a7b1a8d11658667cc56900c61103154ebc","observation_id":"80793765-2150-4de9-a05f-3f5f0f266ed7","resolution":{"observed_at":"2026-08-07T12:16:09.802384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.857532Z","title":"Simple and effective multi-paragraph reading comprehension","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.857532Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:329f60e7aef4980033c009f24699ca99ef96b5ce76199aabe3f84ca6aa48431d","observation_id":"8d538287-bf9c-432d-833a-3fc1eeb760c6","resolution":{"observed_at":"2026-08-07T12:16:09.857532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.945386Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.945386Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:8a38e574c60c5975ba24c227191096e46d2eed2c92cc95b9ba6bedc19655f8bc","observation_id":"d85376bb-fe9a-4889-b1b1-c7529397f013","resolution":{"observed_at":"2026-08-07T12:16:09.945386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.021970Z","title":"Language modeling with gated convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.021970Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:62865ca700a5dcaf033ec94af0d24e9d963ebdf04de7320e9b896aa386de48e0","observation_id":"d9cd709d-1052-43be-89e4-9d466b983348","resolution":{"observed_at":"2026-08-07T12:16:10.021970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.102883Z","title":"Quar-vla: Vision-language-action model for quadruped robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.102883Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b7ddb8a398b9cedf784187318cc9bb8ba0731364d844ea051c3b68aa43e92035","observation_id":"2d053136-7bcb-43c0-81e8-7dbfb24ed116","resolution":{"observed_at":"2026-08-07T12:16:10.102883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.177298Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.177298Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a49cf2245c506d5621406b5d559b6c45f91f1036912efe13931e2dcebf251d11","observation_id":"e06e275e-ba11-47ba-aa0b-f6fc31c2dc26","resolution":{"observed_at":"2026-08-07T12:16:10.177298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T12:16:10.243116Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.243116Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:840e13381fb9c6c480f1054358ba344da4cfd9097d4d0efc2b768e47f4a7e08f","observation_id":"6db3c8b1-01e1-4c50-9129-6fd6c48ccb2a","resolution":{"observed_at":"2026-08-07T12:16:10.243116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.287797Z","title":"Centernet: Keypoint triplets for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.287797Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:f1d6185fd8fea005789573ce117e1ffa7b18ce86d8209344a4d06825c2d99fd7","observation_id":"2a0ae299-5844-406f-b090-fe6419e2ce68","resolution":{"observed_at":"2026-08-07T12:16:10.287797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.334062Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.334062Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a36f51b663e061c535fc7b953b0ceba8e87159a5bf3d4d83858d267f989639ac","observation_id":"f4629046-9ed0-43c9-80a3-4f6dfb2ca8a7","resolution":{"observed_at":"2026-08-07T12:16:10.334062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.403215Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.403215Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:c452ce2c2fe0d3226c557bce9651c4a78e0de9260fbdae9178d0027a01ae613a","observation_id":"a8224738-d488-4f4f-8a18-9997eb7fa620","resolution":{"observed_at":"2026-08-07T12:16:10.403215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T12:16:10.499411Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models.arXiv: 2306.13394 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.499411Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e657d0e6a1f4d358c06444ada598a17d534b9ce39c21230a8a259c7c3cbd5efb","observation_id":"7c64dda6-17a7-4488-b991-c933513eb539","resolution":{"observed_at":"2026-08-07T12:16:10.499411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.597240Z","title":"Rlafford: End-to-end affordance learning for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.597240Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4c30577ad53b8b4e46e513a3f2f49e958eeca28c335beb09457816b15d813d7e","observation_id":"a21a4e9b-e31b-4fac-89a6-3bdabb2ecf9c","resolution":{"observed_at":"2026-08-07T12:16:10.597240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.648005Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.648005Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a88bc8f7d7e7fa178dca948fb6d3a7ab09493e58669b12c94ea9697aa3cfd74d","observation_id":"c49009cd-d63c-43e9-8140-b302563f7a46","resolution":{"observed_at":"2026-08-07T12:16:10.648005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.708199Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.708199Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:37e3e88cecd3136bc126620e1e9aa902c33008a6292e797b2bb1bc2eb52fe4d3","observation_id":"442877b5-7d93-4dc8-9674-df4b5cbf5740","resolution":{"observed_at":"2026-08-07T12:16:10.708199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.791941Z","title":"Girshick","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.791941Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4285c11c0403f1d21b76a84b8788cf9541b825512cd8ea63297cc30de77be6eb","observation_id":"dee8501e-5fbc-4928-8892-5c0aed834f35","resolution":{"observed_at":"2026-08-07T12:16:10.791941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.876192Z","title":"3d-llm: Injecting the 3d world into large language models.Advances in Neural Information Processing Systems , 36: 20482–20494, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.876192Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d99605421839889b76ccea216fd35aaa88e41a3fde4c1007e864832b29645872","observation_id":"d24edc9a-76f8-4ada-9938-76c194bc2301","resolution":{"observed_at":"2026-08-07T12:16:10.876192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-16T12:46:56.834354Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-07T12:16:10.945513Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.945513Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:5948a3abdcad8501df4a7cd145a8469eba8d3fcad4c26fe1ba6314855ac2e2d2","observation_id":"ae01a1b4-d01c-473e-8aa0-0758d5d666d8","resolution":{"observed_at":"2026-08-07T12:16:10.945513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-07T12:16:11.043939Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.043939Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9e7370136bd5454a4875ae2af577c4f9805e2b92946dd1e9e71401415eae2b64","observation_id":"83ed7cf1-98a9-455c-92d6-50f5faa34813","resolution":{"observed_at":"2026-08-07T12:16:11.043939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.134735Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.134735Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9ac1c2bf933d2493aa12938563e35e4814da302e846c17f816427c71775a0400","observation_id":"10c4ad44-4a1e-4e28-a4ca-ca0c0ec860da","resolution":{"observed_at":"2026-08-07T12:16:11.134735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T12:16:11.217497Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.217497Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:46ce1940b423034b0b0a564acb0e4a77116bf37d787a54eea44cfc320d445930","observation_id":"cc41a651-4953-4a73-932e-78c486576128","resolution":{"observed_at":"2026-08-07T12:16:11.217497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T12:16:11.289544Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.289544Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:5f626bdbcfe84dcb8a023727023896203c43e0b2507cf1acd1fe008c7b208f35","observation_id":"c08a66b9-b8f2-4040-b0e6-1a299e52ec87","resolution":{"observed_at":"2026-08-07T12:16:11.289544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.361561Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.361561Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4a1c26eb51b99f56cc579b644b6f2bf714c4b97a4c2a68f6d06e57c0002d9e08","observation_id":"834ff20c-66be-4c9f-b9db-6b92c79dadcc","resolution":{"observed_at":"2026-08-07T12:16:11.361561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-16T12:54:11.878854Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-07T12:16:11.470944Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.470944Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:61041b645343887f16860b5199e8e2600c74c2922176bcf5351525b11f2dde04","observation_id":"77e4ec0b-04f0-4385-a4a5-3a983426f210","resolution":{"observed_at":"2026-08-07T12:16:11.470944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.541136Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.541136Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:03f661c5b73620364b166b2f26e4dbaba24a7582f75096ec39bb5dd48a0e202b","observation_id":"f7dafc7f-ff80-4db9-b147-1bce094aaacd","resolution":{"observed_at":"2026-08-07T12:16:11.541136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.628090Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.628090Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:08f345fbedab6f0c2aa5d9eac4fc1dda804520ddbe146ff7d8a4adc453f86f43","observation_id":"44b23ff9-3d8f-47d5-a5bf-9b174e55b26c","resolution":{"observed_at":"2026-08-07T12:16:11.628090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:16:11.687388Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.687388Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:6742ca576bafc758f4ecbd85b1eff18e4d360aa448c0dc265f4fd6f433c40641","observation_id":"bf0d064b-94e1-4314-b8cc-85003f6d3a3e","resolution":{"observed_at":"2026-08-07T12:16:11.687388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T12:16:11.756541Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.756541Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:060ce9c76fd68ece6fd05f80b8d5e745802bee39de588fb66bc2b8e8be8cfb34","observation_id":"22f767ef-56a2-4155-a22e-5bbff6497ade","resolution":{"observed_at":"2026-08-07T12:16:11.756541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.826342Z","title":"Cornernet: Detecting objects as paired keypoints","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.826342Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3d65d2e9372bc6ce4340c3ced4cc0a3d82962bb0128889ae7f14e6d801677668","observation_id":"fe47318a-98c5-404b-89ef-ab3a454e34fc","resolution":{"observed_at":"2026-08-07T12:16:11.826342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.899475Z","title":"Learning hand-eye coordination for robotic grasping with deep learning and large-scale data collection.The International journal of robotics research, 37(4-5):421–436, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.899475Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9d6e13545e220aca5566da42b99b8a6ebb14b3fa7e6e7f80684c92d1e92f6fd7","observation_id":"89609035-90f0-40cf-a3e8-4f2913f97ebc","resolution":{"observed_at":"2026-08-07T12:16:11.899475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-16T13:57:47.881881Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-07T12:16:11.985639Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension.arXiv preprint arXiv:2404.16790 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.985639Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:024ea419b1cfbce0b20a76b82f2189e1d2bb1a91872ec27a5a354a9cd881ef31","observation_id":"a87c0ae9-e60d-4481-af81-960fba18264f","resolution":{"observed_at":"2026-08-07T12:16:11.985639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:16:12.062017Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.062017Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a225834e210b1451df21e48c332f54ba5a6ffca9ee802b2910ee551624f858fb","observation_id":"fb31d28c-6296-4572-9949-15950c5d4bab","resolution":{"observed_at":"2026-08-07T12:16:12.062017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.141295Z","title":"Learning agile skills via adversarial imitation of rough partial demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.141295Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e3abb3107afc647ba2c1d3fab96a760c2be9dc55f7fc065abb7807322d7f9d4e","observation_id":"2d328658-9d72-4246-910b-1096cea908fd","resolution":{"observed_at":"2026-08-07T12:16:12.141295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.205947Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.205947Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:66b8bff3e911e290a34adfd61a84bab062e874cea2bc9652c1ce816fb8f9ced9","observation_id":"96670f96-a2ab-47ea-be94-64bf0c89c8af","resolution":{"observed_at":"2026-08-07T12:16:12.205947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.285277Z","title":"Omnicorpus: A unified multimodal corpus of 10 billion-level images interleaved with text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.285277Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e6ec20e805cde6d17f3c6367e84660cc607ccac64660975e9054841ca0d91b8b","observation_id":"e3e139c2-7507-4bfa-abf1-f3de348530d5","resolution":{"observed_at":"2026-08-07T12:16:12.285277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16527","last_updated":"2022-06-10T16:57:51Z","snapshot_observed_at":"2026-08-16T17:10:30.242942Z","submitted_at":"2022-03-30T17:58:23Z","title":"Exploring Plain Vision Transformer Backbones for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16527","snapshot_observed_at":"2026-08-07T12:16:12.363276Z","title":"Exploring plain vision transformer backbones for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.363276Z"},"links":{"cited_paper":"/paper/2203.16527","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:8ac3a3bea15e864faf2d8247db53e8bf7ec18d8ad03f1540ba4223307c1cacdd","observation_id":"b3524013-2008-4470-84d9-193b96830b34","resolution":{"observed_at":"2026-08-07T12:16:12.363276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00693","last_updated":"2025-07-27T09:58:24Z","snapshot_observed_at":"2026-08-16T05:40:56.945263Z","submitted_at":"2025-05-01T17:55:05Z","title":"Robotic Visual Instruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00693","snapshot_observed_at":"2026-08-07T12:16:12.453068Z","title":"Robotic visual instruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.453068Z"},"links":{"cited_paper":"/paper/2505.00693","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4a7709fe49638446c89cc9a8ed39e9b93ca3b61695e0b84a7192ae4c8e3dda65","observation_id":"2c551f63-1ff8-4ab4-af58-6f087d92ba59","resolution":{"observed_at":"2026-08-07T12:16:12.453068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.537280Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.537280Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cbe3d63256ae3cc7d66519ff23461bf2660272ac240ff69cdcc75bf571a4f93b","observation_id":"8f210c89-75f5-4c59-8221-675fa03e43a8","resolution":{"observed_at":"2026-08-07T12:16:12.537280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.611092Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.611092Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:0f2f93b9535703b82ba24ccb20efb67c07513f91e7e5795107051c73c78682bd","observation_id":"1f13fe24-c711-4692-bfd3-03c1f25cdbde","resolution":{"observed_at":"2026-08-07T12:16:12.611092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.689514Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.689514Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:2f129ac56cfad9b5c368e3e7fe4389bf8b48999ef842b471ceb546fae0ca7a83","observation_id":"e8a3dc0b-fc1d-446d-ac2b-f7452a92d593","resolution":{"observed_at":"2026-08-07T12:16:12.689514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00754","last_updated":"2024-11-21T18:52:31Z","snapshot_observed_at":"2026-08-16T13:29:08.779838Z","submitted_at":"2024-08-01T17:57:12Z","title":"Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00754","snapshot_observed_at":"2026-08-07T12:16:12.740878Z","title":"Coarse correspondence elicit 3d spacetime understanding in multimodal language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.740878Z"},"links":{"cited_paper":"/paper/2408.00754","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:fd239d5a89e256dfa8edb2abab8e0bb73dda432585428090871efd75e02c4b34","observation_id":"06ca9977-97ca-4c6e-a229-b1cf9a2edc0a","resolution":{"observed_at":"2026-08-07T12:16:12.740878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.799211Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.799211Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a96f51f7d0ca03784879866c7a7e1c4143ec86dff9623a39b13a582ec95eb7f7","observation_id":"3daa9635-42f0-475b-8fd9-4acffa328232","resolution":{"observed_at":"2026-08-07T12:16:12.799211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T12:16:12.881890Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv: 2307.06281 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.881890Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:8d04bf9e36c740d9e6aa42e1b8b93b8c4df9c512c30804c978563ae1ee9c8a11","observation_id":"36f2259d-718a-4b25-8a9e-45b2f0ae47fc","resolution":{"observed_at":"2026-08-07T12:16:12.881890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-07T12:16:12.944251Z","title":"On the hidden mystery of ocr in large multimodal models.arXiv preprint arXiv:2305.07895, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.944251Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:be0107ae187ef8ac3e96bd8c69c1e029e8c24e4a8be82f9006892ccaadeff0dc","observation_id":"689a1580-0f37-41e1-a0c9-08676e08dfa2","resolution":{"observed_at":"2026-08-07T12:16:12.944251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.808678Z","title":"Mminstruct: A high-quality multi-modal instruction tuning dataset with extensive diversity","venue":null,"work_id":"65c09e78-5e76-4584-873a-4cd7cc87f636","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.046266Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3f14c450b94c5b5d861f7f42c9fd0b761c5dba302ca164494db24a0e3eec8633","observation_id":"1a306407-9e2e-46b0-b61d-48280076fd1e","resolution":{"observed_at":"2026-08-07T12:16:22.878623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-08-16T15:34:23.209777Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-08-07T12:16:13.117762Z","title":"Interngpt: Solving vision-centric tasks by interacting with chatgpt beyond language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.117762Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:965d785b32340b927dd78047a845e26c0151a38cba0781f1f9ca3835d35ade63","observation_id":"9e31acdc-ec99-411c-8518-ebe57bced002","resolution":{"observed_at":"2026-08-07T12:16:13.117762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-16T13:10:34.900051Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-07T12:16:13.209440Z","title":"Mono- internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.209440Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:bc57712106a3274ba36ebd1938d8c1eb763dde237ba9031a4320b7ab042a0aa9","observation_id":"8ef13d95-c7ca-4dad-b000-c89cc7399d84","resolution":{"observed_at":"2026-08-07T12:16:13.209440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T16:24:17.092829Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T12:16:13.281354Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.281354Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:7bf9bc2d4bceb593708b5f018b84a0d87877854abf7e45f58c08d6e900f3f3cf","observation_id":"5e872cd2-3e60-48b5-b16e-e9c2b767fd75","resolution":{"observed_at":"2026-08-07T12:16:13.281354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.651464Z","title":"Where are we in the search for an artificial visual cortex for embodied intelligence? Advances in Neural Information Processing Systems , 36:655–677, 2023","venue":null,"work_id":"484adb4d-82fa-452d-a08f-ef391cb6568e","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.345167Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:af8d32f9a0edafeba1618f7a47f8d42fb825d6480d80ad32cb327f8cfafafb3a","observation_id":"3213c8d1-cdf6-4d3c-ad23-d6aa78d04de1","resolution":{"observed_at":"2026-08-07T12:16:22.723933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.421333Z","title":"Walk these ways: Tuning robot control for generalization with multiplicity of behavior","venue":null,"work_id":"2509d694-793b-496b-8542-5933f3d5df5a","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.401055Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:46581c5ef076e1e8eeb21a543be0fe843823a86f53ce57ffcd3fe55f77859867","observation_id":"0efa2d26-a987-441b-8041-4ffb0a5eeab3","resolution":{"observed_at":"2026-08-07T12:16:22.514359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.156544Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"f7d9aec3-0a85-466e-ad27-5cae7ec9a91d","year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.458663Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:85578f201854472cc7de4413a12564514578cab9969c99381347a3d5b8df4a24","observation_id":"060f98ff-3b53-4e2c-a68b-e3d12ac5f5be","resolution":{"observed_at":"2026-08-07T12:16:22.241222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.944644Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"dbdee591-eaed-41b7-9dd0-e511320b6ca1","year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.513833Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:51ba098ff64f276afd514e7d7e0a8eefbbea8226fec72f3cb0e03be90c9217fe","observation_id":"8129ca85-7683-47cb-b8ce-15aea4b9dbb6","resolution":{"observed_at":"2026-08-07T12:16:22.059153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.759653Z","title":"Infograph- icvqa","venue":null,"work_id":"daf8fe64-5fa4-4e45-9d79-2cdb697268f4","year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.613661Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:483285fd5973b49d8fcbdb19dd6caf22e051fabf4a3d6f0b70233657d13f5217","observation_id":"3251f2c2-46c5-4ac7-92ad-062f19267b9b","resolution":{"observed_at":"2026-08-07T12:16:21.829698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16578","last_updated":"2024-12-03T03:49:24Z","snapshot_observed_at":"2026-08-16T13:40:10.099886Z","submitted_at":"2024-06-24T12:14:24Z","title":"QuadrupedGPT: Towards a Versatile Quadruped Agent in Open-ended Worlds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16578","snapshot_observed_at":"2026-08-07T12:16:13.696485Z","title":"Quadrupedgpt: Towards a versatile quadruped agent in open-ended worlds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.696485Z"},"links":{"cited_paper":"/paper/2406.16578","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:101752458c5b32b62181c94fc273334cebed82a3383bfe16099e217eb65f17bc","observation_id":"453ef401-645e-4c86-b12e-a34b569110d1","resolution":{"observed_at":"2026-08-07T12:16:13.696485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.460883Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought.Advances in Neural Information Processing Systems, 36:25081–25094, 2023","venue":null,"work_id":"b1ed10a9-7b2f-418f-acb2-859890975be3","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.764571Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:0ada44a63de252768cfc2c0a1884af8a1b2aedf1ca3f8c2c2d1e92a1472334c8","observation_id":"93073953-f24b-452a-846b-123bb4f6078a","resolution":{"observed_at":"2026-08-07T12:16:21.643942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-07T12:16:13.840242Z","title":"R3m: A universal visual representation for robot manipulation.arXiv preprint arXiv:2203.12601 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.840242Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4ed470102136f979a07445686699109795c8f181db955e5448f0fec65b546a0e","observation_id":"20ec6a30-082c-4364-9530-38aabc8e2478","resolution":{"observed_at":"2026-08-07T12:16:13.840242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.210202Z","title":"Gpt-4o system card","venue":null,"work_id":"a93df020-cfc3-4005-9e92-68341f4b8154","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.906541Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a33a11e0315e65f06f9b7cf1b553a4d4ba87d9f94d3d165fe7e0eec668201b86","observation_id":"59d906ba-aa13-49cb-bb2d-79eef539f927","resolution":{"observed_at":"2026-08-07T12:16:21.324300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T12:16:13.992330Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.992330Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:935c199eef5e17e5d132a7f6ae8b4a9a9805b7bcb57f7d9c4e6e673731a8b2f2","observation_id":"6fa5edb8-db68-4971-9e85-c132ddab602c","resolution":{"observed_at":"2026-08-07T12:16:13.992330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-15T04:16:11.827389Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-07T12:16:14.104148Z","title":"Gpt4scene: Understand 3d scenes from videos with vision-language models.arXiv preprint arXiv:2501.01428 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.104148Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:29df5306d8f71007a340a80c75e4e1cd956ffe5b0d106acfb8863817ae6acd90","observation_id":"859eb22a-392a-4190-b6e6-45f594123c8b","resolution":{"observed_at":"2026-08-07T12:16:14.104148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.005886Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"b52d6918-cc28-48df-821b-99478485ebef","year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.201504Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4f4067f97315be569386f6616c4b8d38dd50a3203f1ba3c1c01d48859005fb78","observation_id":"f0efc46c-7e1b-425c-8ae2-b32a44a583ca","resolution":{"observed_at":"2026-08-07T12:16:21.114182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.803992Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d7bce5e8-26cc-47b6-a8a5-43ac4cfafee8","year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.275120Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b280154f24ba1b3f5e75467fb7b3318a6e006287031769a98631e77f507f3208","observation_id":"5c89e3d8-d4fe-4810-833e-1931d3ffc11c","resolution":{"observed_at":"2026-08-07T12:16:20.918889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.521579Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"b98225cb-92ae-4311-ab2f-01676c792297","year":2021},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.329877Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3e68f689b0f9b2c690a7dcf65be3deb8e68c6873246d55aab2519201e8436244","observation_id":"ee3335e7-0fd7-4dfd-b5a8-50e2e5a0eabb","resolution":{"observed_at":"2026-08-07T12:16:20.665790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.292167Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":"0532ae15-bb09-4995-aeac-6f7d87a6564e","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.436516Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:0acb609a6c8c74630ed5eeb206e24ab66202ebd477514ff555d1e3b229baafc3","observation_id":"cf7157ea-f21c-4296-8883-60c90dca772f","resolution":{"observed_at":"2026-08-07T12:16:20.397881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.080656Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":"ded98445-16ac-4e30-acc5-f89cd9ab971c","year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.584871Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3b84ba63efbd642991515caf5e13ad70ca00819166167b44c97bc3df0f125e2b","observation_id":"9add7871-7f36-4f34-a621-f36582eb566d","resolution":{"observed_at":"2026-08-07T12:16:20.194602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:19.893717Z","title":"Towards VQA models that can read","venue":null,"work_id":"a4ac7f18-c8ff-473f-81da-ff5afa304d9f","year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.692031Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:bbdad547bc955f2dd46933f716562da2258ced47ef04968ed92b3abcd532dd59","observation_id":"2a71a9fb-6724-476b-abb4-411f7b0e9b7c","resolution":{"observed_at":"2026-08-07T12:16:19.971053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-08-16T15:51:32.614520Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T12:16:14.782958Z","title":"Open-world object manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.782958Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:6d9012bf0b7f7c0f509ef251456fcacf38dd7c8c821a6015625d8abb9ff6c77b","observation_id":"e6059b5a-5b2a-4cda-8596-327f9ed638db","resolution":{"observed_at":"2026-08-07T12:16:14.782958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09816","last_updated":"2023-01-24T05:01:23Z","snapshot_observed_at":"2026-08-16T16:00:34.740049Z","submitted_at":"2023-01-24T05:01:23Z","title":"SMART: Self-supervised Multi-task pretrAining with contRol Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09816","snapshot_observed_at":"2026-08-07T12:16:14.859943Z","title":"Smart: Self-supervised multi-task pretraining with control transformers.arXiv preprint arXiv:2301.09816 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.859943Z"},"links":{"cited_paper":"/paper/2301.09816","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cf5ee40e2657e85e10fe0e9985481a72a675f6c3c3d3a4ada104b728b6ed2f87","observation_id":"74674bf9-e778-4018-b380-b4b587df19cd","resolution":{"observed_at":"2026-08-07T12:16:14.859943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:16:14.937333Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.937333Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:81048a1296a379e899e96226f010c98a0af8e5e2653a597dd78b45b7d1929ad2","observation_id":"8ffe0a2d-f610-42fa-841c-d5d9ab45293f","resolution":{"observed_at":"2026-08-07T12:16:14.937333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T12:16:15.034425Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.034425Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:843b8ee7ee64deb5d00d5d399578b141fc537ad56e9c4305775a34a5ec3686d2","observation_id":"34992c8b-5c2f-461a-9ebd-97bd33f16688","resolution":{"observed_at":"2026-08-07T12:16:15.034425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T12:16:15.105152Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.105152Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e4e43389c0c0d223b1bbb1296cbe9f56d4ebe4ffd9a3ecf3af1571c19d9c20b1","observation_id":"dfa936c2-1361-44c1-aca6-700a74758dfc","resolution":{"observed_at":"2026-08-07T12:16:15.105152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:16:15.176031Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.176031Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:fbc6c2149780ad4a157c31811947d7153d8660ff8ff53d4b70308948d8be9762","observation_id":"61693193-d58e-4177-8a7d-ee10df47b7af","resolution":{"observed_at":"2026-08-07T12:16:15.176031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:16:15.268308Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.268308Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b057026505dd205c690c2d3a38970473fe11064c0a4ff4972c0a3e735834e341","observation_id":"06719993-6dd7-4eac-95f8-55b4e8a21ec3","resolution":{"observed_at":"2026-08-07T12:16:15.268308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:19.787135Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world","venue":null,"work_id":"51b916ec-bd3e-465b-8202-d3dcfbea47b9","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.352827Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:30f604218cdd375c11e597646fb78797a336e5dba3b1ae25a986410401b8c488","observation_id":"a41ee9bc-cd25-455a-8f98-20c48cd04f0e","resolution":{"observed_at":"2026-08-07T12:16:19.827901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-15T01:35:58.775756Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T12:16:15.449497Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.449497Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:87c3f8e4378690be4c81c668fca41743d8db6270a9e9d6af6135562884ba9028","observation_id":"e1d03a9a-3438-4690-a6a9-9da73d0da9e6","resolution":{"observed_at":"2026-08-07T12:16:15.449497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:19.664089Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"980b9af1-45a7-40f8-9521-e33a8bc11a7a","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.510411Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:527bdde0344855e48cfcec9d7b75fcc6c89e52509aca958ddc9aad94d551147b","observation_id":"e412d259-4bc0-4a4d-8e91-d339d6ca3b4e","resolution":{"observed_at":"2026-08-07T12:16:19.721585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-14T22:29:28.847917Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T12:16:15.576937Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.576937Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:8f4714146b3df3ff1e47db64c0346b0cf0527a6db09d18f1335b3f2026e024dc","observation_id":"eaff1423-9048-4f1f-8ee2-dd20b974265f","resolution":{"observed_at":"2026-08-07T12:16:15.576937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T12:16:15.641523Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision).arXiv: 2309.17421 , 9, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.641523Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:db911c2ade228f716257533acb84b626a0f335b504341fc6674dae27a1ff245a","observation_id":"239354fb-65f5-4647-9534-f23f80f943f4","resolution":{"observed_at":"2026-08-07T12:16:15.641523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:16:15.718768Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.718768Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:f7dfd5ad0c17f47c030870ca6b29a2b0af2e9c15f043c0684e1d034f851c4b43","observation_id":"8944cc7b-10b1-4c98-b1bf-5159dde0e1f4","resolution":{"observed_at":"2026-08-07T12:16:15.718768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":112},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 112 outbound references and 24 inbound Pith citation observations for arXiv:2506.00123."}