{"as_of":"2026-08-15T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6da5569e682fcbbd053fecfd8bd51c1299bb25b0eb7cdcfa730135cd608fbe0c","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:29:18.351588Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:20:10.174839Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:59:51.757758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:277acd695e4c0ba71e33b666afe5109d346c5a7ac807594209aaf10fd71ee09c","observation_id":"63cbf8f5-25ec-4bc6-83dc-d99c703edc15","resolution":{"observed_at":"2026-05-15T17:18:53.222889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T15:53:29.412890Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2504.19854"},"observation_digest":"sha256:632010e82db6fd0fc3e88531810c2cf1c842be2dc9d470b06b82b451ccea5275","observation_id":"40d1d015-218d-4320-b434-92ee724f9dcb","resolution":{"observed_at":"2026-05-16T15:53:29.482119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T17:53:44.901684Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:9bc4a0e81b1968f810510e4e69e3f689d7a5af37f64b90e505139a3e831b151e","observation_id":"fb77c175-999b-480a-96f4-23524523c667","resolution":{"observed_at":"2026-05-11T17:06:05.281797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:7563e18064cdcae23a91390e3cd6257792081713cec34bd0c02e90105abf4bc7","observation_id":"e8c2aec0-2777-49a3-871b-a3f5f472a521","resolution":{"observed_at":"2026-05-11T04:55:57.288841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2606.03127","last_updated":"2026-06-02T04:10:39Z","snapshot_observed_at":"2026-07-06T23:43:27.226603Z","submitted_at":"2026-06-02T04:10:39Z","title":"TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T10:09:08.056968Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2606.03127"},"observation_digest":"sha256:7f85fcdb3af0393844e864e4e4166dc50448b291378ef8b10e1491308e1c4389","observation_id":"7c69d778-3eff-407a-95fb-8fce7d7dd0aa","resolution":{"observed_at":"2026-07-02T03:26:28.475024Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2606.03784","last_updated":"2026-06-03T08:29:49Z","snapshot_observed_at":"2026-08-13T10:40:55.654755Z","submitted_at":"2026-06-02T15:37:59Z","title":"Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T09:40:04.685274Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2606.03784"},"observation_digest":"sha256:dc0e2f12252a90df0985d07abbb7f876f920f05ff6c82aa016393fd7654093e3","observation_id":"d85cff84-3b21-4767-8162-8ae6d8ee21fc","resolution":{"observed_at":"2026-07-02T03:46:33.195770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2606.27268","last_updated":"2026-06-25T16:50:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-25T16:50:21Z","title":"E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T04:48:28.868562Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2606.27268"},"observation_digest":"sha256:6e70b7fbda2f6456839ce073d4a9b76b69ab9459e9258e6cb99c361712328f73","observation_id":"71091751-41ad-47aa-b4b0-07c0d5d1d1f9","resolution":{"observed_at":"2026-07-04T13:59:51.759123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-08-01T14:39:52.547106Z","title":"arXiv preprint arXiv:2412.11974 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-14T23:38:47.751546Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":271,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.547106Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:de026e103baeb7d6bec24ce0447dedbfca8bdec6ee4951717c53055c97d04dba","observation_id":"10575531-55ff-41fe-be5c-9ac41b018e49","resolution":{"observed_at":"2026-08-01T14:39:52.547106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-08-11T17:19:03.467276Z","title":"Emma-X: An embodied multimodal action model with grounded chain of thought and look-ahead spatial reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09448","last_updated":"2026-08-12T10:16:02Z","snapshot_observed_at":"2026-08-15T06:09:37.750157Z","submitted_at":"2026-08-10T11:22:54Z","title":"VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:19:03.467276Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2608.09448"},"observation_digest":"sha256:583e9e08e46285a653c198e20d9aa007949308a777bc8c045bee4e09532add37","observation_id":"77a40b28-65d4-491e-98f1-f2e9adcb9a84","resolution":{"observed_at":"2026-08-11T17:19:03.467276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-08-14T04:20:10.174839Z","title":"Emma-X: An embodied multimodal action model with grounded chain of thought and look-ahead spatial reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09448","last_updated":"2026-08-12T10:16:02Z","snapshot_observed_at":"2026-08-15T06:09:37.750157Z","submitted_at":"2026-08-10T11:22:54Z","title":"VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:20:10.174839Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2608.09448"},"observation_digest":"sha256:4fa97ad255cc88319a26dae5def8c8e5c3b0a4b61d52be3893b488992b0c1556","observation_id":"4578b24d-9fc7-49a8-816b-69b7f5d34e25","resolution":{"observed_at":"2026-08-14T04:20:10.174839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11974/citation-record","integrity":"/paper/2412.11974/integrity","json":"/paper/2412.11974/citation-record.json","paper":"/paper/2412.11974"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-11T14:29:18.232853Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.232853Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:aacd5d57af9bc3f199c19e979884684855499dd14fca5600448c28dc5f7ee6bf","observation_id":"b6cd4505-8830-4dc7-a541-50cac6a930dc","resolution":{"observed_at":"2026-08-11T14:29:18.232853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T14:29:18.238803Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.238803Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:06b50fdcb19a4ba501f39fbe07c7cb9a0f95fa8f980ef1e6055bf8b3f974a7b7","observation_id":"7cc30af0-d5ea-43f4-8c55-f0707043de11","resolution":{"observed_at":"2026-08-11T14:29:18.238803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-11T14:29:18.245483Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.245483Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:cda91e8538931bc2fc25c0f3e64afff8848f93bcb00ad2ccad21d570d321a3e1","observation_id":"09aa5587-cdb5-4475-9ffb-36ffbe75bf78","resolution":{"observed_at":"2026-08-11T14:29:18.245483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.681691Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"819f3b18-099b-4c0a-9447-c134301073f5","year":null},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.250810Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:dac499f181099b71e313081cb2069eb1c02c0839e80c6cb95270fa46d824132d","observation_id":"1a1bd2f0-a86e-4a1b-8549-d7bc9ab342d9","resolution":{"observed_at":"2026-08-11T14:29:18.690276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-11T14:29:18.255358Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.255358Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:37ac544132cf9ecba9163bbc322e402a49ab567187cb4fec7de7b72acafce502","observation_id":"997481be-b3c8-450c-b094-7504d99584f2","resolution":{"observed_at":"2026-08-11T14:29:18.255358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T14:29:18.260717Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.260717Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:55120bbd600a35a5d0a56d26ee00f9c73307dde84d3317c533d53583b360075b","observation_id":"3ba60856-e6be-4c2f-8b02-5ab8f6016880","resolution":{"observed_at":"2026-08-11T14:29:18.260717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-08-11T14:29:18.265138Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.265138Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:41ca0902b5eb2842a9d6fa8ea7a509d8089cf48ee8057c948b2773707d261b91","observation_id":"9bc56b6b-f5c4-4e6f-97d8-9a5d8a95c42b","resolution":{"observed_at":"2026-08-11T14:29:18.265138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14535","last_updated":"2023-10-01T00:51:18Z","snapshot_observed_at":"2026-08-13T10:47:14.644504Z","submitted_at":"2023-07-26T22:52:43Z","title":"Scaling Up and Distilling Down: Language-Guided Robot Skill Acquisition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14535","snapshot_observed_at":"2026-08-11T14:29:18.270169Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.270169Z"},"links":{"cited_paper":"/paper/2307.14535","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:7f101a7a4d56bd24dda94b7462ace90c0b79aa758702e0041c7c022e11682583","observation_id":"9d47a63a-c54c-460b-9ced-dd4bcdf31b2d","resolution":{"observed_at":"2026-08-11T14:29:18.270169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.662529Z","title":null,"venue":null,"work_id":"cb5f74e9-bd23-432d-a463-6621267b7021","year":2024},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.275027Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:904e86819d019347e8119a847378a68a52492263644ac39b28dbadfb80da2c6a","observation_id":"bc07015f-0303-4d66-be00-602563c8e055","resolution":{"observed_at":"2026-08-11T14:29:18.668818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.285160Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.285160Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:89deab1b776b99954d110a08f73b2721a9ed1ccfad7b46af62a7eb55e960d12f","observation_id":"d05f4355-9f83-4d30-a77d-5381e2f5360d","resolution":{"observed_at":"2026-08-11T14:29:18.285160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.289576Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.289576Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:0fbd49458ad9974c672890f854d6732e301d301b259e23be89a5280f1912166d","observation_id":"62882544-299f-4151-848d-7cfd6eb8f4d7","resolution":{"observed_at":"2026-08-11T14:29:18.289576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-14T13:06:41.783915Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-08-11T14:29:18.294678Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.294678Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:ba79ce7263f401359168387ba0d9ae1d76c5e7ddd602f3f367560353fb3d1098","observation_id":"f2d26b66-27c2-44b7-9c9f-ba91e5247067","resolution":{"observed_at":"2026-08-11T14:29:18.294678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-11T14:29:18.299220Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.299220Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:a355b8f7ec92d4be6e23b94469d8c4af851019d5e8b33124fb3aef42fe0a1f13","observation_id":"ff73361c-77d5-40e7-ad17-1cb3178839e3","resolution":{"observed_at":"2026-08-11T14:29:18.299220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.630980Z","title":null,"venue":null,"work_id":"5f85a10c-6884-4184-9a0d-53ff032b4fa8","year":2017},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.304480Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:5e766d5dd37e03baf3048adf769801ba5af98b7373dabd13e298c39bbab821b4","observation_id":"152a4107-bba9-45a2-88e1-8b2b896d502b","resolution":{"observed_at":"2026-08-11T14:29:18.635734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.617103Z","title":null,"venue":null,"work_id":"4fe6e471-fb50-41ee-856f-6b9d8f3b26f2","year":2024},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.309031Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:043f99f2656a1856a36be09d001f2a88f26c7642fae2a1b6aa651b4b3b216c9f","observation_id":"5cf0247a-68a6-4ee6-8e7f-b0f75cc66735","resolution":{"observed_at":"2026-08-11T14:29:18.621317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.603544Z","title":null,"venue":null,"work_id":"74a1ab46-5ac0-4036-8742-f61a3419828f","year":2024},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.313697Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:9dc047c19b9a86246d1d3d72514f2d5bc8b4601342190beaa41adce99c456852","observation_id":"ed080214-a205-4f30-8ce8-e07eaa0244d4","resolution":{"observed_at":"2026-08-11T14:29:18.608278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.318541Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.318541Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:5d09ccc2cca042f68d9f8a34265ff511944b9fc02b18765001f1c2dee9e43ede","observation_id":"ca46fc1f-46f3-43de-a4cf-2f120463032a","resolution":{"observed_at":"2026-08-11T14:29:18.318541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T14:29:18.323759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.323759Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:2adbcd2fd2fc7e7b7d896d6b9f8b0fc88fef8e7d24b502e855c05b1a006116ae","observation_id":"44fbcea9-22a1-43bb-a169-ccfa06a8a2ac","resolution":{"observed_at":"2026-08-11T14:29:18.323759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T14:29:18.328466Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.328466Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:913bae6056d5750ba81e6a1d96f9e7a95b33aae6d1ce9c12f47e51368cfe28a1","observation_id":"0825053a-6adc-4eb5-b5d1-16ac5b2ade44","resolution":{"observed_at":"2026-08-11T14:29:18.328466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.579440Z","title":"Zhao, Quan Vuong, Chongyi Zheng, Philippe Hansen-Estruch, Andre Wang He, Vivek Myers, Moo Jin Kim, Max Du, Abraham Lee, Kuan Fang, Chelsea Finn, and Sergey Levine","venue":null,"work_id":"d124cd90-27b2-4098-8355-8eb116ded2da","year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.334051Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:958dfec8d479f140fd5b279a087ab77da4bc95ce459c76acaa43c334ed5e7fca","observation_id":"35caf18f-76c1-4f83-b99f-4e7b9232e13e","resolution":{"observed_at":"2026-08-11T14:29:18.584779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-11T14:29:18.338102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.338102Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:9ab7bba005f0d54b0dd26986f82a023dca06b616c2e75c43b4ebee094ee7fff1","observation_id":"8b47159c-ad58-4ede-a848-aeb7bf82cd65","resolution":{"observed_at":"2026-08-11T14:29:18.338102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.562647Z","title":null,"venue":null,"work_id":"53963560-5692-4b6f-a322-7da6c6fbebc8","year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.343328Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:8b176baaa42df8e8c5269f0c988f3abb476a280ab70c3a202d9e39345c160200","observation_id":"6e35bab8-d661-4ec9-b5f3-c118085e30a2","resolution":{"observed_at":"2026-08-11T14:29:18.568277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.347048Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.347048Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:835ce2e4b9658c7007d93592af3b006e27bded9f114ca4d03c3a903561a707b5","observation_id":"81a0533a-290a-414d-a544-51cb7f8b0f3b","resolution":{"observed_at":"2026-08-11T14:29:18.347048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:29:18.351588Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.351588Z"},"links":{"citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:4db79c46cdfa884ef6d2695b1ca82aafbc51b1d68016da47bdad71e1821442ee","observation_id":"f774aba1-3ce1-4470-85ed-34d7e6748668","resolution":{"observed_at":"2026-08-11T14:29:18.351588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 10 inbound Pith citation observations for arXiv:2412.11974."}