{"as_of":"2026-08-11T15:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb26b08b6adeb759e717f0e1f9eb66f24e12a7d3449c3eed425b78c11f040ac1","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:33:55.651566Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:30:57.174397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-02T20:06:32.255780Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T19:19:42.748573Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2505.17685"},"observation_digest":"sha256:c2c81b45a056fd38d352b105501f4340c6da99c9776b4eea4e8e850095092343","observation_id":"7f957329-1602-4060-b1fb-d8301b5ef22a","resolution":{"observed_at":"2026-05-15T19:19:42.874884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-06T22:21:09.315435Z","title":"arXiv preprint arXiv:2505.21432 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21853","last_updated":"2025-09-07T09:44:32Z","snapshot_observed_at":"2026-08-08T23:09:09.540288Z","submitted_at":"2025-06-27T02:08:40Z","title":"Skill-Nav: Enhanced Navigation with Versatile Quadrupedal Locomotion via Waypoint Interface","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.315435Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2506.21853"},"observation_digest":"sha256:9c45893c2a7db8ccd252630e5bda86987ece8c6bc0b831da232819c11ac0d717","observation_id":"9943f6b5-3f45-44ca-a277-c0385c11385e","resolution":{"observed_at":"2026-08-06T22:21:09.315435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:70fbfcd73eea2c0dd540b7393da6d7903c5397899cdb2e8be3e22ecec84dd0c2","observation_id":"bf1e6f74-a5fa-4853-a89d-9d6deb14871f","resolution":{"observed_at":"2026-05-16T15:42:41.581802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T12:42:46.978148Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2509.06951"},"observation_digest":"sha256:639d1c0a63fde70f3a6953f62b457fb814502c484a6e30334f0eaef68ead36a4","observation_id":"e6c42ed0-3a1e-41ec-be9f-2ac5e9d0b556","resolution":{"observed_at":"2026-05-16T12:42:47.069003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:0a0c89e44a8016e72c3693fea4cf4134611139eace936c48c7e30441285d8e38","observation_id":"3edc250c-f891-48c5-987d-ad183462ea08","resolution":{"observed_at":"2026-05-14T20:09:39.902748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-04T09:08:11.780961Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:11.780961Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:aeb2ab75091c0399d74c8cf576eca18438be50387c8f9d51e093633793a64b16","observation_id":"c5a28893-c809-42c3-bf40-11c38ea3f232","resolution":{"observed_at":"2026-08-04T09:08:11.780961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2602.07399","last_updated":"2026-05-22T10:22:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T06:31:53Z","title":"VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T07:00:01.741166Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2602.07399"},"observation_digest":"sha256:863a3818f3d729cce5962229668821cf9e74224d3d9634b23f3474c6cd766b0a","observation_id":"fa07afbc-06fa-432a-b218-afd5a0eb7310","resolution":{"observed_at":"2026-05-25T07:00:26.042642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T20:18:05.030889Z","title":"Hume: Introducing system -2 thinking in visual -language action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-11T03:44:58.958471Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.030889Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:72d3bb01f056a633a5b5ac9c89c3312f7b5e91e8d6b78859cbd17337d82aff54","observation_id":"150d728d-7652-4a3c-bc24-46f9e1ba84ac","resolution":{"observed_at":"2026-08-02T20:18:05.030889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-15T12:10:54.741769Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.09170","last_updated":"2026-06-24T04:09:53Z","snapshot_observed_at":"2026-07-15T12:10:52.932866Z","submitted_at":"2026-03-10T04:19:43Z","title":"ZeroWBC: Learning Natural Whole-Body Humanoid Interaction from Human Egocentric Data","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T12:10:54.741769Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.09170"},"observation_digest":"sha256:7d947fd54222941549d68bb064e409ef2b4d9772204573bc1fafd73c99b79cae","observation_id":"73a9281f-48a8-4fa0-a5d9-b79e4083dc45","resolution":{"observed_at":"2026-07-15T12:10:54.741769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2603.10126","last_updated":"2026-05-11T15:13:54Z","snapshot_observed_at":"2026-08-11T14:14:10.237391Z","submitted_at":"2026-03-10T18:03:29Z","title":"AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T12:50:02.670780Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.10126"},"observation_digest":"sha256:e88edef5ac9dcb693add66e53d7c41b14678c30b5da17daea43f609284b9aa2a","observation_id":"e773579a-6a7d-4e0d-8a2f-5b3e8483c3fb","resolution":{"observed_at":"2026-05-15T12:50:37.167968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2603.13842","last_updated":"2026-04-10T02:57:29Z","snapshot_observed_at":"2026-08-02T22:21:29.644302Z","submitted_at":"2026-03-14T08:53:47Z","title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T11:56:40.836234Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.13842"},"observation_digest":"sha256:aea026b6122cb545392908d08a17cca21193a86bc31a8a52f9bf2f7b84087c1c","observation_id":"8deee7bd-f6c2-4f84-b333-13298a69cef4","resolution":{"observed_at":"2026-05-15T11:59:59.527563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-13T19:53:53.219607Z","title":"Hume: Introducing system-2 thinking in visual- language-action model.arXiv preprint arXiv:2505.21432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23082","last_updated":"2026-06-05T20:06:49Z","snapshot_observed_at":"2026-08-06T13:01:12.022501Z","submitted_at":"2026-03-24T11:25:52Z","title":"Spatial navigation in preclinical Alzheimer's disease: A review","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-13T19:53:53.219607Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.23082"},"observation_digest":"sha256:2324dc8503d0fe3d92e649e91db366c9d79be13c0b6fbbe25cc919e5e800b88d","observation_id":"635e0017-9b9f-4d17-b2f7-0e961982ed91","resolution":{"observed_at":"2026-07-13T19:53:53.219607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2604.02241","last_updated":"2026-04-10T14:04:42Z","snapshot_observed_at":"2026-08-10T22:47:10.433737Z","submitted_at":"2026-04-02T16:33:38Z","title":"UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T21:40:30.771335Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2604.02241"},"observation_digest":"sha256:f4c47338d8ec0f1c2c281112095fd1f7e19389a87b89e9ad0bc32c23d003ff11","observation_id":"5241d33f-930f-4b74-8528-f7da22a0e8d4","resolution":{"observed_at":"2026-05-13T21:43:19.018696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2604.03306","last_updated":"2026-03-31T02:54:21Z","snapshot_observed_at":"2026-08-11T03:51:52.785215Z","submitted_at":"2026-03-31T02:54:21Z","title":"Deep Image Clustering Based on Curriculum Learning and Density Information","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T00:03:05.442554Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2604.03306"},"observation_digest":"sha256:416602506272c875703a5d0e6a92dda9b635b53cf03b0dfda1670bd7afa92c97","observation_id":"90f67b5f-aacf-4d18-a407-f2dfa1a89af7","resolution":{"observed_at":"2026-05-14T00:03:28.527131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2604.04161","last_updated":"2026-04-10T12:28:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-05T16:03:32Z","title":"Adaptive Action Chunking at Inference-time for Vision-Language-Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T16:57:52.595165Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2604.04161"},"observation_digest":"sha256:2b62989e761b99f664ac943138a0b602c0e8785b71960fd71aef2b192d4f753b","observation_id":"28a5c88f-922d-4a9e-afe3-e79a16620ddd","resolution":{"observed_at":"2026-05-13T17:08:01.503826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01191","last_updated":"2026-05-28T05:36:20Z","snapshot_observed_at":"2026-08-11T09:21:10.471962Z","submitted_at":"2026-05-02T02:10:54Z","title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T15:14:03.865035Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01191"},"observation_digest":"sha256:e78e04a51c9b7a5ec0cb207575cc7d03339d084078489ff557924c298742e98e","observation_id":"bce58944-e575-4e19-aeeb-2f96c4ab1f0d","resolution":{"observed_at":"2026-05-11T16:46:04.809662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01191","last_updated":"2026-05-28T05:36:20Z","snapshot_observed_at":"2026-08-11T09:21:10.471962Z","submitted_at":"2026-05-02T02:10:54Z","title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T01:10:48.111387Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01191"},"observation_digest":"sha256:e0824d1146e23060acdb88c4027938c47932cb8d758a5d44f674049697b15408","observation_id":"c66e8685-deec-4791-a0d1-cde96d09ed9f","resolution":{"observed_at":"2026-07-01T13:05:45.064730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01194","last_updated":"2026-05-02T02:13:11Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T02:13:11Z","title":"VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T15:10:16.533927Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01194"},"observation_digest":"sha256:8b572c5d3a76871fe0a9d78b523bfef9ecb9821b02347734465bf40a6a41d6f2","observation_id":"c8b0042f-638e-4de8-b0bf-1858489ed884","resolution":{"observed_at":"2026-05-11T16:46:06.358813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01581","last_updated":"2026-05-29T06:35:10Z","snapshot_observed_at":"2026-08-11T00:51:10.295248Z","submitted_at":"2026-05-02T19:07:09Z","title":"Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T03:47:16.205357Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01581"},"observation_digest":"sha256:a096b5dc428e1c0429f0868b24150a5f9c88d424273eed236fa91e27db229422","observation_id":"9237db13-56b0-4f9c-8a7b-61c5ff07d408","resolution":{"observed_at":"2026-05-12T06:56:30.361693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01581","last_updated":"2026-05-29T06:35:10Z","snapshot_observed_at":"2026-08-11T00:51:10.295248Z","submitted_at":"2026-05-02T19:07:09Z","title":"Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T00:18:14.307099Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01581"},"observation_digest":"sha256:7ac6205b4399b006f0daa9453177dfd77a4b5e70a2dd315d050856226ccaf1c2","observation_id":"2913645b-6fa2-4e10-8c4d-453eb1512fbb","resolution":{"observed_at":"2026-07-01T00:25:09.759639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-08-11T13:33:40.884997Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:1c548a50b07fcacdf1ed8684527ed86ae9150c9547e3af45749552608eae877e","observation_id":"30972e20-377c-40dd-b05c-ff820df2d8c4","resolution":{"observed_at":"2026-05-13T05:12:18.267361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.08015","last_updated":"2026-07-19T14:50:06Z","snapshot_observed_at":"2026-08-02T23:41:02.702950Z","submitted_at":"2026-06-06T07:10:25Z","title":"Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:57:25.010339Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.08015"},"observation_digest":"sha256:c77d54b2f6e043a6805a95b42f169db79b4b6a432946f7b4d3f99fc8751042d7","observation_id":"0c5495cd-9e10-45be-8883-67a3eef00e56","resolution":{"observed_at":"2026-07-02T21:07:23.737640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T12:13:46.004799Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08015","last_updated":"2026-07-19T14:50:06Z","snapshot_observed_at":"2026-08-02T23:41:02.702950Z","submitted_at":"2026-06-06T07:10:25Z","title":"Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.004799Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.08015"},"observation_digest":"sha256:dec1b50b857afa63dd9f65de26509f7ea0dd25cd65546e0d7f6e9495813ee8b7","observation_id":"de9b08b3-5e48-45e1-9deb-259b4f49c5da","resolution":{"observed_at":"2026-08-02T12:13:46.004799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.17924","last_updated":"2026-06-16T13:38:03Z","snapshot_observed_at":"2026-08-08T15:58:38.583682Z","submitted_at":"2026-06-16T13:38:03Z","title":"PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T00:57:58.312567Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.17924"},"observation_digest":"sha256:90d00d94535cfbc4122c86ef2b091ef153361090a164b684d782edf1eaee0e6f","observation_id":"5e3fd18b-156e-424d-98fa-ba4770f928df","resolution":{"observed_at":"2026-07-03T20:58:58.507228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.22794","last_updated":"2026-06-22T03:10:19Z","snapshot_observed_at":"2026-08-04T03:01:53.810285Z","submitted_at":"2026-06-22T03:10:19Z","title":"UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T08:57:01.861091Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.22794"},"observation_digest":"sha256:fd6d2ea27443d1c0a8e4e7d096952a2803a49b76a7067dacca9dd64c6ba3caf9","observation_id":"53e4a2ea-4c7a-4e32-b782-a1ccb57258a1","resolution":{"observed_at":"2026-07-04T10:19:47.647699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.26006","last_updated":"2026-06-24T16:23:18Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:23:18Z","title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-25T19:29:00.117285Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.26006"},"observation_digest":"sha256:24027be596b7a3454b4e1a36a3ff49dd575e5fac63f1df460758cda8022ee9d3","observation_id":"8cf1726e-96e8-4ac7-8326-8919eb2502a4","resolution":{"observed_at":"2026-06-27T04:40:32.814702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.27268","last_updated":"2026-06-25T16:50:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-25T16:50:21Z","title":"E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T04:48:28.868562Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.27268"},"observation_digest":"sha256:9dd11cef02b0892d39a7dec82c7116e348482b77e2a5796696cceecfe725ecdf","observation_id":"a96ac403-2fb8-43bc-bf7f-951da40ff893","resolution":{"observed_at":"2026-07-04T13:59:51.756964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.28374","last_updated":"2026-06-17T14:53:36Z","snapshot_observed_at":"2026-08-05T05:47:13.101802Z","submitted_at":"2026-06-17T14:53:36Z","title":"Recursive Self-Evolving Agents via Held-Out Selection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T11:13:15.923479Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.28374"},"observation_digest":"sha256:e7af3838d87a8a06299d833595683bae19eea52e46cd9548ff8f463796d220c9","observation_id":"1c1c081c-dc97-461f-81d4-34b61c42e28c","resolution":{"observed_at":"2026-06-30T11:14:37.572040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.30686","last_updated":"2026-06-28T14:03:57Z","snapshot_observed_at":"2026-08-02T00:28:44.079969Z","submitted_at":"2026-06-28T14:03:57Z","title":"Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-01T06:56:45.197407Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.30686"},"observation_digest":"sha256:a4bc2fb3ee059d4d18fc46bc9587e653d7c60ba33b3c09a47163d6bae6263542","observation_id":"6d0ce5b9-3a94-40f1-b56c-203336e675e1","resolution":{"observed_at":"2026-07-01T08:55:35.827744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2607.01088","last_updated":"2026-07-01T15:45:08Z","snapshot_observed_at":"2026-08-02T11:41:51.446909Z","submitted_at":"2026-07-01T15:45:08Z","title":"ROSA: A Robotics Foundation Model Serving System for Robot Factories","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-02T11:11:39.584755Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.01088"},"observation_digest":"sha256:dfd9e477f55aae28ec5346c983c70da4148e5193e7c6744336d31699bff3aad8","observation_id":"984e3d47-f327-4463-81e0-474103ed5288","resolution":{"observed_at":"2026-07-02T11:16:52.678721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-12T00:12:42.173815Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03751","last_updated":"2026-07-04T07:53:10Z","snapshot_observed_at":"2026-08-08T12:53:45.209498Z","submitted_at":"2026-07-04T07:53:10Z","title":"Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:12:42.173815Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.03751"},"observation_digest":"sha256:0972597de6b7361909647ceb261ad59b4271a9c74357b291c64e65f7a9ed506d","observation_id":"67504498-1254-428f-91dc-015b7465a512","resolution":{"observed_at":"2026-07-12T00:12:42.173815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-14T12:10:21.115628Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T12:10:21.115628Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:1991476a07d24bcf87e35c9d37faccd28380fe108168c8a486a32637935f3321","observation_id":"73f704b0-a5e4-469e-b3e9-0953aa79b3a5","resolution":{"observed_at":"2026-07-14T12:10:21.115628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T07:19:41.336447Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.336447Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:3cd9832b17d89a552348a8acda806e91e3b2ae58c9805e97211e2bcf5c4be29e","observation_id":"5efd68fd-27c8-462e-ab83-5827f5d3a342","resolution":{"observed_at":"2026-08-02T07:19:41.336447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T00:30:57.030649Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.030649Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:19c9e80a9300ed1d1a74cc87d368ed12fcb4f53148f7dde6049bed160a95b8eb","observation_id":"9c83eae8-90ec-454b-8d38-30cba65811db","resolution":{"observed_at":"2026-08-02T00:30:57.030649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-01T19:56:57.191876Z","title":"Hume: Introducing system-2 thinking in visual-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16806","last_updated":"2026-07-18T12:55:40Z","snapshot_observed_at":"2026-08-09T06:56:01.071812Z","submitted_at":"2026-07-18T12:55:40Z","title":"Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T19:56:57.191876Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.16806"},"observation_digest":"sha256:3ccff1720d0cffc7d6d8f8edf409e691e22408c801c5c9b838b1d69210aff435","observation_id":"d8f48e30-f03c-4298-aa2d-b3bd694feb13","resolution":{"observed_at":"2026-08-01T19:56:57.191876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-10T04:30:57.174397Z","title":"Hume: Introducing system-2 thinking in visual-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06434","last_updated":"2026-08-06T06:32:27Z","snapshot_observed_at":"2026-08-11T15:10:30.248782Z","submitted_at":"2026-08-06T06:32:27Z","title":"Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T04:30:57.174397Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2608.06434"},"observation_digest":"sha256:250310115aa63fed18bc0e15197223716d4686d769e3ab61f82b67213296c44a","observation_id":"c3761f79-4d71-4820-b142-ab1456f4d407","resolution":{"observed_at":"2026-08-10T04:30:57.174397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21432/citation-record","integrity":"/paper/2505.21432/integrity","json":"/paper/2505.21432/citation-record.json","paper":"/paper/2505.21432"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:46.176151Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.176151Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:017a239b436c9935452551c179dfd4a53f2a052b355bea8361c5e8ceb5e4d774","observation_id":"81007fef-4341-4caf-a768-4a4bb9bd60e8","resolution":{"observed_at":"2026-08-07T13:33:46.176151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T13:33:46.316972Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.316972Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f6c3afec95dba5611862a186245ab413baf0f475ab83302bbead6c65d3c7ea90","observation_id":"a679ba6e-d086-424b-9449-b56e638d267f","resolution":{"observed_at":"2026-08-07T13:33:46.316972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.552000Z","title":"Fastumi: A scalable and hardware-independent universal manipulation interface with dataset","venue":null,"work_id":"f1fd961a-5153-4739-a07d-76738b6d40f5","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.445264Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c45cc36e3458a6fbe99826edcb9f0d12cfeca11a8e5697a3c6e28ef650b51d95","observation_id":"fbb5c2de-20a4-4c51-9fb5-d85fe417456e","resolution":{"observed_at":"2026-08-07T13:34:01.649706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T13:33:46.578291Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.578291Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:aa8d56b90cfd693e9d51b9d0ba9a919c22094e78c9a56a847fc4b8eb9b3691b7","observation_id":"f7a06d05-3a29-4c1f-aa89-74229fc47b72","resolution":{"observed_at":"2026-08-07T13:33:46.578291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.394821Z","title":"Learning 2d invariant affordance knowledge for 3d affordance grounding","venue":null,"work_id":"f6511644-58f9-4d51-a272-9690a66b4933","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.673699Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:5df1a6d1dafaaa4613ecde3a2a8696de7d2ff1f9cc0cf0ee3b0477ec384425a0","observation_id":"72bb9ad0-c3ad-4caf-92d2-0ae9f341887a","resolution":{"observed_at":"2026-08-07T13:34:01.457287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T13:33:46.813552Z","title":"Fast: Efficient action tokenization for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.813552Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:34e1df22474bc7c29b04c9f840b642cbf6ff234c5d0568fefd1537a259cea5da","observation_id":"523ae9b6-ae5a-4258-84ba-9c07faaa7f70","resolution":{"observed_at":"2026-08-07T13:33:46.813552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.232949Z","title":"Improving domain generalization in self-supervised monocular depth estimation via stabilized adversarial training","venue":null,"work_id":"4d95a7d3-8436-4b79-8c6f-f7f6ba128ab0","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.961211Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:3f317a577b800ca0482baa4a9988b4d76debb379d0b42e2e7fb716e5f422d4ed","observation_id":"b16ca1ec-1d7f-44e0-94fd-da39d0af58cc","resolution":{"observed_at":"2026-08-07T13:34:01.302774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11081","last_updated":"2025-03-14T04:47:38Z","snapshot_observed_at":"2026-08-07T17:05:01.936206Z","submitted_at":"2025-03-14T04:47:38Z","title":"MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11081","snapshot_observed_at":"2026-08-07T13:33:47.040696Z","title":"Moma-kitchen: A 100k+ benchmark for affordance-grounded last-mile navigation in mobile manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.040696Z"},"links":{"cited_paper":"/paper/2503.11081","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:417bf01b434f80d95dac47c30dd0803b544eb5b0cade1f37ce5c45549a3bc69c","observation_id":"4a1439db-2ae7-4131-a03b-830828a63ccd","resolution":{"observed_at":"2026-08-07T13:33:47.040696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13707","last_updated":"2024-10-20T05:23:35Z","snapshot_observed_at":"2026-08-04T10:51:31.728813Z","submitted_at":"2023-09-24T17:40:19Z","title":"ORLA*: Mobile Manipulator-Based Object Rearrangement with Lazy A Star","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13707","snapshot_observed_at":"2026-08-07T13:33:47.143573Z","title":"Orla*: Mobile manipulator-based object rearrangement with lazy a star","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.143573Z"},"links":{"cited_paper":"/paper/2309.13707","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:7f5e1aeefed7412b6dbc5ff47f603ce804fe09203198c9fa66c0e6b242bef39a","observation_id":"e4c00cb3-77d4-4214-b80e-5fa8af747019","resolution":{"observed_at":"2026-08-07T13:33:47.143573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15836","last_updated":"2025-09-02T08:16:33Z","snapshot_observed_at":"2026-08-10T12:34:37.399870Z","submitted_at":"2024-06-22T12:40:03Z","title":"Decentralized Transformers with Centralized Aggregation are Sample-Efficient Multi-Agent World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15836","snapshot_observed_at":"2026-08-07T13:33:47.253710Z","title":"Decentralized transformers with centralized aggregation are sample-efficient multi-agent world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.253710Z"},"links":{"cited_paper":"/paper/2406.15836","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:b6e94b60d16e2fc236bf49fa5e97c42e12b115eee55e89a72ca89fabe4c8f082","observation_id":"5f130c18-80c5-4cd6-9397-eb6338f72955","resolution":{"observed_at":"2026-08-07T13:33:47.253710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-10T15:50:18.915523Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T13:33:47.358067Z","title":"Gemini robotics: Bringing ai into the physical world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.358067Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:8333c3ba33c69ed1e7e1e8aca47c09cc1410bbd62660bef3d6a044b69688be0e","observation_id":"94eaf881-2020-449e-ab3a-2b66d3dc8480","resolution":{"observed_at":"2026-08-07T13:33:47.358067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T13:33:47.463400Z","title":"A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.463400Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d4f913620267c9153379910ab8ec7038859aede579d118b7fcd7d82c757dab00","observation_id":"7b973670-3451-42d6-ada0-178115d937c5","resolution":{"observed_at":"2026-08-07T13:33:47.463400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:47.579910Z","title":"Thinking, fast and slow","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.579910Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:b643687991f80e8f8471028ddd07a94fc4d4b1756bd24ca9c9db7a27f52de06a","observation_id":"c5d2e319-e561-438f-b073-5c14a9713627","resolution":{"observed_at":"2026-08-07T13:33:47.579910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15146","last_updated":"2025-03-29T14:57:20Z","snapshot_observed_at":"2026-07-31T17:55:12.879597Z","submitted_at":"2024-09-23T15:53:41Z","title":"COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15146","snapshot_observed_at":"2026-08-07T13:33:47.705703Z","title":"Coherent: Collaboration of heterogeneous multi-robot system with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.705703Z"},"links":{"cited_paper":"/paper/2409.15146","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a4a8e55e88bc80a9cdf976a980cc28a1a0fbd238764c65517bb0969d2c9b8ec0","observation_id":"7005a5ee-e8a7-4078-b940-90adc3152e70","resolution":{"observed_at":"2026-08-07T13:33:47.705703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.117598Z","title":"Kinematic- aware prompting for generalizable articulated object manipulation with llms","venue":null,"work_id":"d0bfe7a0-8d81-4db0-a8a1-f4e6e4c0b700","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.802501Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:272f2a09b39082b23b5b311c63339a6e87c897ee23b1a4f870fa4dcf29ad8322","observation_id":"dad5dba8-74ae-4f28-932a-592062ea71e2","resolution":{"observed_at":"2026-08-07T13:34:01.141533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08840","last_updated":"2025-06-12T03:06:12Z","snapshot_observed_at":"2026-08-08T22:54:36.294357Z","submitted_at":"2025-06-10T14:25:58Z","title":"MoRE: Mixture of Residual Experts for Humanoid Lifelike Gaits Learning on Complex Terrains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08840","snapshot_observed_at":"2026-08-07T13:33:47.950909Z","title":"More: Mixture of residual experts for humanoid lifelike gaits learning on complex terrains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.950909Z"},"links":{"cited_paper":"/paper/2506.08840","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c69359c8c6c5e6760dc6d33a1d7d4c3d8d45a3192ac770170d6b2c578fe452f8","observation_id":"8c35e3b9-4873-4117-a821-d10f28fa2b16","resolution":{"observed_at":"2026-08-07T13:33:47.950909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21853","last_updated":"2025-09-07T09:44:32Z","snapshot_observed_at":"2026-08-08T23:09:09.540288Z","submitted_at":"2025-06-27T02:08:40Z","title":"Skill-Nav: Enhanced Navigation with Versatile Quadrupedal Locomotion via Waypoint Interface","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21853","snapshot_observed_at":"2026-08-07T13:33:48.084439Z","title":"Skill-nav: Enhanced navigation with versatile quadrupedal locomotion via waypoint interface","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.084439Z"},"links":{"cited_paper":"/paper/2506.21853","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a37b78ec5b52bd901ac5a0bfff59f25526cf5b8431d159a9b9252522dfd3ce77","observation_id":"6dddf33d-15cc-4694-939f-d600362909b7","resolution":{"observed_at":"2026-08-07T13:33:48.084439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:48.230494Z","title":"Robotic policy learning via human-assisted action preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.230494Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:19d9842b3f3970b13dd274c8271896ee0634e3cd71d48890345baa691c1f44d8","observation_id":"597e2a01-7034-4650-b63b-32cafef1ea61","resolution":{"observed_at":"2026-08-07T13:33:48.230494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.916621Z","title":"Phoenix: A motion-based self-reflection framework for fine-grained robotic action correction","venue":null,"work_id":"46e3eddb-e275-4dad-ae07-da0647d2c607","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.361825Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:71c8aacb11a9ec199cad0024a73e7a285871a42e37ac664c270e909cdbaa03e8","observation_id":"92e6060e-9b8b-44a7-a2c4-33d3bfb0e455","resolution":{"observed_at":"2026-08-07T13:34:00.991650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00420","last_updated":"2025-06-01T18:46:06Z","snapshot_observed_at":"2026-08-07T16:18:35.468522Z","submitted_at":"2025-04-01T04:55:34Z","title":"Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00420","snapshot_observed_at":"2026-08-07T13:33:48.487515Z","title":"Think small, act big: Primitive prompt learning for lifelong robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.487515Z"},"links":{"cited_paper":"/paper/2504.00420","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:20cfaab4e1a2e521c620a619b6d43887ac1966746202aa46e91ce11358fdea8a","observation_id":"85cd5166-56d9-467d-ae2d-9aa866a98f5e","resolution":{"observed_at":"2026-08-07T13:33:48.487515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.764177Z","title":"Spatial-temporal graph diffusion policy with kinematic modeling for bimanual robotic manipulation","venue":null,"work_id":"ccbf535b-0e14-4095-ad6a-db196c0db5f8","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.605623Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:6c91b656d0a02369fa8dc53253582c63b66751c95d9d4df496706839875ce060","observation_id":"1aa81f56-cba4-40c7-b47d-aabcf0641517","resolution":{"observed_at":"2026-08-07T13:34:00.854828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.590418Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"44dcefd3-2921-4c27-89a8-138101e11d3e","year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.729701Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:e69fb709c8f0def55d1172e2aa1f1e9397fb471f68713e4fe63abb7bac75da1a","observation_id":"1af8d243-7c3a-4325-b55d-d0415085ca79","resolution":{"observed_at":"2026-08-07T13:34:00.688344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T13:33:48.892757Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.892757Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:e18cd0b37886865ea7a198666ab63c6219fa3e926f4bec882c9810baec176013","observation_id":"33ca2d67-8cba-48d1-8c09-e441a74ddea4","resolution":{"observed_at":"2026-08-07T13:33:48.892757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.344624Z","title":"A dual process vla: Efficient robotic manipulation leveraging vlm","venue":null,"work_id":"888207c0-7f3c-44ea-ae57-8a1ce8c702da","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.081807Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a5f1f32d1f0bcd3f3023f8d8ec3c93fc89a25447077079a3cf529b1de418f132","observation_id":"afbe1c2c-f490-4a80-a099-310c6b6a865f","resolution":{"observed_at":"2026-08-07T13:34:00.459634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05273","last_updated":"2025-02-03T04:07:37Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-09-12T09:18:09Z","title":"HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05273","snapshot_observed_at":"2026-08-07T13:33:49.257537Z","title":"Hirt: Enhancing robotic control with hierarchical robot transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.257537Z"},"links":{"cited_paper":"/paper/2410.05273","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:10d43df80ee17598757f26e7d17fc460a676805f9aff491f720ca88b489704fa","observation_id":"0593f14e-de49-4900-97f9-ced694cb1150","resolution":{"observed_at":"2026-08-07T13:33:49.257537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-04T13:24:32.760498Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-07T13:33:49.385522Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.385522Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1e48cf3651cee0662ea125e3234ca02c10769286cf8c763cfdaf298c3b955a33","observation_id":"fbc7f4d3-eef8-4e1c-9eb2-c8f2cbfe781d","resolution":{"observed_at":"2026-08-07T13:33:49.385522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-07T13:33:49.511193Z","title":"Dexvla: Vision- language model with plug-in diffusion expert for general robot control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.511193Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:0000c0cac3c1cedc09902a7fd478cacb1db3094f23ff9c6be264c542e9fc49ee","observation_id":"5ca8f132-157a-4cc0-a0b7-b44fbf22ab28","resolution":{"observed_at":"2026-08-07T13:33:49.511193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T13:33:49.614480Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.614480Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f5bbf5200548616747a33f3318ad53db3ee81e427e0ddc13e857b4d407430355","observation_id":"3c1db6a1-da02-49f4-a743-2c29061bc1a0","resolution":{"observed_at":"2026-08-07T13:33:49.614480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-07T13:33:49.760140Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.760140Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c1bb8a0e42f03d6c4e61d601b24b69993cbf822fff2aaeeb199ca669fcbda689","observation_id":"faf03009-fb2c-461a-bd4d-14ef462cf812","resolution":{"observed_at":"2026-08-07T13:33:49.760140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.131743Z","title":"Helix: A vision-language-action model for generalist humanoid control, 2025","venue":null,"work_id":"bd94ee99-29fc-4448-90b3-7d504ccfbc1b","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.915193Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:babec9c04b08c81a606d2a7ab421dc77a988ec73dae15bc4371259ca9e3bc0c3","observation_id":"f3b374f1-6e31-40ef-983a-45e2b9a5fa7a","resolution":{"observed_at":"2026-08-07T13:34:00.206921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T13:33:50.042676Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.042676Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:17f8b561bdf804679b5fb325ea3b451b91fe10bf1aa32045c1b927b710d884f1","observation_id":"32fb4798-d4e5-4b97-82c7-86ae6160cf74","resolution":{"observed_at":"2026-08-07T13:33:50.042676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23346","last_updated":"2025-05-29T11:10:41Z","snapshot_observed_at":"2026-08-10T19:45:26.976782Z","submitted_at":"2025-05-29T11:10:41Z","title":"Beyond Optimal Transport: Model-Aligned Coupling for Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23346","snapshot_observed_at":"2026-08-07T13:33:50.178954Z","title":"Beyond optimal transport: Model-aligned coupling for flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.178954Z"},"links":{"cited_paper":"/paper/2505.23346","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:5ba7f01f15ca82bb3f97dad641f32d994b8bd4b4b8926d92f534b2183d4d45df","observation_id":"e36e8996-aef0-42d3-9da8-5e096f4a255c","resolution":{"observed_at":"2026-08-07T13:33:50.178954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-07T13:33:50.325026Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.325026Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:0ca378febd333d843c28b1bb15fe7d36e95b285d4f91bbca648732fe5299ee71","observation_id":"4e2d2e85-f720-40dd-9f4e-71daf55ff675","resolution":{"observed_at":"2026-08-07T13:33:50.325026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.001813Z","title":"Evaluating real-world robot manipulation policies in simulation","venue":null,"work_id":"eb87de91-188e-4cec-ad32-60763dc2209b","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.473479Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f7621fa79b6722382746aeda4fa73d78576c4400aad0d3bf802b97cf1d5b1456","observation_id":"ed099548-4729-4806-a43b-4047d2b92ee5","resolution":{"observed_at":"2026-08-07T13:34:00.079764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T13:33:50.601029Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.601029Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:375275aaf860e035973c1d2a63f5b4e63e2d4f4716e9ccc46b39524678b0d935","observation_id":"b6980a7b-23da-4fac-9da9-898329f2d91a","resolution":{"observed_at":"2026-08-07T13:33:50.601029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-02T20:06:32.255780Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17685","snapshot_observed_at":"2026-08-07T13:33:50.714630Z","title":"Futuresightdrive: Thinking visually with spatio-temporal cot for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.714630Z"},"links":{"cited_paper":"/paper/2505.17685","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c9fda9dbb6ca428d75e247b744b4d6acd5cc4db4408e95aee726872b9c89b6ca","observation_id":"4661f28f-b4fd-428c-8cab-dd0ea2467d6c","resolution":{"observed_at":"2026-08-07T13:33:50.714630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-07T13:33:50.849364Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.849364Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:7bbb33d538a1f7efcc4db14ab0f12312d5f58007c38e05a081f88397245e6aac","observation_id":"257b1298-91e4-4d6a-b99e-c8e12cacef87","resolution":{"observed_at":"2026-08-07T13:33:50.849364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.856160Z","title":"RoboMP2: A robotic multimodal perception-planning framework with multimodal large language models","venue":null,"work_id":"2271ef7e-e3b4-418b-adff-1d1135e62468","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.961129Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d3c261542a063382105b4a5035b2dfb87e74e8a5ebf0d8c26d3d559fa6f1dc87","observation_id":"15194271-763a-4a9e-ae20-58bc0171772c","resolution":{"observed_at":"2026-08-07T13:33:59.951725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-08-11T00:27:34.812297Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10105","snapshot_observed_at":"2026-08-07T13:33:51.178608Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.178608Z"},"links":{"cited_paper":"/paper/2501.10105","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:e5c24a6125e15d4d717561715ea0ecd6e9579ee3cee17a1996166f878376adc9","observation_id":"6f71dcb0-3c70-43a6-b824-801f1038533a","resolution":{"observed_at":"2026-08-07T13:33:51.178608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.631358Z","title":"Learning causality-inspired representation consistency for video anomaly detection","venue":null,"work_id":"4254a523-77cc-4363-b24a-6757e16c41f5","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.301356Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:ac332e3ea7654334ae84c634d7e08cf9b4dbc18176da5fdb03b9cd20102b86b3","observation_id":"98106cf3-bab8-479b-bef4-aedf443dc267","resolution":{"observed_at":"2026-08-07T13:33:59.715736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.434697Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":"c431c9f9-9096-41d3-9573-5656068dec2f","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.416783Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c1a6c680dfc7802fc3a1ffa651bb0251ac7bced3cb7b94fad1103fc8555f10a4","observation_id":"7987215a-b994-45c6-abc3-f9d0c0442d99","resolution":{"observed_at":"2026-08-07T13:33:59.525438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.238459Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"4ff97077-8359-44d1-b112-1a7cb96f6144","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.548815Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f88dbfda4be1e7eb4f8ebf4c9040b3506e275c2c87a6ba3404aa6c3d7eabe363","observation_id":"a686961f-ed9d-4b19-866a-bda44f39afa6","resolution":{"observed_at":"2026-08-07T13:33:59.312277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.052105Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":"39f63e8f-c59a-4f61-a499-57d196418fe8","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.664459Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:6b2046c05314347c532084f9ba75883bc75298fb6879189268ea8fc5506fce3e","observation_id":"f30ddaf8-0366-41b9-ac3c-a4e833fb91c2","resolution":{"observed_at":"2026-08-07T13:33:59.120220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:51.772547Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.772547Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1236e3a7ab6ad53985116d2ea5f5103f695c97075d8f96cba8f1e6602ae3750e","observation_id":"bb30c695-ea59-47f2-b80d-691d8ebc69ca","resolution":{"observed_at":"2026-08-07T13:33:51.772547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T13:33:51.884717Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.884717Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:3a008c2f814531dc4d8717c0dafc19d5b2298d2b22ee6d6c409ed74c31a06f07","observation_id":"d0c08af9-ddd5-4a01-aed7-1077f92b290c","resolution":{"observed_at":"2026-08-07T13:33:51.884717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:33:51.985432Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.985432Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d7cf5b23577433d3af4b09f8f527c850f6e7decfb9068c1d85a493e9e2fc277a","observation_id":"76800bd8-a57b-47d3-be37-85e5bc17e353","resolution":{"observed_at":"2026-08-07T13:33:51.985432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-08T02:45:56.557199Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-08-07T13:33:52.124767Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.124767Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1295039ca12bf44bdb71c8942ae5fb076b67fc71a56f9ed34e75feeffa6d04a1","observation_id":"232a0add-3c70-40f2-85a8-dc5ba1c1ae8a","resolution":{"observed_at":"2026-08-07T13:33:52.124767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.816934Z","title":"Mllmguard: A multi- dimensional safety evaluation suite for multimodal large language models","venue":null,"work_id":"00ba4695-ec73-42d7-9064-735447a4076f","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.282259Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:2bf4f03f70202bc74500173fc452daff95037fbd8a2dd9fcfbf7b132bd2ac767","observation_id":"c515e4aa-907b-4748-b0fe-ab70894abfb7","resolution":{"observed_at":"2026-08-07T13:33:58.909259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00436","last_updated":"2023-10-05T12:59:59Z","snapshot_observed_at":"2026-08-05T10:40:40.562724Z","submitted_at":"2023-08-01T10:31:36Z","title":"SelfCheck: Using LLMs to Zero-Shot Check Their Own Step-by-Step Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00436","snapshot_observed_at":"2026-08-07T13:33:52.387699Z","title":"Selfcheck: Using llms to zero-shot check their own step-by-step reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.387699Z"},"links":{"cited_paper":"/paper/2308.00436","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1772356dacebb59fb51bb4a8f9a9ba669e56789869ab6eab6590da6b4965e27b","observation_id":"51c50869-8ef4-42d7-9746-4530cff6eec3","resolution":{"observed_at":"2026-08-07T13:33:52.387699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11541","last_updated":"2025-05-20T00:24:09Z","snapshot_observed_at":"2026-08-10T07:19:20.337181Z","submitted_at":"2025-05-14T13:11:16Z","title":"MorphMark: Flexible Adaptive Watermarking for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11541","snapshot_observed_at":"2026-08-07T13:33:52.513946Z","title":"Morphmark: Flexible adaptive watermarking for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.513946Z"},"links":{"cited_paper":"/paper/2505.11541","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:dab4e693874cfdf69a5fe19f08e0876e7380cb4b0e942ca78c7d558fc34b9c09","observation_id":"b14d58a8-8cfa-42de-b0fc-c8e86a6fd48f","resolution":{"observed_at":"2026-08-07T13:33:52.513946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.637946Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"41b83396-da64-4ba4-9717-e28bc6868d62","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.622187Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:b57e28dc24d56080b6f7d0c85434dbc16073426304fa8b099e61f105cb345644","observation_id":"0ade5a7e-5cda-44de-b5bf-de1ce2217f55","resolution":{"observed_at":"2026-08-07T13:33:58.729436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11905","last_updated":"2025-03-21T04:40:24Z","snapshot_observed_at":"2026-07-06T19:17:32.745266Z","submitted_at":"2024-09-18T12:05:30Z","title":"AlignBot: Aligning VLM-powered Customized Task Planning with User Reminders Through Fine-Tuning for Household Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11905","snapshot_observed_at":"2026-08-07T13:33:52.754745Z","title":"Alignbot: Aligning vlm-powered customized task planning with user reminders through fine-tuning for household robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.754745Z"},"links":{"cited_paper":"/paper/2409.11905","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:cbe62f4d84a56f7f10d584d2b5b1750d0b2efe77f8f0302d9847c5ce92f4d0c6","observation_id":"52dd79ae-1572-46ca-b6ee-a04dcf031ad7","resolution":{"observed_at":"2026-08-07T13:33:52.754745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:52.896307Z","title":"Sets: Leveraging self-verification and self-correction for improved test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.896307Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:cafe0551f16896cc8c8ad68144422c415032d9626c097f6994c670a786c8edbc","observation_id":"56722f56-4188-4b25-aede-774f1ca05879","resolution":{"observed_at":"2026-08-07T13:33:52.896307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01707","last_updated":"2024-12-25T13:32:54Z","snapshot_observed_at":"2026-08-11T03:40:32.971692Z","submitted_at":"2024-10-02T16:15:31Z","title":"Interpretable Contrastive Monte Carlo Tree Search Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01707","snapshot_observed_at":"2026-08-07T13:33:52.995028Z","title":"Interpretable contrastive monte carlo tree search reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.995028Z"},"links":{"cited_paper":"/paper/2410.01707","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:7297a8b4cbf2dabce376bd44ff4a331c3df21507112c53707f69cd20df5dfe6c","observation_id":"23c7015d-acb4-4e75-9d04-2bd052aeccba","resolution":{"observed_at":"2026-08-07T13:33:52.995028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-07T13:33:53.140367Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.140367Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a7d67f1de900b36147e5a98c8c7d566ce8c1296702607fb91d698bb561ee1a1b","observation_id":"51468219-21ee-4e85-a594-c758e0825966","resolution":{"observed_at":"2026-08-07T13:33:53.140367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15282","last_updated":"2021-12-17T17:21:04Z","snapshot_observed_at":"2026-08-07T06:41:10.116700Z","submitted_at":"2021-05-30T17:14:52Z","title":"Cascaded Diffusion Models for High Fidelity Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15282","snapshot_observed_at":"2026-08-07T13:33:53.244353Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.244353Z"},"links":{"cited_paper":"/paper/2106.15282","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:ec36757fa171df138f7872d3409de8d5a5ad69da50f13386d63a304a668a2cee","observation_id":"b0acd536-3231-4720-905d-cf6adbc16476","resolution":{"observed_at":"2026-08-07T13:33:53.244353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:53.327795Z","title":"Revis- iting multi-agent world modeling from a diffusion-inspired perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.327795Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:33acc6e6f2dd7ad08aeaee82cd86e63eb72a711bf085b6b88abaa2570caea89b","observation_id":"55a1e608-4ed0-4fa6-bde0-4ddcb2a9a26a","resolution":{"observed_at":"2026-08-07T13:33:53.327795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04955","last_updated":"2022-10-10T18:49:25Z","snapshot_observed_at":"2026-07-06T14:03:17.645948Z","submitted_at":"2022-10-10T18:49:25Z","title":"f-DM: A Multi-stage Diffusion Model via Progressive Signal Transformation","version":1},"cited_work":{"arxiv_id":"2210.04955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.04955","snapshot_observed_at":"2026-08-07T13:33:56.118253Z","title":"f-DM: A Multi-stage Diffusion Model via Progressive Signal Transformation","venue":"cs.CV","work_id":"a4c4e12e-b432-42c3-8dd4-fb0b55bad0d8","year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.420181Z"},"links":{"cited_paper":"/paper/2210.04955","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1beb474a79eb5bf4269d9f07d39d4067f4e1fcfbb22f4ce777b9043110b82e72","observation_id":"f73061fa-010c-4826-9dc2-865bbd20f8fd","resolution":{"observed_at":"2026-08-07T13:33:56.228091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02414","last_updated":"2024-01-04T18:55:01Z","snapshot_observed_at":"2026-08-10T10:44:05.196789Z","submitted_at":"2024-01-04T18:55:01Z","title":"Bring Metric Functions into Diffusion Models","version":1},"cited_work":{"arxiv_id":"2401.02414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02414","snapshot_observed_at":"2026-08-07T13:33:55.933422Z","title":"Bring Metric Functions into Diffusion Models","venue":"cs.CV","work_id":"663fcf4c-9d8a-4948-8af2-81b725d23dba","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.554629Z"},"links":{"cited_paper":"/paper/2401.02414","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:b94816aba86c3f1be01a81565001e13593c687189de36b87fbab603f4aaee6ee","observation_id":"d2f7f3f1-10d6-4d08-ab54-bf8ea252f4b1","resolution":{"observed_at":"2026-08-07T13:33:56.005341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.414151Z","title":"Spectral-cascaded diffusion model for remote sensing image spectral super-resolution","venue":null,"work_id":"b4be3b9f-00af-4e8f-9859-073e7b9b2153","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.717819Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1ed8cb9d832821159e6ef96fa8837e728aa49119740acae98ddbb8c7a95b9b07","observation_id":"50763b71-7e9d-4562-b70a-c7dee4706c6c","resolution":{"observed_at":"2026-08-07T13:33:58.526003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.236694Z","title":"High-resolution frame interpolation with patch-based cascaded diffusion","venue":null,"work_id":"2c4ae53e-a149-4717-862a-5e67fac67684","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.835285Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:8d93847f21b1ea50759ec268eb6d798abd57d416ae85ac315942b14ca012a5b8","observation_id":"f51f89c3-d1cb-4027-84ce-d0d70f442a8f","resolution":{"observed_at":"2026-08-07T13:33:58.305583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.056810Z","title":"Cascaded diffusion models for virtual try-on: Improving control and resolution","venue":null,"work_id":"b2d3a273-9a8d-4d3d-871c-3b5bfd711762","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.990234Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:81ae2482744d0c816c5040107c34ad376652a5bed7d65dfcb3eb504b6838e093","observation_id":"c527b747-cc31-4b73-8b80-f6f1e271296e","resolution":{"observed_at":"2026-08-07T13:33:58.127619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:33:54.126278Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.126278Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:af7ce011815b14c6f0c63b8a2c0fbdf6457ab3fadb37ad00114f045009a4ab05","observation_id":"2c28b4f4-4442-4192-947e-bf9bac79cfd2","resolution":{"observed_at":"2026-08-07T13:33:54.126278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.912153Z","title":"Pre-training for robots: Offline rl enables learning new tasks from a handful of trials","venue":null,"work_id":"fd9ffa19-4e48-437a-b086-f72ef76cfe98","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.254443Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1d9732a0a706f1de02fa05bbbbf0e486444ec9f7fe2db24133af6db102e1a0bd","observation_id":"05da854f-a948-4814-ad54-9ffdfb1cc9e1","resolution":{"observed_at":"2026-08-07T13:33:57.971727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.746746Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"872e9e25-a8ba-4d71-b8c9-025b2f2ac8ee","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.384981Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d62f73fe13998b45c3649ed52f9db981f0b7eac4da400ec0fd6887b81af817b0","observation_id":"287d1e5a-a6e8-4633-a58d-c5f73ef9088f","resolution":{"observed_at":"2026-08-07T13:33:57.814329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T13:33:54.509544Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.509544Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:668388f0fa684e700f9e69e97afa7d76924b7965d50cd7fd504d6014cda54266","observation_id":"f5826893-a8b4-4a18-848d-bfba099c12f1","resolution":{"observed_at":"2026-08-07T13:33:54.509544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:54.674777Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.674777Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:000f50009409428128633483f2f6f333eba81d34a671f588a9477f8a09654d2b","observation_id":"b73c3ab7-a074-4ed8-bac6-3ee1f980e446","resolution":{"observed_at":"2026-08-07T13:33:54.674777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.553441Z","title":"Scaling proprioceptive-visual learning with het- erogeneous pre-trained transformers","venue":null,"work_id":"d541d6a1-34f7-418b-9b68-f40d5cdb0113","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.796683Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:eae80b750320f5e90fc9adc319e2c8d09f3a1d6cb379dac075b0f9b431ae3986","observation_id":"949e21aa-1443-418a-a674-d4b10016708d","resolution":{"observed_at":"2026-08-07T13:33:57.645007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-07T13:33:54.889344Z","title":"Towards generalist robot policies: What matters in building vision-language- action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.889344Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:127db756a813c08162929fa94eff06f09d42c5187b4a683fca5c3fae506e7d59","observation_id":"fb8bd160-8b34-48c3-9899-1b76a00db3e0","resolution":{"observed_at":"2026-08-07T13:33:54.889344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-07T13:33:55.004692Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.004692Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:89de0260eb9e36020c408b500fde7e0c986b25273778c7294266a19e90bcece8","observation_id":"4ee513b6-aba5-475c-9d35-14fb20a3afc8","resolution":{"observed_at":"2026-08-07T13:33:55.004692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:55.157444Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.157444Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:1b5fd8114ad2f73e8f39954c8085a03a738f343f2e5313a61674ea918df06e21","observation_id":"ad6b665d-616d-44f5-bdca-262e55c9930f","resolution":{"observed_at":"2026-08-07T13:33:55.157444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T13:33:55.223798Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.223798Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:4804757770467ee3a795297e2830692d7c602c5dd10514746698d065c15e42ac","observation_id":"7ac1ebce-6d32-4038-8412-5bb69cd72bc6","resolution":{"observed_at":"2026-08-07T13:33:55.223798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10047","last_updated":"2023-10-16T04:11:19Z","snapshot_observed_at":"2026-07-06T16:33:30.170449Z","submitted_at":"2023-10-16T04:11:19Z","title":"Improving Large Language Model Fine-tuning for Solving Math Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10047","snapshot_observed_at":"2026-08-07T13:33:55.329461Z","title":"Improving large language model fine-tuning for solving math problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.329461Z"},"links":{"cited_paper":"/paper/2310.10047","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:5c1ed8c580a5f18f99c1c736c250dbc44720093ff7ed6b3ffc511026160eef84","observation_id":"ae1bf471-dc67-454c-9dff-58f2d586f78c","resolution":{"observed_at":"2026-08-07T13:33:55.329461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T13:33:55.428373Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.428373Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:240f1132eeb144db577d7ce6cf4c883cd7a36594393b6fef4feade27a3eed377","observation_id":"1791c3be-837b-4f62-b6bf-1553d4807b86","resolution":{"observed_at":"2026-08-07T13:33:55.428373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.331728Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"60d80ed8-8f75-4d84-b09b-85adbb4efb23","year":2018},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.564589Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d81cb7b6b6e15377413001405be9a1206e28be2e7b545b65ec10a2d56216ccde","observation_id":"9b18831f-3bec-46ab-82ca-e17095e176ce","resolution":{"observed_at":"2026-08-07T13:33:57.417704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T13:33:55.651566Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.651566Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:00f9563befd2347db3a18573e75c4acc5719d9f2d2a2311b3d1647ce2dac4bc9","observation_id":"5d8e87df-c426-4323-8554-e9c8d0a2fea1","resolution":{"observed_at":"2026-08-07T13:33:55.651566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T15:34:18.920235Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 36 inbound Pith citation observations for arXiv:2505.21432."}