{"as_of":"2026-08-08T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0005699f061bd89ed5d48bbc43ca9de596f79eb900477d64bade2067dc8b56cb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:43:02.033013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T15:05:47.993970Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2408.01129","last_updated":"2026-04-06T02:10:55Z","snapshot_observed_at":"2026-07-30T06:31:55.204130Z","submitted_at":"2024-08-02T09:18:41Z","title":"A Survey of Mamba","version":8},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-23T22:09:19.917854Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2408.01129"},"observation_digest":"sha256:80b08770ce50745d35f815f243e6b9fd826e6ba4c4853171a1d11a5a4593a229","observation_id":"02702282-2022-4da4-96d1-3542817a2aa2","resolution":{"observed_at":"2026-05-23T22:13:30.932811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:8e0021fbbf5f1a75d20a11ff31fbb2d26bfe6f30a078c6f16750a4f35ca552c7","observation_id":"290b5786-1f73-4067-a976-d11cdcb7f124","resolution":{"observed_at":"2026-05-17T21:37:50.751231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:4b7307ef2fffaf9655a5f700a73abb2c62b674970975c8cf66edf1e8a5c5c508","observation_id":"2363350b-bbe2-4354-b5c1-d3eb7f646721","resolution":{"observed_at":"2026-05-15T22:00:48.981558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T13:43:02.033013Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.033013Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:26b7fd46211ffb3346fb6061850bd62d3b44a71ccbd7c47112eb0d5f12fe6204","observation_id":"d0bc70a6-f547-44cb-8a61-00668dc6b4f8","resolution":{"observed_at":"2026-08-07T13:43:02.033013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T12:35:11.651667Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24305","last_updated":"2025-06-20T13:07:10Z","snapshot_observed_at":"2026-08-08T15:01:56.456303Z","submitted_at":"2025-05-30T07:38:46Z","title":"SR3D: Unleashing Single-view 3D Reconstruction for Transparent and Specular Object Grasping","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:11.651667Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2505.24305"},"observation_digest":"sha256:e3a67630adde3c1e371a1df0348d104c1f5b263d4b369952b346e75b01710e45","observation_id":"3ddf92af-9bd3-46d0-9a71-74918263d5eb","resolution":{"observed_at":"2026-08-07T12:35:11.651667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T04:42:22.491193Z","title":"Robomamba: Efficient vision-language-action model for robotic reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.491193Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:b51d4a56e6f34e1ed9de5b59b6d4c3d13ede177359d5f05cf5fd7c131b455573","observation_id":"4028d45d-1f3b-4f46-8544-e66684b8a3ec","resolution":{"observed_at":"2026-08-07T04:42:22.491193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T00:57:29.206479Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation.arXiv preprint arXiv:2406.04339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-07T07:38:26.007252Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:29.206479Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:8c2527a5ae1a5360cd0cf422a198253ae4ba22efd54e496a15423428fffb5798","observation_id":"38cca183-d0f7-48ce-8f4d-94170850d9d4","resolution":{"observed_at":"2026-08-07T00:57:29.206479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-06T20:45:29.955616Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01961","last_updated":"2025-07-05T04:00:38Z","snapshot_observed_at":"2026-08-07T06:49:22.555930Z","submitted_at":"2025-07-02T17:59:54Z","title":"AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:29.955616Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2507.01961"},"observation_digest":"sha256:d7b9631e77c9e5b565721925a0ad03b5349ef1f91857d8ae45c241ccc14aefc9","observation_id":"4afea0c2-b45a-4512-ad4e-b59c05750672","resolution":{"observed_at":"2026-08-06T20:45:29.955616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-06T20:04:38.171370Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03930","last_updated":"2025-07-08T01:07:30Z","snapshot_observed_at":"2026-08-07T12:49:17.624180Z","submitted_at":"2025-07-05T07:29:37Z","title":"RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:38.171370Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2507.03930"},"observation_digest":"sha256:3206b2bcc826d9dc11428e9405793f4d43b81e8eaf5dbf76ad318e00552b8435","observation_id":"09e0e0a6-017d-4cc1-ae66-daf950206a4f","resolution":{"observed_at":"2026-08-06T20:04:38.171370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-06T16:33:57.134511Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-07T12:51:41.116234Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.134511Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:6f6dbe9ad2a1132300fddba9802e6d315370b1f03b14a70a8428df0cd03852fa","observation_id":"c3e0b10e-500c-40ed-9d4b-64a657555ab4","resolution":{"observed_at":"2026-08-06T16:33:57.134511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-05T20:35:45.475365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-07T13:33:54.413844Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:45.475365Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:1eb6ad0342033edd10f44dae40f802a3ce0cdbdcc7bbc68681e9cc696d6be164","observation_id":"827e18ad-5ac8-4119-9e93-12a9df8da143","resolution":{"observed_at":"2026-08-05T20:35:45.475365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-05T20:38:42.321331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-08T01:00:17.824912Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:42.321331Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:db137f50d9bdec2d96050336597b51624ce046349dcf1a2ba17c3699787a9473","observation_id":"1272386a-855e-4b88-b10d-489b933db069","resolution":{"observed_at":"2026-08-05T20:38:42.321331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-05T14:42:32.706108Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation.arXiv preprint arXiv:2406.04339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.706108Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:83963f2909a86ec771b28cb4e2f69d1bdac9d25d10df8878db704f14f531a790","observation_id":"279c0bc5-afb6-48cf-adfa-27dc11b302c6","resolution":{"observed_at":"2026-08-05T14:42:32.706108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:e8b505b8ab639f7dfc29283258b0a2257da6a5c1f7849c6876dc3c60af2702c7","observation_id":"232d7b16-fcef-45a4-8b47-f1d67965b293","resolution":{"observed_at":"2026-05-15T09:19:54.429268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2604.07935","last_updated":"2026-07-08T13:12:46Z","snapshot_observed_at":"2026-08-03T01:55:34.670351Z","submitted_at":"2026-04-09T07:55:03Z","title":"The Hyperscale Lottery: How State-Space Models Have Sacrificed Edge Efficiency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:46:11.859634Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2604.07935"},"observation_digest":"sha256:079f5d12e4dddfd65a858bc1f10f2a8d9c333dd96a2e7fb031fdf297d98443fe","observation_id":"0d2c3558-3b71-41ab-8934-d827233a0666","resolution":{"observed_at":"2026-05-11T06:11:01.047812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2604.24447","last_updated":"2026-04-27T13:12:16Z","snapshot_observed_at":"2026-08-02T20:38:02.984524Z","submitted_at":"2026-04-27T13:12:16Z","title":"Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:46.460069Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2604.24447"},"observation_digest":"sha256:4c86b9313a86046245f99c97e54cd8aace3d2d813230620c1360ce4a25db3f9f","observation_id":"3deb1b49-17d2-4a9d-89ec-32c44af5808c","resolution":{"observed_at":"2026-05-11T22:16:52.201546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.07308","last_updated":"2026-05-18T04:08:11Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:17:08Z","title":"AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:24:34.761241Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.07308"},"observation_digest":"sha256:a302769a22e2e2b9a2048c7baae8f83c6e84560438732e587c508dd8b529a1e8","observation_id":"eb6e3af0-41c6-4784-a60f-2bba7d547084","resolution":{"observed_at":"2026-05-11T04:25:57.892889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.07308","last_updated":"2026-05-18T04:08:11Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:17:08Z","title":"AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T23:21:10.571364Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.07308"},"observation_digest":"sha256:03e0be795146c0a7b5232a446ea118cebc0328eb6f939f2888c0debcc7397739","observation_id":"63dccea2-d187-4cec-b06b-c4ded16157da","resolution":{"observed_at":"2026-05-20T23:23:51.545108Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.21854","last_updated":"2026-06-06T09:58:33Z","snapshot_observed_at":"2026-08-02T07:58:30.433073Z","submitted_at":"2026-05-21T01:02:41Z","title":"CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T08:07:51.697353Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.21854"},"observation_digest":"sha256:2dfdf0cd5a4ee5f4d3b50cfffacc92868a5b5308e11c0cdac29e4e867c07ce07","observation_id":"c44723ea-3401-4271-946b-0bc903555288","resolution":{"observed_at":"2026-05-22T08:11:17.224854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.21854","last_updated":"2026-06-06T09:58:33Z","snapshot_observed_at":"2026-08-02T07:58:30.433073Z","submitted_at":"2026-05-21T01:02:41Z","title":"CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:48:02.228941Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.21854"},"observation_digest":"sha256:7dd4cae46312d01c2c0ddc0c738f742f61bc486e7373484671b9c444f401da0e","observation_id":"14abd914-4aa0-4f37-9e5b-5391753079be","resolution":{"observed_at":"2026-07-01T15:05:47.995575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2606.31909","last_updated":"2026-06-30T16:12:30Z","snapshot_observed_at":"2026-08-07T13:32:05.518576Z","submitted_at":"2026-06-30T16:12:30Z","title":"CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T04:58:31.739325Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2606.31909"},"observation_digest":"sha256:5c589deed17abc34974cc185878903c500dac5c2537e99687a15ce443307c978","observation_id":"5e7ca5f2-56ce-463e-8057-42436297d75f","resolution":{"observed_at":"2026-07-01T10:55:41.904539Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-14T05:40:47.306935Z","title":"RoboMamba: Efficient vision- language-action model for robotic reasoning and manipula- tion.arXiv preprint arXiv:2406.04339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11427","last_updated":"2026-07-13T11:31:53Z","snapshot_observed_at":"2026-08-07T09:19:25.836681Z","submitted_at":"2026-07-13T11:31:53Z","title":"EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T05:40:47.306935Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2607.11427"},"observation_digest":"sha256:48c937f4a27fb4421edcd597e67df856e0568032d3a1afdbe627caf7cfe030f1","observation_id":"bc8f7130-84a0-4d70-9e1a-6150da353e7a","resolution":{"observed_at":"2026-07-14T05:40:47.306935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-01T02:21:24.234162Z","title":"2024 , doi =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25487","last_updated":"2026-07-28T09:24:17Z","snapshot_observed_at":"2026-08-06T09:09:27.676695Z","submitted_at":"2026-07-28T09:24:17Z","title":"CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:24.234162Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2607.25487"},"observation_digest":"sha256:09dca9cadedb295989560be27e4157a21754bd02df28e02361fed1f3fa8ba0f8","observation_id":"e630e1e5-c998-4b01-b933-51fe81955606","resolution":{"observed_at":"2026-08-01T02:21:24.234162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-04T19:45:34.954818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":154,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:34.954818Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:67528143a7a0292fd8b3d14c9b0d696ee87870bd63ce736cb1556a12257b8381","observation_id":"0ab7cd4f-ce11-4b07-ac97-2d39d3e53784","resolution":{"observed_at":"2026-08-04T19:45:34.954818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.04339/citation-record","integrity":"/paper/2406.04339/integrity","json":"/paper/2406.04339/citation-record.json","paper":"/paper/2406.04339"},"outbound":[],"paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2406.04339."}