{"as_of":"2026-08-16T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07123e1ab7ae400a19e07de81cb71eaee273a9fc42c92ec5824d4416fc8cd4b0","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:32:47.949431Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:27:01.402929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-04T09:34:44.154129Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-15T23:50:04.432268Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:44.154129Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:f16da175896d411c9bda13399d36f87376180c807cd8537c0f0f00e46af6f3b4","observation_id":"19af9271-5ab4-4013-9b05-dd7b6cf08d83","resolution":{"observed_at":"2026-08-04T09:34:44.154129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-11T21:22:03.633630Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:a2fe7863d421a47d11c26bcdf83842c558774669c67090fb979aa1403a11f392","observation_id":"0fe86c0c-8d69-4c55-ab72-8922135f7214","resolution":{"observed_at":"2026-05-17T06:29:09.956059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:ad3bc4266b6378e1766f2280296edd0ac9f749d2072ccbc6c5752be2132d16f7","observation_id":"fa147f79-109b-48ed-8d65-e62d9182f7f1","resolution":{"observed_at":"2026-05-21T13:24:11.084402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2603.15620","last_updated":"2026-06-30T14:22:00Z","snapshot_observed_at":"2026-08-09T22:53:09.817358Z","submitted_at":"2026-03-16T17:59:57Z","title":"Towards Generalizable Robotic Manipulation in Dynamic Environments","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:26.446868Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2603.15620"},"observation_digest":"sha256:a8013d81f2a1bd3ca92586f1dbea3211e497a3e9b1d00097884b1820eff31233","observation_id":"687336c7-bd92-4c6d-9459-ecc1d17ac7e6","resolution":{"observed_at":"2026-05-15T09:49:54.270525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-14T00:13:51.580603Z","title":"arXiv preprint arXiv:2508.10333 (2025) 14","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15620","last_updated":"2026-06-30T14:22:00Z","snapshot_observed_at":"2026-08-09T22:53:09.817358Z","submitted_at":"2026-03-16T17:59:57Z","title":"Towards Generalizable Robotic Manipulation in Dynamic Environments","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T00:13:51.580603Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2603.15620"},"observation_digest":"sha256:e2160b9c642bb3d32c23a9f7367685621f8a95549fe406ac22197e5c1e738a66","observation_id":"ac8c78d4-7a12-45ed-a724-9bff414a72fd","resolution":{"observed_at":"2026-07-14T00:13:51.580603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.11751","last_updated":"2026-04-13T17:25:41Z","snapshot_observed_at":"2026-08-15T16:15:43.733780Z","submitted_at":"2026-04-13T17:25:41Z","title":"Grounded World Model for Semantically Generalizable Planning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:05:29.465402Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.11751"},"observation_digest":"sha256:ccefc1f9c8316a1f47f8e846e9c945a08b886fe9747d1b7c6326ca3a165a6075","observation_id":"61734d00-9f8d-434e-97c7-60a46713027d","resolution":{"observed_at":"2026-05-10T15:05:32.233313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.14125","last_updated":"2026-05-10T14:25:46Z","snapshot_observed_at":"2026-08-13T18:00:34.316553Z","submitted_at":"2026-04-15T17:50:07Z","title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T14:01:50.429917Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.14125"},"observation_digest":"sha256:823d6d91f7c060c1139a6d2d5752690386b36bf69f42675dbe873cb3ff480e64","observation_id":"37ad6c86-c8ef-4dee-9050-fe0b8a291e96","resolution":{"observed_at":"2026-05-10T14:05:29.539890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.14125","last_updated":"2026-05-10T14:25:46Z","snapshot_observed_at":"2026-08-13T18:00:34.316553Z","submitted_at":"2026-04-15T17:50:07Z","title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:51:46.849464Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.14125"},"observation_digest":"sha256:d18c6edc143eddb2059531bc53db9ce63c0c6e832592d68d3ad1c985df97dd46","observation_id":"a89019a4-ca2b-49da-b1b5-e39e3a5f0e8f","resolution":{"observed_at":"2026-05-12T07:46:52.410964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-08-15T06:57:44.935343Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:14:17.676675Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.19683"},"observation_digest":"sha256:721a88a50cf4668ec22936e7f4904197098a9345bad168031188d1bdda4bdbce","observation_id":"8b519540-cf1a-4cb5-bf3d-dd72203cd8ee","resolution":{"observed_at":"2026-05-11T13:11:06.115031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:24.208555Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:f710e1a260abb9dff34853ff30f126dc40a0579c3ee826e6a56231d9059e30e4","observation_id":"8596f8aa-4994-4f4a-bdb5-6a505effefb7","resolution":{"observed_at":"2026-05-11T14:16:25.118343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-12T18:39:49.173828Z","title":"Reconvla: Reconstructive vision- language-action model as effective robot perceiver,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T18:39:49.173828Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:3e1c4d217564cbec918a022ed35e5e061e9b3edde570c011d94920a8343c1849","observation_id":"0b5e01cd-11ba-4333-a186-a3d1e3e36d45","resolution":{"observed_at":"2026-07-12T18:39:49.173828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.24182","last_updated":"2026-07-05T10:54:06Z","snapshot_observed_at":"2026-08-14T12:48:06.949032Z","submitted_at":"2026-04-27T08:44:12Z","title":"$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T03:13:36.437080Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.24182"},"observation_digest":"sha256:fb16b302dd605d67b5ea5523caffd89a94ad947446b3d26c026138bcffca390a","observation_id":"b834c9a3-a4f5-42f6-9030-286defb1a253","resolution":{"observed_at":"2026-05-11T22:11:16.014701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-12T18:17:43.564400Z","title":"Reconvla: Reconstructive vision- language-action model as effective robot perceiver,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.24182","last_updated":"2026-07-05T10:54:06Z","snapshot_observed_at":"2026-08-14T12:48:06.949032Z","submitted_at":"2026-04-27T08:44:12Z","title":"$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T18:17:43.564400Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.24182"},"observation_digest":"sha256:068e5e76d85b18d849981b1ea2c426eb260252416ad05481f9de1d6184b6451d","observation_id":"120946ea-c5c6-4db0-bf1b-2c4431ab940b","resolution":{"observed_at":"2026-07-12T18:17:43.564400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.10903","last_updated":"2026-05-11T17:41:54Z","snapshot_observed_at":"2026-08-16T13:14:47.829623Z","submitted_at":"2026-05-11T17:41:54Z","title":"CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:07:52.566360Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.10903"},"observation_digest":"sha256:1b714f92f3b702cacc03b6fde4b9c9a6ff0a572497cd5efbfbacfd5eece7fc61","observation_id":"ebe3b632-0602-4730-bbed-32727529d609","resolution":{"observed_at":"2026-05-12T06:36:26.986030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.12160","last_updated":"2026-05-12T14:10:54Z","snapshot_observed_at":"2026-08-12T12:10:15.602610Z","submitted_at":"2026-05-12T14:10:54Z","title":"Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T04:55:23.145492Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.12160"},"observation_digest":"sha256:fad6833cd963ad05ba556ecd34d71a1a9bc83ad329c4c24a949ef423405e4248","observation_id":"633e7192-f355-4783-9050-9e01dab00802","resolution":{"observed_at":"2026-05-13T04:57:17.450518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-08-12T15:22:27.691107Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:52.461348Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:7d5be84580346473ae9e27ed250a78669e3a455781456970f0d8b583f633ee58","observation_id":"3f82cfcf-3285-4442-82fa-fb2cff8805a0","resolution":{"observed_at":"2026-05-22T06:06:08.676554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-08-12T15:22:27.691107Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T16:52:05.565650Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:f3ed28dfda34bf6727264f291c7cb6193b682ef9d456f14a6f85a94bce1c31a2","observation_id":"b45b1ea2-afc0-4140-a249-687f7ee2fdc2","resolution":{"observed_at":"2026-06-30T16:54:58.253115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:f4caee529864c7ca03a270fe0611449a22f7ad6aa70585b34266382aef62836a","observation_id":"9fb6d44f-2a71-4c89-bed3-bc563272dbff","resolution":{"observed_at":"2026-06-29T13:43:28.942277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.31116","last_updated":"2026-05-29T10:27:32Z","snapshot_observed_at":"2026-08-02T02:51:10.320818Z","submitted_at":"2026-05-29T10:27:32Z","title":"NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:57:01.742536Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.31116"},"observation_digest":"sha256:dc72b154d54d938c29f60790f8cf8da2090b53dc6e6ca37ab29a5eeca292b10e","observation_id":"97f062d7-ed85-48d7-9bdd-387dd4e394a0","resolution":{"observed_at":"2026-06-28T23:02:45.777855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2606.01241","last_updated":"2026-06-02T03:11:27Z","snapshot_observed_at":"2026-08-16T17:06:17.147392Z","submitted_at":"2026-05-31T13:43:23Z","title":"OneVLA: A Unified Framework for Embodied Tasks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:08.124096Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2606.01241"},"observation_digest":"sha256:1bbaa038cc459745afb59b40c97bef547c0d22dcbb8491012397ce1b759c9d1c","observation_id":"c7e9f867-668a-4f8d-abba-10e39c14a3f0","resolution":{"observed_at":"2026-07-01T21:26:14.110096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:aa326d8e6d1baa820ed5e711a5db28d79a2a4398ced1b3f80db922821ef2f5b7","observation_id":"def8b06d-2585-490c-9a1c-43e1c96c8825","resolution":{"observed_at":"2026-07-02T13:16:59.252395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Reconvla: Re- constructive vision-language-action model as effective robot perceiver,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:d6a8f0f79f5f86ca0479b1e2281693ffb27b107dbf16a183daf1ca10c4c28cbb","observation_id":"679555cc-f140-41bf-872f-17c2adabb100","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-02T05:16:41.306473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-16T10:27:13.748143Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.306473Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:e31d0aa583b3e2c19e8704b776fa345f7b4a48520c809ee5d9ab9373a4d63f07","observation_id":"432ac8cd-3b5a-4d82-bd7f-38db2c5679f7","resolution":{"observed_at":"2026-08-02T05:16:41.306473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-06T00:30:08.940833Z","title":"arXiv:2508.10333","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01221","last_updated":"2026-08-02T13:11:22Z","snapshot_observed_at":"2026-08-10T01:38:25.766313Z","submitted_at":"2026-08-02T13:11:22Z","title":"EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:08.940833Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.01221"},"observation_digest":"sha256:6cc0aea4f7a70a329678849b5770c1f582a5e614ccc963bc3c0ff52fa72d4b21","observation_id":"7c3528a9-9a6d-477e-9437-b8c2a6af53d9","resolution":{"observed_at":"2026-08-06T00:30:08.940833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-06T19:43:02.573394Z","title":"ReconVLA: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04657","last_updated":"2026-08-06T12:11:22Z","snapshot_observed_at":"2026-08-13T22:02:33.724752Z","submitted_at":"2026-08-05T10:12:37Z","title":"MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:02.573394Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.04657"},"observation_digest":"sha256:77522cc2a7f0d077ecbff33909bdcb48ab057184077b9aebe7c4a042827b53f2","observation_id":"a229022d-8beb-4610-9978-6d1de4977e9e","resolution":{"observed_at":"2026-08-06T19:43:02.573394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-08T18:04:05.199011Z","title":"ReconVLA: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04657","last_updated":"2026-08-06T12:11:22Z","snapshot_observed_at":"2026-08-13T22:02:33.724752Z","submitted_at":"2026-08-05T10:12:37Z","title":"MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:04:05.199011Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.04657"},"observation_digest":"sha256:ff97b718aebdfd98a0e29a5e1e1f04373ba0e415907c5a75714fc1d1acccf896","observation_id":"f2086ba7-6ef6-43ed-bffe-b0771fb280dd","resolution":{"observed_at":"2026-08-08T18:04:05.199011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-10T04:29:48.065577Z","title":"ReconVLA : Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-07T04:37:06Z","snapshot_observed_at":"2026-08-15T17:43:23.138791Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T04:29:48.065577Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:2d83fb3bc5503ac8fd3c31b12b6c23002c3ee53de3ddaf6b00d7092337be3959","observation_id":"1041b97c-be14-4232-a8e7-8e454e373539","resolution":{"observed_at":"2026-08-10T04:29:48.065577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-14T04:27:01.402929Z","title":"ReconVLA: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.402929Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:e7a16999ed6d4b1ff08d7da9c9412d5a0b9d0117489ac9968959055a55bcf094","observation_id":"6a50ebe8-ed3b-405d-baff-8aefda09b651","resolution":{"observed_at":"2026-08-14T04:27:01.402929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10333/citation-record","integrity":"/paper/2508.10333/integrity","json":"/paper/2508.10333/citation-record.json","paper":"/paper/2508.10333"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:42.157327Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.157327Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:4e36772d591c881dd7d3110db66f21b5f022467a2073c60b4e5b456a2e8938e2","observation_id":"016cf2e5-6ffc-416b-b2ae-b2216e04b144","resolution":{"observed_at":"2026-08-05T20:32:42.157327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:42.256938Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.256938Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:5449c05c4e2b99158ad510355bfc2b16c8ac4da7b0e40a44f2a6f1a0a9655632","observation_id":"51f44ab3-2844-4713-9497-581cd0c11de9","resolution":{"observed_at":"2026-08-05T20:32:42.256938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T20:32:42.335373Z","title":"W.; Ilharco, G.; Wortsman, M.; and Schmidt, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.335373Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:ca46bd1b6acdf8b4386c2476383bb7208ea3dc3464c445331b5fa75055176039","observation_id":"aeeb2696-acee-489f-a136-bc444a61c5b6","resolution":{"observed_at":"2026-08-05T20:32:42.335373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T20:32:42.445023Z","title":"S.; Kolesnikov, A.; Wang, X.; Salz, D.; Neumann, M.; Alabdulmohsin, I.; Tschannen, M.; Bugliarello, E.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.445023Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:6eec33a0e0eab45c7351152a3262c06c375cd7ca92829e1f22c3b142555cdbfe","observation_id":"55b44d0f-e875-4922-be3e-02fe9f8fd682","resolution":{"observed_at":"2026-08-05T20:32:42.445023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:55.223829Z","title":"R.; Finn, C.; Kumar, A.; and Levine, S","venue":null,"work_id":"45c94ffa-c531-48ad-9c75-4b1b20c7ecdd","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.532847Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:62f24b74372e9c934c469fefe6d9a7e66f09e781d091379ca840f2c87cf215b0","observation_id":"c00ad31d-fa76-43a3-90a4-ad61a16998c0","resolution":{"observed_at":"2026-08-05T20:32:55.339761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:55.009705Z","title":null,"venue":null,"work_id":"54dee4fa-6c81-45e3-9cf1-e9c98d2b3642","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.649791Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:b30419d3e4249078b5f7c8b38da3f564dd5b94bfd74f9bf3916defb011645a09","observation_id":"06acae65-edc6-4903-8305-99374a8069ba","resolution":{"observed_at":"2026-08-05T20:32:55.111512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-05T20:32:42.733209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.733209Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:c7d0229a8df643d78b3ecf1aa8820d876e6466545d9cd45a1e1236f9905213e1","observation_id":"198b9eed-5966-4a5b-925f-906ed4ef824f","resolution":{"observed_at":"2026-08-05T20:32:42.733209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.817467Z","title":null,"venue":null,"work_id":"97d5355a-4bbd-40b3-95a1-7cc5adae6f93","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.870859Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:ce48a4646cd0838783381ed171bf2733ba894b8d020bcf7fd7b38281dece4f51","observation_id":"c547134b-6b44-49d3-8058-63b9bcfabe75","resolution":{"observed_at":"2026-08-05T20:32:54.891716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T20:32:42.981102Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.981102Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:3e218bec21e8d118d49bd14e7c19b24cac89c9c64efb268e8b32e919461af008","observation_id":"a0da2fd6-ec44-4efb-b3ca-6e38b27f6f4b","resolution":{"observed_at":"2026-08-05T20:32:42.981102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07194","last_updated":"2023-02-14T17:02:35Z","snapshot_observed_at":"2026-08-16T15:55:22.913215Z","submitted_at":"2023-02-14T17:02:35Z","title":"Score Approximation, Estimation and Distribution Recovery of Diffusion Models on Low-Dimensional Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07194","snapshot_observed_at":"2026-08-05T20:32:43.065743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.065743Z"},"links":{"cited_paper":"/paper/2302.07194","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:ad3ab8e239cc18a9bcca76721b41df7f2ba030a3e51b3b7e0223a57732662071","observation_id":"ab4bafc3-28af-4703-879e-7fe899692918","resolution":{"observed_at":"2026-08-05T20:32:43.065743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.566274Z","title":"2016--2019","venue":null,"work_id":"6f8be93e-1e24-4aa6-86d3-277a9b7b8c13","year":2016},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.146408Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:2373d257c5d3690bc9c8cfd38e7b2b8b32afcb3fcc31a05a4c9150ab407ea9ff","observation_id":"714ce289-afb3-4d49-997b-99ce921d69b2","resolution":{"observed_at":"2026-08-05T20:32:54.667834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-08-15T23:40:23.773295Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-08-05T20:32:43.242879Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.242879Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:bf6d6724b2ae34cfedf428c2d136ea4d276dcb93bb0d35167802f2365d502438","observation_id":"69e98311-e672-4d82-a735-259fddfe5f32","resolution":{"observed_at":"2026-08-05T20:32:43.242879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-16T05:23:06.971834Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-05T20:32:43.318557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.318557Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:5f64b817dfc615a78dcba7f9d6d40001de7e93154d45f31c818ee1682fea4d87","observation_id":"551c752c-1b81-4542-9afb-cc94e77c9086","resolution":{"observed_at":"2026-08-05T20:32:43.318557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.335899Z","title":null,"venue":null,"work_id":"480660d3-13a3-4985-90e4-ac64a301105e","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.423867Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:0117294dbb79bc8098af68d1b866b9e34c9680b932dc5fab8625d7c0e0514c20","observation_id":"938d2317-9e60-46c1-a3f9-030549681f0e","resolution":{"observed_at":"2026-08-05T20:32:54.442791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.125633Z","title":null,"venue":null,"work_id":"b0356b2d-23b3-4fdd-bc11-006f78997c9a","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.559992Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:f88058816cabcf2b886731a278cde7579b37a06403e4788e061eed749a5fac76","observation_id":"d35117dd-cc1c-4143-9414-317818c7bc8b","resolution":{"observed_at":"2026-08-05T20:32:54.217460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.908481Z","title":null,"venue":null,"work_id":"434334bf-9478-4f35-9923-04214fd59926","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.659725Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:28fa98e5fbac31f8c1a8c965ac7bf8e2cd2d6d1a4269fff03200cf5d54e74157","observation_id":"53a7fbd4-1b51-41ca-82a2-d25b7325feb7","resolution":{"observed_at":"2026-08-05T20:32:54.003307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18179","last_updated":"2024-11-27T09:54:58Z","snapshot_observed_at":"2026-08-14T20:33:05.566928Z","submitted_at":"2024-11-27T09:54:58Z","title":"Prediction with Action: Visual Policy Learning via Joint Denoising Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18179","snapshot_observed_at":"2026-08-05T20:32:43.779814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.779814Z"},"links":{"cited_paper":"/paper/2411.18179","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:cccdd868dd74f39404f4c397678449071cd9d7d5ae9b144ca84372eda6b3baa7","observation_id":"1202615c-7b2a-4fb4-ae69-df1faa8315fa","resolution":{"observed_at":"2026-08-05T20:32:43.779814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:43.866349Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.866349Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a5cb7ae8ff8364cd28e48ac33b1cbae1c973b2b0657a5356cb31f48ecc5f92b0","observation_id":"5ea62d55-fde7-489e-a6e8-98527acce49e","resolution":{"observed_at":"2026-08-05T20:32:43.866349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T20:32:43.969912Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.969912Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:36a6dee59299b3f183d200081083ff4662a7f3239fe8e84c23c52b6b1b8847b2","observation_id":"1689ff9b-2280-4c5d-98aa-43d842ff1973","resolution":{"observed_at":"2026-08-05T20:32:43.969912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.732679Z","title":null,"venue":null,"work_id":"96f8b52a-2238-45ea-946d-7535e4d18307","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.077675Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:44031860833148ea7d7d27a81ad768d07a2ad3cb44aa7b3371fbeac8960f5c30","observation_id":"6087975a-809b-457d-9aa9-8bbee619fd25","resolution":{"observed_at":"2026-08-05T20:32:53.809157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00364","last_updated":"2022-10-11T13:20:30Z","snapshot_observed_at":"2026-07-06T13:16:16.926712Z","submitted_at":"2022-06-01T10:03:24Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00364","snapshot_observed_at":"2026-08-05T20:32:44.168164Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.168164Z"},"links":{"cited_paper":"/paper/2206.00364","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:45b977b968ff09b447fefa7f2f9db5f7fae381b88c439c5aac3ce21d1dc796f2","observation_id":"ab0ec46e-731b-4f0b-abf5-efcf72132ebd","resolution":{"observed_at":"2026-08-05T20:32:44.168164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-08-13T01:57:27.555320Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-05T20:32:44.246525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.246525Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:d8eeeaaf6f662b1c86716abb569851296d0d0bcff0bc884c0e9115b182d9a817","observation_id":"a9876cd6-eab2-4244-8bdd-b648e0c9944c","resolution":{"observed_at":"2026-08-05T20:32:44.246525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.475320Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E","venue":null,"work_id":"cd9c12e9-88ce-4930-888f-e70c054d2670","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.342040Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:bac6319af35145b89abf74b5ddb5a13628974b50a64559f605490b6c8d8f34ca","observation_id":"dcc27518-8402-45ab-8d2d-e921d14404e3","resolution":{"observed_at":"2026-08-05T20:32:53.600727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T20:32:44.447704Z","title":"P.; and Welling, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.447704Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:2a0f54700801baf5d4df563f2f13acfb5a333d6ed538d9b10d066e7a5dc6b44c","observation_id":"da5c8f71-2c0d-4347-a6e9-a711655e2601","resolution":{"observed_at":"2026-08-05T20:32:44.447704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-05T20:32:44.554728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.554728Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:32b720abe454b459f86c2b070582a243aceb887a2c78ce51663a4354e14cff45","observation_id":"9fca09ee-667d-40b0-9ce7-6108f3bd8d1f","resolution":{"observed_at":"2026-08-05T20:32:44.554728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.200146Z","title":null,"venue":null,"work_id":"e9ac60d3-3f6e-490f-91e6-f21344cac7d8","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.669023Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:b786415a0ea596fee908b7740329eddc8002fabdc29a98178e945984437f9267","observation_id":"b70c07cb-7301-41f9-bb17-c5cbbd37e5a1","resolution":{"observed_at":"2026-08-05T20:32:53.342812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.993507Z","title":null,"venue":null,"work_id":"a47c9f21-2173-487b-b6a4-42a431cd9fcb","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.765284Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:697f9a98b229d675d03d1a673f01d55d00282fcfb4b47000d14c05fb2be0861a","observation_id":"c6d3a858-2cef-4a18-868a-14a5e7a7fa19","resolution":{"observed_at":"2026-08-05T20:32:53.096576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.680647Z","title":null,"venue":null,"work_id":"ea0a738a-de88-4991-9a00-53155b0068ec","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.866675Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:747e7f31302ec03aa1308424fb60f10264ff11afccf382559797ec65f6f40ba5","observation_id":"c4ffcb0e-a213-4910-8ad6-d0482e7ffc4f","resolution":{"observed_at":"2026-08-05T20:32:52.824198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.435394Z","title":null,"venue":null,"work_id":"dd03dba7-d4d6-4f3e-83c9-fcc16e937c70","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.956249Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:349ad4f0364220e45600b82c641cf185bc1728d04f8f74bf8719e5391904f1fa","observation_id":"07a1d701-131b-4fb7-81de-748660bc9c78","resolution":{"observed_at":"2026-08-05T20:32:52.552907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.106769Z","title":null,"venue":null,"work_id":"93788f20-3ec1-4e43-9e65-7990060be3ae","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.066281Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:d6da307459b4446a714a9089a90c19fb79470230d6740057ebf1135cc92f0c7a","observation_id":"ae041e0c-9b5f-4608-8038-a44070d822f3","resolution":{"observed_at":"2026-08-05T20:32:52.262406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T20:32:45.212485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.212485Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:986dc26de65740ec069350b1a008923de577d82306f4438300abd43b44dc9494","observation_id":"cc708740-53df-4841-9066-d53e6a38ec97","resolution":{"observed_at":"2026-08-05T20:32:45.212485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:51.810514Z","title":null,"venue":null,"work_id":"6b1de07f-ed87-466a-a160-16fb525bfb6b","year":2021},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.297037Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:866406ff39aae26548493de87e09aa854553fb242f9696c4af50d7c5ac343d1a","observation_id":"19505c9c-a177-4790-8423-3693c94b90c0","resolution":{"observed_at":"2026-08-05T20:32:51.940390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11815","last_updated":"2024-06-17T17:55:29Z","snapshot_observed_at":"2026-08-16T13:42:08.042355Z","submitted_at":"2024-06-17T17:55:29Z","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11815","snapshot_observed_at":"2026-08-05T20:32:45.390488Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.390488Z"},"links":{"cited_paper":"/paper/2406.11815","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:92cad2ffc958fd10937179615139796ea3f187449a26ef06e1d20c375561c42c","observation_id":"dc6d773c-9e4a-4678-94a5-6d73163ec34e","resolution":{"observed_at":"2026-08-05T20:32:45.390488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:51.487601Z","title":"Y.; Sanketi, P.; Vuong, Q.; Xiao, T.; Sadigh, D.; Finn, C.; and Levine, S","venue":null,"work_id":"cdb7f6db-2a66-414e-a4ca-5a1562e4707e","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.482182Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:e2a2dabd8846da53ffe28f577cbfc4e9edc69bb1b4f269ed49a3fe59c0af82c8","observation_id":"89925814-2c7a-48a3-96e5-87396f0cc01b","resolution":{"observed_at":"2026-08-05T20:32:51.617250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:51.116620Z","title":null,"venue":null,"work_id":"8ad1d4ed-e37a-4d3b-a28c-2c54214ee81a","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.579047Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:50bf03a19c5c1e479347f5f5d0730a5f5618d804d8e94751b217beb2eecdf74c","observation_id":"df7fb02b-7e2b-4311-a8b1-676ab029924f","resolution":{"observed_at":"2026-08-05T20:32:51.298656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T20:32:45.709820Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.709820Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:3e94aea6af53e0d2a6e2662e425f54b38a711a8a945f8c66774a247a9e226351","observation_id":"8276046b-c484-4278-8264-49318ee9d348","resolution":{"observed_at":"2026-08-05T20:32:45.709820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T20:32:45.824230Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.824230Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:0900da947132692f6de443bc85cf6eee13ba51147bfa2bd7896745c007452fd7","observation_id":"1cdedee4-544a-4af8-a9b4-0b3a8e676f7c","resolution":{"observed_at":"2026-08-05T20:32:45.824230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-15T19:54:39.077178Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-08-05T20:32:45.934582Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.934582Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:500e7c813aef3cd11fc2d8816a07c92a3165dc697d060f06e5fd0eea632a8068","observation_id":"be481c99-2867-4366-a198-bc684b3d9df4","resolution":{"observed_at":"2026-08-05T20:32:45.934582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:46.054694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.054694Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:c433d52113861c18e43854bffc93bf0b56695deaa1a1f9564645da456dad39aa","observation_id":"dc72166d-d190-4471-abc2-81fee668cfae","resolution":{"observed_at":"2026-08-05T20:32:46.054694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-16T14:02:38.692247Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-08-05T20:32:46.126998Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.126998Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:8c5dffef2a020337bdaee5010db5e8d8bb9775e7f8a63753b5995a0cced1351e","observation_id":"aa00de08-9610-42d6-9bd4-d8f86cb31bc2","resolution":{"observed_at":"2026-08-05T20:32:46.126998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:50.874559Z","title":null,"venue":null,"work_id":"0c564c18-79f8-4e7f-a33b-16e609a0bfd7","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.259758Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:1b7c7649d8137a4699dee68c5e9b7e453f773bad89a3cac2ccb6ae89acbd6f5e","observation_id":"962310b2-29a4-435c-8c94-a14bacd57d74","resolution":{"observed_at":"2026-08-05T20:32:51.007699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05600","last_updated":"2020-10-10T07:46:19Z","snapshot_observed_at":"2026-08-01T16:44:46.833530Z","submitted_at":"2019-07-12T07:37:26Z","title":"Generative Modeling by Estimating Gradients of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05600","snapshot_observed_at":"2026-08-05T20:32:46.370745Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.370745Z"},"links":{"cited_paper":"/paper/1907.05600","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:89fb80ee6a4bd0a9b40c1fd2aca187d053d46036addaad61c2ade1865d7f152b","observation_id":"c8a4849e-a5f7-4daf-ab83-e3007ad3de02","resolution":{"observed_at":"2026-08-05T20:32:46.370745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:50.553678Z","title":null,"venue":null,"work_id":"07d71290-d8b4-402d-95dd-11a7ac3f9233","year":2020},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.479452Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:e331d9b80151c0b28ad069553a4b8c905b9055a583f5daf6243e0d6022ad20b4","observation_id":"555eac16-8dc4-49c0-8c20-45642aa8b9e4","resolution":{"observed_at":"2026-08-05T20:32:50.728268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-05T20:32:46.559044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.559044Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a7d086b862953e693b2764c6e1a9df65d5c8591e793b0e03c32e82e5b139f49d","observation_id":"d881a641-d32d-4186-baf1-a0d8bba7cae6","resolution":{"observed_at":"2026-08-05T20:32:46.559044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15576","last_updated":"2025-05-27T07:05:44Z","snapshot_observed_at":"2026-08-15T03:08:30.071134Z","submitted_at":"2024-12-20T05:17:06Z","title":"QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning","version":5},"cited_work":{"arxiv_id":"2412.15576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15576","snapshot_observed_at":"2026-08-05T20:32:48.204027Z","title":"QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning","venue":"cs.RO","work_id":"8e03241d-4e83-46fd-924d-d99a874a870d","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.642262Z"},"links":{"cited_paper":"/paper/2412.15576","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:1e1e96423f5c3a1c8db6ea9f68c71814ad504cb4fb370115e0daf33aa7aaaa0d","observation_id":"04fd7e57-eaf3-4ceb-b882-4eea9e122eba","resolution":{"observed_at":"2026-08-05T20:32:48.264716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:46.725496Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.725496Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:6c6657b1d003434ed61e0bd0221c7fa6a8d47df74894832c55f48e99f1eafdd5","observation_id":"78b3481b-d7df-4f6c-b1ad-bf84737163a5","resolution":{"observed_at":"2026-08-05T20:32:46.725496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-16T15:06:00.366316Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-05T20:32:46.783305Z","title":"J.; Du, M.; Zheng, C.; Zhao, T.; Hansen-Estruch, P.; Vuong, Q.; He, A.; Myers, V.; Fang, K.; Finn, C.; and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.783305Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:58dad8369dda7fc0c79a324ec2adfbc565cd832ffafc2e36f13aac9c3fb7b17b","observation_id":"c1cd9d61-8884-436f-b469-261b8210cb6e","resolution":{"observed_at":"2026-08-05T20:32:46.783305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:50.147395Z","title":"R.; Black, K.; Zhao, T","venue":null,"work_id":"10486014-63af-4917-8fd4-b6877ade0e86","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.873909Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:ba329ce0f562c191cf8414b51f95d9cc7a08219a46c94331e7354fde676ebd22","observation_id":"5e261572-3b55-4c88-b4be-eb504e83cbf3","resolution":{"observed_at":"2026-08-05T20:32:50.320404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-08-16T13:10:02.146064Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-05T20:32:46.962180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.962180Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a32272b4a028c23b74f5ccdd9b46902b408f6ed926dea891c005e02feeb86b94","observation_id":"961c6b19-704e-4cf5-8b3d-43130886e1a4","resolution":{"observed_at":"2026-08-05T20:32:46.962180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-15T18:55:35.634820Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-05T20:32:47.040368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.040368Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:cffedbab83024112281e36c250c2f0c79d6f6a5bb487ded0c1a744f0a96b43d0","observation_id":"35480d38-3d8d-435c-a75a-6db8a4a4b601","resolution":{"observed_at":"2026-08-05T20:32:47.040368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.804258Z","title":null,"venue":null,"work_id":"176d76e9-11d7-4539-8ed2-6c4af130afc5","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.125046Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:c94fcd732404925c8294fde30868cd58a837e75af12cd0299805670637e988e5","observation_id":"ab9de928-841d-4d9c-b2d6-9bac4f94c513","resolution":{"observed_at":"2026-08-05T20:32:49.945212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.649341Z","title":null,"venue":null,"work_id":"a2f446aa-4bcd-4164-8ca8-f450b5e01860","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.234493Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:b235870efe7b3fe6b4a4ac2cb613ed36d27de7b716666812d3e72ae4f377cce7","observation_id":"f7912514-9f6e-441a-a431-939058de3eed","resolution":{"observed_at":"2026-08-05T20:32:49.736982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T20:32:47.323607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.323607Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:1b8b0cc2206494c0a2192558c2ab1ccd16bea23c1ba00e60f86cb06abeaf09bd","observation_id":"e3675e46-39e6-40c1-8a83-8b3963868738","resolution":{"observed_at":"2026-08-05T20:32:47.323607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.468899Z","title":null,"venue":null,"work_id":"18116286-9bc4-400d-8d6f-253acc44b40c","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.410676Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:572e451df07455fc060c3fc5f3c9485de934299bf7db7d29021daf64c050ae83","observation_id":"9b121ff5-6903-468a-b8b1-5072aa742e75","resolution":{"observed_at":"2026-08-05T20:32:49.535472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-05T20:32:47.498001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.498001Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:45a73e8cd50707b63cb05a30d28dd60ccdb8177ed01c480c3ea7bf14080a5ec9","observation_id":"c72d3213-3f3d-4590-99c1-76b9ef2cd74e","resolution":{"observed_at":"2026-08-05T20:32:47.498001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-05T20:32:47.563746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.563746Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:e65ac0a2ec5a1f451ec649c5ff8f2e4a36effae22c72401cbe117f6218180c02","observation_id":"e5c2536f-6e29-4fd2-9a13-780548522aeb","resolution":{"observed_at":"2026-08-05T20:32:47.563746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.255995Z","title":null,"venue":null,"work_id":"4fc926fa-7916-44d7-9a58-e8301ad5c420","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.644076Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:cd63c8b9def9dc5f5308bec44a5dbdd11d952e1d0bfc201e6c02ef94e71e9da4","observation_id":"4e7d3ff6-6072-4b93-ba59-62fe787ce832","resolution":{"observed_at":"2026-08-05T20:32:49.340025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08007","last_updated":"2025-03-11T03:13:45Z","snapshot_observed_at":"2026-08-16T12:51:17.669045Z","submitted_at":"2025-03-11T03:13:45Z","title":"MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08007","snapshot_observed_at":"2026-08-05T20:32:47.702884Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.702884Z"},"links":{"cited_paper":"/paper/2503.08007","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:647ef6ce80c52008b7aed756950ddc9e23bc3a9f7dd22c36ea97d95983687869","observation_id":"2878e17c-26e5-4437-902a-464de73e7722","resolution":{"observed_at":"2026-08-05T20:32:47.702884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.081264Z","title":null,"venue":null,"work_id":"b653c24c-443e-4f18-984b-d8828e8343b2","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.766165Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:b615b6f60020e72e286e58ae8dd1475445e8ae45f97b90d4bc100eda882b5d9d","observation_id":"30b05cf0-1631-4f7f-802e-65e17540558d","resolution":{"observed_at":"2026-08-05T20:32:49.158036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:48.921380Z","title":null,"venue":null,"work_id":"4261a2ea-e7e7-4097-b4c8-920f92f4fa82","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.881596Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a54e1a9c057d6d732f18c1965e866700a97675262fe23a31c6dc3e46ed7faba9","observation_id":"c5a20b2a-d22f-4280-bcaa-1753625b240b","resolution":{"observed_at":"2026-08-05T20:32:48.985244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:48.757010Z","title":null,"venue":null,"work_id":"1bbd7652-5fa7-4a35-b962-28b68418e565","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.949431Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:979e023f5ab6615038a56328b508cd1f3eb5dc2a6b68db93a76509e447afb588","observation_id":"c1bca469-ffdb-400d-bdd3-e767492d0800","resolution":{"observed_at":"2026-08-05T20:32:48.824489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 28 inbound Pith citation observations for arXiv:2508.10333."}