{"as_of":"2026-08-19T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afd470df3b46748b0810647954cbd76188ea46c68cbfa5a3eff64752652c749a","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:14:51.731026Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:26:09.241377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.333762Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-08-05T20:31:36.552950Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-17T18:39:16.964832Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:36.552950Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:83f43e2db11862ab7c964dbda8999aab48b47bc38568f9ab9be5e1ed1f90b93a","observation_id":"da9aa6c4-60e5-45c7-9ff8-4f003dadc063","resolution":{"observed_at":"2026-08-05T20:31:36.552950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2511.18082","last_updated":"2026-04-13T14:33:40Z","snapshot_observed_at":"2026-08-11T02:22:51.293115Z","submitted_at":"2025-11-22T14:44:03Z","title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T06:07:42.311608Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2511.18082"},"observation_digest":"sha256:128ea752a551fc1a08e3991b629421c4b4424b7187c9e53647b323f3e3ab1468","observation_id":"54c57a68-59f9-4697-a2a0-c616ee2cd437","resolution":{"observed_at":"2026-05-17T06:09:09.496820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-08-03T09:07:41.041488Z","title":"Edgevla: Efficient vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14945","last_updated":"2026-06-24T08:09:11Z","snapshot_observed_at":"2026-08-03T09:07:37.767508Z","submitted_at":"2026-01-21T12:43:11Z","title":"TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:07:41.041488Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2601.14945"},"observation_digest":"sha256:b4de9f06304e5da5bc82d7982e1ee290283312ea1f24d07bb1f69fda444d7c33","observation_id":"f7bbf31f-8fc3-4012-ace2-eedf8b7042b9","resolution":{"observed_at":"2026-08-03T09:07:41.041488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.01581","last_updated":"2026-04-27T12:47:49Z","snapshot_observed_at":"2026-08-18T15:46:30.680632Z","submitted_at":"2026-03-02T08:12:03Z","title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:39:58.095112Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.01581"},"observation_digest":"sha256:e3034e6b5eb1a271ee8529c5e3f4b335e0bb4893230d344c346b24613aead0dc","observation_id":"d8f0805e-1214-469c-9032-b9c6bbcbe125","resolution":{"observed_at":"2026-05-15T18:40:14.582101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-08-11T12:57:12.574965Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:41357c1c763dfa194c7eac806bdf708ef086e12dda04b876207cc29ea8c21387","observation_id":"6bf5f007-1226-4aec-bbca-a9fb2570e77d","resolution":{"observed_at":"2026-05-15T09:19:54.424179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-10T22:18:18.061068Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:13.188363Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:61c1699a7bbcb7f7dc5cfba660509485d26ac3873de1199efba9d626f307e07a","observation_id":"002d6968-f493-4674-985d-6952177d4333","resolution":{"observed_at":"2026-05-15T08:05:15.140852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-10T22:18:18.061068Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T10:48:56.280105Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:0f4a1d348f46221a2b322d5096137cf643e785e2d5b3cd7ab7444eb1126b47d7","observation_id":"50cac3e0-43bd-4d76-9562-69ca0c71d509","resolution":{"observed_at":"2026-05-21T10:50:01.129618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:85632043562121e033c5bb2e37de4c6d9b08e71a4e5649626b8083780b91a820","observation_id":"763f57ef-d2b5-480a-bad2-867d8b36c257","resolution":{"observed_at":"2026-05-10T22:50:51.536005Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2507.14049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-07-04T09:09:43.333762Z","title":"arXiv preprint arXiv:2507.14049 (2025)","venue":null,"work_id":"efe30499-6376-4c04-bc80-f2d79bb17c40","year":2025},"citing_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-08-13T19:54:38.163011Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T10:27:00.283283Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2606.22540"},"observation_digest":"sha256:ec4dbbb7d347531f0f96b67bf73514806ede4a3cdcbf2ce8a40d8abe154d3d19","observation_id":"9c12160e-3380-4ccd-b26b-127e60ada1c1","resolution":{"observed_at":"2026-07-04T09:09:43.335102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14049","snapshot_observed_at":"2026-08-15T20:26:09.241377Z","title":"arXiv preprint arXiv:2507.14049 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12932","last_updated":"2026-08-13T08:10:54Z","snapshot_observed_at":"2026-08-19T11:22:04.824952Z","submitted_at":"2026-08-13T08:10:54Z","title":"FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:26:09.241377Z"},"links":{"cited_paper":"/paper/2507.14049","citing_paper":"/paper/2608.12932"},"observation_digest":"sha256:0d49cc546ae8d57b80bd27e7742b4d7b7180dd044bbf7d8130ab3f2e6f58a845","observation_id":"38a9c4d0-2bbf-41ba-83b6-b07b40aa5dc0","resolution":{"observed_at":"2026-08-15T20:26:09.241377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14049/citation-record","integrity":"/paper/2507.14049/integrity","json":"/paper/2507.14049/citation-record.json","paper":"/paper/2507.14049"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.108615Z","title":null,"venue":null,"work_id":"8af090e3-3152-4205-9fdc-df0d5d6d97cc","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.643918Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:2ee3f70a046eae538e9cae9c0905abfa1b2ddb8ec79a86d75481ad028ad80099","observation_id":"fcc61c4b-b9e6-4380-a4cb-ea1bec758bb6","resolution":{"observed_at":"2026-08-06T16:14:52.114122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.085372Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023","venue":null,"work_id":"2ea3a6e3-e46b-40a9-9462-b362ffae0491","year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.649176Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:d5eca06238226898f06ddc7ef1ba492ba994b1a4227caa14dcf451511e817e46","observation_id":"7cabeaff-8ea3-401f-bf07-ce88bd2fdb57","resolution":{"observed_at":"2026-08-06T16:14:52.093783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.653392Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.653392Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:5cd6d879cfef8b19df3056e0651d4e5c7468644775c4cfa6ca89b3c9c0208cd4","observation_id":"4b55040a-e5e3-4fa9-bc2f-ea89ea386e74","resolution":{"observed_at":"2026-08-06T16:14:51.653392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.057904Z","title":null,"venue":null,"work_id":"c9fa2f84-0bbc-4572-86ee-e21312e87533","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.658018Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:4c7c3e43ad2bf2053f3d20cc4f4f1e431ca583710e2f7202ca1050feb78ccb33","observation_id":"b4339069-68af-4cb4-90d1-244af27c6055","resolution":{"observed_at":"2026-08-06T16:14:52.062527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.663390Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.663390Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:e65d914ccfa26bc5f39c614f572be560fff48743345dd5f239dee1538c517a4d","observation_id":"1d2cb8fd-f9c3-4f45-9572-544ca6f370f6","resolution":{"observed_at":"2026-08-06T16:14:51.663390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.024821Z","title":"Zhao, and Chelsea Finn","venue":null,"work_id":"8781b5f6-30cf-4207-8c84-0d6870764e77","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.668497Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:5b9b9b7a3439b98d33d3ca707a5d64e9ffd037824da6365be4db55f5b6cfa0dd","observation_id":"e58dc51b-1e4d-4ff7-a6ae-16b7d2198660","resolution":{"observed_at":"2026-08-06T16:14:52.030724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:52.000032Z","title":"Flexattention: The flexibility of pytorch with the performance of flashattention, 2024","venue":null,"work_id":"618a2269-a2e8-4969-8642-e6bb3acab116","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.673240Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:45fb321fa51fedaf40d36e9892cb2105e2232323ff5951d8cd31067bbb5b8e27","observation_id":"017e0517-d1c4-42a9-828b-8ecd93c5d542","resolution":{"observed_at":"2026-08-06T16:14:52.006801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.973644Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models, 2024","venue":null,"work_id":"19b123b2-8370-48fc-b224-5238070957e7","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.677745Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:492002afc78ce4de96ce147e99c3ea9f940d22a52242adae48666ee8dafb0d15","observation_id":"ba47cdc3-8731-48ee-8c30-bbe99711d169","resolution":{"observed_at":"2026-08-06T16:14:51.978880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.956039Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"5a157ed4-9357-44fc-a87e-68476d2f83bb","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.681757Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:00bfd35cecc0a34a3bcbd23ebb520cf876808e8334c5bff41ffd1293249066c6","observation_id":"7cb397e5-b48b-4eb7-82f4-501a6295911a","resolution":{"observed_at":"2026-08-06T16:14:51.960675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.938851Z","title":"Jin Kim, Nur Muhammad Mahi Shafiullah, and Lerrel Pinto","venue":null,"work_id":"6997df1a-d368-4981-b0d6-c1e6a21fc367","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.686592Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:94cf1d0acca23c4ccff3a7c5fdfa486ce02ab618b461340fd6beba2076d081e2","observation_id":"f1bd67e5-551e-4282-8c46-95159e0ca72b","resolution":{"observed_at":"2026-08-06T16:14:51.943638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.691041Z","title":"Video-llava: Learning united visual representation by alignment before projection, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.691041Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:d336251e5ae8e71ec036a5d8f5719dafb23c30549138a7db317efc8c74515228","observation_id":"724075ea-6e53-4700-bb1e-5d6264548882","resolution":{"observed_at":"2026-08-06T16:14:51.691041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.910970Z","title":"Dinov2: Learning robust visual features without supervision, 2024","venue":null,"work_id":"aa1f41b3-d992-4580-b9c6-a362b90a217b","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.694992Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:30634dc42594cdff561173b76ade706ce8b68b88f7bd6de5970c7d8c9eb713ea","observation_id":"5e746a9c-9553-41a7-a8eb-28ae70598b29","resolution":{"observed_at":"2026-08-06T16:14:51.916406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.890722Z","title":null,"venue":null,"work_id":"2af15f26-5760-4c94-b16b-2d96b2661ed9","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.699660Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:d2d05c0d208a51e31e8be2ef2635b92bfeb9778429c7ffd2940cb793604ef200","observation_id":"b33b3167-bea9-4fad-9bea-eae5ff169748","resolution":{"observed_at":"2026-08-06T16:14:51.895106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.873368Z","title":null,"venue":null,"work_id":"f14eee63-404b-4bf5-9cde-f3bdb03a4c1d","year":2018},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.704415Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:af44777b1ead6295400b29cebe33b3d455e3244da86eb38ee064ca7e845d75f1","observation_id":"bb728f67-722d-45f1-a62c-cd881427c286","resolution":{"observed_at":"2026-08-06T16:14:51.878082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.852727Z","title":"Bridgedata v2: A dataset for robot learning at scale, 2024","venue":null,"work_id":"835a6f03-2393-4d40-9318-1651bb0ece8b","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.708513Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:91dda93343d31d8d68c7ddf1198d0b591263e6ca4b3dd6c99f96685883c540f9","observation_id":"18e69dac-09a5-407c-b9f2-59e05049e314","resolution":{"observed_at":"2026-08-06T16:14:51.861172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.712660Z","title":"Bitnet: Scaling 1-bit transformers for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.712660Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:74ac5747978f457449e9c0490b89e56a547b3a1b9eb11c4e1e597212ed86fda9","observation_id":"26f78f88-05c1-42de-913f-ab7c8125e026","resolution":{"observed_at":"2026-08-06T16:14:51.712660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.716782Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.716782Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:ccefe7f7ecf9b5761b037a7d41a72bf43a8808d7d72bc11720ff90f057e08916","observation_id":"259752fe-5b07-4191-99a8-1d85cd21750f","resolution":{"observed_at":"2026-08-06T16:14:51.716782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.804800Z","title":"Homerobot: Open-vocabulary mobile manipulation, 2024","venue":null,"work_id":"3c1e4017-cf31-4373-9d38-7d5dd1705bff","year":2024},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.721214Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:956bd4611224d6f9b1075785fd13e13a0c501e626bc3b1d2f440f7b5af51ed30","observation_id":"b5798ae5-359a-4d01-b392-842f0dd672d9","resolution":{"observed_at":"2026-08-06T16:14:51.814516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.725819Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.725819Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:88896711ae30576e7d7dcb95d54bafb7ef408be4195d1918fe5d5942bc94a976","observation_id":"7d9cf56f-60fe-4b63-a7e9-e3e93e31a559","resolution":{"observed_at":"2026-08-06T16:14:51.725819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:14:51.766843Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":"5d7cfc93-e46e-407d-8df1-d1b548a03813","year":2023},"citing_paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:51.731026Z"},"links":{"citing_paper":"/paper/2507.14049"},"observation_digest":"sha256:6fa32dd9ab260bbc0e95422da9a1230b4e639ccfde3c50654dfc6ee1b2702f26","observation_id":"56a71ae0-c734-48bb-9384-25db405ab0a4","resolution":{"observed_at":"2026-08-06T16:14:51.774308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14049","last_updated":"2025-07-18T16:15:09Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T16:00:04.278743Z","submitted_at":"2025-07-18T16:15:09Z","title":"EdgeVLA: Efficient Vision-Language-Action Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 10 inbound Pith citation observations for arXiv:2507.14049."}