{"as_of":"2026-08-17T23:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8033b3682c05ea25ce772b41892d79ebacaf5545d302c609ffda8c4d66000472","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:24:59.159037Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29350/citation-record","integrity":"/paper/2606.29350/integrity","json":"/paper/2606.29350/citation-record.json","paper":"/paper/2606.29350"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:4b648efabec2f61eaf4df8a1220ae07889ca603bedd7652e34d8795cb990de3c","observation_id":"dfa6a222-4c88-42a1-b377-6bdb8a55bb5e","resolution":{"observed_at":"2026-06-30T07:34:22.124779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:4b0c84452390f479db0d1e18a29578054e902e297e3755ba02c3482afa886295","observation_id":"8dd48735-492b-43e9-ab99-d003ff7e30dd","resolution":{"observed_at":"2026-06-30T07:34:22.130859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:05946c5f28581dd2909cfd7a2ef241bbfaa822b1616315c7d53626d7e53e42d0","observation_id":"36a530f2-00c9-4206-99d1-53172469ba99","resolution":{"observed_at":"2026-06-30T07:34:22.117016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:9866316a703dd28f61dde97772d0c832bd0fd603dd54609b40c83291b7c1c44a","observation_id":"cddc2954-e1c9-4168-aa06-11ed219cb9fa","resolution":{"observed_at":"2026-06-30T07:34:22.119869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:0ca4e6ecf47772df3598ee5f7d59b6e7b47b44f38e123468a9a2bb6dc8e8e1b6","observation_id":"a485c24c-cd2b-43d6-89fc-803775ff22c5","resolution":{"observed_at":"2026-06-30T07:34:22.122440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:d9ef2f87a56a93e61f825362978af4d303fa2db8cab18d9c9ce08f52feb5d31c","observation_id":"4d214fce-f917-4415-bbd7-0676650c77ae","resolution":{"observed_at":"2026-06-30T07:34:22.109277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Impedancegpt: Vlm-driven impedance control of swarm of mini-drones for intelligent navigation in dynamic environment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:8b4e466b72c51dfd96de8e2b219063c89f3dedbce8514aab80f15cc6add9842d","observation_id":"8eed4ad4-d269-46e2-8a6d-def0eb2588bd","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Rod-vlm: A framework of real-time robotic perception, reasoning and manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:fe77cd0464dcd1882f0a21985b0acda107b83666dbafc3abb7898da8e21d5428","observation_id":"1d74d197-929c-4f4f-b5a8-ebe1865af5ee","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"On the safety concerns of deploying llms/vlms in robotics: Highlighting the risks and vulnerabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:e5723b2b53a0ccf2d575e50b9a799aaf134568096860e92f80d2045ca19dfa9b","observation_id":"f196455a-34bc-402e-8edd-3e933462884b","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:a006dfd2dcfe9c529fbff4155158c971403720ea314bb690d03801dc192bb2ba","observation_id":"679fb846-7f80-4646-a552-f5bf90cc467d","resolution":{"observed_at":"2026-06-30T07:34:22.099014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:98b3727323cad43e9a2221bcb765f1e0d2c6d3591addfd8f6b2964ccc1dc4bb8","observation_id":"b985be5a-df5f-464f-8385-fcc934e8f8fa","resolution":{"observed_at":"2026-06-30T07:34:22.117350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:7004233f792365f708c248afa9b0e2e8d5385584075a91ff3a8234b15be91558","observation_id":"df498cf9-7197-4728-acf5-237dc11be59e","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23782","last_updated":"2024-10-31T09:55:32Z","snapshot_observed_at":"2026-08-17T02:25:26.682926Z","submitted_at":"2024-10-31T09:55:32Z","title":"Video Token Merging for Long-form Video Understanding","version":1},"cited_work":{"arxiv_id":"2410.23782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23782","snapshot_observed_at":"2026-07-03T20:48:56.496339Z","title":"Video token merging for long-form video under- standing","venue":null,"work_id":"22026621-b240-4dd9-9eec-8594541308e8","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2410.23782","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:9457a129f40f5f49fb68d53aa36e0381a82a8cd89e4feb776f15efb700c72c39","observation_id":"48d86d1c-a1b4-44a3-a713-47a48858a4f7","resolution":{"observed_at":"2026-06-30T07:34:22.136566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17530","last_updated":"2023-05-27T17:16:27Z","snapshot_observed_at":"2026-08-16T15:29:01.361050Z","submitted_at":"2023-05-27T17:16:27Z","title":"PuMer: Pruning and Merging Tokens for Efficient Vision Language Models","version":1},"cited_work":{"arxiv_id":"2305.17530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17530","snapshot_observed_at":"2026-06-30T07:34:22.099263Z","title":"arXiv preprint arXiv:2305.17530 , year=","venue":null,"work_id":"91361f0f-8572-41d1-a5eb-06f62fd5b464","year":2023},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2305.17530","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:fe71873f7e6a4f52aeaeef6f4583d01f001d12a40d58bf775015f2314b5f2cd6","observation_id":"2887f1e4-bb4c-4ed7-a3f7-6017f8d40248","resolution":{"observed_at":"2026-06-30T07:34:22.100839Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":"2210.09461","doi":"10.48550/arxiv.2210.09461","metadata_source":"pith","pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Token Merging: Your ViT But Faster","venue":"cs.CV","work_id":"528509bc-2611-4e7f-a772-ea14d25b6dae","year":2022},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:d5c0efc9737b7614d9693da25b0694a589c711b07e0e538b8ed347ac9b95865f","observation_id":"d0289b44-1d3a-46a9-8a8d-6673629f30e3","resolution":{"observed_at":"2026-06-30T07:34:22.122264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Boosting multimodal large language models with visual tokens withdrawal for rapid inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:4600d007bea624e8d9001ad3dddae3c8037b092acf5402e66227b6d0949a9320","observation_id":"94d41bf3-1808-4809-8b85-88f15ee10a97","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"An image is worth 1/2 tokens after layer 2: Plug- and-play inference acceleration for large vision-language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:44ad0e9024c65348018f2e0f7eeee6a4d89656dce0ceb01c3f28b7359a953254","observation_id":"54ad8726-5061-49d9-9931-32ef63431cf8","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Framefusion: Combining similarity and importance for video token reduction on large vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:0649844d6eceb956330948bf246f53d9fc0df058f92696567c8783e69049831b","observation_id":"694edf93-7b38-4903-9800-dee449e9f99c","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:baaff78caf07919fc73ad1d51708a68386d4fe2b87fc2db07f24a342a946b4a1","observation_id":"4d57363d-6ea0-4bef-ac28-0fac05256c08","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:43be2d38fb24c0151a14e259d957a7911cb4a117409ffe16ea89f6185c752d35","observation_id":"7589ee9a-6b38-4a4c-9a9f-ae5e7ff2e5ca","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"An advanced driving agent with the multimodal large language model for autonomous vehicles,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:d4831abe7e2e65c52ca9495a3877f428b3e270c0a839b17200d877722161713f","observation_id":"f609e80c-90cb-48e1-b0ed-e518164bf6b1","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Cliport: What and where pathways for robotic manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:fd5f1f4c556cd7cf6488945f5a57c7061571d8381ac4d76535adcf67ac61d215","observation_id":"e350805a-9678-45df-8f28-6ada83bf8da5","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Vima: General robot manipulation with multimodal prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:977fcbf02df8ab27fa246a972e960bcf374b36540e573d06db35f104da701bb8","observation_id":"9af89bed-4449-4cba-a163-110c6480b37a","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:a6c773c70a5aca90160cc01788e7102bc71f5e1c3ce34405532ae3b4f2e47b8b","observation_id":"5da6386a-2f46-444d-8228-249548131f3c","resolution":{"observed_at":"2026-06-30T07:34:22.127845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:fe6313d7551ce978a3affa6df00a8734f8aad54808c4eb36ce0f15643eb3662a","observation_id":"dfcfe20a-1bea-43c1-b89b-a4d09fdd5557","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Physvlm: Enabling visual language models to understand robotic physical reachability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:9c66804813a5c13d39a90fd6135f274e8f45e1cc337f9769eb7e2e4fca642513","observation_id":"d3606b2e-4ec4-4c78-8724-030d0242b4c4","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09829","last_updated":"2024-07-13T09:42:02Z","snapshot_observed_at":"2026-08-16T13:34:32.798731Z","submitted_at":"2024-07-13T09:42:02Z","title":"VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2407.09829","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.09829","snapshot_observed_at":"2026-07-04T06:39:37.271777Z","title":"Vlmpc: Vision-language model predictive control for robotic manipulation","venue":null,"work_id":"2b76bccd-f802-4163-b683-376c7cc34995","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2407.09829","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:32eaf329b58711c7963bdf0b3e2342d3dc9b200cd9ac0f53222b94d642dc0c62","observation_id":"7f57ac76-391f-4f57-80c1-f0f548b67f96","resolution":{"observed_at":"2026-06-30T07:34:22.139716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-13T11:17:54.365190Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:2107cbfd566526bc9c6eb6a95ab7ab755318da5d151d70176a80656e6bb49c1a","observation_id":"3d45dbb1-deca-423c-ab4f-72ffd7a2537e","resolution":{"observed_at":"2026-06-30T07:34:22.124969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Drivelm: Driving with graph visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:f8d18926959c0fe1873d943087ff0f50eb569f076dedd3e4c405e017cb0b6001","observation_id":"d89824cc-af80-446b-9624-1b0aad4f29e1","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06564","last_updated":"2025-03-09T11:37:11Z","snapshot_observed_at":"2026-08-16T12:51:48.491165Z","submitted_at":"2025-03-09T11:37:11Z","title":"TR-DQ: Time-Rotation Diffusion Quantization","version":1},"cited_work":{"arxiv_id":"2503.06564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06564","snapshot_observed_at":"2026-06-30T07:34:22.105176Z","title":"Tr-dq: Time-rotation diffusion quantization","venue":null,"work_id":"8223857a-976f-46d1-865c-915402ce1ca1","year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2503.06564","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:bc51cac9809b05a023368844efdeb58033cd50f1b5409f92dfcf13cfead4d7e5","observation_id":"1fc8220e-365c-4d18-9a12-bfe228ac0780","resolution":{"observed_at":"2026-06-30T07:34:22.106711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12015","last_updated":"2022-02-24T10:56:17Z","snapshot_observed_at":"2026-08-16T17:18:58.644497Z","submitted_at":"2022-02-24T10:56:17Z","title":"Learning to Merge Tokens in Vision Transformers","version":1},"cited_work":{"arxiv_id":"2202.12015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.12015","snapshot_observed_at":"2026-07-04T05:09:36.498887Z","title":"Learn- ing to merge tokens in vision transformers","venue":null,"work_id":"1231d256-2489-42e5-a2ec-24a67c94a6d6","year":2022},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2202.12015","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:b87486fcbace5270dd0a98b289c2bd2fda2d99714e454ce392e750aaf7f9f9ed","observation_id":"1943de30-9f1e-4531-82f7-11f2f0aaf79b","resolution":{"observed_at":"2026-06-30T07:34:22.142467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Learned token pruning for transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:5814feb6c203059ac53abe78e84303d81a4b91f769b89b9f3083f669653ba089","observation_id":"d2cf0d65-e021-420f-91f0-187a65f4a9f4","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Exploring token pruning in vision state space models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:c4f5b4f2e09b6064a79bad6449dddecbda1bf2d37f65e1557bc92b79f36d1653","observation_id":"8156aec3-1cac-436e-b95a-8a6e7177745b","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Topv: Compatible token pruning with inference time optimization for fast and low- memory multimodal vision language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:9fa270bddf92af21b8e42183a75f332bfa272738b85c7318d6ee85974cc2ac1a","observation_id":"ba041b35-a96a-45a0-82d9-820d8b7e45b5","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Flashat- tention: Fast and memory-eﬀicient exact attention with io- awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:e099ea2131949a78d8b162266026b6a721303ac84bc78cb385ce39e64eef7c1f","observation_id":"b0d3ecb4-de88-436a-9037-80c60653df10","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.15388","doi":"10.48550/arxiv.2403.15388","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"6da9a077-fa9e-4020-bdb4-f30c9ebb0fc8","year":2026},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:896b30f5e3428207e2719abd894375d20c8952e40d3b0a431b03df1a2b8beedf","observation_id":"de8e5f54-191c-4a60-b11f-cd5b14913f5f","resolution":{"observed_at":"2026-06-30T07:34:22.133596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Rotary position embedding for vision transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:583e88676935186a1a12d72cd0c8c30011301067deee87f2a883a361d90e41a5","observation_id":"9f0e35cc-af81-47e0-aae5-3d857b5bd176","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:c9398a5760df1ec5bf7ed99f5fb425406147e2350536bc5fe85f264b418f77a6","observation_id":"b9d7fb34-5c93-4fd4-bd81-52d1de2fb150","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual- linguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:50b4970ee633dcfb0586c815a56406818aa863a7040f47e5a2b88556a42c79cb","observation_id":"978f05a2-2528-4dbe-a1c6-ecdf976c33fb","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Roformer: Enhanced transformer with rotary position em- bedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:6cd96477b0d9a2f7a5d558bfccaf28a0d68c206618b93a970535b47080dadc01","observation_id":"9a3e28a1-7ced-4dd7-8430-ea9ba2297cde","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:cfa60705fb7100ca921129ceff0b7828d7d4ca74821c9752c43e00102034bdaf","observation_id":"405e9bd1-0db9-4bfc-8bf8-6a6e5c2d1341","resolution":{"observed_at":"2026-06-30T07:34:22.145236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"lerobot_ π0.5_base,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:3f52ea03b0d256e917b2b27c70888040d801bb9c9035503f9c6285c088052edb","observation_id":"13093a61-3d58-48db-bbe6-6d046b56c1a0","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"A shortcut-aware video-qa benchmark for physical understanding via minimal video pairs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:7bf3e2af774b309a1abe3e904a224ebbe04315cb761585a15ce2aecb4b646957","observation_id":"5fcc7b26-bdb0-4e32-a349-3a8cab0f3b41","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:24:59.159037Z","title":"Lerobot: State-of-the-art machine learning for real-world robotics in pytorch,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:3b5717938548a5c730c820c59f7fbb7846b162404957d9ab222f81459321f79d","observation_id":"9d026fb4-d253-4ab5-aecb-16b2f679ee76","resolution":{"observed_at":"2026-06-30T07:24:59.159037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":26,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2606.29350."}