{"as_of":"2026-08-18T01:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc383372490027ccaf908abdc2f464d21e81fa1b4a6563dd941132f9b323d204","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:57:56.752601Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03083/citation-record","integrity":"/paper/2608.03083/integrity","json":"/paper/2608.03083/citation-record.json","paper":"/paper/2608.03083"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.108091Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.108091Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:d3645a99ef69ddb8c44683ef602490e5b456f77f28c6b5bd7766b64448f8cda7","observation_id":"e1085018-dfde-44b0-85f7-78b5c614ad57","resolution":{"observed_at":"2026-08-15T14:57:56.108091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.131532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.131532Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:dcbb10fb7a5f197fdef13e44c9da648b4d4e94daee30b2038a8140d306350fe9","observation_id":"ff5ee652-4d49-40f9-9b74-17d6e282f1d8","resolution":{"observed_at":"2026-08-15T14:57:56.131532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.152004Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.152004Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:f108272d49cff2944c19e3d5f3e054c3bac24cb2bddc6a2888efdacf8619379c","observation_id":"8c807c83-78d9-46cc-8132-fc2d4d69d817","resolution":{"observed_at":"2026-08-15T14:57:56.152004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-16T14:03:39.369872Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-15T14:57:56.162092Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.162092Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:419089403acca1f9657478244afa845528432eb8fa1ce897f9a17372f4aaa2ee","observation_id":"2752700b-4ebb-45cb-9490-5e443217e22a","resolution":{"observed_at":"2026-08-15T14:57:56.162092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-15T14:57:56.170077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.170077Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:71c24f47af54cfc57a0586acadcf9809217572f18b6067e3c6f960eb0a0a0a8a","observation_id":"47de14fd-faf0-4cb9-8de4-a139f1b4bfb3","resolution":{"observed_at":"2026-08-15T14:57:56.170077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T14:57:56.181207Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.181207Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:69bc710948b610085bb3ba38e2ddb7a3ac31f1fe15993ea4468866bd751e31aa","observation_id":"33ee5007-8e23-48a8-99d7-2d9d0a657a08","resolution":{"observed_at":"2026-08-15T14:57:56.181207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-15T14:57:56.189069Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.189069Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:b4676fe42d24124bbb3bf638bc515cd4dccce26aa9e5f32759b224ab36a6985a","observation_id":"976a2390-5358-40c2-8220-69286d6b0dbc","resolution":{"observed_at":"2026-08-15T14:57:56.189069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-16T15:30:58.546906Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-15T14:57:56.198538Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.198538Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:9e3b2af9d6f0ddde77eeb8539826b66a9ad61ad52aa0a6b326c8692bf9c10338","observation_id":"22c1062b-1245-4720-88ab-07791839a334","resolution":{"observed_at":"2026-08-15T14:57:56.198538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.205337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.205337Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:2e4a4a781280b0ba2bed1274a3a4852fd263dfd100479b56da0b15f381d1bb51","observation_id":"cb9c2de3-7353-4897-8dc9-929353f72484","resolution":{"observed_at":"2026-08-15T14:57:56.205337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-15T14:57:56.212904Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.212904Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:d4aa7133a3cbe0d4f7e4484cc996a28c569b588d7f1f2773d37bdcd668ad5d4f","observation_id":"acc0232e-b8b9-46d0-87e4-a5a1681fad42","resolution":{"observed_at":"2026-08-15T14:57:56.212904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T14:57:56.227468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.227468Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:173b2c9454b2fc12ade115c7569b7f794541acd3d61dee2b94949029decf20df","observation_id":"4b8d239a-2792-41d6-939e-32466093dcbf","resolution":{"observed_at":"2026-08-15T14:57:56.227468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.235912Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.235912Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:eb2f60dad118e406b25f3014c67a41102ed1678605d50501a6775a1127f316cb","observation_id":"036ab384-5f20-4baa-bcdc-384ca0e7152d","resolution":{"observed_at":"2026-08-15T14:57:56.235912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-15T14:57:56.242973Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.242973Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:d29f2fb23b602012c23b51790ec40ac779bb9f9802dd63e24bf54112fdcd0e39","observation_id":"a25a4001-a7cf-4b3b-8750-1cb6cfb6d7db","resolution":{"observed_at":"2026-08-15T14:57:56.242973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.384888Z","title":null,"venue":null,"work_id":"ac2056f9-7c99-4ebd-9c46-64ccfdfccdfe","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.256934Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:d0735a5057b54457563e59f61015f9780566bcf522e471bc0e18d1b6d6047b3f","observation_id":"8402874c-e6eb-499e-98d4-d89bb27acbb8","resolution":{"observed_at":"2026-08-15T14:57:59.393789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T14:57:56.266257Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.266257Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:468f994c62b895be3f915f355772c04f14e7a99506b30af6e4ff0a2bbf2b7f4f","observation_id":"213f6d5c-f975-441d-bd33-15a5cde08464","resolution":{"observed_at":"2026-08-15T14:57:56.266257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.334751Z","title":null,"venue":null,"work_id":"a22059cd-8254-4ce0-8e39-8b8851c567f4","year":2022},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.274197Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:11161b2d169622df8a69e7cb3378dbe9564d64ec4fca0b7854457ff3e49d6e84","observation_id":"1b02549a-428a-4f5d-afbc-31f50c60bb1f","resolution":{"observed_at":"2026-08-15T14:57:59.345547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.283633Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.283633Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:dcc90beed7eaa6bd3fb710035ac436a862ccf4c2a4d4e643189804432a0e2d71","observation_id":"165bbe61-23e5-4761-91bc-dfea5340b00e","resolution":{"observed_at":"2026-08-15T14:57:56.283633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.264095Z","title":null,"venue":null,"work_id":"5da052bb-5b00-47b6-96b6-6ed421cc8237","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.297668Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:462a13dfe42a7551dc99a930aaa5abf8987366a0ef3e047093ece864bd6ccfd8","observation_id":"0003ab70-5e6e-44b2-a1a1-5853ce217d7b","resolution":{"observed_at":"2026-08-15T14:57:59.274925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.207018Z","title":null,"venue":null,"work_id":"5c28a5e6-6022-41d7-a583-2b003a18a81e","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.306431Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:e797a7fe41c64776ff9a9b482fcb2b024186464622be7d724b7db3b0838d92de","observation_id":"1153f228-79c5-4b5a-aff2-6b76bb7f6cf1","resolution":{"observed_at":"2026-08-15T14:57:59.224719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.162154Z","title":null,"venue":null,"work_id":"7645e6b0-ec5b-492c-95a6-1a5811435709","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.315528Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:48a5f7724c767e890b3568c9519c36997850a2e43afe31efd57256520e7edada","observation_id":"86489d16-dca3-438b-89c5-24aa30bcae3a","resolution":{"observed_at":"2026-08-15T14:57:59.174796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.324734Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.324734Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:c89f6a69e03ad4237d9a5297d4c80c557dab68491fd76823cd4ce97e7b61cf53","observation_id":"70854148-96bf-40bf-93b3-4d22dce6448a","resolution":{"observed_at":"2026-08-15T14:57:56.324734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T14:57:56.332299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.332299Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:dc0a1fcb2d6f25b706ad02627b6e809c2681af9506ae2f0639d1e0d55dd29dc1","observation_id":"f182365d-6de8-44a6-adb0-f3e5b6b9c24c","resolution":{"observed_at":"2026-08-15T14:57:56.332299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.343809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.343809Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:15d95c5416e1fc0a2e6c7c2a6a358489aab72a02b363a4781eb6ee6d70c1d785","observation_id":"a631fc30-95a3-4236-afde-8d3068e58e9d","resolution":{"observed_at":"2026-08-15T14:57:56.343809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.354162Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.354162Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:4ec7e563c091c01bbfa84e976a81b6754b3e7816c5e80cb55e6625336d113b25","observation_id":"a3e910f7-1986-4a4c-85af-70f08a47fa12","resolution":{"observed_at":"2026-08-15T14:57:56.354162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.362695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.362695Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:1f8af32d770b76d3d272df9a8f3d6e6cac777eaeb05e449bc45598b3f8297593","observation_id":"9c9da7ad-f05a-4c11-8056-47f981526d11","resolution":{"observed_at":"2026-08-15T14:57:56.362695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.375209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.375209Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:b9e1706cb5e395ad8643111154a3384259f5ad62bb6bfdfecc8b5781f51ba687","observation_id":"0215bf0b-ad13-4201-bc61-b19e7b86591d","resolution":{"observed_at":"2026-08-15T14:57:56.375209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-15T14:57:56.388709Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.388709Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:6ea903c22b6b3a31e81512c949845e9998fe4606303c608c57636a8e02c4ca8a","observation_id":"775cee6d-21f0-400f-b0e0-ce21db608cea","resolution":{"observed_at":"2026-08-15T14:57:56.388709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.403321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.403321Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:5184cf99a7dc9d63626bb5ecfe2ac0b1f053f5b96b7dc7ac807be5d62a325312","observation_id":"4ef048d8-0f0a-4a72-973e-fa2a13665635","resolution":{"observed_at":"2026-08-15T14:57:56.403321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.418822Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.418822Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:6e358ee772e461cc2eb616b192128eef0a29d84d6854e545e102cb3b6f15079a","observation_id":"c251361c-8b88-451e-85a8-1924fa62f407","resolution":{"observed_at":"2026-08-15T14:57:56.418822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.430736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.430736Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:05f22edd9799f91f274f91b9993ed066c08393fb8c7f2c5d78e149ad7f9e36d3","observation_id":"1c2ff6b0-2fca-4ce6-9d22-c5e484402030","resolution":{"observed_at":"2026-08-15T14:57:56.430736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.923385Z","title":null,"venue":null,"work_id":"22ad4c55-9857-436f-a011-144c60f808b7","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.446762Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:40a4a56cf8431792fe6337777f3d088ef104103c93237e747c0348b6d87ada8f","observation_id":"4b391219-50fa-46eb-9ead-85bf81236d22","resolution":{"observed_at":"2026-08-15T14:57:58.930653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.872216Z","title":null,"venue":null,"work_id":"6c6539c9-097f-4e1d-9a69-85bcb43e9c9a","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.460789Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:f7b9d7034b6af2dea22f2b2eee1f91d5f1bb6d9d2ea614498a4b83628bda251e","observation_id":"4060da20-332d-4247-9ca4-fd48cd18631e","resolution":{"observed_at":"2026-08-15T14:57:58.895761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.477466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.477466Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:56fad5792e1f333109a7a160a857b259f810de815fa089ca4d3069a2cfc06d65","observation_id":"9ab596e9-d35f-4d94-a3f3-cf32b1e0939d","resolution":{"observed_at":"2026-08-15T14:57:56.477466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.490173Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.490173Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:0e98a9a774bf5e7a5ceb18ad17ee0791565373d005c6c3b395f243e6095bb366","observation_id":"5453f54a-217e-4f0b-bae0-b276527533bf","resolution":{"observed_at":"2026-08-15T14:57:56.490173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.499506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.499506Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:96733d63b547cd25809490d9e6359c0ccb9274482d63f39cd95deb0854062162","observation_id":"089bbc5a-ef76-484f-9d0b-149371639113","resolution":{"observed_at":"2026-08-15T14:57:56.499506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.513049Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.513049Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:0dc73770fa90b72498b352108a1ddff5e4ba714c55a8a79e9250e4fcee3e6adb","observation_id":"9cfc4506-8302-406f-999f-a53d56ef2b64","resolution":{"observed_at":"2026-08-15T14:57:56.513049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.535717Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.535717Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:52840ae4ef1c7007333332fff463be5cb2bc06607f624e422ca1f78de2908491","observation_id":"f92f55b0-5846-4249-99ec-12f84baaf23b","resolution":{"observed_at":"2026-08-15T14:57:56.535717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.543695Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.543695Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:8a7b02e73309c847d1b69ce67d6179c9e35e69fd685ae6f663c544c8c2e22e8c","observation_id":"ddfc45c4-336a-41da-8c5c-8bd60da3a61f","resolution":{"observed_at":"2026-08-15T14:57:56.543695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.685354Z","title":null,"venue":null,"work_id":"e818ac9a-e612-4514-a57a-182c04ef0cf8","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.555312Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:1dd3b41238b09230bda05f328a2c2714381b598bfa1ab1a06942a1aaebb31d64","observation_id":"c44ac986-dd29-4347-af25-a97e532d0fcb","resolution":{"observed_at":"2026-08-15T14:57:58.697057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.635533Z","title":null,"venue":null,"work_id":"b588729f-70b0-4ba6-9a69-dae324e9861d","year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.569779Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:50e911c9ae60af866826066fca30512cd660052b33e3ea066c4c07f8f3f5bd53","observation_id":"7088f210-d73a-4f6d-ac74-d4d8b01b5243","resolution":{"observed_at":"2026-08-15T14:57:58.660001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-15T00:34:08.333930Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.20100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20100","snapshot_observed_at":"2026-08-15T14:57:57.254203Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","venue":"cs.CV","work_id":"a95680fb-7dec-4a59-9c25-35c7d8a54f3c","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.582528Z"},"links":{"cited_paper":"/paper/2505.20100","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:4b379928a11b87aa216a86c127e137d45aab55ba77648836db9422e8545e28a0","observation_id":"2073a944-5328-40b6-9520-14fe4d6f4c8b","resolution":{"observed_at":"2026-08-15T14:57:57.269717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.589948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.589948Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:f5d3fff5153f7999b9d8215c0f5393e8e875d0827a1984a079db7c9ff92869bb","observation_id":"772fb8d1-53d1-4470-91ea-b2d273c5ff39","resolution":{"observed_at":"2026-08-15T14:57:56.589948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.572315Z","title":null,"venue":null,"work_id":"435e7b05-4e95-44ca-abc7-d7b9753bae31","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.599390Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:3fe8a7254dfdfb753277e2f7364a043ce8fa62dfd0bde85c7670506c45e30050","observation_id":"11f3c715-5a64-47f1-bb66-7ac013f47b7a","resolution":{"observed_at":"2026-08-15T14:57:58.583179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.542647Z","title":null,"venue":null,"work_id":"467a9d5c-cff4-499a-b8d0-3b13e7445af9","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.611700Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:fa3911866f15cc02e35b6c2af60981e90c81427c376c600025fc2229a53047d3","observation_id":"a3258b68-4238-4411-aa41-dd5f7abea387","resolution":{"observed_at":"2026-08-15T14:57:58.550414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.619114Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.619114Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:43f9f86ada4897b6b43460882544100f9fca7a184f8be0ca4f5c574eebb0c64d","observation_id":"64a4e827-a9c3-4bcd-a4c8-082bf7b7ab40","resolution":{"observed_at":"2026-08-15T14:57:56.619114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-15T14:57:56.627432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.627432Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:8bd23e5d7e477f51442ea2b81c927c1abdfb5e27778254ea91237b5576bb3bd1","observation_id":"694e1842-7425-4edf-8f27-01d056af4ff8","resolution":{"observed_at":"2026-08-15T14:57:56.627432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.633694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.633694Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:6619e81cc3af157499b8c794d7b8d6b39de8473263d4715fb026b69b36eb5948","observation_id":"1e2e6ee1-1712-47ba-b12f-9545d5dba291","resolution":{"observed_at":"2026-08-15T14:57:56.633694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-15T14:57:56.640802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.640802Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:92adb675fc11564d41a3cb0977d2e36c0e80ccd83a8e0f0a7158f6d550ec7c1c","observation_id":"010c3b1e-cb27-49ca-8f15-57d01737d440","resolution":{"observed_at":"2026-08-15T14:57:56.640802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.456328Z","title":null,"venue":null,"work_id":"a64dea3d-8ad3-4bcb-93f2-0632edda5218","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.650251Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:c9d460404663e9e7ccee638fa55c1e87de61086e74f088f797f5bfd5caff4430","observation_id":"20e58152-9c2d-43ad-8e45-8501ee920757","resolution":{"observed_at":"2026-08-15T14:57:58.477114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.420041Z","title":null,"venue":null,"work_id":"a878b828-3c9a-4a81-a211-b5d49f13ed8c","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.658637Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:ca01d7cda5aff0ff36deaf216ec13d16e8d19a5a1f90caccb9e2ec1c2cd4b772","observation_id":"550c3538-91ba-4b70-8cf3-2ab5bec83702","resolution":{"observed_at":"2026-08-15T14:57:58.430213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.379166Z","title":null,"venue":null,"work_id":"2b760db8-883e-4a07-92c3-8b7719a931db","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.676220Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:a14dd29ead9ccd53785eb33dd939530b805fa4a64e1afb5b145551526670ec96","observation_id":"75f927b1-301b-44c4-ad50-57b5fb545933","resolution":{"observed_at":"2026-08-15T14:57:58.388636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.684005Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.684005Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:e8b1f1871e123b8ebe7b0cc5866a6892a67220a2cd9df5d564a0774270a3ee58","observation_id":"f8f6d80a-39b2-43df-bc8d-8d8d45ec9044","resolution":{"observed_at":"2026-08-15T14:57:56.684005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.699482Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.699482Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:9474a0de03473f1d359e6dc8dcc60a03f886ec24b89af188883d991e1d70b415","observation_id":"11101bf1-83a1-4c81-928b-1444ec23b155","resolution":{"observed_at":"2026-08-15T14:57:56.699482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:58.287080Z","title":null,"venue":null,"work_id":"12ad55c2-42a3-4777-aa53-78d52b34a48f","year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.712767Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:327ac7d6191c13999fb9b0cc40ff116cab0380fb25445a4eb349f2bd54ba61bd","observation_id":"001fd366-5c11-4c09-9234-3350672fa44c","resolution":{"observed_at":"2026-08-15T14:57:58.301627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-15T12:04:12.375959Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-15T14:57:56.723618Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.723618Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:7f72128d76f72825c6c525116e664f01c650770bd2aca3b0b23ecd0cf1ca81ca","observation_id":"14e7701e-2074-4b82-836f-dad26b1bd571","resolution":{"observed_at":"2026-08-15T14:57:56.723618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.729974Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.729974Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:1c3246f68ff09f2bed7e342e30e7185ccbba423bc5d379e1c073160a2bc81dca","observation_id":"3acfe0d8-6ee5-4625-b64e-e8a1c28917ea","resolution":{"observed_at":"2026-08-15T14:57:56.729974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.743820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.743820Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:55118e465fa6448ef72498c5ed6939c48a37822397476f92276f9f28d4c9e649","observation_id":"c1759393-e52c-498c-be32-fd0e4b07dec9","resolution":{"observed_at":"2026-08-15T14:57:56.743820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T14:57:56.752601Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.752601Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:56d4b4564c3d158ae076879047b6125277b80758466f8f7a52e367db6bc48ea4","observation_id":"fe7b203f-cde9-4956-baeb-2cd35b553471","resolution":{"observed_at":"2026-08-15T14:57:56.752601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-15T14:57:56.737747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.737747Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:3017ba9a33c139e526212415b644bc18a80074c3f1efe2c694053aa8eaf7a848","observation_id":"a6d206d4-edab-46fa-ada6-a614a83cef4d","resolution":{"observed_at":"2026-08-15T14:57:56.737747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.523306Z","title":"Advances in neural information processing systems34 (2021), 13937–13949","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.523306Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:3809701465759dac284493c8c77f6eae223481c8344fb09e6efee5be7f5c2354","observation_id":"9e8d6223-e916-4026-a7cf-c291ee1541fb","resolution":{"observed_at":"2026-08-15T14:57:56.523306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.120294Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.120294Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:00709d78c612b6f109195569f891d97fc27b062b8daf9da6c97b705d7df5b35d","observation_id":"85cc6769-bc5a-4d74-9385-a720e870132c","resolution":{"observed_at":"2026-08-15T14:57:56.120294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-14T15:26:24.383948Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-15T14:57:56.439046Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.439046Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:eb9772ab8e341d26f9e93d6e5510779cdb9092c931e648c29c22e67d8d34b73d","observation_id":"a2aee47a-d6c7-43da-bbc9-29666f38fb20","resolution":{"observed_at":"2026-08-15T14:57:56.439046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:56.142848Z","title":"InProceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.142848Z"},"links":{"citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:3422b29248093fe479d2c7331a2caaef35012fe1ae391dd9f2495c63a5c498a7","observation_id":"bab3dea0-b8cc-4aa0-b581-ee049fd4b787","resolution":{"observed_at":"2026-08-15T14:57:56.142848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2608.03083."}