{"as_of":"2026-08-09T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03551c7613376b56e26f1ce32656045b5dbd82a6515a5d41be15891cdafb3b22","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:08:11.296096Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20100/citation-record","integrity":"/paper/2505.20100/integrity","json":"/paper/2505.20100/citation-record.json","paper":"/paper/2505.20100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:12.251791Z","title":null,"venue":null,"work_id":"813d9436-a29e-4c66-874a-fc0164d9bf35","year":2022},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.334198Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:68b2793519b37baad3e560562d20b77b4aad112b32e4b77141269f1b7ac0d7f3","observation_id":"71c38705-e07d-4bc7-b2ac-ffdc02face53","resolution":{"observed_at":"2026-08-07T14:08:12.301984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:07.469918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.469918Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:48e5362b05b3475dd0f39f974db6194ab301829bb8643cd13ecc80ad94cf1ab3","observation_id":"2632c7f6-f7db-4558-b5f4-5fa871d22dc3","resolution":{"observed_at":"2026-08-07T14:08:07.469918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:08:07.651269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.651269Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:dd9279d2b40759e7ea46b1ea9df62ebf2861b3b3c8d1bac60124c9e4f49094c9","observation_id":"bc8321d9-4ebe-4ec6-9b16-5f6864a728b2","resolution":{"observed_at":"2026-08-07T14:08:07.651269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T14:08:07.824929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.824929Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:0ef90ef152104fda8db62e82dd86d69e28062f6245bb5d153eacbfd6de7e524e","observation_id":"6254fc63-920a-4b5f-87a6-2df08e1a02d5","resolution":{"observed_at":"2026-08-07T14:08:07.824929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:08:07.940796Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.940796Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:714162d34e83b0b14046bdfcde6d2fd67302b34abf027f99e08cbaf25a64b138","observation_id":"b0622fd0-cdb1-4abe-8054-84a79293f9f5","resolution":{"observed_at":"2026-08-07T14:08:07.940796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.008568Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.008568Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:9fb7d8fe4e1c5d95969b0d384f171279aea365de5509ebdefddcafec81ea14de","observation_id":"f923c722-715d-4bfb-9910-bc41f5fbb8fd","resolution":{"observed_at":"2026-08-07T14:08:08.008568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T14:08:08.089865Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.089865Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:6801c2aac02a72bac47440d1090fc6ff2a6807ba6c416389e54e6884a2f2ad11","observation_id":"534f4d18-7d34-49ee-85ae-c58f6212dcc6","resolution":{"observed_at":"2026-08-07T14:08:08.089865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T14:08:08.176479Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.176479Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:7aeedd180459893d5686d74b8ef4be1b49c95e49fc4949ed6170ff172a41f09e","observation_id":"a8546b57-4fee-4192-901d-55c9b19b1f6d","resolution":{"observed_at":"2026-08-07T14:08:08.176479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.244315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.244315Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:38dc6beb3774b6cc877d2790c53bc874d16eb47c5a182332a7d363de25f26886","observation_id":"1c896fc2-dcc5-492d-9fb8-479e882bc975","resolution":{"observed_at":"2026-08-07T14:08:08.244315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.362280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.362280Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:168afb1be6946ebd06b50a466de10e6278fb800c8c78a95d4fcfe987d28dc87a","observation_id":"a6e6a82e-f71a-4c19-8fb0-484b227b7c9b","resolution":{"observed_at":"2026-08-07T14:08:08.362280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.441927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.441927Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:3bd509ac712d76d676fb231f94cc409fc795793c83f10191ac1ef2e337e632d9","observation_id":"6d01685b-994d-4601-b622-0ab88a9f2b8f","resolution":{"observed_at":"2026-08-07T14:08:08.441927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T14:08:08.604098Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.604098Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:10bc214544bab12dddbee143777a64a2fce0e89cd4e80b9519d54261a35f3116","observation_id":"6a74b289-d8f6-4edf-8326-1d43112a9d3a","resolution":{"observed_at":"2026-08-07T14:08:08.604098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03860","last_updated":"2021-10-11T15:17:21Z","snapshot_observed_at":"2026-07-06T11:55:39.142653Z","submitted_at":"2021-10-08T02:22:50Z","title":"Token Pooling in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03860","snapshot_observed_at":"2026-08-07T14:08:08.722595Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.722595Z"},"links":{"cited_paper":"/paper/2110.03860","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2d962d28a8d1061d7cb576cbcc919c4e20ed951305218a760e901978c815121e","observation_id":"5881e8b5-c92a-453e-9282-cec7857fda4a","resolution":{"observed_at":"2026-08-07T14:08:08.722595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.812415Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.812415Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:bc794a4b542dec778e089f3559cb26456de1aedd356991d5c76bbd57ac31a92e","observation_id":"28b71577-081d-48db-9b00-002d3184eb0e","resolution":{"observed_at":"2026-08-07T14:08:08.812415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.931794Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.931794Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:69ed0e0d6b8f13371380ce4f0aec6b18a0c33921a4d79ac08976ee15821fe938","observation_id":"60050535-e83c-40ad-860c-0162b6037cca","resolution":{"observed_at":"2026-08-07T14:08:08.931794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:09.028514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.028514Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:e829fc1a2b11310027cc080dbbd8b94546767ab1e5b3ee43a2648629d6001cf2","observation_id":"7efea8a8-b5aa-4968-98cd-7a1618d18b7e","resolution":{"observed_at":"2026-08-07T14:08:09.028514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:09.144568Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.144568Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:71a5cef91d30b2c4808e54ba3c78b9123a9d14c52553eda1ba90b85b1132a74e","observation_id":"e5a98b9c-3fd7-4452-be25-fa03219ee3e9","resolution":{"observed_at":"2026-08-07T14:08:09.144568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T14:08:09.248749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.248749Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:0eaa32dcf6026a2c80dcf64e7990b51de1b060cc6bbbc5eed623497712c8b8ff","observation_id":"52f69615-1a5e-44bc-b7fc-b0b73babfd78","resolution":{"observed_at":"2026-08-07T14:08:09.248749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11205","last_updated":"2025-03-14T08:49:52Z","snapshot_observed_at":"2026-08-07T17:04:36.345651Z","submitted_at":"2025-03-14T08:49:52Z","title":"LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11205","snapshot_observed_at":"2026-08-07T14:08:09.356278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.356278Z"},"links":{"cited_paper":"/paper/2503.11205","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:563269c38d51a91a9a6221aa8233453dc2e488093d1c9e887d4da2cff8c10082","observation_id":"719b3a36-7538-4b16-8b26-79d5f3e9e793","resolution":{"observed_at":"2026-08-07T14:08:09.356278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-05T13:11:54.824513Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-07T14:08:09.432264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.432264Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:8b1e26c8c59e19ad39ddf4f096c8a4fc6f2a99fae461ee275c1d631f51fdb969","observation_id":"3f1acf08-3f3e-4d4d-bf9c-889c2570e0ce","resolution":{"observed_at":"2026-08-07T14:08:09.432264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:08:09.546942Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.546942Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:749a04a8e5415ef4ac9acbc5755ecc9c2292fb899ca31eeb96eda65264960b52","observation_id":"b65dbd14-f6a8-49b6-92c7-ec607346748e","resolution":{"observed_at":"2026-08-07T14:08:09.546942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-09T00:24:49.492041Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-07T14:08:09.626063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.626063Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:9fa6cd2beb91198b2a866600ee1e4f943ef3a14e348f33fc83b46fd56e66d38a","observation_id":"0684c49d-fb94-46a0-b763-5b078f39c65b","resolution":{"observed_at":"2026-08-07T14:08:09.626063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:08:09.721510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.721510Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:0a63e521a93d5920d7469a35219d0f09def4ad5a33b6be234076376ed895f1fd","observation_id":"4599b744-4add-46b6-865e-7532ca33d6c2","resolution":{"observed_at":"2026-08-07T14:08:09.721510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:09.823977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.823977Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:07751e86b47c0bc40e56abce0a3a77c7d380328dfb2cd5c60cede9b8a1f3ecd2","observation_id":"4f7f90ef-383e-4577-a8fd-68578ae97ab5","resolution":{"observed_at":"2026-08-07T14:08:09.823977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T14:08:09.942396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.942396Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:8e0f50d92e6527be3a7c199e6795f1839338822c787e706bb443bcdd7ffa8c01","observation_id":"6a2b4522-d97e-4cef-9d57-7819ff5ce560","resolution":{"observed_at":"2026-08-07T14:08:09.942396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-07T14:08:10.024398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.024398Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:7d217bee664178d56a1595da869d4260ce26267cc68449e1cc59ab65e6bb4ee2","observation_id":"309b5d2b-9e37-4f24-ba44-7ec66d766431","resolution":{"observed_at":"2026-08-07T14:08:10.024398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T14:08:10.098876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.098876Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:ee128d28de22f7ef40220e7f866d160c0c07525542a5be36ac832d6df1e88f7e","observation_id":"f8ea79b2-886a-4b30-b6aa-f3be6fafe4b8","resolution":{"observed_at":"2026-08-07T14:08:10.098876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:10.209360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.209360Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:b026216553a2a16ee98c3c3d55c4ef296ea8f0e2e325b481773e78825904009c","observation_id":"e9e59250-5ad6-411f-8c5c-3c558679a56d","resolution":{"observed_at":"2026-08-07T14:08:10.209360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:12.008840Z","title":null,"venue":null,"work_id":"06c1537b-1e55-4650-a7c6-5db88f69f5a7","year":2022},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.294540Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:1cf5e517928bd48e161797d9ba24cf3b6e439b335e2f21c49e235d861ecb9e94","observation_id":"997ad8eb-01d5-4ffc-9546-4130bccf413a","resolution":{"observed_at":"2026-08-07T14:08:12.075391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:10.384993Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.384993Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:f4b4bdbb1941963b7996edfc18cb2f791ddfc21d0fd9539728c4c963a93f67d8","observation_id":"1ebabf5a-c74d-4111-a3a1-8db4a9fb5a18","resolution":{"observed_at":"2026-08-07T14:08:10.384993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T14:08:10.490334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.490334Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:52dbe0bfee5208ad8e2bcdc19925c3f19c8c666f71dcb2f392b411a45266740b","observation_id":"94ea1965-e3a7-4fd4-9eec-5b6d1d628f21","resolution":{"observed_at":"2026-08-07T14:08:10.490334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-07T14:08:10.568820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.568820Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:f4d60198e39fd0be87d51738dece77b944ff487ddb980f5c9e35e0e5f5bbe62d","observation_id":"a152e2cf-71b3-4838-ae5a-24f22fbedff1","resolution":{"observed_at":"2026-08-07T14:08:10.568820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T14:08:10.697724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.697724Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:175c4c5cd792c098c837b4a2cecfad367db371cc5ca614b33bc3a53b1dd7ee03","observation_id":"f3a496cd-ad53-4c95-84c7-41cd139ded15","resolution":{"observed_at":"2026-08-07T14:08:10.697724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:10.807603Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.807603Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2fcb61600ef24ffd9d22206493c4eef02aa8737556f4f81a2c4a01f86fcf164c","observation_id":"68ab79c8-9c58-4478-a77d-c559245a1bea","resolution":{"observed_at":"2026-08-07T14:08:10.807603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-07T14:08:10.915558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.915558Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:0da395324581d6bd48eb93450209c90e69b7ffe83e5b1d8b443f34299df8a053","observation_id":"4ed619fe-2182-414b-afff-bd1a1ca8dd69","resolution":{"observed_at":"2026-08-07T14:08:10.915558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T14:08:11.015163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.015163Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:e6089793b7b85cdb8b95c53ab8f99d45d4f17804a2cf3e953abb77b7d1f470d4","observation_id":"952ba7ea-fada-4dde-9e84-ad50a5522652","resolution":{"observed_at":"2026-08-07T14:08:11.015163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:08:11.091612Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.091612Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:f1ada2dab7dbc008adea3cd06dce814dbebfc60b31ce8e8cc9fbb7cd631ed062","observation_id":"6010160f-7766-4bbb-8aaf-153c129cd9cc","resolution":{"observed_at":"2026-08-07T14:08:11.091612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:11.196238Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.196238Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:87ecf0d6b9c42e88b28d567b18eab294fdbd7f28725adaaed2eb7c025a033dbf","observation_id":"8786fdcd-26d9-4adf-934a-6e0d31b5786c","resolution":{"observed_at":"2026-08-07T14:08:11.196238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:11.296096Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.296096Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:eebf30bb3ff86c54cb02cc87b43b1be4037429c516c891893f462ad471b13406","observation_id":"af24ddb6-0af2-402c-9f88-22bada028561","resolution":{"observed_at":"2026-08-07T14:08:11.296096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:38:50.390450Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.20100."}