{"as_of":"2026-08-10T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76444ba6bde51f9cb3893beb04f210baaee6c446d5799399e88143cf8b8d8d0d","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:05:56.484408Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.00969/citation-record","integrity":"/paper/2509.00969/integrity","json":"/paper/2509.00969/citation-record.json","paper":"/paper/2509.00969"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:53.235597Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.235597Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:d3bd75b3312de95303ead28e040e053e2a732e2af2f12d92a96d4fd71600b8b9","observation_id":"3eba0d5a-0297-42dc-9608-6a95e01a9741","resolution":{"observed_at":"2026-08-05T13:05:53.235597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:53.365017Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.365017Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:734b7338d7d0da6bb0c1b98522dec6a7081d472736f24783029e0a31e5d89c79","observation_id":"06e8b971-70d6-417f-953e-29cb46383135","resolution":{"observed_at":"2026-08-05T13:05:53.365017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:57.085457Z","title":null,"venue":null,"work_id":"ed7500c3-2c9d-4de6-b374-0d416861e43a","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.473748Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:ecae3ee74da45114bff59d0729dda662297a9a6a8a98f3437da7c9a241db3b67","observation_id":"a50d49d8-e4fe-40df-bf1e-f6367e27301e","resolution":{"observed_at":"2026-08-05T13:05:57.088261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:57.075178Z","title":null,"venue":null,"work_id":"cd509250-46b6-4ebb-a976-c124342a6d72","year":2021},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.550665Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:f174aea954823e950a1bf8f48e6ccdf005f13b3f75085fcab3ac2786551e8ba7","observation_id":"80a89611-51ad-47ea-9a7e-4ffd757fcfc2","resolution":{"observed_at":"2026-08-05T13:05:57.078212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T13:05:53.616303Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.616303Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:f40f63709f60aba994c79db43970aec457f10b2b4fe536696d65cbde0c7e0c82","observation_id":"d3f6908b-f5cb-43a8-8a83-2b6c0c3769e9","resolution":{"observed_at":"2026-08-05T13:05:53.616303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:57.064047Z","title":null,"venue":null,"work_id":"0d387e6c-b502-4983-8957-16fc21084200","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.681026Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:5966b243b75aa42fc54415671784c18c70417362c3a5368bce2c6026152cf550","observation_id":"61ce91eb-1861-41e1-b0f3-e174b6415dc3","resolution":{"observed_at":"2026-08-05T13:05:57.067311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:57.052996Z","title":null,"venue":null,"work_id":"b2763b1a-964e-4144-bd95-a2f9ed45aae2","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.746451Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:d409a918ea3819944199f923b9e5810c9dc11ac6dfc38e33ceecd8554143fc28","observation_id":"8eacebfc-68c3-470b-a361-d7ff1f73cdb3","resolution":{"observed_at":"2026-08-05T13:05:57.055994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-05T13:05:53.794576Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.794576Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:323b96be1736f81a7e6f1d81264c42f0c7bae81244313244b59b2fa140b55acd","observation_id":"bbd2c311-4312-47b8-b990-4fb9747f14fc","resolution":{"observed_at":"2026-08-05T13:05:53.794576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:57.041576Z","title":null,"venue":null,"work_id":"d38ef96b-1e01-490d-9182-524c1d1629d8","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.832400Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:60ef345c5d3de76c3523f4f443cb2fc9a6860697c712298d2e3548f0aa80e376","observation_id":"334e107d-3199-48d8-93e2-df47d2985064","resolution":{"observed_at":"2026-08-05T13:05:57.044854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:57.031368Z","title":null,"venue":null,"work_id":"cf2fc119-99c5-473b-831b-1a1dbda9ec5b","year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.876365Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:9ec91f36d1675126937e8db531aafb74c72bfb8a027f8d8e58f0ee4275d4e059","observation_id":"c36bc76c-9875-4ff9-b6c0-69c82a7293ba","resolution":{"observed_at":"2026-08-05T13:05:57.034658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:57.021692Z","title":null,"venue":null,"work_id":"7f6a1203-1c16-43c3-9978-665781dbf67c","year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.931576Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:34e9de9246891b04883d4521fd84bfda6a9acb187da00f48db3e536e97591794","observation_id":"aca1768d-d489-4e0c-bd38-add5b271fc87","resolution":{"observed_at":"2026-08-05T13:05:57.024753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T13:05:53.979850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.979850Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:a7470726b4e73da19c386d696c696cc06a07d93f6cae95c1a527a9615c1ffe4e","observation_id":"c21867b7-2676-48dd-9917-21e5fb1f3d22","resolution":{"observed_at":"2026-08-05T13:05:53.979850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-05T13:05:54.046573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.046573Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:bcd21c49db40adec62c20c3e77202c300e982e6f808f9a476b65fed7f1caf30a","observation_id":"52e0de29-c462-44ec-9e5c-e515c51147a4","resolution":{"observed_at":"2026-08-05T13:05:54.046573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-05T13:05:54.085259Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.085259Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:71c91d95e3402774c63ef820de3485e9b7086e52b023e652d3503bd6004127d4","observation_id":"e3056099-9f02-4247-a432-4af80e8acff8","resolution":{"observed_at":"2026-08-05T13:05:54.085259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:54.126692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.126692Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:00ef698461c3a59fac52a111f6ef1cec05cb2d72198c95d3464702a348e58078","observation_id":"30ff767b-59c4-4bf1-8691-dba56165d421","resolution":{"observed_at":"2026-08-05T13:05:54.126692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.996743Z","title":"something something","venue":null,"work_id":"4ae1c6eb-39d2-41c8-b61c-2815328cf755","year":2017},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.163677Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:c4a135294643e7f18ec233212bb4cd31a8e9eee13c76462fab3a52fab0a5fe8c","observation_id":"7963f233-83ad-4476-8f33-3e858db0c826","resolution":{"observed_at":"2026-08-05T13:05:57.006612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.985548Z","title":null,"venue":null,"work_id":"7045a75c-ec85-4b94-8752-f5b2d846921f","year":2019},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.175024Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:7c1a54061b99bc84c35f81e21412010902cfe0fd1871fed920d4460e025de247","observation_id":"656a4fd0-605b-4fe3-aaed-9e6b92553960","resolution":{"observed_at":"2026-08-05T13:05:56.988491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.974179Z","title":null,"venue":null,"work_id":"7f947c31-ed08-4fb2-8ce1-b818571fdae8","year":2019},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.213261Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:8559f4d5a8d528683fb2187542b258c1dc25e4e3b70e11fe45947f61c6e5dafe","observation_id":"c8369171-f4de-4de8-a44b-0619cc4f5a02","resolution":{"observed_at":"2026-08-05T13:05:56.977478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.962439Z","title":null,"venue":null,"work_id":"f0f3b2e4-194a-4fe9-ad1f-7774d199eb6b","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.230744Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:9f15c925df72a2e01bc719c75315461fc1b6c899c47e27277f8df7ba25ae4c22","observation_id":"e3cae302-8947-4497-bd34-7b0087cb4523","resolution":{"observed_at":"2026-08-05T13:05:56.965785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-05T13:05:54.267164Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.267164Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:bc0c74974f9ce482c1b50ef24b355a4bc458c17980d1a87dd776484e30df4033","observation_id":"df9c99fa-17c8-4d90-a87f-994d1b2549ce","resolution":{"observed_at":"2026-08-05T13:05:54.267164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.952072Z","title":null,"venue":null,"work_id":"3650c759-e9b5-4809-8994-d98cb01df589","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.304338Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:4e205b7fb389e354135a4b5eecb9a766b4b76ef1c4013d480c45fbb891e608cc","observation_id":"b2ac6a30-6a71-46a5-8d33-61a69186265d","resolution":{"observed_at":"2026-08-05T13:05:56.955306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.941982Z","title":null,"venue":null,"work_id":"c5478238-05e0-43fc-877a-75e01d58b9ad","year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.345335Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:8b5af6403252afcef08d67ee71adac7920edcb63044dadeb98baa49bbf89b99e","observation_id":"45f76a06-6955-4e83-986f-d7d40c10be68","resolution":{"observed_at":"2026-08-05T13:05:56.944892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T13:05:54.367396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.367396Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:91c956c2e6928b3782c8830a12e4aff3b6c650af91b6efe7b4fe63aa21a7239a","observation_id":"53f00fa1-41cb-4adf-bc27-2b7712cca3ae","resolution":{"observed_at":"2026-08-05T13:05:54.367396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:54.407668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.407668Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:fe8b09fdeb4d1c2b33a3058d4ff95f26ec81d4c7380e3083a1d08359b9fee2b8","observation_id":"c53423cd-a64f-4ffb-8d3c-16d32a626f8e","resolution":{"observed_at":"2026-08-05T13:05:54.407668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-05T13:05:54.422800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.422800Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:889f15bd25727ead16c3773b943de9417d0481d540627f7914468f03415867a8","observation_id":"4b131883-97a4-4f14-97af-e2abeb8c3d79","resolution":{"observed_at":"2026-08-05T13:05:54.422800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-05T13:05:54.478225Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.478225Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:a7aeee8c1be90d6fb312f4b9514d65535811c9a04fa4159032cb853ff809d173","observation_id":"6c41d5a6-4e76-40c6-adc6-d2060604eea6","resolution":{"observed_at":"2026-08-05T13:05:54.478225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.925025Z","title":null,"venue":null,"work_id":"6df7e5bd-81b5-4836-898e-48597fab3eb3","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.537883Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:f9866680a5928d4587c3a16d3b71b37c5f5148af661d7dce79f0b8deb23b1782","observation_id":"d189ee06-e847-43e5-bc8f-a8d55761c9b0","resolution":{"observed_at":"2026-08-05T13:05:56.928365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:54.626918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.626918Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:4ebc4d7fd1614c297f59bb1fc09aa8f6925eb33affd43561604fd3b40ff3c431","observation_id":"908088f7-fd8d-4088-8056-6a83a82e5dd7","resolution":{"observed_at":"2026-08-05T13:05:54.626918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.914926Z","title":null,"venue":null,"work_id":"1a616b02-a84a-499d-8160-7482dc47ca2a","year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.731172Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:8fea30177d5e71c500a31090b573f430e6c986712c2f825edcb670f8cfac6eb2","observation_id":"56b263f3-4ca1-4088-8d93-cb68876d970e","resolution":{"observed_at":"2026-08-05T13:05:56.918008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.905728Z","title":null,"venue":null,"work_id":"c0f4f17d-5435-4eeb-8cfc-f124b08c7cb4","year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.782248Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:ae67f496524e746ada9d558f82eb2d660462d70812fe5d0657a838ad8d52346c","observation_id":"b001d0d2-5c6e-4698-a81e-97dcb9b60390","resolution":{"observed_at":"2026-08-05T13:05:56.908659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:54.790967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.790967Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:2ae0639f8873b38236359dd47aaddc67d34ad343839dd0f9b656566a9cb80193","observation_id":"4ad8e511-e310-4792-95d6-3f350695e653","resolution":{"observed_at":"2026-08-05T13:05:54.790967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.889378Z","title":null,"venue":null,"work_id":"458bfcee-e40d-41db-a536-a0bfbdcf5235","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.797709Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:55e6192128c22fca9d03c8c5d1527aa4ae06ea1b661b3ad116cf7591071cc6d4","observation_id":"53c833c4-00fe-4e23-bec0-cadc49a3b59c","resolution":{"observed_at":"2026-08-05T13:05:56.892820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-72998-0_1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Lecture notes in computer science","work_id":"2280b27f-ace2-4e33-b582-bbc41480235b","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.817737Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:33852ce19a68a98bcd91654eee1cc9906ca31fbd231c9ac449e5928764871490","observation_id":"6c48193c-9fa1-45ec-9f52-1f2faa13b998","resolution":{"observed_at":"2026-08-05T13:05:56.531169Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-05T13:05:54.875262Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.875262Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:44d1025c329e69fa5087cc67d12793641f336fe87c9c18e4f6442b3c8ace84fd","observation_id":"a6630497-dc85-42bc-83c5-efaa1c28942c","resolution":{"observed_at":"2026-08-05T13:05:54.875262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.880045Z","title":null,"venue":null,"work_id":"6fc3b487-c718-4e26-be52-bcbdfb10dc70","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.971859Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:608cee8124666c3c178c55a2cc593ad74fb831a2073feb3d4aeb8711434de206","observation_id":"d2ced70f-f85b-4c34-bdf5-e2df936bef70","resolution":{"observed_at":"2026-08-05T13:05:56.882918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-09T01:53:18.568676Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-05T13:05:55.083406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.083406Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:1ca0aa1768d226f616c591e40b82b8355d1b20477dff2145f615aca3a6af88ff","observation_id":"12300213-6095-433b-8b26-6bece59e0d14","resolution":{"observed_at":"2026-08-05T13:05:55.083406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.869584Z","title":null,"venue":null,"work_id":"1b8f6c0b-685b-44a1-88bd-408e1c479b3c","year":2022},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.168318Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:a41ca72defac12803c9a8e8267f826204e80511be8065f4fb995a73222dcbc87","observation_id":"32a734d8-0c95-4c5d-aacb-cb97f6a28e5f","resolution":{"observed_at":"2026-08-05T13:05:56.873199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-08-05T13:05:55.211311Z","title":"Koster, Junlin Zhang, Stephanie Winkler, and 5 others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.211311Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:9c7222141b5342dc1bf9ebdb470991c709fd9830ca77b448f844083c53cdb400","observation_id":"7f192378-6656-46d9-82d4-cce3ea3690ab","resolution":{"observed_at":"2026-08-05T13:05:55.211311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:55.293574Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.293574Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:eb00d9d81b767b9aaafe9914ec98c2e2fbdaa581caeeb180316385455deb8288","observation_id":"5efc6ad7-758e-4d84-ab19-fe4b4297cca6","resolution":{"observed_at":"2026-08-05T13:05:55.293574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.853343Z","title":null,"venue":null,"work_id":"c7a29474-822f-4030-98f0-93cfb419b07d","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.363817Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:f301fe922a683cb91435b7fc1bb1c4bceb8472fda9b17c2d31f65f06e7aac0a3","observation_id":"b509660e-f94a-44f4-8710-8c1f3035b75e","resolution":{"observed_at":"2026-08-05T13:05:56.856410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.843466Z","title":null,"venue":null,"work_id":"a65372cd-415b-4ca0-82b1-0c8cadb2f0e0","year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.406091Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:64852e2c551da77459dfd75ed2139d5b25aabb8d1f1a60450ed648abd910e7ca","observation_id":"1fb4b155-49b7-4811-84df-94f42a5ad213","resolution":{"observed_at":"2026-08-05T13:05:56.846261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.832627Z","title":null,"venue":null,"work_id":"66c73b7a-af60-4e9d-9367-45b2ed717838","year":2025},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.466123Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:4734dad0421f34af871a5b65c28fb1c221b86c0f337fb41d7abd30b2a503d297","observation_id":"24428157-7a14-4ced-8cbe-2c3db02157c5","resolution":{"observed_at":"2026-08-05T13:05:56.836332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.822047Z","title":null,"venue":null,"work_id":"f735397a-dc61-4d17-ad3a-6fc1a8c16643","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.512481Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:bae21ee31e9302cecbdc944ea3a035fc86b0d6af5b7d36618d82b1dfe347af00","observation_id":"9ddb16e0-3e75-4641-8258-fb9e5640614c","resolution":{"observed_at":"2026-08-05T13:05:56.825240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:55.584430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.584430Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:eb67b80310b08664d669f20d98e3fe7d217b8b78434312701297faf0616ad32b","observation_id":"d5344a12-99f3-424b-b19e-99df6a1295f8","resolution":{"observed_at":"2026-08-05T13:05:55.584430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.804977Z","title":null,"venue":null,"work_id":"d28ec1a6-73e1-4d87-b320-320f22c73a73","year":2019},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.654485Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:3182045bc94c3b44c5a90463de80dab2db951a6b0bb44c087dac76e30c6fdff1","observation_id":"35343478-ec9f-496f-b0dd-78614b9c746a","resolution":{"observed_at":"2026-08-05T13:05:56.808257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T13:05:55.724253Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.724253Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:8abb151be10e9aaef0555b9706591e6b5b82a9cbf64342ef9de24ef25254230a","observation_id":"66c95aa7-e169-42e3-8816-cfcd532bcb56","resolution":{"observed_at":"2026-08-05T13:05:55.724253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T13:05:55.794328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.794328Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:f500aee4c35c1843bcb60e92b32850402a18beda489b12b347c379008c719067","observation_id":"9c72c10a-aa91-4c35-b588-6183f952f355","resolution":{"observed_at":"2026-08-05T13:05:55.794328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.794113Z","title":null,"venue":null,"work_id":"ee2e42b1-5207-4567-af88-b1671f172caa","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.839359Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:b91c8b3fe316b2a3739bcc9bceb8a05e71a1d882884e7e8c4dd0332d5c7d2d53","observation_id":"d0ee8bd6-f100-4136-8876-c03688e45bc4","resolution":{"observed_at":"2026-08-05T13:05:56.797175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73414-4_26","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Lecture notes in computer science","work_id":"a20ac83e-d628-4a78-b0e6-e96ec62fc684","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.894783Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:8c93a3d6ececfb374f8adbaa0eae5f4cbc3c973c8c0838807cd379db40452e8c","observation_id":"a35eae8e-1978-43cc-b43f-da23d8134e7e","resolution":{"observed_at":"2026-08-05T13:05:56.520197Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:55.937129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.937129Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:ea23e6afa97f035940d59a59b3596b16ab72b0beda760fe5828735426a2f6f26","observation_id":"e3736764-6d94-4e73-8a19-b65e5879f412","resolution":{"observed_at":"2026-08-05T13:05:55.937129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:55.979545Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:55.979545Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:174db106e71d84a23df25553dcf654393907704f37fc668fe21de5cd668aa9f9","observation_id":"f0343381-ce90-4446-a91b-08601cc6c9e3","resolution":{"observed_at":"2026-08-05T13:05:55.979545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.770011Z","title":null,"venue":null,"work_id":"c1cb7a29-20bb-47c5-8963-304e05ccca6d","year":2017},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.002741Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:7e6d2dccc54241e80bdfdd4b9942728a2c2fbe7e1e36ce1dc6ea8aaf0f91b586","observation_id":"10f2929c-0710-4e3d-b7f2-c63bd70b44e9","resolution":{"observed_at":"2026-08-05T13:05:56.773627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.758320Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":"e4d55b26-6901-418f-aa48-36b49e5d9cd4","year":2025},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.058383Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:cffbd46bf3ef92fb5a7ba84d50a9e9a05a96ee8435d8d879c6506c52d53bcf2f","observation_id":"e6da866d-f3be-4087-b9b3-4587f6eb0075","resolution":{"observed_at":"2026-08-05T13:05:56.761756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.748263Z","title":null,"venue":null,"work_id":"7bc7a3c5-eade-4198-8768-d12818144d1c","year":2025},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.102237Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:69816f865dff28a6c56a35e59aa2f723b2d52c6c846dc505c9d4708877641112","observation_id":"c78a3461-6b53-4510-b9aa-1b2910607279","resolution":{"observed_at":"2026-08-05T13:05:56.751423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-05T13:05:56.164738Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.164738Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:f63f065d386f35bca32ee46a8912a85690650fadb41c794aebd637d1d0d0fc63","observation_id":"c60e3fa1-6315-425e-b4e2-141155b5ec52","resolution":{"observed_at":"2026-08-05T13:05:56.164738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.737462Z","title":null,"venue":null,"work_id":"de0ee869-32d1-4302-b421-6b016bd079b1","year":2019},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.215245Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:a7824d369ee5c14c2e25d33335f36cd03e4a93ec96c3d6a250a56993e7b8af71","observation_id":"44f6258d-6830-47b4-9121-e95269b6d565","resolution":{"observed_at":"2026-08-05T13:05:56.740895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.273972Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.273972Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:6476f47ba7bdf04eba6781fff98fb6251c7bc9088de662c71a0bf6775edf1fb5","observation_id":"cf62ef30-a320-401e-baba-17efa35e793c","resolution":{"observed_at":"2026-08-05T13:05:56.273972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.727669Z","title":null,"venue":null,"work_id":"d7ce82f9-a130-467f-9da9-db9cdab7dc29","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.324177Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:0b052b4b906fe7ecf1667d5fb06db46d45e2c0025bd1427d5bf4b15e6810b065","observation_id":"434e5fa5-6559-4f83-930a-34765c97f39a","resolution":{"observed_at":"2026-08-05T13:05:56.730852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:05:56.717531Z","title":null,"venue":null,"work_id":"27a20d05-2929-48d6-b43a-b18ea46ad3ba","year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.337483Z"},"links":{"citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:ad5122d4c8076f13c1273f7ef96e70058e1c79a3e8897a62125be3af11ba3634","observation_id":"451a5ec0-1aea-40c2-be0e-11e1cd09b5f8","resolution":{"observed_at":"2026-08-05T13:05:56.720709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T13:05:56.397948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.397948Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:b33c4ff924b22e2a319b9997dd86cd2bb0e4ce8be4026a695ea7c65136e97880","observation_id":"be70dd87-0aee-4f07-a90a-33ab85d0a529","resolution":{"observed_at":"2026-08-05T13:05:56.397948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T13:05:56.484408Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.484408Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:ff5ae1958150892437621c0039f14dbb60e6041a99f2457e73de10d600251e50","observation_id":"469b897c-590b-4a9d-a34a-adaacffc4b8d","resolution":{"observed_at":"2026-08-05T13:05:56.484408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2509.00969."}