{"as_of":"2026-08-14T07:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eeb5daa9089a0e22d717ace9535ee1f245409388e6d11f39824a78c2c05e16cd","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:56:05.432793Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:51.641946Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:29.938511Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-08-02T20:14:05.052870Z","title":"Dyntok: Dy- namic compression of visual tokens for efficient and effective video understanding.arXiv preprint arXiv:2506.03990, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00198","last_updated":"2026-07-01T00:40:56Z","snapshot_observed_at":"2026-08-08T00:25:26.077628Z","submitted_at":"2026-02-27T08:11:06Z","title":"Stateful Token Reduction for Long-Video Hybrid VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:05.052870Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2603.00198"},"observation_digest":"sha256:5143316f36ba8b9ce309d0e0c8aaaf048eac27d878ab85be5a121e80021c983d","observation_id":"5b063c2e-aa4d-4da7-973c-621e23709d06","resolution":{"observed_at":"2026-08-02T20:14:05.052870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-07-04T03:19:29.938511Z","title":"arXiv preprint arXiv:2506.03990 , year=","venue":null,"work_id":"9f7446a4-8c5a-4dea-b3ba-b307cabcb570","year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-06T15:40:32.013079Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:ab9286956d503533f20797560b6d6059bd9e49708ad4302ea96f8afefd85ce82","observation_id":"3bcde7a0-8149-44a2-85f6-c3ce2e762161","resolution":{"observed_at":"2026-07-04T03:19:29.940719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-07-04T03:19:29.938511Z","title":"arXiv preprint arXiv:2506.03990 , year=","venue":null,"work_id":"9f7446a4-8c5a-4dea-b3ba-b307cabcb570","year":null},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:aa71dc4439783490cd2cfeaa8782b923a7ad9a67ce01958ea5c5a5397e092832","observation_id":"62bd9af1-87b9-4723-8fd0-00f2d8d2e4a5","resolution":{"observed_at":"2026-07-01T11:55:42.206405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-08-04T23:46:51.641946Z","title":"arXiv preprint arXiv:2506.03990 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-10T14:57:44.819541Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.641946Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:becfec24dead3be57048f8a2024282d69de29c6a379d33413cac2c486ff33a2d","observation_id":"84d2da63-359b-4e4c-9943-42b6095c3fb3","resolution":{"observed_at":"2026-08-04T23:46:51.641946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03990/citation-record","integrity":"/paper/2506.03990/integrity","json":"/paper/2506.03990/citation-record.json","paper":"/paper/2506.03990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.981119Z","title":null,"venue":null,"work_id":"6b3bf6b9-84be-4c54-b00d-273296175148","year":2022},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.276195Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:cf3b23d5c32ac982ff7e5e11296736d3bd3ad1f78a8470d0e35b2f323f4fca8c","observation_id":"aa61887c-8890-4ecc-bfdf-96752c60cec1","resolution":{"observed_at":"2026-08-07T10:56:05.984503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.970665Z","title":null,"venue":null,"work_id":"e4219b2a-717e-410d-a485-c9b42ddb5d7e","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.280476Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:c0c32aca37efa231b102b2f4608de4392889650278520877393dd2185392f0bc","observation_id":"dc61cc26-beb8-430d-85f6-82c0ca483762","resolution":{"observed_at":"2026-08-07T10:56:05.974300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.959770Z","title":null,"venue":null,"work_id":"7cf67ebf-1e58-483f-a370-0c73dcd04d9b","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.284562Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:bcc5f24fbb63cd634e43fd60b03561a7228912d85d297a7d39efcd46aa42c8c5","observation_id":"c79db32a-ddd9-407a-a895-d22bc85a8470","resolution":{"observed_at":"2026-08-07T10:56:05.963475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.948786Z","title":null,"venue":null,"work_id":"a910f232-63dc-43c6-a651-6bb62a8806f9","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.288049Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:2486ce40cf5ef4788af2d2207cd678c6ca80e715144ea44f1babb6d08ab930c8","observation_id":"e9bc4e7f-5737-47b7-bc18-3eda5692741f","resolution":{"observed_at":"2026-08-07T10:56:05.952522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-12T23:57:02.109382Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-07T10:56:05.291412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.291412Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:501e2dabe7bd6078c6955723107623afed8f0e7422a18bda967472ac8a1e5c6b","observation_id":"2a779ba7-a508-414c-a14a-7e710aa26f10","resolution":{"observed_at":"2026-08-07T10:56:05.291412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T10:56:05.295051Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.295051Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:af7e99c962ec65b705824afce4341e156e3edd73c308965cf554bff16c9a916d","observation_id":"d4c6e30f-30cf-4d31-b3da-6649ec251dc0","resolution":{"observed_at":"2026-08-07T10:56:05.295051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T10:56:05.298607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.298607Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:0acfab7e8008e7fd577c05711cfbb1a5901d0eb4cb846a47515027ac4fa6b83f","observation_id":"33af4884-a719-4c17-889e-bf36fe9aa410","resolution":{"observed_at":"2026-08-07T10:56:05.298607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-07T10:56:05.302047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.302047Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:7b9597ee1c24fc7cdf10a1c1aeb6d85b6767895734c940913271239d20924091","observation_id":"9dc5e770-71cc-4304-8aad-4f9b10a4b007","resolution":{"observed_at":"2026-08-07T10:56:05.302047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T10:56:05.305472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.305472Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:6a3bd0cd7483ae909187260b4f95bc49dafd033df009cfe3f3f46351b3d8a6f4","observation_id":"26f4b637-9060-4488-80eb-9c2a838b3e8f","resolution":{"observed_at":"2026-08-07T10:56:05.305472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-08-14T04:36:49.170070Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-07T10:56:05.308899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.308899Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a6a2e23aaa2089f81da88c26ab4797adcc42c88763e3f52030ae7f578a3c5b08","observation_id":"a916a4f9-d205-473b-b4f7-13df30d1a489","resolution":{"observed_at":"2026-08-07T10:56:05.308899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19315","last_updated":"2024-06-07T03:39:04Z","snapshot_observed_at":"2026-08-12T23:54:55.937841Z","submitted_at":"2024-05-29T17:39:42Z","title":"Matryoshka Query Transformer for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19315","snapshot_observed_at":"2026-08-07T10:56:05.312460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.312460Z"},"links":{"cited_paper":"/paper/2405.19315","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:420ca9bea9bda6b11ab65cf756fedccaa041f1ac4b91ab3f747179468eb20954","observation_id":"d5b5039e-25b6-42c4-90b9-336ed569aca1","resolution":{"observed_at":"2026-08-07T10:56:05.312460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.938259Z","title":null,"venue":null,"work_id":"84f429e0-e05d-4407-b8f9-5158e6a15069","year":2025},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.315715Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:37a7accd5d6a964d557924ba44aa7f63144b268836d6074591a733414a8797d9","observation_id":"e6f80ed6-3d9b-4dc6-b009-6f5c563b7436","resolution":{"observed_at":"2026-08-07T10:56:05.941866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.318608Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.318608Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:1a99d2186e7055c4c35fdb0cbad4a1598f30c57c9452eb787e209ccb04031656","observation_id":"da39ac70-4056-459d-bb73-49d2f7a73fe0","resolution":{"observed_at":"2026-08-07T10:56:05.318608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-12T22:28:12.899379Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:56:05.321429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.321429Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:69e2309b4db42336d82d0cb7a755f935e3514e05d42e9351b78efa0f1da7655d","observation_id":"264fb417-cc39-45a4-a218-e19a0cc9fa8d","resolution":{"observed_at":"2026-08-07T10:56:05.321429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.324395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.324395Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:70c3efc22e86ef326345794d7ed15325e2202f1e0532ed80a4ed7d27e5cdfff4","observation_id":"dfbdef21-7869-468d-8320-59bfb76e569e","resolution":{"observed_at":"2026-08-07T10:56:05.324395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T10:56:05.327297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.327297Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:55cacea76856210456ada2603db268d1f12c4cdc3b86bc3cd2dc224da5a0f873","observation_id":"fb72792c-376e-40b7-80b9-4ed91c6044b2","resolution":{"observed_at":"2026-08-07T10:56:05.327297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.913609Z","title":null,"venue":null,"work_id":"b6f215b7-aad0-4948-99e3-627cad945cbc","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.330290Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:973ddec79beeb0c591a3a7260557192a65fdfdbbb4c6a5649104aa3e0a115039","observation_id":"13319851-0f2b-40b7-8362-c5ffbd386569","resolution":{"observed_at":"2026-08-07T10:56:05.918195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T10:56:05.333184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.333184Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:c8faffaf5ba87fae2580411616492b1eb9ec2e9c2d37d4bd65e7d110026cb16f","observation_id":"81818563-8738-439b-a096-f401ce88c5b9","resolution":{"observed_at":"2026-08-07T10:56:05.333184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.336628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.336628Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:3ffda06d687187fa389e34e3c482a9c0e62659e9755258abd4e80fa9aa3bd1e8","observation_id":"2ac41062-a81f-4c23-8768-e9838f583c2a","resolution":{"observed_at":"2026-08-07T10:56:05.336628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-12T23:43:17.035818Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-07T10:56:05.339561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.339561Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:6b1eaf7442fdb9bc07b33acb24b33476dd5e445f37606155fa9bfe3a6fac428e","observation_id":"bac04eb9-4d82-49b6-bc64-11e7635497c8","resolution":{"observed_at":"2026-08-07T10:56:05.339561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.897504Z","title":null,"venue":null,"work_id":"5261f50d-d0a9-451a-8418-b3854c6356e8","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.342903Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:5e4ca2108f49125f511425678b18f8d86f278db62900d9e19c46e6182ec6432b","observation_id":"8f293930-0977-4141-a852-9528cbacc60f","resolution":{"observed_at":"2026-08-07T10:56:05.900748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.886401Z","title":null,"venue":null,"work_id":"d8a9ffa4-efa8-441c-8037-af5126c7e409","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.345833Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:69f655424f3e3ab12e4caa695cb1184d643eb19996257102a4b99c4c0143948f","observation_id":"b21742c1-cb48-48f8-9e18-72ff9f469fec","resolution":{"observed_at":"2026-08-07T10:56:05.890243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.875465Z","title":null,"venue":null,"work_id":"d1a92aa2-d5f1-48eb-8d06-0d562a1f0aa1","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.348695Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:9618fc3325a5e69793d5047282bff42b3bb5c62df9c8eb2fa42b73452ebbfe33","observation_id":"20152ca6-858c-4b66-ad82-e400bf1af8e4","resolution":{"observed_at":"2026-08-07T10:56:05.879074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.864382Z","title":null,"venue":null,"work_id":"916908b5-1dcc-4a63-a487-4fd8f1ebca84","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.351703Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:52e053751fd685f1d34a6f11c9339cd02532a329d73270c3c0ded4b5f1e7b1b0","observation_id":"0d1ff616-b72e-42c1-8406-557aaa997bec","resolution":{"observed_at":"2026-08-07T10:56:05.868075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-08-13T01:33:21.194051Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-07T10:56:05.354802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.354802Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a6aa0a772654381559566dd54ca8daddcb6902175046fabcfc2ff832634aac25","observation_id":"53677ca5-1ac8-42b3-9335-e3510cf0ee6d","resolution":{"observed_at":"2026-08-07T10:56:05.354802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.358235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.358235Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:961a67541b070483a28263c48b49365d0febd57db4a2810cbb49fe1c7cde0e84","observation_id":"64ec724f-b4c6-4fcc-a125-e0bdab7eedd9","resolution":{"observed_at":"2026-08-07T10:56:05.358235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-07T10:56:05.362186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.362186Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:97d71134c11619ef0e3216bf597aa69903abdb736ee8045dbd0c925adcda1609","observation_id":"f2792e61-63a5-472a-8d51-e05cbbedfa04","resolution":{"observed_at":"2026-08-07T10:56:05.362186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:56:05.365504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.365504Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:f249e1f702c0b49d8d0addd0a7aec5d12ad6f86d3e06edcade7af288b28216e7","observation_id":"106473ca-fc15-413e-9740-5656892a4c6f","resolution":{"observed_at":"2026-08-07T10:56:05.365504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T10:56:05.368592Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.368592Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:1c740268ba8e717d49ba140a2624e528748b766ca80945095bef9ec686765862","observation_id":"64346559-2710-49cb-890b-c1fc11bfaf92","resolution":{"observed_at":"2026-08-07T10:56:05.368592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09530","last_updated":"2024-12-12T18:20:41Z","snapshot_observed_at":"2026-08-13T22:05:52.819323Z","submitted_at":"2024-12-12T18:20:41Z","title":"Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09530","snapshot_observed_at":"2026-08-07T10:56:05.371800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.371800Z"},"links":{"cited_paper":"/paper/2412.09530","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:25c99bd67c7d2fbd794d0f21b59578a9ba015b5d3aa10f6c6992e810acc7d793","observation_id":"559084cc-f064-4cc9-8f56-f56b9d8f608a","resolution":{"observed_at":"2026-08-07T10:56:05.371800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T10:56:05.374864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.374864Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:c0680da65297d9fddca12832b741e7f2a692298656f9a3af2cee5cee8545f46e","observation_id":"73c33537-a5e3-4dc3-b645-08885b5d2b8c","resolution":{"observed_at":"2026-08-07T10:56:05.374864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.854070Z","title":null,"venue":null,"work_id":"355e8719-15ed-4897-9afe-68ec45dcf8f2","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.377969Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:f99ba47a3f8a30b7d798b203e8842e2ae58f9b05920e34d32bd7948a21e5d021","observation_id":"5f45281d-0bfb-4c17-81bc-01fc47dc6ea7","resolution":{"observed_at":"2026-08-07T10:56:05.857436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.843743Z","title":null,"venue":null,"work_id":"c02e792f-1d66-463b-a43e-7ebe0ad01500","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.380731Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:c9ec38a4e5e4005f1ddc539acf77cd9d70fe3f6a90d37ef419eaf2aaae48ec46","observation_id":"fe533a48-10ce-4d8c-beb2-38ac03429af0","resolution":{"observed_at":"2026-08-07T10:56:05.847252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T10:56:05.383591Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.383591Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:8ad666023ffa908097a24e28ce804fd4f9af166523641db3025339f574121105","observation_id":"ca11976d-f9ad-4707-a57a-bbee01e75148","resolution":{"observed_at":"2026-08-07T10:56:05.383591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.831069Z","title":null,"venue":null,"work_id":"7db71654-ad47-45ed-af24-aab53c9acd29","year":2021},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.386907Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:d223a8d185ba7c5954c213543555c0ad88f57305c300f200da5b99fab639bfb6","observation_id":"8ae79a53-3939-4976-a6e4-916cb7ee8073","resolution":{"observed_at":"2026-08-07T10:56:05.835679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T10:56:05.389890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.389890Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:55129ced2d3d3a82b525d053c1bdc980581c8a8e42705063185344792c9f16d4","observation_id":"b80eb3c8-54d4-45d1-975d-01eed4caa809","resolution":{"observed_at":"2026-08-07T10:56:05.389890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:56:05.392924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.392924Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:cc97b2e7f9fde061de6aaccccdfb0f7aec0536bfdfd2f8bed26d499edbbf994d","observation_id":"6a589e1a-66ac-416d-80f8-67ffa2397b8b","resolution":{"observed_at":"2026-08-07T10:56:05.392924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.396090Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.396090Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:5ad6dcd09d8bec551d0ad24d64fccdb624f79020ad6c640cdc7107ab15a1f5bf","observation_id":"c81d325b-2bb5-4b51-8784-28bdf7bd4a62","resolution":{"observed_at":"2026-08-07T10:56:05.396090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:56:05.399011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.399011Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:ef06425f4b072a3fa773533e5fb026cb3a159c6dfdb9b504f71a4872f62b386d","observation_id":"2d1ab832-3f2b-4656-a918-af0566f5aa48","resolution":{"observed_at":"2026-08-07T10:56:05.399011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T10:56:05.402373Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.402373Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:86e55f2a8fd18808756b6ccf1efdd541f20a1865bd9254d7ff0771017999f0f9","observation_id":"6e6a6b50-4c14-491e-9a18-6c60e07f2cc0","resolution":{"observed_at":"2026-08-07T10:56:05.402373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T10:56:05.407052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.407052Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:ac72b8622d55f1401fd40c03d677cf7e64c91ac3f0e011029642bb3e00cd683d","observation_id":"29db3ad9-d287-4e59-8754-7cbb96c444d0","resolution":{"observed_at":"2026-08-07T10:56:05.407052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-11T01:31:42.961611Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T10:56:05.411061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.411061Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:410a4fa7aa1adbee8be3faf8464cd8428cb7f215934de0e7b9d6bc513f559139","observation_id":"d1f0c0cb-268c-402c-aad2-c20d039f92d4","resolution":{"observed_at":"2026-08-07T10:56:05.411061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T10:56:05.418612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.418612Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:025797d4ba00592c0d2b7288fba61d87d31c5613166755c241c7ee4b088e623d","observation_id":"500a1ece-fc59-4481-a16d-988122648280","resolution":{"observed_at":"2026-08-07T10:56:05.418612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T10:56:05.421882Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.421882Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a60f880aa2f38f15182f10cdb8230156934b9404a5833ad979a184cdf8702ba9","observation_id":"a0b9f381-ede6-48c1-903c-f0c0bcad59ca","resolution":{"observed_at":"2026-08-07T10:56:05.421882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.425465Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.425465Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a1b0d26ab5c28389278b1e69011f34787a610a16f8fa05f1968b5f3251440fb2","observation_id":"1ad1be84-66b9-4d36-9bc9-d868946137e9","resolution":{"observed_at":"2026-08-07T10:56:05.425465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.428727Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.428727Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:79c3751fb079957ff184911693bbae25e9f33dcf4086ea1179a41616a39cd568","observation_id":"4cc700f1-1743-4f53-81f9-3d7a5be55d0b","resolution":{"observed_at":"2026-08-07T10:56:05.428727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.432793Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.432793Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:01976dbbfcb55d21ec679b3942e8b38252b878f58c92d368652a385e93be5b4e","observation_id":"b331cc54-46dd-4cba-be33-02492310fb91","resolution":{"observed_at":"2026-08-07T10:56:05.432793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2506.03990."}