{"as_of":"2026-08-15T14:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ee7a924620b8ee506880e3338bda2c59ea597801c29af8ce0816f1625f7000c","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:15:05.248695Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:35.137666Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:57.149192Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2604.08077","last_updated":"2026-04-09T10:48:32Z","snapshot_observed_at":"2026-08-14T07:58:36.169265Z","submitted_at":"2026-04-09T10:48:32Z","title":"AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:47.439019Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2604.08077"},"observation_digest":"sha256:4d6bc28835a9e3013bd8ed2cccaa1c1dcffa7f5af5ac7dfc5f1eb885f5e681c1","observation_id":"0b6ad907-50e4-4dc3-bfa1-ecd47740152c","resolution":{"observed_at":"2026-05-11T06:56:04.269758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-12T15:34:37.002001Z","title":"Q-Frame: Query- aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T15:34:37.002001Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:25bbda5c173e26dcda5b42f09281bf9ce43bdbaded7fbbde3316f66577e4dede","observation_id":"33844b79-8431-4eda-bdce-8ca1e28b38dc","resolution":{"observed_at":"2026-07-12T15:34:37.002001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-14T18:39:24.915547Z","title":"Q-Frame: Query- aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T18:39:24.915547Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:d74c34cdd4e658b1d0eedb981f4056015556f29e30a3d4bb0915ff55b65709cf","observation_id":"eacdb4a2-0578-4ee1-87d6-3cc48c57148e","resolution":{"observed_at":"2026-07-14T18:39:24.915547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2605.31029","last_updated":"2026-05-29T09:01:56Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T09:01:56Z","title":"PEEK: Picking Essential frames via Efficient Knowledge distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:53.704892Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2605.31029"},"observation_digest":"sha256:52d772c02435e327a59ab71715893c5fe9ba5c097fb85ce1acf9d5c5745a4932","observation_id":"079f6c34-65d1-42bd-aab7-82261c6a427e","resolution":{"observed_at":"2026-07-01T19:16:01.318490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2606.03100","last_updated":"2026-06-04T05:13:15Z","snapshot_observed_at":"2026-08-01T16:37:35.015535Z","submitted_at":"2026-06-02T03:38:51Z","title":"Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T10:54:02.188634Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2606.03100"},"observation_digest":"sha256:00169fdecf5be8270b417daa405852f1f3ba045db29bcf0bf6f7b886c2c94002","observation_id":"9498d452-63c8-44f2-8693-0f8a72695bb3","resolution":{"observed_at":"2026-07-02T02:26:27.027565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:844670388b18a4e769da0481d11e7f4adc7e61e02b57211f0fbf0581c743ace1","observation_id":"de4ae604-e237-4b7a-9565-2c18234cc729","resolution":{"observed_at":"2026-07-02T17:27:15.057718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2606.24187","last_updated":"2026-06-24T04:06:43Z","snapshot_observed_at":"2026-08-12T20:32:05.568631Z","submitted_at":"2026-06-23T06:13:30Z","title":"Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T00:53:43.629684Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2606.24187"},"observation_digest":"sha256:7ba30768f849c40d4f9d63f59ae10dc905d3ca5b7b4d3d722b4595ee9fc94ed9","observation_id":"9824f3dc-f80b-4c09-b06c-904f35ade8c6","resolution":{"observed_at":"2026-07-04T16:09:57.150830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2607.00983","last_updated":"2026-07-01T14:19:24Z","snapshot_observed_at":"2026-08-13T08:15:37.802200Z","submitted_at":"2026-07-01T14:19:24Z","title":"QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-02T14:09:54.549499Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2607.00983"},"observation_digest":"sha256:c595e6c15da6c2ca53c1b1b0a01633c91aa8f6b4c4b1d65fa9c4aa88a651a022","observation_id":"5051ba87-dc57-4d7a-946d-cbf469c36426","resolution":{"observed_at":"2026-07-02T14:17:02.668832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-08-07T23:42:35.137666Z","title":"arXiv preprint arXiv:2506.22139 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-12T19:31:11.240092Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.137666Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5de67402c9c5790c07d08f9bb5c578f7a898297ba2a75ec73b4f6d57d979f9f4","observation_id":"83ce1718-bef9-4d79-a24a-13456167b10f","resolution":{"observed_at":"2026-08-07T23:42:35.137666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22139/citation-record","integrity":"/paper/2506.22139/integrity","json":"/paper/2506.22139/citation-record.json","paper":"/paper/2506.22139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T22:15:01.915030Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:01.915030Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:7913b6651aebe4773d44d2472a66966a8f470c6fc164e378a2429687ef430b06","observation_id":"a2c548b6-25d1-44d2-ac91-7ec88012bc3a","resolution":{"observed_at":"2026-08-06T22:15:01.915030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.965440Z","title":"Robust motion-guided frame sam- pler with interpretive evaluation for video action recognition","venue":null,"work_id":"e2879679-1bf2-4399-bd2a-4eb2afcf2aa7","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:01.967902Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:e70bc2fdb258c84214977087009fb5ce151752942331fffd8b83161f0d01173c","observation_id":"ea63bb34-9624-424a-a837-d4b9cafa0642","resolution":{"observed_at":"2026-08-06T22:15:09.053397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.798623Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"f163a7dd-5d8d-4426-8e61-edcc02b2ffc6","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.033532Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:7143810e1b3dd11bb754a051b77e297baf449c0f7ef2194b04f0e1bf42f0ff00","observation_id":"86249126-8260-4bac-8d4e-d5b7523ba862","resolution":{"observed_at":"2026-08-06T22:15:08.884299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:02.128356Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.128356Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:0ef5ba85891a1edc67b73bcf6e29e71bec593f23a24c8ded5aed3f2b615a8187","observation_id":"5ca6dea2-4ce0-4342-9bda-680746d4e6d6","resolution":{"observed_at":"2026-08-06T22:15:02.128356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:15:02.241212Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.241212Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:23fd9fba35ca0934308c656d2f261c958c12e19d62e710459dd9f5b8f23d41e7","observation_id":"636f60ca-4311-4df5-bf28-12d428f28cbd","resolution":{"observed_at":"2026-08-06T22:15:02.241212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-15T00:31:30.908728Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T22:15:02.340057Z","title":"Video-ccam: Enhancing video-language un- derstanding with causal cross-attention masks for short and long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.340057Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:4e1b0074cdf638766b86a23dc1863b290b8a781491042c21f7ad67174be3cf33","observation_id":"55a5ff53-44d3-4273-8475-82950400326c","resolution":{"observed_at":"2026-08-06T22:15:02.340057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T22:15:02.450017Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.450017Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:32108d793dbef38cf2f4c21e2fabda339ad13d0639719f95705cf2acf72df0f8","observation_id":"260f516a-eb60-4a70-aa94-5a542647b211","resolution":{"observed_at":"2026-08-06T22:15:02.450017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-06T22:15:02.527447Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.527447Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:e59e9c5eeadfd361e128b29072d0697af43bd9d03aa0136835357f289115606d","observation_id":"d7ed91ed-796f-4940-b039-802d573b9f48","resolution":{"observed_at":"2026-08-06T22:15:02.527447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.624654Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"f3e55776-50ff-4ac4-b3a9-47679d94666a","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.615899Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:0bb8f3043bb1caccfe8ea58c0495d7cbf6427e90cdcba060eb897103fa65519b","observation_id":"e1403065-aac9-4fcd-bfdc-403074e446ef","resolution":{"observed_at":"2026-08-06T22:15:08.677569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T22:15:02.714570Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.714570Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:94a199646726c1566b9dd38f7c739c161894eaf1018788d9c4db554366499d4b","observation_id":"49eacf54-21f3-4a01-b6c3-b164f5b11144","resolution":{"observed_at":"2026-08-06T22:15:02.714570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.474794Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"7004325b-cabf-4a1e-ac64-9d4478530793","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.778441Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:7b830e5f8e4b44f0768b54c741ba9da2de5d603e3932f33a8f9f8af1a61f268b","observation_id":"f53e097e-80e5-4101-b645-9a7a49a929b7","resolution":{"observed_at":"2026-08-06T22:15:08.537709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.296883Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"f63b6505-0b73-4549-9b5e-1bb40e6bbd17","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.859142Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:cc671d3507bdd9669a57cd6c805209bb0a97cc06e35e2a18dddb28ea69b3ff2a","observation_id":"a797c863-8993-4d59-b303-c2213ace2331","resolution":{"observed_at":"2026-08-06T22:15:08.389761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-08-12T23:29:35.251909Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-08-06T22:15:02.922173Z","title":"Keyvideollm: Towards large-scale video keyframe selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.922173Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:af4aa7d29cffd726d3691b0b66ac233bc0d0fa07cfe9029cf74c3c66808fed46","observation_id":"76dc95d8-f7e4-4b88-9a02-94e10a7c9b77","resolution":{"observed_at":"2026-08-06T22:15:02.922173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.138072Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"278f6778-963e-44f5-b03d-27a073cc8b2d","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.991356Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:5313a2d8cdb188c9d4cfd8f9acf2a11f2843630ad7b925eba4db07751dbb18cf","observation_id":"b2dd8b82-c552-47d0-885a-c4f771f400d5","resolution":{"observed_at":"2026-08-06T22:15:08.243146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.973229Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"bf1f83b9-bdf1-4947-9ddf-5e21d531237f","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.062699Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:4f2b24e54cef11322f411063a5e12f84bf5cda44861202216365aba82d12a37a","observation_id":"2475e21a-6cd2-4261-8e08-9faca5ee815c","resolution":{"observed_at":"2026-08-06T22:15:08.048504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.769990Z","title":"Visual instruction tuning","venue":null,"work_id":"85f3a0d6-2abb-4f6e-9214-44de1e24ea07","year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.144052Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:0ae43c54377c3d41d6717bf642d13b680216d9907724fa972cceb87ef66a522b","observation_id":"d5d2932f-6139-47ee-8d33-e1b0201e24e6","resolution":{"observed_at":"2026-08-06T22:15:07.838909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:03.202524Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.202524Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:62315a87ae0a111a0c12d9934ca0a212c82171272c1a7120ff2b0df7a082bd35","observation_id":"73badf97-5289-4ab2-9a12-ae2e30d2d29d","resolution":{"observed_at":"2026-08-06T22:15:03.202524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.605928Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"4199969d-9805-4ddc-8393-91c1bb4e6734","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.286726Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:92b2a31806b917c95318569e47d1c90a1224b66c5a1850397e081901d63f71f8","observation_id":"b8379fdf-f320-447c-9623-29220e3249d2","resolution":{"observed_at":"2026-08-06T22:15:07.653968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-13T04:53:28.750571Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-06T22:15:03.351183Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.351183Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:8d64836e78d0a786089efac5fef6c60ba8d39155ce7a79d39c23abe06c0ba7e1","observation_id":"0f33d806-78f9-4ccf-9bd3-34caa259491c","resolution":{"observed_at":"2026-08-06T22:15:03.351183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.410693Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"2a09f979-504a-4b39-b124-de9e9ef11b32","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.417538Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:c315a529c9e0259799cfdc1cb0c06866b60f01674d92f01a237da5d4f0e74b20","observation_id":"666db4a5-e386-4eac-b8a7-5681a16d0392","resolution":{"observed_at":"2026-08-06T22:15:07.490542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.193360Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"3d55bf2a-28ef-497f-8f43-3cf7d0d5b48f","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.481220Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:3a1f8144595d799927e076c4d7ee33eee30b588aaff243c8b7c8f2ccd70bac09","observation_id":"ad62d436-89cf-4000-b98e-3e65e6ed29ca","resolution":{"observed_at":"2026-08-06T22:15:07.287773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.992602Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"2c9566a5-047f-4e77-a089-90ea63b4c2fc","year":2021},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.561078Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:15446457919ac6c86301b6722ce1641b8201827d96ecfcd5cbbdb2c3e249dbd8","observation_id":"9fbe48c4-ba7c-415b-a164-a6f7af190310","resolution":{"observed_at":"2026-08-06T22:15:07.110497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.853397Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"2b76967e-9fc7-4a57-b7ba-e838227b376e","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.678869Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:8ce1de8583bdf0308959d5f687f39d451036e922c53a783b8da8719d4a5d2b3a","observation_id":"20018ddc-e8da-4d12-8dd6-b41804ca24cd","resolution":{"observed_at":"2026-08-06T22:15:06.906491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-15T03:08:15.732831Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:15:03.755141Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.755141Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:50393794287efd4f3281ab1246dde6c3cfed83c54f0a869b2c0582667c0e8cb4","observation_id":"51b1b8f9-be18-4d35-bc41-a649916768d0","resolution":{"observed_at":"2026-08-06T22:15:03.755141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:03.824422Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.824422Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2ef47a99743fe307d291169b43c1852605c0683649540f0e25f8a09a70824818","observation_id":"5f3b6777-e92f-4325-91a5-bf8b25fc6660","resolution":{"observed_at":"2026-08-06T22:15:03.824422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:03.875000Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.875000Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2a06d7e28015a2f5cafda802f374a40c872968ac4a3c726f19ee7696a7c8082e","observation_id":"b47ab2da-1955-449d-998b-88df156c4469","resolution":{"observed_at":"2026-08-06T22:15:03.875000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:15:03.971684Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.971684Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:8a063e7bf0031fac25436a4f12a4ac502eaae1d9420bf8a37c9347bf12efc0e7","observation_id":"e4359f59-bc8b-46fe-a718-628a619f961b","resolution":{"observed_at":"2026-08-06T22:15:03.971684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.691657Z","title":"Internvideo2: Scaling foundation models for multi- modal video understanding","venue":null,"work_id":"a4196953-0091-47c5-9ebf-4181b421a7e1","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.029772Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:e313c38b570279a5065c7493dceb8d0033211f1ab96e38fe98ba2c91c268a21c","observation_id":"1f4c3484-0531-472f-ad6f-3aa4f348d22f","resolution":{"observed_at":"2026-08-06T22:15:06.755357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.578505Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"f4d7db9e-d349-4d3a-87bc-44106e7d8d0c","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.102916Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2c4aa7683f280a7af3ea183258a614da9742002db7b75a636b5909600bdba903","observation_id":"e39c4189-926f-46bb-b906-7f1542fec27a","resolution":{"observed_at":"2026-08-06T22:15:06.629724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.453402Z","title":"Multi-agent reinforcement learning based frame sampling for effective untrimmed video recognition","venue":null,"work_id":"8a0768a3-7dc1-45d2-ad76-364fdad842df","year":2019},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.241569Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:047a8798da6295f9c7e1dc6a9780cffdc7317b21a0c789a66362c4777f1b48ce","observation_id":"e73ebea1-c1cf-4f09-8858-be514963c3a3","resolution":{"observed_at":"2026-08-06T22:15:06.502690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.326929Z","title":"Adaframe: Adaptive frame selection for fast video recognition","venue":null,"work_id":"6f50bc81-b8a5-4747-8d60-e11454955894","year":2019},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.299593Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:9a9dce5bc22c198e20322d79f0ea17f0d78732ad6b569c354d462b58e9a95487","observation_id":"d916726f-0327-4842-ae41-4fcc2571c33c","resolution":{"observed_at":"2026-08-06T22:15:06.387469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T22:15:04.382683Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.382683Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:7a6bbe536adc01e3a69c936f74e86b7ab0e7ba8da830aa04a286a111ebf0baf6","observation_id":"a4b2f519-101d-44cc-af46-640da2b1c2df","resolution":{"observed_at":"2026-08-06T22:15:04.382683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.217018Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"e08d9ccf-dbc3-4e5c-9ef5-a2d7cf710493","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.480606Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2411a4af1e2d1e93f925f3f2d2a533c2b4d31dc73269633d718c7119bcdcda9a","observation_id":"665bd746-852e-4a8b-a786-607ecfbe37a9","resolution":{"observed_at":"2026-08-06T22:15:06.261410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.079929Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"7a2c3c35-463c-49e6-82e3-c572776f60ad","year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.561512Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:19507bfaee2637920130a825ef95e42e1642b082f47ca63ee54493f7d81ffaab","observation_id":"eb4d00fa-9cc6-44eb-bf77-de94c0c3682b","resolution":{"observed_at":"2026-08-06T22:15:06.143689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T22:15:04.623326Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.623326Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:1e6ec1ecdbfc11bc597de6d8910f8879f262edd208885c0cdccf49c4e328f606","observation_id":"e0e680ee-9a99-4961-857a-fd21ac5307dd","resolution":{"observed_at":"2026-08-06T22:15:04.623326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T22:15:04.686714Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.686714Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:887999369b08f770fe15561321f7e31aa4904eee6cb8ec00ac6c79ce6694cbfb","observation_id":"5d985fbf-4b73-481f-b255-2b737e68829e","resolution":{"observed_at":"2026-08-06T22:15:04.686714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:15:04.749344Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.749344Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:73eb103e44d8bef0ebbafaec34a30a839674d24bba771ecec655c0032c29130d","observation_id":"ef8de3d9-0280-4974-bb2f-47853121def6","resolution":{"observed_at":"2026-08-06T22:15:04.749344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-13T00:39:57.337984Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-06T22:15:04.864133Z","title":"Direct preference optimiza- tion of video large multimodal models from language model reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.864133Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:1d28fa30542c0897bbe178cf262cba7a90f3bcbfca3b4d2ae32a569bc30ca537","observation_id":"5a1f0d10-f715-47c1-b335-f47ffddde9c3","resolution":{"observed_at":"2026-08-06T22:15:04.864133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T22:15:05.019965Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.019965Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:ea1883077bd984bb53891728fd6933e22723741b906e113e7662420d5a4a6180","observation_id":"0c307f2e-7cdd-4c08-b992-c4fc22cea03a","resolution":{"observed_at":"2026-08-06T22:15:05.019965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:05.935086Z","title":"Mgsampler: An explainable sampling strategy for video ac- tion recognition","venue":null,"work_id":"ba711317-cb48-4d1c-92a0-cfb0e62fdba3","year":null},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.086874Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:3db84b6ffd0dd605e6a5f9016b9a33b447ffff94db5ab6270c6815ac4baf8467","observation_id":"9fc18216-6abf-4dc7-915d-f115ba96b59f","resolution":{"observed_at":"2026-08-06T22:15:05.983536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T22:15:05.172214Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.172214Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2512e5096853581d72d54b669ba5e25822a38820c4c74be099f3fa3bffcb0627","observation_id":"f71645bf-2cfe-46ad-8924-4ae73dd3d962","resolution":{"observed_at":"2026-08-06T22:15:05.172214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:05.795588Z","title":"Limitations Q-Frame enhances query-aware video understanding, but it depends on pre-trained models, lacks explicit temporal modeling, and operates within a fixed token budget","venue":null,"work_id":"61c01e1e-4315-4205-9ca5-d2eb68c4e976","year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.248695Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:55dcc5e1d58af22a9e835fda5c160cd09f43fb3d324b74355ccda3fd6ae8c019","observation_id":"2eef322c-e13d-4329-90c3-8916f65c57a9","resolution":{"observed_at":"2026-08-06T22:15:05.867099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 9 inbound Pith citation observations for arXiv:2506.22139."}