{"as_of":"2026-08-19T11:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48e490aab3b9c07473cfc30fe169911cc6f9d9e36dcd930866106e8f755f61d7","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:26:25.786061Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15778/citation-record","integrity":"/paper/2607.15778/integrity","json":"/paper/2607.15778/citation-record.json","paper":"/paper/2607.15778"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.595392Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.595392Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:e5762b7a125d0cb228595e527f37e8a46d3786c816ee203b4a94d42ae7fb7722","observation_id":"71770873-c96e-41b7-8ea5-5f4f414eb406","resolution":{"observed_at":"2026-08-01T22:26:23.595392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.675835Z","title":"Vtimellm: Empower llm to grasp video moments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.675835Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:bb49a60d7df8b5c7d269c57f794bf6cd0c5917364842bdbb2bcd82e5696bef1b","observation_id":"b60c17eb-72d5-4278-9532-11abf5a921e2","resolution":{"observed_at":"2026-08-01T22:26:23.675835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.762387Z","title":"Moviechat: From dense token to sparse memory for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.762387Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:bdbdf8b92d9b972274fc77b2d07d377775789d3649487de86bd352d198a0d9db","observation_id":"bca80b31-fcc4-4c19-a038-2e67946393ab","resolution":{"observed_at":"2026-08-01T22:26:23.762387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.851331Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.851331Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:7241b26827237ea1099f034193ca0ecfcd3d4abbfa6588ee02ab6d96406f26c1","observation_id":"516af506-3490-4cae-8328-df5f228a802f","resolution":{"observed_at":"2026-08-01T22:26:23.851331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.929607Z","title":"Adaptive keyframe sampling for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.929607Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:77c20758f87c0e44d40fd9d23fd7fba8b33d2f094fb1ea843455b895e4893aa8","observation_id":"fc751885-29c3-46e8-a23b-9341c4188ed2","resolution":{"observed_at":"2026-08-01T22:26:23.929607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.014552Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.014552Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:4ed59dbd08531603cd4b322ef259cd0d39754bc722ed4602ab9e4891cdb8e086","observation_id":"b26a6ad1-2c4c-4c83-a035-d270a02de89e","resolution":{"observed_at":"2026-08-01T22:26:24.014552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-01T22:26:24.098278Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.098278Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:883099d74470deb7b481f13774e49c52b2dbb000819973d8b45e28c44e920634","observation_id":"b4514555-9fbd-427b-b890-8d02cb6bd112","resolution":{"observed_at":"2026-08-01T22:26:24.098278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.184455Z","title":"Multi-modal generative ai: Multi-modal llms, diffusions and the unification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.184455Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:7ab229ac8ac73c8b629df2e45ca3c123c5eebb701c7b73434855d5f725f86248","observation_id":"619415b4-fd29-417c-a927-e3f6caaa5805","resolution":{"observed_at":"2026-08-01T22:26:24.184455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.262670Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.262670Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:f3cef205a66f82872bd5d234a97f66d796deeac3fe1b351ed86fe9e0f74da9f9","observation_id":"99a99d8b-abf6-454d-9c75-d4977f9faf5f","resolution":{"observed_at":"2026-08-01T22:26:24.262670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.319973Z","title":"Fuyu-8b: A multimodal architecture for ai agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.319973Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:bb838dbca92c869877e8b7c091762dffcdff18d652688f0bf57072163adfe98e","observation_id":"52d9003b-0352-48f2-97e9-ae08892790e7","resolution":{"observed_at":"2026-08-01T22:26:24.319973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.409429Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.409429Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:84e98fad5744536293d80bf512a4fdbd2297ffdf27b9409553d4e81d093d6645","observation_id":"186f6d8e-07d2-4b51-bde7-d135f99109ad","resolution":{"observed_at":"2026-08-01T22:26:24.409429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.490559Z","title":"Multi-sentence video grounding for long video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.490559Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:4ffddbfb8e3c07f347a33e6fc471f96cf18cd1747539af828952ae9696bfea9a","observation_id":"397a33f9-1e21-4be9-8587-1e01bb531ae1","resolution":{"observed_at":"2026-08-01T22:26:24.490559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.568442Z","title":"Modularagent: A task-aware modular framework for joint optimization of multimodal large language models and world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.568442Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:d7633261ae7acd1fe6952c8ca78f25a93dfb8f420b8be2282dcb55b2acc435b1","observation_id":"06667faa-010d-4fcb-98b3-ba8c654cf06f","resolution":{"observed_at":"2026-08-01T22:26:24.568442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.659409Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.659409Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:f084a97533544ded7c271afae2874d2d41624afe1c2675c8cf7f4a6441a05c67","observation_id":"27f6580e-b61b-4b21-8470-779f462246bf","resolution":{"observed_at":"2026-08-01T22:26:24.659409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.726194Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.726194Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:0c6218db02050832b5146583f2b789893d07298c01946b6ab432fefc6b7a5b56","observation_id":"b9a81adf-f114-4fdd-b6ea-507aa91a415b","resolution":{"observed_at":"2026-08-01T22:26:24.726194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-14T14:43:02.885779Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-01T22:26:24.782850Z","title":"Video-xl-2: Towards very long-video understanding through task-aware kv sparsification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.782850Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:2b209eb81ebbb8753fbc93ec052dd6e3dc48d3e043b530540ceacfc2ea3f33d2","observation_id":"3e370153-360e-4d06-9b8a-c84ad2d9ff37","resolution":{"observed_at":"2026-08-01T22:26:24.782850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-01T22:26:24.831412Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.831412Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:9a8efdc6071a2c19029a07b2d4c4e0ee54e64932a7535bdedf5e538b8f0da720","observation_id":"bc3e9312-03be-4c05-9bc7-dd2aa0f38df6","resolution":{"observed_at":"2026-08-01T22:26:24.831412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T22:26:24.886162Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.886162Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:83fadf044211750fe4ada4f8ff108fceb901a057a48012d7dd0f7718ed2530f4","observation_id":"5e94b226-070e-4c91-8f2f-c5abcb729756","resolution":{"observed_at":"2026-08-01T22:26:24.886162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.942904Z","title":"Llava-video: Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.942904Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:3c4209926ddd213b83637133882a76dd2f6937adda291a10f55e9d011e5f19ed","observation_id":"ffdb04a3-c6cc-41a7-8f42-bc62895b3193","resolution":{"observed_at":"2026-08-01T22:26:24.942904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.981811Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.981811Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:571b972564e14774498ba5fe83bbe824bb93d70aff10bb264348a11c375ff500","observation_id":"1d97a38c-90ec-48ce-8061-3c336499d9a1","resolution":{"observed_at":"2026-08-01T22:26:24.981811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.055475Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.055475Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:4fd677123beff643ef0160344c5db2b8b8914ab369bb51127237eef9a001de17","observation_id":"6ff3a8e3-9878-42e5-9d63-566d7077ad1c","resolution":{"observed_at":"2026-08-01T22:26:25.055475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.141517Z","title":"Modularized self-reflected video reasoner for multimodal llm with application to video question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.141517Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:2f33fcfde4cc1a5636c658eec9b1a4bb8ca07db2951b56f2c47c850ae057079b","observation_id":"cab6b849-c83f-4440-976c-279ef2738788","resolution":{"observed_at":"2026-08-01T22:26:25.141517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.216497Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.216497Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:1170e87ef5cc95febfdc4eb23199fbf7136c261321d455d11f153d2de79a2b56","observation_id":"c2f565c9-4d53-4318-b85c-26a6049b825d","resolution":{"observed_at":"2026-08-01T22:26:25.216497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.266600Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.266600Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:b1fd7f4023787290e616b5927b3a6978edfeea1b681993dba9e72a00ecbf4ff9","observation_id":"349e2906-80de-4009-ae36-b0068cf5dddf","resolution":{"observed_at":"2026-08-01T22:26:25.266600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.321124Z","title":"Lvbench: An extreme long video understanding benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.321124Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:ce9e2d3c67db4ed213ba69169569d33602f7ba69983e4bc62331f3c80c89c833","observation_id":"7ee821ea-8269-4eae-b24c-152814391dbc","resolution":{"observed_at":"2026-08-01T22:26:25.321124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.405821Z","title":"Mlvu: Benchmarking multi-task long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.405821Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:0ec6a5e0d140cb7f31efd2e305a001aa832bac20bc0c58320116d3bf8c75b814","observation_id":"bf72d852-b689-4c96-af23-6c98535cefeb","resolution":{"observed_at":"2026-08-01T22:26:25.405821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.477899Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.477899Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:4765792a16908101b9e3386f7a520c26f5c0c050881e5940b090a44a944bdec6","observation_id":"157dd742-d96c-4a01-82fe-16c9341215c6","resolution":{"observed_at":"2026-08-01T22:26:25.477899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.559526Z","title":"Infinibench: A comprehensive benchmark for large multimodal models in very long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.559526Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:a71173b231404d12216a81b014a5040d6820c4547319282fbab09d13e74b5d7a","observation_id":"e56562a6-61e0-413a-9acd-5a1a5c1133d2","resolution":{"observed_at":"2026-08-01T22:26:25.559526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.637198Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.637198Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:20475f53b9a648fa8457368ca8ee553b27d39c4104aafa996ffcc8285b4a77c2","observation_id":"8e6a8668-c044-4dbd-8956-2902276bf543","resolution":{"observed_at":"2026-08-01T22:26:25.637198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.723913Z","title":"Videoitg: Multimodal video understanding with instructed temporal grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.723913Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:f95b18ebdcbb00b11a31d63bd8a85a27a87708972765c7a10f1831bdede730ac","observation_id":"6b7562bd-dc6d-4bb7-b34c-a1c11e98e26e","resolution":{"observed_at":"2026-08-01T22:26:25.723913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.786061Z","title":"ordering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.786061Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:a273dfa3ad6f4e9e37e25f0cbbfb6867b8d7ebe4e797745c563e61c33098293b","observation_id":"d76e0c01-b8d1-4867-8c1c-aa60e84153fb","resolution":{"observed_at":"2026-08-01T22:26:25.786061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T22:10:10.594754Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.15778."}