{"as_of":"2026-08-10T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff6ba5bb33caaf0103f10dd053fa7877a4e944c89d59db47715102ab430c9bc7","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:38:20.743420Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10302/citation-record","integrity":"/paper/2507.10302/integrity","json":"/paper/2507.10302/citation-record.json","paper":"/paper/2507.10302"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:38:13.744309Z","title":"arXiv:2303.08774 (2023) 4, 6, 9","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.744309Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:f21aa783c8b2a8c77863fd3d4c2c79d5652bb2a3d28310039a470bc852789e09","observation_id":"c201e185-eee5-49ee-a9b0-c2ca80d845f4","resolution":{"observed_at":"2026-08-06T17:38:13.744309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:13.800454Z","title":"In: NeurIPS (2022) 1, 2","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.800454Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:452f5f5cb577f1adfa7c371031a276ad641cdd7a46f33a570a8e7d80fa614033","observation_id":"43efa36a-bb39-4e18-8419-7712a080ed51","resolution":{"observed_at":"2026-08-06T17:38:13.800454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T17:38:13.887420Z","title":"Ablations on the weights different components in the total training loss of DisCo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.887420Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ebc9db4791c5dfb30e0d7485998071740170c9c7698b3f4840140f6d1e65b031","observation_id":"724bd4d6-c78a-45d0-a194-cfe9edf3479b","resolution":{"observed_at":"2026-08-06T17:38:13.887420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:13.993701Z","title":"In: ICCV (2021) 2, 6, 9","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.993701Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:c7870722888ed31a8e93b373f66637131410a82585c31a1c77f8196681530a5f","observation_id":"9f9a2c07-49b6-4862-a614-6beafbde6294","resolution":{"observed_at":"2026-08-06T17:38:13.993701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.035353Z","title":"In: NeurIPS (2020) 2","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.035353Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4f369b8bd56ffb6fdc56c5acdc7c314be062a19970eb70847f015040904d3aeb","observation_id":"607be67e-a3c6-44a2-8956-93aab90f7d4d","resolution":{"observed_at":"2026-08-06T17:38:14.035353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.105134Z","title":"In: ECCV (2020) 4","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.105134Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:bc8e0eb76e95078ef4d11e1507aef85f31f7d71d57c520577bd02398fce1e278","observation_id":"03173b9b-2712-4504-8da1-8ca05b4a22fe","resolution":{"observed_at":"2026-08-06T17:38:14.105134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.175728Z","title":"In: CVPR (2024) 1, 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.175728Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ebcc2a10350e4c6bfbaf0f17546b1240cb5cbca6c2512fa4553aa95026328fde","observation_id":"7836d8d4-84b7-47c8-a079-162823de13a0","resolution":{"observed_at":"2026-08-06T17:38:14.175728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02768","last_updated":"2025-05-06T09:02:57Z","snapshot_observed_at":"2026-08-01T16:37:35.461629Z","submitted_at":"2024-09-17T05:17:37Z","title":"Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02768","snapshot_observed_at":"2026-08-06T17:38:14.260667Z","title":"arXiv:2410.02768 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.260667Z"},"links":{"cited_paper":"/paper/2410.02768","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:74d82e8935ff556672fb0d2f19aa58ba57713b690008aa20f76e1a29a2f004d3","observation_id":"4f3e1cfc-98a5-41bd-9d90-15aea3596228","resolution":{"observed_at":"2026-08-06T17:38:14.260667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T17:38:14.332299Z","title":"arXiv:2310.09478 (2023) 3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.332299Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:adfceae17612566dae8b9782dca710b4710e40e4d62426ccdf7c95ed12472efd","observation_id":"345d4ff9-0653-4faf-8052-39fb18424663","resolution":{"observed_at":"2026-08-06T17:38:14.332299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T17:38:14.390971Z","title":"arXiv:2311.12793 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.390971Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:869368b10735889ccd87b4406be755e8d180810afa5fc360960f72ce94986133","observation_id":"66fe3c21-9130-4585-a951-609915ea4b3a","resolution":{"observed_at":"2026-08-06T17:38:14.390971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T17:38:14.432529Z","title":"arXiv:2406.04325 (2024) 1, 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.432529Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:73fc40de005fed75215c7520ac2524f9e7fc9b980c1c2db3b0d5f363ba41704e","observation_id":"2da34952-7e06-42c6-ad0f-7a60dfe52fc0","resolution":{"observed_at":"2026-08-06T17:38:14.432529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.513288Z","title":"I see you, Batman!","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.513288Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:475c4416357768b114802bc5fce892801b1c5746f6e4b6455bf57e99d09e52bc","observation_id":"86b558ce-f96b-4733-9f88-c59990bc0dd7","resolution":{"observed_at":"2026-08-06T17:38:14.513288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-09T01:06:11.036691Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T17:38:14.586386Z","title":"arXiv:2312.06722 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.586386Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:53e1dfe6b0b6c13f7ef5e29602dc8dc7150629d5a626ea93c8eba1cdbcf77db4","observation_id":"5c4a722a-da2d-42d3-bc83-d5940e9691a8","resolution":{"observed_at":"2026-08-06T17:38:14.586386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.671358Z","title":"In: CVPR (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.671358Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:769f38b273584085f532a40eabb57fda0893a5074a3cb9b367fcc72c73895ab7","observation_id":"5498de92-18fa-4680-97ac-b93c70780507","resolution":{"observed_at":"2026-08-06T17:38:14.671358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T17:38:14.763233Z","title":"arXiv:2406.07476 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.763233Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:46ed00eef8cb40e530590d4862cbb5a80427560ff5e9235d18889fcf8bc173e9","observation_id":"b7ae5fcc-f264-4131-9fb5-268430b92ae1","resolution":{"observed_at":"2026-08-06T17:38:14.763233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.830921Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.830921Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:9e5eb2562ab77ef60bd09d23a49a1fe24f2711f2fa094038cce67dec0f0860a0","observation_id":"f0194408-f5ec-4a50-9cf6-5439a4022bcf","resolution":{"observed_at":"2026-08-06T17:38:14.830921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T17:38:14.924271Z","title":"arXiv:2402.03766 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.924271Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:cd00bb05c00dd12188c3458ccd9d16916b640c4d867646a36049305e50385741","observation_id":"1eef3aac-44ed-4ba3-bf11-518e7d03ccfa","resolution":{"observed_at":"2026-08-06T17:38:14.924271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T17:38:15.022435Z","title":"arXiv:1810.04805 (2018) 2","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.022435Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:0f89e6a2bfbabf23edeab95175558fa4014baf6f1cea0c47a2f777d45953ffe4","observation_id":"eefbd9ad-4aaf-413d-9aaa-49f560c5227e","resolution":{"observed_at":"2026-08-06T17:38:15.022435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T17:38:15.079259Z","title":"arXiv:2010.11929 (2020) 3","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.079259Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:44860d7636f6f6c169cb6a28c0b962b9ee6c9a694a97d43c879f938806f58eb6","observation_id":"cb31d280-a509-4892-8e52-0cb174b0c121","resolution":{"observed_at":"2026-08-06T17:38:15.079259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T17:38:15.184382Z","title":"arXiv:2303.03378 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.184382Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:1194aa5780c58698eb120885c3004cf4987e1230e98da1229e5326ffb96fc7d5","observation_id":"41c84606-e81a-430b-9fc2-b1a174403ae8","resolution":{"observed_at":"2026-08-06T17:38:15.184382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:38:15.276356Z","title":"arXiv:2407.21783 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.276356Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b36a000ac2bc7c2915b4a66b6983bf0ab117b1fd0d70a4ad1d3498843d42d4d6","observation_id":"8cd5c9eb-8562-4209-a371-08b49ddf1272","resolution":{"observed_at":"2026-08-06T17:38:15.276356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.378346Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.378346Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b8b2b76f688fe0a0b191d6d22196f9d4033aff55542dc884cdfae5e97937416d","observation_id":"b2823f80-b137-44c5-b1ac-0516804f4955","resolution":{"observed_at":"2026-08-06T17:38:15.378346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.426339Z","title":"In: CVPR (2023) 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.426339Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:7767c19ecbf1f8b18e19bc4762dd304c6ce53e2e31b7e01217ab858eae888af7","observation_id":"e3776ed1-c023-4dcb-b04b-50b221e334e1","resolution":{"observed_at":"2026-08-06T17:38:15.426339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T17:38:15.473346Z","title":"arXiv:2405.21075 (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.473346Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:2a8de9d247658acf84f9f63d5a32b3c1992506f43e2c4d8944fc51347b3f6bb9","observation_id":"0ce230bb-953d-4a1e-8900-a855f7c56296","resolution":{"observed_at":"2026-08-06T17:38:15.473346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08041","last_updated":"2023-08-12T04:42:29Z","snapshot_observed_at":"2026-08-06T07:20:51.958343Z","submitted_at":"2023-07-16T13:41:39Z","title":"Planting a SEED of Vision in Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08041","snapshot_observed_at":"2026-08-06T17:38:15.540771Z","title":"arXiv:2307.08041 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.540771Z"},"links":{"cited_paper":"/paper/2307.08041","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6ae07f6feee5e46bee11a1adb9495e0e0be93db297b79ac191d1ec28b7bdc330","observation_id":"ff4062fc-f51c-4b6a-8b42-aeb20bd31974","resolution":{"observed_at":"2026-08-06T17:38:15.540771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.614673Z","title":"In: ICCV (2017) 6","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.614673Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b65d2c4311a8d17f605f6dbd3e76a67a2bd32720ee155fd58b2e8def8b2ca17b","observation_id":"02d3d1dd-4791-464b-b24d-bc252e7e3746","resolution":{"observed_at":"2026-08-06T17:38:15.614673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.687789Z","title":"In: ICLR (2022) 6","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.687789Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:a1d9a54986a508530f1b9b5670bfcc4ffd10808387d43ea66e635d8a207a5790","observation_id":"1a15b683-b156-4d4c-9959-6d4ed0728984","resolution":{"observed_at":"2026-08-06T17:38:15.687789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.959593Z","title":"In: CVPR (2019) 2","venue":null,"work_id":"9a0f2df2-59b0-4e61-8f9f-86bdcfa00ad0","year":2019},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.781525Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:f1747c30d29a60e07cd3c0db25997a8aa1eb2c180d27b14afabbbd3b00eed03f","observation_id":"607dafda-84ce-4743-9e65-46991d82fbb3","resolution":{"observed_at":"2026-08-06T17:38:31.066212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T17:38:15.849245Z","title":"arXiv:2310.06825 (2023) 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.849245Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:9795a25a3476c3c0022fbefbc23f062eceb4558a80b4a07e638c66ab56bd4bca","observation_id":"e98d4342-9857-4619-b6b2-377dac9c3b79","resolution":{"observed_at":"2026-08-06T17:38:15.849245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.697322Z","title":"In: CVPR (2024) 6","venue":null,"work_id":"fa51efb9-6c2f-46c6-a05f-d6d07f53ce82","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.963244Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:c0acdb4296e9f85f2c57af42d1002a719b212ae4115864a7829899d515201a1a","observation_id":"2c7f589a-3863-4465-a417-2f691152cc5e","resolution":{"observed_at":"2026-08-06T17:38:30.848354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T17:38:16.022354Z","title":"arXiv:1705.06950 (2017) 6","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.022354Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:f3bc886dde97865555118568caf1cea160628db6c0fe4dd878680d9ec3501663","observation_id":"6cdc7be4-f0c6-42f2-8e3d-3274e708f59b","resolution":{"observed_at":"2026-08-06T17:38:16.022354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.387596Z","title":"In: ECCV (2024) 1, 2","venue":null,"work_id":"012b12d3-b460-45a3-acf7-d3628371e7fb","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.087756Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:35007af4f19a93453b4c41c58dad7b06ab1799ca91cfcfb9e5a96297668e467d","observation_id":"0959ef81-d36f-470e-82ac-a4902e94d8aa","resolution":{"observed_at":"2026-08-06T17:38:30.531168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-06T17:38:16.116489Z","title":"arXiv:2306.05425 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.116489Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:db5c016547f64a66510f8151d3047582db49be9d372e2b0aaa79bdad83b8ad80","observation_id":"538bee68-24e6-4c16-ae51-3ecc023ed6df","resolution":{"observed_at":"2026-08-06T17:38:16.116489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-06T17:38:16.192030Z","title":"arXiv:2305.03726 (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.192030Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:bfa5cb1a465ba61ade5ea667d0effd4b30a6ff5d168fe2cf1575c4fa68e9cea3","observation_id":"b348445d-e214-4a77-a551-d348e98fc3e9","resolution":{"observed_at":"2026-08-06T17:38:16.192030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T17:38:16.241699Z","title":"arXiv:2408.03326 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.241699Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ad4c181ea38c62d2df848bb4f7430fc8d69c02d49c9eb4ae25113e21326e1b74","observation_id":"d59a25e4-0fa2-4725-9687-d6d4acfc89ff","resolution":{"observed_at":"2026-08-06T17:38:16.241699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.040287Z","title":"In: ICML (2023) 1, 2, 3","venue":null,"work_id":"0ca37aff-0eb0-498b-bd0d-0445e8300506","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.297011Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:a2c675f791f573163a9b1bc3f9cb938c365f54ff9d0f8e6c321dcbf0ee28071d","observation_id":"4520737c-1b66-4709-bf54-2658a49e8343","resolution":{"observed_at":"2026-08-06T17:38:30.215814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.763667Z","title":"In: ICML (2022) 4, 6","venue":null,"work_id":"89da97d1-5afc-4b5e-8436-456e4dc7789f","year":2022},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.371511Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:7bfd6f2f8f58595be84d9bc3f796b853f92f3576784115eda282d83e13db1b62","observation_id":"7542d54d-f7fc-4283-b69d-2ada832e5bca","resolution":{"observed_at":"2026-08-06T17:38:29.902598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T17:38:16.430652Z","title":"arXiv:2305.06355 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.430652Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:522224b1de1ee29d7da38803887d7147e41a427a999a248d04e358a2721971b4","observation_id":"7c86479a-1c60-4aa1-b402-216da35395b0","resolution":{"observed_at":"2026-08-06T17:38:16.430652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.587016Z","title":"In: CVPR (2024) 1, 2, 5, 6","venue":null,"work_id":"d30cdf34-0f00-4e5b-852a-f6eaf3f33e25","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.489156Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:95849a4abd01fde5e313ac570d5c9398de202b67359038810de092bafa7fb0cf","observation_id":"d8289b59-9e87-4593-b8c3-81e9643c4161","resolution":{"observed_at":"2026-08-06T17:38:29.657002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13911","last_updated":"2024-11-03T09:25:57Z","snapshot_observed_at":"2026-08-08T07:33:55.965303Z","submitted_at":"2024-05-22T18:35:10Z","title":"TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment","version":2},"cited_work":{"arxiv_id":"2405.13911","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13911","snapshot_observed_at":"2026-08-06T17:38:21.212095Z","title":"TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment","venue":"cs.CV","work_id":"8afe9f53-b19d-4ff5-a826-56b7744db573","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.555603Z"},"links":{"cited_paper":"/paper/2405.13911","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fb718c7ed7d0e6146b65fe35c6094073b2bd0d809fbf512423a53aae4ad5c3c1","observation_id":"442b2771-6305-4adf-85c8-671c77800522","resolution":{"observed_at":"2026-08-06T17:38:21.336547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T17:38:16.589632Z","title":"arXiv:2407.02392 (2024) 1, 2, 3, 10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.589632Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6f8d57af11c7d8f6cf4e0c916baff1b6ba561ddcfebf60d42fb8019da51ad980","observation_id":"3243f840-cfe4-4a19-8f2d-3f79e8bfccb5","resolution":{"observed_at":"2026-08-06T17:38:16.589632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.424822Z","title":"In: ECCV (2024) 5, 6","venue":null,"work_id":"ba03c18b-7b8a-4221-9cc0-598eb7ceeb88","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.624560Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:94ef450e85fca1d6214bbad889109c9c83b2fa12964db93669999d7339d781e1","observation_id":"321d4b0d-5c05-495f-80a2-096a7362fa8d","resolution":{"observed_at":"2026-08-06T17:38:29.498383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T17:38:16.675424Z","title":"arXiv:2311.10122 (2023) 1, 3, 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.675424Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:5295c08ba5c391616c763835cad2e43dc055bc6126ee68f01c92aadff76c7110","observation_id":"32e494bc-9636-4bc8-9cc8-1b200e7e6b36","resolution":{"observed_at":"2026-08-06T17:38:16.675424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.179425Z","title":"In: ECCV (2014) 2","venue":null,"work_id":"0743e484-5e3c-4cb5-b8e0-de4a4290e506","year":2014},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.723028Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:cf28c60a72d9e7ddfb4ee22fe65b8a8bce94f750f5087a0d84d7486b6b34ae3c","observation_id":"883d0dd4-0754-4599-8909-105cbb6e0d87","resolution":{"observed_at":"2026-08-06T17:38:29.304790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.909512Z","title":"In: CVPR (2024) 1","venue":null,"work_id":"90a8706f-4b9b-4e7c-84fe-193ff062528a","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.765941Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:0a7efcf1b211aa7acdb1425437b6b16b588f4dc228fe079d405813df6cdde8f5","observation_id":"e629ad1a-c779-4479-8d24-7deba78bd179","resolution":{"observed_at":"2026-08-06T17:38:29.062686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:16.846803Z","title":"In: NeurIPS (2023) 1, 2, 3, 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.846803Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:2c380bb9d7aac4e992afbfe5b29f6396c2f36cc5a1bcecb907eee44e694de961","observation_id":"4a44d768-9562-4cc9-afbf-b67f35e7967f","resolution":{"observed_at":"2026-08-06T17:38:16.846803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.627622Z","title":"In: ECCV (2024) 5, 6, 9","venue":null,"work_id":"d1deebfa-3a82-4373-bd77-85136a45cf49","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.889577Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:1807edcdcca2a06470cfcda138a175dce1558d1e065cf10ac2f93df60757bcc6","observation_id":"81f964ad-84e6-4297-9683-bfdb99e9498c","resolution":{"observed_at":"2026-08-06T17:38:28.764386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.449824Z","title":"In: NeurIPS (2020) 3","venue":null,"work_id":"1c70e9d5-2001-4147-a13d-ed6171aec7d4","year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.916656Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:82940c30ac97661be459d4b6f7aef95fcb2be8cd91870bd9b1ed2609459db443","observation_id":"8461f797-6b66-4aca-a0ad-f46468ac7f1f","resolution":{"observed_at":"2026-08-06T17:38:28.539521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.263977Z","title":"In: ICML (2023) 2","venue":null,"work_id":"dde331c0-f88b-4331-8064-445f9518c20d","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.966244Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6e8af53d179b1561e285ce9bd872a36b2831196e5d0e8d416b4a133d8e6fdd30","observation_id":"7d6b7801-4119-411d-8ec9-75f68c7a6da9","resolution":{"observed_at":"2026-08-06T17:38:28.318729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-09T01:53:18.568676Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-06T17:38:17.002664Z","title":"arXiv:2406.09418 (2024) 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.002664Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:d6bee16cb7c4532a7f898b50f2f3a9dadbcfd3406f61574505031ad8e8d4a5ce","observation_id":"5bdbdf56-eabd-4041-96e7-58489e03b796","resolution":{"observed_at":"2026-08-06T17:38:17.002664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T17:38:17.072193Z","title":"arXiv:2306.05424 (2023) 2, 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.072193Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:1d21d730decb842d54354e52f41e3b0d0bf51369a066b1e0a097497fd7545145","observation_id":"8e14157d-7c11-4d81-a775-cbeed9b6125d","resolution":{"observed_at":"2026-08-06T17:38:17.072193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.045947Z","title":"In: NeurIPS (2023) 6","venue":null,"work_id":"72cba3f7-360f-43ef-afc8-24a57782240d","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.130992Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:e2b5cd2839b920cc98a3a8989ccf5cb768707d04f97d8bf32dcc9860ef5a6d66","observation_id":"67b073d9-1d6a-4165-9ec4-b8d6bcc8e4ac","resolution":{"observed_at":"2026-08-06T17:38:28.175772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.823831Z","title":"In: NeurIPS (2024) 1","venue":null,"work_id":"3756975d-81bf-401b-8849-2f75b791a459","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.161209Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6571ae51f0e24528e4cd11ae9cef11a3e8fc8dcea155dcacbf3e742533009a2c","observation_id":"386b79ff-461c-439c-8740-a77dfb464328","resolution":{"observed_at":"2026-08-06T17:38:27.903975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.565551Z","title":"In: NeurIPS (2024) 6","venue":null,"work_id":"d63cd09b-aeab-47c0-b0e0-1e54151cf88a","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.208737Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4d4e44f35b55f01619ccac35072869dacd89a28098246662621a0b6434b9a32f","observation_id":"49a829dd-f3dd-4985-bef6-b4571903db11","resolution":{"observed_at":"2026-08-06T17:38:27.677008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.352127Z","title":"In: ICCV (2015) 2","venue":null,"work_id":"073700f0-72d8-492f-a6dd-4d19ef109d32","year":2015},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.278269Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:29507f416aae8e08dabb17be726bbc838206742b055b5c3bce894307a81ddfbc","observation_id":"ee7759d0-0519-47ec-96a9-a2904642e3e4","resolution":{"observed_at":"2026-08-06T17:38:27.487305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-07-06T18:19:42.946629Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-06T17:38:17.320965Z","title":"arXiv:2405.16009 (2024) 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.320965Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:0bbe55439a21d1bfff504b66f5b4145035a5b225cb9b9cdf3a713ff4294fdd67","observation_id":"43c0b533-4ac5-4a04-9d05-714a5d021326","resolution":{"observed_at":"2026-08-06T17:38:17.320965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.179035Z","title":"In: ICML (2021) 4","venue":null,"work_id":"0d20093a-8fb8-4b5f-bcae-591f78267ecf","year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.439568Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:2ad18ff683681999c5a6c9683ab153cf33cae74f082b5d1aaf903998ad0c89f6","observation_id":"7233cdfa-b97e-478c-92fb-9754b71359eb","resolution":{"observed_at":"2026-08-06T17:38:27.263986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T17:38:17.535347Z","title":"arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.535347Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:7d839d5c2c98874e91c986da1dfdc868bab6ffcfb7aaa50d6441ad0f5dae95c5","observation_id":"b7ffccc3-a817-4768-aebb-b72c3e2920ec","resolution":{"observed_at":"2026-08-06T17:38:17.535347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.851599Z","title":"In: NeurIPS (2017) 3","venue":null,"work_id":"89716e15-c53c-48bd-98b5-2f489e88c7b8","year":2017},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.677509Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4a8f5c1b0a66111a688be28fc7196db7c2663106b6417dc6e2b336cade40eaa5","observation_id":"6a05af73-cc51-4fa8-a9fe-06b5697fa399","resolution":{"observed_at":"2026-08-06T17:38:27.011795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:38:17.726972Z","title":"arXiv:2409.12191 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.726972Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:48bab5146eabab9b75e2fce20ad296cfe336dd43bb665ce4075b31f06272c3d0","observation_id":"8d2417f6-8f7b-4124-ad1b-50160aa41901","resolution":{"observed_at":"2026-08-06T17:38:17.726972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.662530Z","title":"In: NeurIPS (2024) 3","venue":null,"work_id":"2d881958-27c6-4c55-8620-06b9f5650428","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.788180Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:75b3ae6bb2ffb47d6ba6abb4d1ce9165b6f5903092969602626d8746a7f124c6","observation_id":"fbe2b09d-1871-496c-8ba4-195f40160540","resolution":{"observed_at":"2026-08-06T17:38:26.719355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:17.876527Z","title":"arXiv:2409.02889 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.876527Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:0bb661ec4cb6ef60f53e2df3b57bab135dba59f5fa5529b033d5359770250372","observation_id":"d0e2a374-33f4-4108-a157-64655cfd577d","resolution":{"observed_at":"2026-08-06T17:38:17.876527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.435529Z","title":"In: ECCV (2024) 1, 2, 5, 6, 9","venue":null,"work_id":"29549632-b0a0-479e-8dae-0550322b0e5c","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.935120Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:abe0fa65e8be4c5d230e50022e725415a1e45d35e27e4057b7e95305f4508331","observation_id":"a9e902cd-cb82-47cf-82d4-603c9f294408","resolution":{"observed_at":"2026-08-06T17:38:26.539128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.158357Z","title":"In: NeurIPS (2021) 2, 6","venue":null,"work_id":"2d0761e5-2589-45a4-85b9-3cfeabaf2a34","year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.007029Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:33f35be6d7a7c634ac0f4d67ffc2f9980b80e6e3cdde4f18bc6a1466749a3fa8","observation_id":"511b4426-8679-44f0-a05d-b86c191e34b7","resolution":{"observed_at":"2026-08-06T17:38:26.310005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:25.780205Z","title":"In: CVPR (2021) 6 12","venue":null,"work_id":"6e46a85c-5100-4bda-a0a6-136cf0c27fb8","year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.031278Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:e3863343320b34896566d0768d37007891517ba3f61501907af65bb094f6b5cd","observation_id":"0de2c905-712d-4d08-b347-fd91b045fc66","resolution":{"observed_at":"2026-08-06T17:38:25.983174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13088","last_updated":"2024-02-20T15:30:09Z","snapshot_observed_at":"2026-07-06T17:32:56.445791Z","submitted_at":"2024-02-20T15:30:09Z","title":"Slot-VLM: SlowFast Slots for Video-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13088","snapshot_observed_at":"2026-08-06T17:38:18.120829Z","title":"arXiv:2402.13088 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.120829Z"},"links":{"cited_paper":"/paper/2402.13088","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:325941e9f50a0d950ad6caa30e83cfc3841bf70ac87527017acbc3356461e152","observation_id":"f7d431bf-cb92-4640-a746-f6f2056a90d8","resolution":{"observed_at":"2026-08-06T17:38:18.120829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:25.488541Z","title":"In: CVPR (2016) 2","venue":null,"work_id":"ddcb90fc-2cb0-450a-8467-61d3c2a8d11e","year":2016},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.244765Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fb0999a3372688e6fbb9d9a3ccff0833d914b6a24225b955213adeda8632f5f9","observation_id":"ebaffa45-cddf-4b24-9b6d-ca4799c54f16","resolution":{"observed_at":"2026-08-06T17:38:25.628447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T17:38:18.355450Z","title":"arXiv:2404.16994 (2024) 1, 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.355450Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ba242c15eb348526940fdeda8e1af7dc16e5d770c85ad2f5078a9a78f880c4f6","observation_id":"8da4eebb-4466-491b-b306-00581c9b7091","resolution":{"observed_at":"2026-08-06T17:38:18.355450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:25.216251Z","title":"RAL (2024) 1","venue":null,"work_id":"cf414538-091f-4eb6-83d5-38df6c4f0756","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.449200Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:8f97e941899709c1d1bd4e71d441743e76171bbaf2c3639c041c9794a7b92427","observation_id":"34460155-d1c6-48db-85f6-23598d400956","resolution":{"observed_at":"2026-08-06T17:38:25.341643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T17:38:18.564455Z","title":"arXiv:2405.20985 (2024) 3, 10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.564455Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6825056f56f8ec5a93708404f41e73e0ae405c15cc3fd97c64ad8aa3721ea044","observation_id":"7bf3ec7f-6b4a-4085-a110-40881a5299fd","resolution":{"observed_at":"2026-08-06T17:38:18.564455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T17:38:18.659223Z","title":"arXiv:2304.14178 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.659223Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:bab47e69ed3cdb4795bad3290009d1a9b0c1b09956bf5fae3f4b92bb4c7a1342","observation_id":"e5b3b342-ae0a-44a5-b0b4-153c0da017fd","resolution":{"observed_at":"2026-08-06T17:38:18.659223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:24.878566Z","title":"In: CVPR (2024) 1, 3","venue":null,"work_id":"7e6e6d9b-8697-40c9-b11d-3775db41bda6","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.725956Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:65605f415f031801dc8c852e1572abb63af1136a79050bb47474ae9be82f66bd","observation_id":"8e0faf98-bfa6-4278-8748-473a2e7926dc","resolution":{"observed_at":"2026-08-06T17:38:25.052767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:24.560963Z","title":"In: ICLR (2020) 6","venue":null,"work_id":"834164b1-d375-4b12-a797-952c892188d2","year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.776700Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:9fc589956b9c518a6ba31b7081ec33ee3136405261574fcc2269130ea91ca314","observation_id":"81106527-a8cd-4c8f-a833-43e854334668","resolution":{"observed_at":"2026-08-06T17:38:24.698975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:24.253798Z","title":"In: ICLR (2024) 2","venue":null,"work_id":"78d90923-cb68-4df0-9592-de7184a5e45c","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.945497Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6158ea2db49a1dddf1fd40e52bbbb3024661db98518bf7c29523404690d748be","observation_id":"0beed7bf-d1b4-4ce8-8fe0-58119cbd0be3","resolution":{"observed_at":"2026-08-06T17:38:24.434302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:23.964169Z","title":"In: ECCV (2016) 2","venue":null,"work_id":"e5541ffa-81dd-4efd-bd42-6d11fbe1b349","year":2016},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.078605Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b1b16f5c310d11a4c7ebeb1d3e54837f9133b0c7684e8a9149566b1369358542","observation_id":"0231cead-6e59-41bb-b365-ccd9cc2b50bf","resolution":{"observed_at":"2026-08-06T17:38:24.113166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:23.621830Z","title":"In: CVPR (2023) 2","venue":null,"work_id":"6352d618-ef3d-463f-9d45-dd90a6da8cef","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.188805Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:a068ba52a23231693fa357d2431282d0bb04323f645c88b94e8e8446bb7ad0d0","observation_id":"bc52b499-29e2-4fb4-a2ff-eff8f96974b8","resolution":{"observed_at":"2026-08-06T17:38:23.824932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T17:38:19.313543Z","title":"arXiv:2306.02858 (2023) 2, 3, 5, 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.313543Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:e081361133a931f2a187eafc2c899bd6503c0ea812ba042624eabf64677960f4","observation_id":"3726dca5-5270-440f-946b-40c29d849afe","resolution":{"observed_at":"2026-08-06T17:38:19.313543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-06T17:38:19.466169Z","title":"arXiv:2407.03320 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.466169Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:2addc02247aa72dc2de99ec73653380ed63379739cd77d869b57770d6b696608","observation_id":"5c636545-9057-455b-86a3-c57df509d1d2","resolution":{"observed_at":"2026-08-06T17:38:19.466169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-06T17:38:19.548969Z","title":"arXiv:2303.16199 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.548969Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:df45d911b96ebccd77eb1b7f9f1f199ab643eb1ecaa4fcc3988b8185077e6148","observation_id":"cf98a928-97fb-49f1-a8b2-0426a301e87f","resolution":{"observed_at":"2026-08-06T17:38:19.548969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-06T17:38:19.619551Z","title":"arXiv:2404.01258 (2024) 6, 9","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.619551Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:8d4f51be5a8c19adcc11a5b7fa4c328233cab238e9ad3eff954eb859828332ca","observation_id":"bc289c9d-427d-4610-8baa-f295ed061a79","resolution":{"observed_at":"2026-08-06T17:38:19.619551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:23.259839Z","title":"In: ICLR (2025) 5, 6","venue":null,"work_id":"d4ec5948-bc75-466e-87cb-0144ef922e59","year":2025},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.736433Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:5d1584772dda0d23e6fcfa66126b3d394cd3955eb0e724b9c3dd74620b73cbee","observation_id":"e819ecc3-4df0-474b-b1df-8a031c12164b","resolution":{"observed_at":"2026-08-06T17:38:23.450916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:22.936045Z","title":null,"venue":null,"work_id":"64dae292-4afd-45a1-a7f1-18d1f445a8a7","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.814174Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:57cec32a583c11237fa94db7b6dc5191766d476d7022933cf3ea95ec0e398313","observation_id":"4bc26048-147c-4687-835c-a95a3e75083a","resolution":{"observed_at":"2026-08-06T17:38:23.105549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T17:38:19.891685Z","title":"arXiv:2410.02713 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.891685Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:34c213c5f872f0283c0f166f33295f441d992c7d0d100aefe3de110fbe63b5ba","observation_id":"904869a4-664e-4648-b434-788a107d910f","resolution":{"observed_at":"2026-08-06T17:38:19.891685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T17:38:19.968980Z","title":"arXiv:2309.07915 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.968980Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:7cd80b71680d652c265fe186bacca36ed0153a522c896379f5a0220e6b951a18","observation_id":"17b80f1f-639d-4ed0-8004-9db7e39d7fca","resolution":{"observed_at":"2026-08-06T17:38:19.968980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:22.668270Z","title":null,"venue":null,"work_id":"fa6819b0-fb2d-4179-a886-b3acd8d422e4","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.040411Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ce6227346a06cf2329288fd0af3c4f7f9d821ce4f1cc7f9903a79ccc9e9da354","observation_id":"1cc34e76-338a-432b-b6d5-791c97873d5a","resolution":{"observed_at":"2026-08-06T17:38:22.784460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:22.345032Z","title":"In: NeurIPS (2023) 2","venue":null,"work_id":"176cbf5e-e636-4f8e-994d-b41437d0b71e","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.130340Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ffa535a780a9cd2c35efcee465c0ca8fadc9648aef903bea333d431baa3a4086","observation_id":"291812b2-9a35-4724-8333-e582821e6ec1","resolution":{"observed_at":"2026-08-06T17:38:22.525218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:21.971699Z","title":"In: NeurIPS (2024) 1","venue":null,"work_id":"8c0c1063-665e-4c22-a38b-01ab0914b448","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.238682Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:bcd577ce71b0052e36b5e3b489ce7c52c746cb01dce23070d17907f96186dbca","observation_id":"3aa8ffb8-1d66-486b-9788-233ae4cc58c3","resolution":{"observed_at":"2026-08-06T17:38:22.186809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T17:38:20.326601Z","title":"arXiv preprint arXiv:2407.14500 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.326601Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fab550208be37e8f4d878b4a0cb99bb456e7ccebd01f71fe02b84c02ebae1282","observation_id":"d69fd75a-9aa7-4bd6-928c-b428aaaf0e05","resolution":{"observed_at":"2026-08-06T17:38:20.326601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T17:38:20.409072Z","title":"arXiv:2406.04264 (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.409072Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6579ee8097ecd0a998b9b9361c5894049536c5aaf42b373f514d459d3fda6cbf","observation_id":"e973c4df-534a-4661-8449-cf606e65c9f5","resolution":{"observed_at":"2026-08-06T17:38:20.409072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:21.648937Z","title":"In: AAAI (2018) 2","venue":null,"work_id":"4780697a-a01c-4b76-8d38-d23b6768e504","year":2018},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.527167Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fcc9d4fb986965ee79b186ad9a84cb825723cc8825d7e2f8124c2001c772e816","observation_id":"e8ea2821-4834-40c5-8833-fc92a11bd334","resolution":{"observed_at":"2026-08-06T17:38:21.736590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T17:38:20.626312Z","title":"arXiv:2304.10592 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.626312Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:15db1385ed0ea8919e8e28037aa3bd75b3e0992103d086d41624504353d669f6","observation_id":"4144ffb2-608f-478b-b583-7ffa57eae19f","resolution":{"observed_at":"2026-08-06T17:38:20.626312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-07-06T17:02:05.607732Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-06T17:38:20.743420Z","title":"arXiv:2312.09251 (2023) 2 13","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.743420Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:185a8e45157190cadee566ca9f715bd6597e807647a6fa0bea410677003016f8","observation_id":"f7f5f831-62fd-475b-bc0d-3474d9e72514","resolution":{"observed_at":"2026-08-06T17:38:20.743420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2507.10302."}