{"as_of":"2026-08-18T13:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f074b73ae0803a464a8f5fa97467460e6b423b43ca308fec084c140e3b757a75","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:21:34.883733Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:19:24.219539Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T17:45:25.594440Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15453","snapshot_observed_at":"2026-08-06T15:19:24.219539Z","title":"Enhancing instruction-following capability of visual-language models by reducing image redundancy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-13T20:22:14.596107Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.219539Z"},"links":{"cited_paper":"/paper/2411.15453","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:65bba573f6461fb6ffe55c281c0cefff56fad8daa28d0270f731c48889414dd7","observation_id":"ba3da3bd-99a7-4c67-87fa-f21e8ebb26f3","resolution":{"observed_at":"2026-08-06T15:19:24.219539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"cited_work":{"arxiv_id":"2411.15453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15453","snapshot_observed_at":"2026-08-05T17:45:25.594440Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","venue":"cs.CV","work_id":"e42e1849-1fea-4e44-9e4e-ca5c2f3e1d94","year":2024},"citing_paper":{"arxiv_id":"2508.15694","last_updated":"2025-08-21T16:21:46Z","snapshot_observed_at":"2026-08-13T23:28:36.851209Z","submitted_at":"2025-08-21T16:21:46Z","title":"GoVector: An I/O-Efficient Caching Strategy for High-Dimensional Vector Nearest Neighbor Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:22.575645Z"},"links":{"cited_paper":"/paper/2411.15453","citing_paper":"/paper/2508.15694"},"observation_digest":"sha256:821826a25dcd704c33f3ee443a343f88151a081d1d056660d6cabb6f13509c4b","observation_id":"a3f681dd-5629-44b2-99c5-05cccb89b915","resolution":{"observed_at":"2026-08-05T17:45:25.681289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15453/citation-record","integrity":"/paper/2411.15453/integrity","json":"/paper/2411.15453/citation-record.json","paper":"/paper/2411.15453"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-16T14:28:08.030037Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-12T14:21:34.648846Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.648846Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:e7bbe75f93a5ad9831d48395d60c3c6e8eb82ef2dd0c5c9dfda7907eb39a92c0","observation_id":"bfdcc233-3c64-440b-a9ba-6e6676a59393","resolution":{"observed_at":"2026-08-12T14:21:34.648846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.655050Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.655050Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:a064c9b6e4d9d5b7ff851b5d24c44817e680da9a3d5013bdf7d9506ecf731d6b","observation_id":"fec0190d-6334-4ec8-ad40-09fbc9f4dedb","resolution":{"observed_at":"2026-08-12T14:21:34.655050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.659870Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.659870Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:81ed4227282d321e6e75993d80e61465db8097afdae59a724e7667db292f7cb2","observation_id":"97481105-b6bb-4edd-9482-468496acff33","resolution":{"observed_at":"2026-08-12T14:21:34.659870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:21:34.664086Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.664086Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:98cbdf968bdaf8626547372ae8b43d4a1cf951f585220c22222044cc7c4a205c","observation_id":"6cb39386-d352-4df8-b5d3-25d4ec998ebd","resolution":{"observed_at":"2026-08-12T14:21:34.664086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.732295Z","title":null,"venue":null,"work_id":"3398c6a9-36d8-4712-9783-a1ac18ce2c2f","year":2022},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.669040Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:37c17aa8429bbade74c9662c1b4809d8ff4373f1a17cef436d5a8bc551fde16a","observation_id":"b2883594-10bc-48cf-a758-52a2f3ecf323","resolution":{"observed_at":"2026-08-12T14:21:35.736555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T14:21:34.673746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.673746Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:1eafc9401c38227263c7e2de82e1059e249a17fc0e72420c12e7fc10b7c8de26","observation_id":"8ba58933-ebfb-4b45-b033-fc65a2a9d328","resolution":{"observed_at":"2026-08-12T14:21:34.673746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.678796Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.678796Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:536c7597ac947b843d10b5fbdff8707e45ad3b8d34d5f57df309dbf01346ff60","observation_id":"934d00c2-332b-4d18-b965-c404f8669cfa","resolution":{"observed_at":"2026-08-12T14:21:34.678796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.684323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.684323Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:f66f69a445d1eb3e0b771e7a66d48b8dc823ab85565e8a54e278a04643d4ff07","observation_id":"5b2b603d-3e20-47e0-91c6-e83a0827ee7f","resolution":{"observed_at":"2026-08-12T14:21:34.684323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17530","last_updated":"2023-05-27T17:16:27Z","snapshot_observed_at":"2026-08-18T12:52:10.026734Z","submitted_at":"2023-05-27T17:16:27Z","title":"PuMer: Pruning and Merging Tokens for Efficient Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17530","snapshot_observed_at":"2026-08-12T14:21:34.689280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.689280Z"},"links":{"cited_paper":"/paper/2305.17530","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:ee133fe7f0eef65960120163a5f264eac16564af6d3da681788d919923db59d7","observation_id":"fd31cc0c-f7a0-4a03-93cd-82d5f2a7d105","resolution":{"observed_at":"2026-08-12T14:21:34.689280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.703512Z","title":null,"venue":null,"work_id":"6d27d9da-206e-42c8-bb56-baf0f0cf79ef","year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.693856Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:dd125782444e0a73f3020c8b76e27a8ede70c226148b1d12e1f55fc94e703f97","observation_id":"033d3e43-1c10-4d41-b9d9-17738af2932d","resolution":{"observed_at":"2026-08-12T14:21:35.708288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-12T14:21:34.699177Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.699177Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:0d2a1ffefd2c21c51ed9b2a5cae547b587fc1f281395755bb424a076aa86e4c1","observation_id":"220e32d6-2416-4f56-b817-71c22e3d438d","resolution":{"observed_at":"2026-08-12T14:21:34.699177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T14:21:34.703412Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.703412Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:25629cb164c62f1ce57dd0156bddeea94a4a96e775d4e49bcd97299b1d92a051","observation_id":"2a91a72e-b111-40a8-81fa-d69822036f7b","resolution":{"observed_at":"2026-08-12T14:21:34.703412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.708001Z","title":"E.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.708001Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:c0cb4012c4f7ef919c033433ea340d1f0021347ebe9a8f1a45a47dff13f904af","observation_id":"af5677ec-ce38-4ff4-920b-d4aa6a29049e","resolution":{"observed_at":"2026-08-12T14:21:34.708001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-12T14:21:34.712391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.712391Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:958e1b09f0d089af019769c5a123ae68642800854bd5c85e4f0f8aef491f7080","observation_id":"476d3616-7fa3-47fa-8be9-066cf295c02c","resolution":{"observed_at":"2026-08-12T14:21:34.712391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.681159Z","title":null,"venue":null,"work_id":"dbfcf075-9d6b-47ed-9a08-be1b39817b12","year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.716326Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:4f7a25c1e6c2ac2ce6359753251264ca3c0ed1169c055fa8f129d81fe1626f4e","observation_id":"3d81df49-44a7-46fc-be70-918bee1e5dc5","resolution":{"observed_at":"2026-08-12T14:21:35.685668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:21:34.720334Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.720334Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:21e26d68a8b3b0ab14dae746903b35062c6b7ed4a4dba95489d83dfd820682ab","observation_id":"33a1fe99-d3d3-4df9-bc2e-4b8e59360e68","resolution":{"observed_at":"2026-08-12T14:21:34.720334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T14:21:34.724684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.724684Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:0d5169208efad8e28e7a9f600467410350ec41da9e013ba9195ea59e96abaeaf","observation_id":"fa32e8c2-2e75-4a29-98e7-558b34d29205","resolution":{"observed_at":"2026-08-12T14:21:34.724684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.729037Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.729037Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:97daefc494f47df083670fba18e6bb9c0e4b28d4c9d4be6493a34c820c780aa5","observation_id":"0c8d4602-3f82-44d5-a6cb-1e098fd4b37e","resolution":{"observed_at":"2026-08-12T14:21:34.729037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.661477Z","title":null,"venue":null,"work_id":"fc1df86b-0c58-4533-b87c-dd992ef3b0d5","year":2022},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.734631Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:9d18b40a7b8838379c079237467d9a1539f694b0c519b12ecbfb03ae0d28cb54","observation_id":"5994cfb4-0c2b-47fb-b066-1e84d08e9b1f","resolution":{"observed_at":"2026-08-12T14:21:35.665203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.738551Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.738551Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:f0069faff32e666ea072d6ab2b2beea799c6a974b1b4d8f645edea6b61d32cfa","observation_id":"8fcd0e5a-a5c4-41c0-8003-fef3fe760a52","resolution":{"observed_at":"2026-08-12T14:21:34.738551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-12T14:21:34.743132Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.743132Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:c8fe2a4609936397e99f5f704fdfb2a3fde6c292cbb989cec73b2fe263e3cc04","observation_id":"6487c2b4-59f1-4538-aa4e-0767c51e811e","resolution":{"observed_at":"2026-08-12T14:21:34.743132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.747404Z","title":"A.; and Manning, C","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.747404Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:493f95c2ff2e48d321da67fef8d1f75d5de00607613f6307a9356c8498231191","observation_id":"794c8a28-881d-434b-afe8-b640b4a62ed2","resolution":{"observed_at":"2026-08-12T14:21:34.747404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.631325Z","title":null,"venue":null,"work_id":"383c780f-9cf8-422b-b6a0-6bd6183ac086","year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.751001Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:b6753f012361459cc822af17fdf8751f6d7bede6e36cc787684950d3e1f00a5d","observation_id":"c28dd39a-3662-41fa-a368-26501a2b1cd1","resolution":{"observed_at":"2026-08-12T14:21:35.635332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-12T14:21:34.754809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.754809Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:47a42cab838163df65e581c8e56ccd2ad8b09aa3ecf6135adafc4a2086a017eb","observation_id":"c0984625-26e8-483a-8e0b-cb1c6682a783","resolution":{"observed_at":"2026-08-12T14:21:34.754809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.619185Z","title":"M.; Bommarito, M","venue":null,"work_id":"06faa462-fc90-4426-9151-d181dcd35fd2","year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.758912Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:f61ac766237b07e7538479053a02d4f053f32f421f11510a56687ca3040c8185","observation_id":"2cde3319-c7e3-47de-b200-b2d9fb282b7f","resolution":{"observed_at":"2026-08-12T14:21:35.623222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18406","last_updated":"2024-03-27T09:48:23Z","snapshot_observed_at":"2026-08-16T14:05:58.376161Z","submitted_at":"2024-03-27T09:48:23Z","title":"An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18406","snapshot_observed_at":"2026-08-12T14:21:34.763655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.763655Z"},"links":{"cited_paper":"/paper/2403.18406","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:f7d90ff4ed5e9a646dcc4a3e6a3a5af31259d4689162875a9a129ac9a5857dbd","observation_id":"304945a7-11f1-43ba-8ea5-4def64e1f41d","resolution":{"observed_at":"2026-08-12T14:21:34.763655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.604361Z","title":null,"venue":null,"work_id":"53e2c49c-dad7-4123-9c45-79ef040a17ed","year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.768281Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:697f28894dc7a08e222ff8007785020ce08ca859da2a536522b09fb1ce072c1e","observation_id":"da516c66-8aba-4538-bf4a-758f49d5f36d","resolution":{"observed_at":"2026-08-12T14:21:35.609031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04219","last_updated":"2023-11-07T18:59:58Z","snapshot_observed_at":"2026-08-16T14:45:10.647424Z","submitted_at":"2023-11-07T18:59:58Z","title":"OtterHD: A High-Resolution Multi-modality Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04219","snapshot_observed_at":"2026-08-12T14:21:34.771888Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.771888Z"},"links":{"cited_paper":"/paper/2311.04219","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:1713071d36ee95d6c920af5d9bb97d937e6f2bd74e8e5842d8ccaf07bbd0a522","observation_id":"d79ab744-ba17-45b0-9e0b-ab8799d6b314","resolution":{"observed_at":"2026-08-12T14:21:34.771888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-12T14:21:34.776149Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.776149Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:9713acea82aac29474d8fc3f4bb413fe1d6ea08cb02d8ceb37f40234c11a73ce","observation_id":"a7f9b2a6-da60-4150-a6a5-67274334256c","resolution":{"observed_at":"2026-08-12T14:21:34.776149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.780220Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.780220Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:dd227c67cdce6afa6690e6ce1fefcefa6d0aea91d6807ff6bf7b7a89cb3cddcd","observation_id":"d112de80-b060-45f1-9afd-c2a66e8717f6","resolution":{"observed_at":"2026-08-12T14:21:34.780220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T14:21:34.786706Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.786706Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:aa013113ec8c474d8ff8d4fdf24ffeb7624caf2a13b29f92a93d6f6f9fb2df51","observation_id":"3fdc6136-e95c-4799-b64c-b594606e0d99","resolution":{"observed_at":"2026-08-12T14:21:34.786706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T14:21:34.791499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.791499Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:a8a1b1631e6f956e666481bfbd071938bfe702159f5732270769b2515a622cc4","observation_id":"18d52d78-545d-4e99-b1cf-c99881318b9b","resolution":{"observed_at":"2026-08-12T14:21:34.791499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-12T14:21:34.795861Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.795861Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:56841145ae93f89f790703c7a6c80fb40e4edeaa8f55b255c5d206f68a7b4e14","observation_id":"7e3ce87b-2785-4118-a9e7-ee615e3344d7","resolution":{"observed_at":"2026-08-12T14:21:34.795861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.800147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.800147Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:ef07d9a642cc715a737605cad0115617024f6f74bc3129fd261302939f8ebe52","observation_id":"aade3e33-5607-442c-96a5-b7dcc3742a0a","resolution":{"observed_at":"2026-08-12T14:21:34.800147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.804487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.804487Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:049d762f34db481a4f6123c5c6badbd9fe7223aedd3a57328b9b94b76076dae4","observation_id":"829a9214-bafc-46d1-b88c-9488f25397a1","resolution":{"observed_at":"2026-08-12T14:21:34.804487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T14:21:34.808514Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.808514Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:e464d5f38742b4532cd7e7381f4a87aacb82565eaf724d98b3cba20d33e01ef1","observation_id":"1bc045fd-3104-44cc-97be-ab789dbf8c3d","resolution":{"observed_at":"2026-08-12T14:21:34.808514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-12T14:21:34.813356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.813356Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:bc3e9cecf8cad3bc5c960d3204b10ca509b0e9f4d5ced2d138cbfef44bbd4ace","observation_id":"eae51f99-e8c4-43d4-9e4e-e4dd83cc4877","resolution":{"observed_at":"2026-08-12T14:21:34.813356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-12T14:21:34.817645Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.817645Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:0d7163f216fb34bf1cacb8f1f47051ddd0bc13f9b0bb2ab1dc96e77c8ce45fb3","observation_id":"b880f91c-ec04-4505-b538-480c237f60b2","resolution":{"observed_at":"2026-08-12T14:21:34.817645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.821523Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.821523Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:a8e5907eb78f4dcc85061471d0785e530f0a59ab7af84ea66a2096d228ea6881","observation_id":"40649477-08fa-4b19-91f8-e22bf1433a3e","resolution":{"observed_at":"2026-08-12T14:21:34.821523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.825034Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.825034Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:cac73532d1ec5fca269b09f3a4b4526e3d5d28e4d8f466acdfa1816444fcfe88","observation_id":"505bd8f3-378d-4145-9875-c8cc1c52adbf","resolution":{"observed_at":"2026-08-12T14:21:34.825034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.828599Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.828599Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:bb65d79a8acb08ee73670ff8b8c16da68fb2a50b4e54d46e9d22e403238dbd2b","observation_id":"fb3d6a5d-b454-40fe-a1c3-d50bb490a486","resolution":{"observed_at":"2026-08-12T14:21:34.828599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.832084Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.832084Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:d25861bd094a097dfb0d27335111722e8e832a9cbd56bb44bf25d0c056b085a5","observation_id":"5942c393-4a04-4fda-9c5a-cad874f379ba","resolution":{"observed_at":"2026-08-12T14:21:34.832084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.836981Z","title":"J.; and Yan, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.836981Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:4db5fda9568a90fa5f5af05fe2cc306d3228d8474f5ce0981eeb4fbc174cd84d","observation_id":"3f55ba0f-5e3d-4ac2-9a7b-5e88cbe8d15c","resolution":{"observed_at":"2026-08-12T14:21:34.836981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.841096Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.841096Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:a1b17ae425c801488de2ce20b214dddd5ae4ef87ff29916401f2db8b8db97a2d","observation_id":"2acbabdd-d441-4abf-a6de-c4091218ef70","resolution":{"observed_at":"2026-08-12T14:21:34.841096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.844867Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.844867Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:7349e3613c20bcdd847dd313e5a9f6535f189da24bc864b0a13c1bab4e0ee279","observation_id":"c19be0be-6dea-4578-953b-8f88991e100f","resolution":{"observed_at":"2026-08-12T14:21:34.844867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T14:21:34.848280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.848280Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:e97c4b8a1a1820177ff96a92158e3335f2f6e0588e6c3cc670481dfa6ab58f38","observation_id":"a5a64b03-b089-42a2-9944-5a22f60b2b84","resolution":{"observed_at":"2026-08-12T14:21:34.848280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T14:21:34.852530Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.852530Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:2af2a05a454bc456887210e916be5132c298786143c0277a11d207fc443fd8a0","observation_id":"634f3212-6bf5-41ba-b408-0c6bca286042","resolution":{"observed_at":"2026-08-12T14:21:34.852530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-17T01:19:18.409791Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-12T14:21:34.857038Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.857038Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:3b5987d38f2aaec6483d7cfe1804d66b75c7f3eebf1683708cd559ccc70a9bde","observation_id":"a4c9044f-8546-4431-9d3b-f534c47f891d","resolution":{"observed_at":"2026-08-12T14:21:34.857038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15033","last_updated":"2024-02-26T15:26:20Z","snapshot_observed_at":"2026-08-16T15:30:12.949513Z","submitted_at":"2023-05-24T11:18:00Z","title":"SmartTrim: Adaptive Tokens and Attention Pruning for Efficient Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15033","snapshot_observed_at":"2026-08-12T14:21:34.861100Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.861100Z"},"links":{"cited_paper":"/paper/2305.15033","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:f7afe1fcbbdafa290e99eadf50ac31bf0a207b456ef12054eb62c204dfc6e56a","observation_id":"6b0e6642-c249-4dca-8626-087a0eddbcd1","resolution":{"observed_at":"2026-08-12T14:21:34.861100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.392920Z","title":null,"venue":null,"work_id":"469b52a2-921c-4e3e-8e96-2f3457c30676","year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.865081Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:dc5b4cc9d2c2113cff90fbfe81dc1bd7466b59a1481330a7efd4800c75b189e8","observation_id":"1fe18d07-90c8-4940-9f68-66e75506af6a","resolution":{"observed_at":"2026-08-12T14:21:35.397729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08005","last_updated":"2023-02-10T06:51:56Z","snapshot_observed_at":"2026-08-16T17:20:53.529877Z","submitted_at":"2022-02-16T11:42:34Z","title":"Should You Mask 15% in Masked Language Modeling?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08005","snapshot_observed_at":"2026-08-12T14:21:34.868682Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.868682Z"},"links":{"cited_paper":"/paper/2202.08005","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:e19838b3da380e6db9ba01d4fcddffaa0984d18f3b1afe4cfeac000ada20ab98","observation_id":"8b7c15e2-fd0a-4fac-99ba-3837589499df","resolution":{"observed_at":"2026-08-12T14:21:34.868682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T14:21:34.872391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.872391Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:18f06fdc608266eb5f1dc0c6c0af46d3503c23b2a09670cda91ed3166b67a1f2","observation_id":"ef32f889-edb0-484f-86f7-91a1467a4adb","resolution":{"observed_at":"2026-08-12T14:21:34.872391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:35.377197Z","title":null,"venue":null,"work_id":"99c6a923-85e2-4baf-b1c9-7d498e7c5ee9","year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.876152Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:6f37169439dbf6d946a99a85730c1d74ed53e19f496658072576776fb7304192","observation_id":"51149963-7a1f-4e81-a36f-2f4b57600d24","resolution":{"observed_at":"2026-08-12T14:21:35.383410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:21:34.879921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.879921Z"},"links":{"citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:85c6d9ac16710b9a7c023e08b2b1d0b7c87944b160f83c0945433f545e9a5406","observation_id":"d71aea1f-e280-4820-8845-7debb73c14fd","resolution":{"observed_at":"2026-08-12T14:21:34.879921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-12T14:21:34.883733Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.883733Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:aa32524a810ab95349f665707ecfe25f006b56c604f2fd6d1a4b8db6d5868ce7","observation_id":"84837abe-8bbc-4d0b-9e66-bfaa44e232f9","resolution":{"observed_at":"2026-08-12T14:21:34.883733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2411.15453."}