{"as_of":"2026-08-15T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:784b04ea1f57bcb79bb0801c7cbda60f1daba2adfbb9d996ea121ee7fedb6384","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:31:59.644467Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:18:01.973663Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:28:04.138065Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14164","snapshot_observed_at":"2026-08-06T13:18:01.973663Z","title":"FoPru: Focal pruning for efficient large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.973663Z"},"links":{"cited_paper":"/paper/2411.14164","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:42a59a6d6ac4986b92c461cd2bd6cae61dcdb97523cafae822dff428a0f9b8aa","observation_id":"41ffb6cd-4e62-4975-bb51-ac4ff2dec3bb","resolution":{"observed_at":"2026-08-06T13:18:01.973663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2411.14164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14164","snapshot_observed_at":"2026-07-03T11:28:04.138065Z","title":"Fopru: Focal pruning for efficient large vision-language models.arXiv preprint arXiv:2411.14164, 2024","venue":null,"work_id":"52182e1f-6995-4a0e-b987-5df55a5b5f85","year":2024},"citing_paper":{"arxiv_id":"2606.12412","last_updated":"2026-06-10T17:59:57Z","snapshot_observed_at":"2026-08-03T05:45:43.148184Z","submitted_at":"2026-06-10T17:59:57Z","title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:24.118536Z"},"links":{"cited_paper":"/paper/2411.14164","citing_paper":"/paper/2606.12412"},"observation_digest":"sha256:17ec128388097883ee8743f1f7f6f3e65b320b142b99e755f2f4a05b0d2f8233","observation_id":"b28d75ea-ad84-4120-a553-fbcde58dc1c0","resolution":{"observed_at":"2026-07-03T11:28:04.139675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14164/citation-record","integrity":"/paper/2411.14164/integrity","json":"/paper/2411.14164/citation-record.json","paper":"/paper/2411.14164"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T15:31:59.476631Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.476631Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:13ce87fb232f6f68857d66eb3756e4a61ae19f536a667591a279861bad852784","observation_id":"db8227f8-147e-4253-b9ce-cb9b46f1f1a9","resolution":{"observed_at":"2026-08-12T15:31:59.476631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T15:31:59.481892Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.481892Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:fdd534ff5c36c1ee6b451cde857ffd1bd3edd5758cd6e8e506b077a32eb98448","observation_id":"872ca09e-972b-405c-b7ec-09fe25eba6e3","resolution":{"observed_at":"2026-08-12T15:31:59.481892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.487118Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.487118Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:1f59e9a1145d29ac5bafe646e99c59ef75555211447fcde1724f871d651981aa","observation_id":"45aa0da5-97f5-4cc0-94c2-534a372bfda9","resolution":{"observed_at":"2026-08-12T15:31:59.487118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-12T15:31:59.491831Z","title":"To- ken merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.491831Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:8798bb4011cebe9614b5b258ff9382c5fd24b07067689365769ecd044e2304b1","observation_id":"c4e0bd32-77d8-4629-8bd3-c51421c48563","resolution":{"observed_at":"2026-08-12T15:31:59.491831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:00.297966Z","title":"Vip- llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":"a357664c-343f-4ef5-8c39-ada78eb72582","year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.496469Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:f210f7a52c51111c8cf7834e47f9842e27c0e6595c15d59065cfd0aa6b9b766e","observation_id":"23a606ca-6404-4c92-a4dc-a4d1fca2a2f6","resolution":{"observed_at":"2026-08-12T15:32:00.302317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:00.284124Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"651f5b2e-0dcb-4a24-aee3-dd7a181e411a","year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.500945Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:ecd56307f6654e6faf008d269b834127537757a05a1c632edf33e9107811aa11","observation_id":"e0b08df6-00f3-4f40-8c41-b2feb04fa150","resolution":{"observed_at":"2026-08-12T15:32:00.288629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-14T09:58:22.897108Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-12T15:31:59.505542Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.505542Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:864168162bc604d5161b55aadf3fdc05a5a2a1aa403e8af24bd716392dff5828","observation_id":"6eaca42b-0de6-47f9-a1f2-48dec4c38701","resolution":{"observed_at":"2026-08-12T15:31:59.505542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T15:31:59.510689Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.510689Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:02f19f63da5fb24c3dff102db679f8b3a05e87e7956124adc8e586da88208f59","observation_id":"2adbd800-f522-440c-bbca-5c1d812a1a88","resolution":{"observed_at":"2026-08-12T15:31:59.510689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-12T15:31:59.515164Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.515164Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:d211f0703ca3872ab45dcf8e0f809d4e3a679ad35d7c1ac88da6aadd7718cb35","observation_id":"4d69ffdc-97d4-425d-b861-3cc5c7a8955b","resolution":{"observed_at":"2026-08-12T15:31:59.515164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T15:31:59.519727Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.519727Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:d3df2bb94909d4f6c36268c266527d48b0c11cb5c85ad6bfdb627e5e1afdfe15","observation_id":"62308d71-e63b-4ee7-9331-b78ce6aa90fb","resolution":{"observed_at":"2026-08-12T15:31:59.519727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03112","last_updated":"2025-05-29T12:31:57Z","snapshot_observed_at":"2026-08-13T11:49:03.699432Z","submitted_at":"2023-05-04T19:11:33Z","title":"Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03112","snapshot_observed_at":"2026-08-12T15:31:59.524484Z","title":"Mitigating undisci- plined over-smoothing in transformer for weakly supervised semantic segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.524484Z"},"links":{"cited_paper":"/paper/2305.03112","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:116c0feb063f64f725fc6f2f94275ae941a97aecd4010bc1716bb7f62921a5ba","observation_id":"c6fcfb3f-b9b0-4c66-958c-fbf697ffeddf","resolution":{"observed_at":"2026-08-12T15:31:59.524484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.529257Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.529257Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:915913d2ab8a5aab2276d250e714e22e05efb0d5c7e09043db4bd88bdba9a28e","observation_id":"da4056be-e374-407b-b2b1-c86e417c5ad9","resolution":{"observed_at":"2026-08-12T15:31:59.529257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.533871Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.533871Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:9dc15424a827cde571c46a5d590c4103d2638a21fdc94358ff2188a7a1ac4a12","observation_id":"6a6798ac-b1bf-48af-8f15-da704e40ccb8","resolution":{"observed_at":"2026-08-12T15:31:59.533871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:00.240011Z","title":"Llava-next: Stronger llms supercharge multimodal capa- bilities in the wild, 2024","venue":null,"work_id":"720f6f7a-956e-4e2b-9839-d7d10c260c4d","year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.543127Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:12f84a59a032c651d93e3b6a90f0da520b5074a088b18343b48bc39fc6764f05","observation_id":"7b56f0b5-555a-4d44-a954-d69ac04895f4","resolution":{"observed_at":"2026-08-12T15:32:00.244395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.547893Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.547893Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:a4b0ea4abef343881466ae62bd19c721e284c7f9423c1145a06040f23682aa83","observation_id":"debfac4b-95a8-4a29-906f-987e399f8058","resolution":{"observed_at":"2026-08-12T15:31:59.547893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-12T15:31:59.552458Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.552458Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:f98c4b84b4753ec1336a49bd12b4996d63b3154843c3924474a186592f64fde8","observation_id":"b9df33b0-369c-4531-afcb-3e94984d212a","resolution":{"observed_at":"2026-08-12T15:31:59.552458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T15:31:59.556790Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.556790Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:9b5206b45126fe4b8fbce5fcaef70397d5a94af3d79d5e96e66855b30be26400","observation_id":"28d7c062-e1de-4a34-b6ea-f3b52dcdcca5","resolution":{"observed_at":"2026-08-12T15:31:59.556790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:00.217402Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":"9d05b66c-0c88-4623-9bd8-ab31449cafb0","year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.561383Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:c8996918ab23949b5f7b4290f8a69c118da93fc8680ac4bc8d5019e2a749ff5f","observation_id":"579c04ec-67c3-4821-a427-68dd004d9182","resolution":{"observed_at":"2026-08-12T15:32:00.221877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.565487Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.565487Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:10d6d0d5db7d92353bf5b68d17701f9e101894389ed12638a487bfc6b481e7a9","observation_id":"8b30e869-b499-425c-a72d-f627a50e1ed3","resolution":{"observed_at":"2026-08-12T15:31:59.565487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.570078Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.570078Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:bd0ec0b33f14867ddc526b45349ea291fd1a4a2b90d70476d95e7cebb522303e","observation_id":"08d7fe03-6b23-4d81-8b19-329bb8cef50d","resolution":{"observed_at":"2026-08-12T15:31:59.570078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-12T15:31:59.574233Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.574233Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:2ccc693af284c43c3313d14c0cbbdd6b3fe0ac2bd8cf53f6b126b3b91923ecf3","observation_id":"fa296f04-2fe7-441e-88f7-f56d29bbfa5f","resolution":{"observed_at":"2026-08-12T15:31:59.574233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.579416Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.579416Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:0ea9ef4ce972e512183ec23ecee9d393e189955675b3c5293efef18a34015534","observation_id":"758ccf5c-db25-46e5-b383-f98da0ac6e4f","resolution":{"observed_at":"2026-08-12T15:31:59.579416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T15:31:59.584282Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.584282Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:7767c492df1d4566b6c68af2efd1a5112f51837a73df168fb6309a5a30492ccf","observation_id":"b32fa945-9439-4ee8-a624-454f1b08a336","resolution":{"observed_at":"2026-08-12T15:31:59.584282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.588618Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.588618Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:7b6e282b4b8a7d607247791b83b4703c45cb46ca0c3de3419bcd77554af60ac0","observation_id":"5f19cbb5-f716-4625-9575-a0d478a3977e","resolution":{"observed_at":"2026-08-12T15:31:59.588618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:31:59.592952Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.592952Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:32c3506afac20969860ba25a2fb89b1426053e3bbe8cf2f8ff624cd5f7d1c273","observation_id":"9e6919cc-55a7-426c-90a5-83b0e81fa39e","resolution":{"observed_at":"2026-08-12T15:31:59.592952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T15:31:59.597350Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.597350Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:73c569865a4de9a9afd73068b1828bb6d32e0362650afad0270e08db0e209192","observation_id":"13f29409-05bd-4f6f-8156-48011eb7d8af","resolution":{"observed_at":"2026-08-12T15:31:59.597350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T15:31:59.601712Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.601712Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:518379eb6daaa962b2dc4ff60e60668abd789a44c5c7756122cd7e4d200f36d2","observation_id":"9ef5a90c-9652-4ce0-86fa-b511f526d811","resolution":{"observed_at":"2026-08-12T15:31:59.601712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T15:31:59.606386Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.606386Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:161f2a8ca0e63d8975f3a59ef6f113f8156f3613f2ff27361376b016df08b4c2","observation_id":"5ff5cd4d-0220-46b9-8588-730cdad390dd","resolution":{"observed_at":"2026-08-12T15:31:59.606386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-12T15:31:59.611155Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.611155Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:f2439a5ee3d8a18a0a95788f73dd4f995f2e44e3216af9e70033649f4edfa8e3","observation_id":"4717be79-c53a-4b50-921b-984e1ec7af9e","resolution":{"observed_at":"2026-08-12T15:31:59.611155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13800","last_updated":"2024-11-14T23:53:05Z","snapshot_observed_at":"2026-08-13T00:02:01.586554Z","submitted_at":"2024-05-22T16:25:03Z","title":"Dense Connector for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13800","snapshot_observed_at":"2026-08-12T15:31:59.615606Z","title":"Dense connector for mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.615606Z"},"links":{"cited_paper":"/paper/2405.13800","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:5b5bd98a63dec4a63fc51a03e2201a8d871dae65984e3ebe2235f93362ec61ad","observation_id":"d43c3b93-998c-4912-a1da-37ab5b1d91dd","resolution":{"observed_at":"2026-08-12T15:31:59.615606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-12T15:31:59.619881Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.619881Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:c2f32c11fb08daced5f5cedb427a434967a0d384546ae0c1ca48ad5ea233dc27","observation_id":"35422bff-9241-458e-b612-0c18351d37c7","resolution":{"observed_at":"2026-08-12T15:31:59.619881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:00.167242Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"87608213-124f-469d-8bfe-f62297b6fd4b","year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.624666Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:c8d856a2c6f16e6fa6fc14de51e4626ffc2ff0af8f494a4b47b238ebad897c2b","observation_id":"2f8fb637-e32f-4b4a-bd4a-03fbd19a2ea8","resolution":{"observed_at":"2026-08-12T15:32:00.171833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19101","last_updated":"2024-12-19T08:00:44Z","snapshot_observed_at":"2026-08-12T23:33:43.957187Z","submitted_at":"2024-06-27T11:28:36Z","title":"DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19101","snapshot_observed_at":"2026-08-12T15:31:59.629310Z","title":"Dockylin: A large multimodal model for visual document understanding with efficient visual slim- ming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.629310Z"},"links":{"cited_paper":"/paper/2406.19101","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:ef6398ae9c200a18bb78e64177f415a2b985aa0c51eee79253a40050c33dff63","observation_id":"4cb094ab-17e0-442b-8e41-0cfaedb324df","resolution":{"observed_at":"2026-08-12T15:31:59.629310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-12T15:31:59.634230Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.634230Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:76fc802a583bfb280b5b12f01c1bb7dad672eaaf7cf6b3cec474539ceed141d5","observation_id":"e86d7296-89d5-4b09-8265-3e093fb1b967","resolution":{"observed_at":"2026-08-12T15:31:59.634230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T15:31:59.639379Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.639379Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:ff06c49bc2aa1b012bfa40a9a3752d397242f5f229d1b593662ddebe0591ffc6","observation_id":"7868158f-73dd-4e55-8e48-45c883b69eb0","resolution":{"observed_at":"2026-08-12T15:31:59.639379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:00.151469Z","title":"The trend is smoother compared to rank pruning, where accuracy often rises more sharply at lower ratios (e.g., Ocrbench)","venue":null,"work_id":"de0467fe-60f4-4232-a53a-641041babee3","year":null},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.644467Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:ad2323e17078ffd062c6df089f70a0ffbdf257c1f934f27384cd11187e19b001","observation_id":"33ba7d4a-8565-4683-9490-c9f6db6125b6","resolution":{"observed_at":"2026-08-12T15:32:00.157804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:00.253317Z","title":null,"venue":null,"work_id":"7fcb2261-b345-4c64-8209-d02cfafaf4c9","year":2016},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.538808Z"},"links":{"citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:b61b9a5d1c01a6508bf2e704ab8532bc8206613b7895fbb889d6f748f389d1f8","observation_id":"dc4be51d-ce40-4950-840d-90e17a451bd3","resolution":{"observed_at":"2026-08-12T15:32:00.258193Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":30,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2411.14164."}