{"as_of":"2026-08-10T09:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:052029eef97ff8e9fbc1b17c5d11e15962c078aff112cee2302a5e359a504fb3","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:26:19.007163Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:09:22.538353Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:07.123416Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-02T12:34:37.611019Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:28354f9bd8c29e3c87892a51fcc621cae5a95291bd1c855b096da36b2919ef0f","observation_id":"341e1f61-fa3e-416f-970b-95f992795572","resolution":{"observed_at":"2026-05-18T12:32:36.355166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-08-03T21:09:22.538353Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models.ArXiv, abs/2502.01419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16672","last_updated":"2026-06-09T22:19:41Z","snapshot_observed_at":"2026-08-06T04:41:40.984877Z","submitted_at":"2025-11-20T18:59:54Z","title":"EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:22.538353Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2511.16672"},"observation_digest":"sha256:6d27335b6e91de99614095f0142c9610453748b1209a69edb6a4a8a7fda2fea4","observation_id":"25c8c43b-135f-4629-87e9-c85888966d5d","resolution":{"observed_at":"2026-08-03T21:09:22.538353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2604.05497","last_updated":"2026-04-07T06:41:05Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:41:05Z","title":"Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:45.417233Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2604.05497"},"observation_digest":"sha256:52c3249c2379ab086506956536719effceda76322d9980f101632f779162d849","observation_id":"cfb9597e-fe8a-42ce-abaf-2b0832b018fb","resolution":{"observed_at":"2026-05-10T23:30:50.600673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2604.10999","last_updated":"2026-06-06T02:58:48Z","snapshot_observed_at":"2026-08-08T01:31:41.325067Z","submitted_at":"2026-04-13T04:58:52Z","title":"TraversalBench: Challenging Paths to Follow for Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:25:38.215013Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2604.10999"},"observation_digest":"sha256:994421b16d41115f17d21fa68ecdb3613696581357ec0575c37391c4d861ef71","observation_id":"dd292eed-8c43-4279-927b-c44726795d69","resolution":{"observed_at":"2026-05-11T10:36:02.729236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2604.25273","last_updated":"2026-04-28T06:29:27Z","snapshot_observed_at":"2026-07-06T23:11:11.827339Z","submitted_at":"2026-04-28T06:29:27Z","title":"Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T16:56:52.714346Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2604.25273"},"observation_digest":"sha256:12286c0ac49c316d29d998a518d43169aa6d3158e2fb75ff0da55e8a552adc02","observation_id":"1e295fe0-14a8-46f4-81ee-d81be756772d","resolution":{"observed_at":"2026-05-11T23:31:13.633902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2605.25799","last_updated":"2026-05-25T12:49:15Z","snapshot_observed_at":"2026-07-06T23:35:41.527169Z","submitted_at":"2026-05-25T12:49:15Z","title":"Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:28:35.155099Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2605.25799"},"observation_digest":"sha256:337fbb5a20a180e020394388d3fadb883c58321276d67679bb253ec30079dcd0","observation_id":"406b86ce-0591-4441-967b-0ab2d5884f90","resolution":{"observed_at":"2026-06-29T22:34:01.851487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2606.07647","last_updated":"2026-06-02T08:23:28Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-02T08:23:28Z","title":"Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:22:40.055153Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2606.07647"},"observation_digest":"sha256:672dbfcf5c08e4a712d6112493abd7d23823a313bfdb38aa59addd5bad51e545","observation_id":"a2a9f9a6-797d-441c-a065-0f67309b9ebf","resolution":{"observed_at":"2026-07-02T03:06:29.650511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2606.25432","last_updated":"2026-06-29T19:08:38Z","snapshot_observed_at":"2026-08-06T21:03:12.899914Z","submitted_at":"2026-06-24T05:50:28Z","title":"Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-25T21:05:36.836361Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2606.25432"},"observation_digest":"sha256:d8955500e7297e7b54900486a8863b2173e04f81908e25dcec573264916c0860","observation_id":"a95a305f-3762-4453-8a21-7134a1e655c8","resolution":{"observed_at":"2026-07-04T19:40:07.125342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.01419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01419","snapshot_observed_at":"2026-07-04T19:40:07.123416Z","title":"Visual attention never fades: Selective progressive attention recalibration for detailed image captioning in multimodal large language models","venue":null,"work_id":"2a84126a-4a9f-432a-bb76-0706a8a5c718","year":2025},"citing_paper":{"arxiv_id":"2606.25432","last_updated":"2026-06-29T19:08:38Z","snapshot_observed_at":"2026-08-06T21:03:12.899914Z","submitted_at":"2026-06-24T05:50:28Z","title":"Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-01T06:30:27.178950Z"},"links":{"cited_paper":"/paper/2502.01419","citing_paper":"/paper/2606.25432"},"observation_digest":"sha256:1d6196621e6ab5cc23e80eb20c4d7dd326dd1b1b5e098d45680df31f4e4b245f","observation_id":"6272d759-cbc3-4095-bf0c-48fdcb8124ff","resolution":{"observed_at":"2026-07-01T09:35:39.546947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01419/citation-record","integrity":"/paper/2502.01419/integrity","json":"/paper/2502.01419/citation-record.json","paper":"/paper/2502.01419"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-09T15:26:18.616973Z","title":"A., Bach, N., Bahree, A., Bakhtiari, A., Bao, J., Behl, H., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.616973Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:c1509342879564640e7c8a3160487c35af910a347c12695b1aff198ab6b3487e","observation_id":"dc454b96-53da-4674-9971-29ee93a38a47","resolution":{"observed_at":"2026-08-09T15:26:18.616973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T15:26:18.622787Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.622787Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:9a55774dc442d226f8bbc5166d6d9351a7767c3dfb89c832c566439633486577","observation_id":"929745e4-1eb3-46e7-926d-d7eee55e8359","resolution":{"observed_at":"2026-08-09T15:26:18.622787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-09T15:26:18.749075Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.749075Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:3c22758cc9f1e617672495b66c0ce79652050f4f819ef1c8cf5c26fa804c624d","observation_id":"c6b79058-3286-4746-ba23-fa5799509d55","resolution":{"observed_at":"2026-08-09T15:26:18.749075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04236","last_updated":"2024-06-06T16:35:36Z","snapshot_observed_at":"2026-08-07T13:15:20.097995Z","submitted_at":"2024-06-06T16:35:36Z","title":"Understanding Information Storage and Transfer in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04236","snapshot_observed_at":"2026-08-09T15:26:18.754601Z","title":"Understanding information storage and transfer in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.754601Z"},"links":{"cited_paper":"/paper/2406.04236","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:4ab62adf9877c75d86990be3533257199825ca8340d68b2dbf3fca842a685491","observation_id":"5655d819-507b-4aff-b2ca-1bde8bc3465c","resolution":{"observed_at":"2026-08-09T15:26:18.754601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:20.273656Z","title":"Y., and Furlotte, N","venue":null,"work_id":"9aee6dcb-1820-408d-b99d-b97ea77aebba","year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.759715Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:e3212744330c8713a04562f26124ed20df395c2bac14885bcf8527d57f92991b","observation_id":"dac0f0e0-37fd-4cc7-85ff-8b6013bf3e8d","resolution":{"observed_at":"2026-08-09T15:26:20.279117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12971","last_updated":"2023-10-19T17:59:01Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:59:01Z","title":"CLAIR: Evaluating Image Captions with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12971","snapshot_observed_at":"2026-08-09T15:26:18.764360Z","title":"E., Darrell, T., and Canny, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.764360Z"},"links":{"cited_paper":"/paper/2310.12971","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:73f06dae3d8bb882917f72492421e9fbc8f9a1c729c7a2877c140a9fbe0fae3c","observation_id":"768ff524-1948-4ea3-8a64-8d127762fdbc","resolution":{"observed_at":"2026-08-09T15:26:18.764360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.769342Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.769342Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:4a667eb620eaa4c0b3e847a19aa17a94db272fcc8ff55736be38ee33995412af","observation_id":"36792edd-90c0-4ebc-a640-d0fb42ae9d61","resolution":{"observed_at":"2026-08-09T15:26:18.769342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-08-08T00:04:37.857776Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-09T15:26:18.773637Z","title":"Holistic analysis of hallucination in gpt-4v (ision): Bias and interference challenges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.773637Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:6852ed0db381c3835f7c921b8ede8a94b17b57f810e3f2b603071a158147b98d","observation_id":"d5ba4fad-8213-4420-bc26-8d22e767bea7","resolution":{"observed_at":"2026-08-09T15:26:18.773637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.777967Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.777967Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:bfcaf8f698c7767fa21e401f1d41e82edb291b4a80204b6f16572c55c2c6ff61","observation_id":"fc52342b-b5e1-4817-99b3-ffa0fde8affe","resolution":{"observed_at":"2026-08-09T15:26:18.777967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T15:26:18.782254Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.782254Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:5bb082c4160daaa1d2449be8b57d099835348369a419f3e0e14c23c3c4e06cb5","observation_id":"94b37f1b-95ef-49bf-811f-ac77e0ac460a","resolution":{"observed_at":"2026-08-09T15:26:18.782254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.787091Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.787091Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:de236d2b2730a01027d998042554d413be02edb83b1b97218c431b6030b8f2ba","observation_id":"6d611715-887e-40cf-9c2c-94bfbcb03611","resolution":{"observed_at":"2026-08-09T15:26:18.787091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02793","last_updated":"2024-10-28T21:15:36Z","snapshot_observed_at":"2026-08-02T05:25:18.174400Z","submitted_at":"2024-05-05T02:15:11Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02793","snapshot_observed_at":"2026-08-09T15:26:18.791790Z","title":"K., Bitton, Y., Montgomery, C., Onoe, Y., Bunner, A., Krishna, R., Baldridge, J., and Soricut, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.791790Z"},"links":{"cited_paper":"/paper/2405.02793","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:460d0792d767ba835c593c986e61d77a495c76a63987134cb478a116d066a113","observation_id":"a828e6d3-4d90-4496-be4d-97b563001f75","resolution":{"observed_at":"2026-08-09T15:26:18.791790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.796443Z","title":"Damro: Dive into the attention mechanism of lvlm to reduce object hallucination","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.796443Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:a764156efdb793eb751c8367c38bef3163d105b816c33fe562870038135c3dfb","observation_id":"09708e40-51b5-41fc-ace0-ea80c40a84f1","resolution":{"observed_at":"2026-08-09T15:26:18.796443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:20.217063Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"e9eaae08-26f6-4bc0-9b9c-8800516b3a38","year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.800701Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:01fc16b83d0b1a59b0b59689f72696b34949fd2e6dd7e6a6352d9d2a574444a7","observation_id":"28e1978c-33b5-4dbd-9fda-f3d2f367da4f","resolution":{"observed_at":"2026-08-09T15:26:20.222254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16483","last_updated":"2023-11-27T15:20:23Z","snapshot_observed_at":"2026-08-06T14:11:19.997270Z","submitted_at":"2023-11-27T15:20:23Z","title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16483","snapshot_observed_at":"2026-08-09T15:26:18.805012Z","title":"Chartllama: A multimodal llm for chart understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.805012Z"},"links":{"cited_paper":"/paper/2311.16483","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:2be45a83bf7bde3e1fd386f4265ced021480de7e774f1c34ce3598dc6b9b93c3","observation_id":"c2292dcf-936d-46f4-8e90-083cb94d6c31","resolution":{"observed_at":"2026-08-09T15:26:18.805012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:20.201713Z","title":"A multi-modal foundation model to assist people with blindness and low vision in environmental interaction","venue":null,"work_id":"61fc87b3-d505-40f3-9a67-e54f13e69ecf","year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.809785Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:0e9bb36e966295d9c7fd1b5cc02aa8710811f77814f8ea4589973c65cf24a3d3","observation_id":"fa9046c4-4bb0-40b7-b71e-7e79621c16c6","resolution":{"observed_at":"2026-08-09T15:26:20.206745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.814189Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.814189Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:5d3cecc68b0c43f5c704f065b3323f78526baa19751a71c656125676a9986b8f","observation_id":"b4a7800c-c682-4ff8-806f-a28293abd7c3","resolution":{"observed_at":"2026-08-09T15:26:18.814189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-10T07:13:04.110775Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-09T15:26:18.818734Z","title":"Self-introspective decoding: Alleviating hallucinations for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.818734Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:2731f585134c3a20227323c46c0f4edfbde127b9614f2d13f6d58728765477d5","observation_id":"e24ae048-8936-45a1-9ce8-d59201f9c993","resolution":{"observed_at":"2026-08-09T15:26:18.818734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-09T15:26:18.823683Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.823683Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:f87290a07d4b80722c981bc5c6cb4ee9491870ce12525f77fa6643cde62b2821","observation_id":"2a55e92d-2673-4baf-8a20-9360e35ac4d7","resolution":{"observed_at":"2026-08-09T15:26:18.823683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16724","last_updated":"2025-04-01T01:33:30Z","snapshot_observed_at":"2026-07-06T19:56:48.086175Z","submitted_at":"2024-11-23T03:40:05Z","title":"Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16724","snapshot_observed_at":"2026-08-09T15:26:18.828246Z","title":"Devils in middle layers of large vision-language models: Interpreting, detecting and mitigating object hallucinations via attention lens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.828246Z"},"links":{"cited_paper":"/paper/2411.16724","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:af24172ed118acb9533b601e606b8e6fc18a377626fa48966c8b310c1a1ba880","observation_id":"0d31e5fd-2734-4a17-b51e-1d22a8f52548","resolution":{"observed_at":"2026-08-09T15:26:18.828246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-09T15:26:18.833482Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.833482Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:340bdeb5e5a13f14e6de24213fc0264297ea475df41410550defc459013f2a3d","observation_id":"163df10a-8836-4206-ae1b-7df13092ee82","resolution":{"observed_at":"2026-08-09T15:26:18.833482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07362","last_updated":"2024-04-02T04:12:43Z","snapshot_observed_at":"2026-07-06T16:46:38.855912Z","submitted_at":"2023-11-13T14:26:24Z","title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07362","snapshot_observed_at":"2026-08-09T15:26:18.838137Z","title":"H., Jo, Y., and Seo, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.838137Z"},"links":{"cited_paper":"/paper/2311.07362","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:d1f80d0f4719bb4d8f976d1c126005e2c82a101a322aa7f5f3a343eacc9a220b","observation_id":"1da64ded-5870-471f-85d3-d2c441a3b1fe","resolution":{"observed_at":"2026-08-09T15:26:18.838137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15484","last_updated":"2025-07-07T05:27:08Z","snapshot_observed_at":"2026-07-06T20:10:37.385214Z","submitted_at":"2024-12-20T01:37:22Z","title":"Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15484","snapshot_observed_at":"2026-08-09T15:26:18.843059Z","title":"Toward robust hyper-detailed image captioning: A multiagent approach and dual evaluation metrics for factuality and coverage","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.843059Z"},"links":{"cited_paper":"/paper/2412.15484","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:6b749dde23b557e6e4cbf25f11c3cb09487390f31d8e6df700a87da36dc6cc42","observation_id":"4984a3af-918b-41e9-a7cf-d6276e863dae","resolution":{"observed_at":"2026-08-09T15:26:18.843059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.847626Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.847626Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:75af863f12f0318ff90e2d000f20d94756a37e44125c08fd3abbb808edf652aa","observation_id":"703cbab1-369b-4076-beb2-c3100d8d8972","resolution":{"observed_at":"2026-08-09T15:26:18.847626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T15:26:18.852478Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.852478Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:a45e40f80f4700f10f4dbadd61c435f2133103cc20b97a625e9d98165c99b9ce","observation_id":"6db63981-1b8b-49ee-8a9a-716399238624","resolution":{"observed_at":"2026-08-09T15:26:18.852478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.858826Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.858826Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:99370a43ea3a45518413ab3fd5d92740a43d68b406145cce2c3a5f5bb3235249","observation_id":"830131d7-cf91-473e-a02c-34758493ff7b","resolution":{"observed_at":"2026-08-09T15:26:18.858826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01926","last_updated":"2026-05-28T22:52:46Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2025-01-03T17:56:28Z","title":"Cross-Modal Attention Calibration for LVLM Hallucination Mitigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01926","snapshot_observed_at":"2026-08-09T15:26:18.863554Z","title":"Mitigating hallucination for large vision language model by inter-modality correlation calibration decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.863554Z"},"links":{"cited_paper":"/paper/2501.01926","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:aa29ffd32d0af131b02a871500bbb61f62017c79474462170100f33a344ae0c3","observation_id":"7ac09cf9-c142-4a9a-a90f-443ce8d0678d","resolution":{"observed_at":"2026-08-09T15:26:18.863554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:20.141263Z","title":"Inference-time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":"a20d22f6-1083-4be2-8d68-78b7974c3f18","year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.868930Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:2f0adbf39ca110ca6037601e0ce926621cb33d6af62cd5f8fa13c3a2fb8ca156","observation_id":"e7444099-b997-455c-bbf0-93ca8acba103","resolution":{"observed_at":"2026-08-09T15:26:20.146464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-09T15:26:18.873607Z","title":"X., and Wen, J.-R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.873607Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:0e251a4363bd00c0d2eeb50fee792a886c4b97cbbd3d28fec099b36fa1974228","observation_id":"31722197-d145-45df-8b98-1cbe9753e336","resolution":{"observed_at":"2026-08-09T15:26:18.873607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.878445Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.878445Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:ed9922ad4cd85e12076572b3c2abf4e9cabd6590e91be47a205b4f8c6a0d7dbb","observation_id":"39c2733b-45a4-4007-a569-74f0c70ab65d","resolution":{"observed_at":"2026-08-09T15:26:18.878445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.882657Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.882657Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:658e5f6c3f8162178b0a74f2feb2eb268fc07327e670ffb4ecf62fd97d33515b","observation_id":"b918d1fc-8e51-486a-9e60-da4b57d37268","resolution":{"observed_at":"2026-08-09T15:26:18.882657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.886450Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.886450Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:134c5f18f8a43f2cd4e012172098d1aad3452d76d2af6b83dc5c2c7ba0bf88b5","observation_id":"f6d22130-cf54-47ba-8e94-2817bdad97c7","resolution":{"observed_at":"2026-08-09T15:26:18.886450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.890273Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.890273Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:b82b74eeed7cca82c8d7d116a8a1fb8644901e2988d6c3b15d9a224005ee5b5b","observation_id":"759121a0-e4b1-4609-8e3f-c84a130b11d5","resolution":{"observed_at":"2026-08-09T15:26:18.890273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.894434Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.894434Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:b95c24377be0384169ca2219268edc87aaa7bff815aa35b37ea2e5307ddcb577","observation_id":"a76229f8-5a87-49f7-8822-70c208e58f1b","resolution":{"observed_at":"2026-08-09T15:26:18.894434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-09T15:26:18.898320Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.898320Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:e9893724787fb75fee9e41d3874d3008fb3b9c48a67c81b834ca19f5de784258","observation_id":"8212c0e5-0e29-41b6-bd50-b7fec29fcac1","resolution":{"observed_at":"2026-08-09T15:26:18.898320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:20.050690Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms","venue":null,"work_id":"a56a2563-a78e-4e10-879d-5f627bcd5f91","year":2025},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.902420Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:4eea1c3dbc20a3738adf41d2454196c9af184634200d5c807afe3e0fc4cf4e2c","observation_id":"8b20465f-2f18-4cee-9756-0fc0f4a19943","resolution":{"observed_at":"2026-08-09T15:26:20.059606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-09T15:26:18.906231Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.906231Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:29ca2b27e152bf8c19f50df54a175aa72dba8707a5bd9bca8bb55b56c44c1384","observation_id":"3a066575-8af0-4f62-a543-226beb93ca90","resolution":{"observed_at":"2026-08-09T15:26:18.906231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:20.034110Z","title":"Compositional chain of thought prompting for large multimodal models","venue":null,"work_id":"26721e0a-16bd-4531-bfeb-efb1a1c3d901","year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.910203Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:f805fdfdf61c734e3ad2426c863fc5a0aee8f426f05f55d282f8a35b31910bdd","observation_id":"00fee5ee-15ef-43a5-a228-e0ff08d8719b","resolution":{"observed_at":"2026-08-09T15:26:20.039403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:20.015226Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"1801915f-febc-49fc-8cd8-a476ff053e3b","year":2025},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.914484Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:d92b9119b4262d6e5192a417f72092fff11debbaf9aad0318a7c6870263fdbd4","observation_id":"e474e85a-abd5-412c-8a32-68f7b29ab44c","resolution":{"observed_at":"2026-08-09T15:26:20.023284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:19.993835Z","title":"A., Shalaby, M","venue":null,"work_id":"7156eadb-2fba-4080-874f-d8f876c4fec9","year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.918841Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:773fadf8c483312a5c252bb5b3b0d82a9d804f2145c009ce40e6d550d7961e23","observation_id":"b9cedbf7-9d93-4f6f-931a-54537ea03e37","resolution":{"observed_at":"2026-08-09T15:26:19.998650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-09T15:26:18.923315Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.923315Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:00778499b7a9112a080999716c6e6d45a06e67bbf8055ccaf74047560beb4cb4","observation_id":"f15fb0b3-9fd9-49a0-b3d1-33912980296a","resolution":{"observed_at":"2026-08-09T15:26:18.923315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-09T15:26:18.928214Z","title":"V., Carion, N., Wu, C.-Y., Girshick, R., Dollár, P., and Feichtenhofer, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.928214Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:4910b72eba5832afaf46d05082944a73016d2f8fbfb60cc7e0cde5e6ee51bba5","observation_id":"d12fc426-50c4-4c63-bda3-5e8f53725a1c","resolution":{"observed_at":"2026-08-09T15:26:18.928214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.932776Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.932776Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:0c4d5e5c840e9709ce8a1046baf820d9abc2863175a6cdf6d401f3b1b919ce7c","observation_id":"a68c285a-3519-4933-8a84-461668832f04","resolution":{"observed_at":"2026-08-09T15:26:18.932776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-10T08:25:28.506770Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-09T15:26:18.937139Z","title":"A., Burns, K., Darrell, T., and Saenko, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.937139Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:8e7c7598671202ac74a98ec6a5b385a46739c4482b1446fb6375f98934aa00f9","observation_id":"562cea6c-bcdf-4aca-8b3d-66c29f6dce0f","resolution":{"observed_at":"2026-08-09T15:26:18.937139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.941824Z","title":"Wasserstein distance guided representation learning for domain adaptation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.941824Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:1878304f0333dc23636b5b2173c7c867c1f75d5407840ee777c10e012af0c8c5","observation_id":"46c47705-ddd7-4769-9df1-31e11b0dfdc4","resolution":{"observed_at":"2026-08-09T15:26:18.941824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T15:26:18.946105Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.946105Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:1a0a61dd8f36fa3cbf7f656039b9d4f68663fe90d41fc4b4dd74b616348bec6c","observation_id":"c426fc89-9ac4-4a64-920b-6b22da6e79ee","resolution":{"observed_at":"2026-08-09T15:26:18.946105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:19.947057Z","title":"Calculation of the wasserstein distance between probability distributions on the line","venue":null,"work_id":"abec488c-497a-4fe5-b4ae-ab9b98d42a88","year":1974},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.950544Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:6abedc05f2968390f8d48106ca20cfa91ff8a4664c6b6f1238808d1ca52e36df","observation_id":"e6bd7613-9db6-43af-a8b4-4ef9388fed1b","resolution":{"observed_at":"2026-08-09T15:26:19.952507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:18.955068Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.955068Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:5fe17be0a13cf3a0baeecafda666fd775661b67b6efbd52f400ad2f719e3e3fc","observation_id":"4572e567-32f1-4456-972c-1433bbfa4185","resolution":{"observed_at":"2026-08-09T15:26:18.955068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-02T01:09:26.116796Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-09T15:26:18.959612Z","title":"Efficient large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.959612Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:17cd5ce2bd9434bc676853e7babf2dfdb184881edf5f75b4c8e504d79b87cb0c","observation_id":"b7d85cb7-4d73-4e51-bdfd-5863dc4c2aa4","resolution":{"observed_at":"2026-08-09T15:26:18.959612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-09T15:26:18.964914Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.964914Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:c1593f1c6bf05d3a6fe8b9576a7fbb49c6186c0e3f47822121016b2f2b6b45b0","observation_id":"f1133279-1091-4a56-b01d-5ffc383e9e32","resolution":{"observed_at":"2026-08-09T15:26:18.964914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17820","last_updated":"2025-05-31T02:41:34Z","snapshot_observed_at":"2026-08-08T02:36:07.552587Z","submitted_at":"2024-05-28T04:40:57Z","title":"Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17820","snapshot_observed_at":"2026-08-09T15:26:18.969743Z","title":"Don't miss the forest for the trees: Attentional vision calibration for large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.969743Z"},"links":{"cited_paper":"/paper/2405.17820","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:da0db674711912c8907bf3879f7461102a2e6abdf66f8f83aa28119e91d4b53a","observation_id":"03d01345-741e-4ae5-9a86-9a68d8519573","resolution":{"observed_at":"2026-08-09T15:26:18.969743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15926","last_updated":"2024-10-21T11:54:53Z","snapshot_observed_at":"2026-08-08T00:09:35.155222Z","submitted_at":"2024-10-21T11:54:53Z","title":"Mitigating Object Hallucination via Concentric Causal Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15926","snapshot_observed_at":"2026-08-09T15:26:18.974611Z","title":"Mitigating object hallucination via concentric causal attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.974611Z"},"links":{"cited_paper":"/paper/2410.15926","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:dcc04e29f6a6deab8ff2550cf48962b8efb01bccc8fbcfc677cc12117899fa8b","observation_id":"dfd7ffc4-6e19-4861-9f2e-dfd7aee0f512","resolution":{"observed_at":"2026-08-09T15:26:18.974611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-08-09T02:22:19.607073Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-09T15:26:18.979301Z","title":"Less is more: Mitigating multimodal hallucination from an eos decision perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.979301Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:55073c01d379c9c12d0a17a9ed0c5f88e489b8bd3e353dbb254ea936dd7f7a13","observation_id":"a03e7f78-8efd-483f-b46f-3dc9e7866ee4","resolution":{"observed_at":"2026-08-09T15:26:18.979301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:19.919789Z","title":"MLLM s know where to look: Training-free perception of small visual details with multimodal LLM s","venue":null,"work_id":"c2b7cd52-0135-4c35-8aa2-d402279c24e7","year":2025},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.984229Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:8a775de2cdb86413651e853f3db696e634ae477372612e3167a25a5aadce416f","observation_id":"253cf50f-d1b4-4129-a141-da335b064f5e","resolution":{"observed_at":"2026-08-09T15:26:19.926146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-07T09:15:02.322742Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-09T15:26:18.988905Z","title":"Seeing clearly by layer two: Enhancing attention heads to alleviate hallucination in lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.988905Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:0849cb4fec6801eba299842a786cb2199426cc558233159653c2e773b8f3b1e4","observation_id":"ec6a6d8e-3533-4188-af1d-8de9b73f68c0","resolution":{"observed_at":"2026-08-09T15:26:18.988905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00569","last_updated":"2024-08-03T17:52:43Z","snapshot_observed_at":"2026-08-05T17:18:35.898227Z","submitted_at":"2024-06-30T03:04:11Z","title":"Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00569","snapshot_observed_at":"2026-08-09T15:26:18.993526Z","title":"Investigating and mitigating the multimodal hallucination snowballing in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.993526Z"},"links":{"cited_paper":"/paper/2407.00569","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:cf6d2e78c647724d1489ca7aec686d95263cb102c9ef743f36679759d3d37856","observation_id":"3bbe3254-050b-4a0d-8abe-bd0229721ed8","resolution":{"observed_at":"2026-08-09T15:26:18.993526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-02T06:11:56.496482Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-09T15:26:18.998158Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.998158Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:f38eb353a9c475524eb474b91ca731f5f1582be69e3c4cee8b7114b1c0a0e1b6","observation_id":"c38059a1-b5b1-42dd-a0a5-60afd10374e5","resolution":{"observed_at":"2026-08-09T15:26:18.998158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-07-06T17:36:56.979448Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-09T15:26:19.003177Z","title":"Ibd: Alleviating hallucinations in large vision-language models via image-biased decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:19.003177Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:45e7f36884697c5d86d4fda695593363b5f50aa4d1bf3b0a3cb8c015d3e2bbdb","observation_id":"42e5d5f6-d04e-408f-8854-9b108b5ce77f","resolution":{"observed_at":"2026-08-09T15:26:19.003177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:26:19.007163Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:19.007163Z"},"links":{"citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:95ee641e70a5af5ff9258028bd4cf1f555ced2b189e62535a42f61ee402353cd","observation_id":"39c70211-9980-4c13-adc6-20dfedbd2f98","resolution":{"observed_at":"2026-08-09T15:26:19.007163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 9 inbound Pith citation observations for arXiv:2502.01419."}