{"as_of":"2026-08-10T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb7119bb6a107e3ba0e7c0ea643236128ec464bfd2408ab3edaa887c28b56dbf","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:41.573398Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19498/citation-record","integrity":"/paper/2505.19498/integrity","json":"/paper/2505.19498/citation-record.json","paper":"/paper/2505.19498"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:18:34.245378Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.245378Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:bc6fefc70238d3bc9fac025899d4c5e7d91eef4c348e8ad10e305977e4fc79d1","observation_id":"dc270e6b-1411-400f-89ab-9b53f6f0d004","resolution":{"observed_at":"2026-08-07T14:18:34.245378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T14:18:34.382282Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.382282Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:eecf826faa5d98ce014738a0078fb734d93c30f1c4dd2456fe0091efa77446b1","observation_id":"e16b32d5-3e7b-4711-95fc-a16660d8f7ff","resolution":{"observed_at":"2026-08-07T14:18:34.382282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:18:34.488464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.488464Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:61384d4f0045871395f69b760391455d6fcb706c5ec78be7ae18109ce5759eac","observation_id":"079fbe18-00ed-4260-9f94-42331fa2bf94","resolution":{"observed_at":"2026-08-07T14:18:34.488464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.783621Z","title":"Grounding everything: Emerging localiza- tion properties in vision-language transformers","venue":null,"work_id":"677002e6-c564-4700-b3b7-f9f8aa4d748b","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.559262Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:daed712abe68b138e033b5fd7f54cd540cd1d56ae6681cd3882d043f877587e8","observation_id":"a0f77696-68c1-46ad-8bf6-664d8bf419c4","resolution":{"observed_at":"2026-08-07T14:18:46.882005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.485656Z","title":"Evaluating a large language model on searching for gui layouts.Proceedings of the ACM on Human-Computer Interaction, 7(EICS):1–37, 2023","venue":null,"work_id":"0a248453-de62-4718-a983-641aa0dd51cd","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.663382Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:5eab9f6ac6fcfcf660310ea018b0a39ecc1400d4960c27667cc58f4a557e340a","observation_id":"0a1960cd-3116-4762-ba08-3a0cd9bfd393","resolution":{"observed_at":"2026-08-07T14:18:46.616784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:34.757066Z","title":"Lan- guage models are few-shot learners.Advances in neural in- formation processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.757066Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:434b096513ced7480e5ee2e5f1562a07860abd4580df3da04698a75bef1c5430","observation_id":"46070d0c-e37e-4745-88da-737228c6686a","resolution":{"observed_at":"2026-08-07T14:18:34.757066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T14:18:34.892057Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:34.892057Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:14076b8dcba3290ea3d7c5dd98855e6ecb8506db34f0c9f1c8f298c1dce944ac","observation_id":"5b69f746-4314-4683-be6f-53aba037e581","resolution":{"observed_at":"2026-08-07T14:18:34.892057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01548","last_updated":"2024-03-12T09:49:28Z","snapshot_observed_at":"2026-07-06T17:38:51.653737Z","submitted_at":"2024-03-03T15:53:41Z","title":"In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination Mitigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01548","snapshot_observed_at":"2026-08-07T14:18:35.034387Z","title":"In-context sharpness as alerts: An inner representation perspective for hallucination mitigation.arXiv preprint arXiv:2403.01548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.034387Z"},"links":{"cited_paper":"/paper/2403.01548","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:e977cbccc31eb4c1e37509308f6288da1db8c48fa3a1b979513948c90d132e89","observation_id":"961ad80d-293a-44e4-8a39-0d432ccb3e2c","resolution":{"observed_at":"2026-08-07T14:18:35.034387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.216299Z","title":"Palm: Scaling language modeling with pathways.Journal of Machine Learning Research, 24(240):1–113, 2023","venue":null,"work_id":"c20084c8-e37d-44f4-9254-e2ea999f4c98","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.106132Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:cd507fdbf579876f9dc232e0dae7bf976f2ceb7be8e0563fdb0ae50fba436988","observation_id":"e49fb8e4-fbaa-47e5-8d17-208c0bae6518","resolution":{"observed_at":"2026-08-07T14:18:46.325338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-08-07T14:18:35.174567Z","title":"Dola: Decoding by con- trasting layers improves factuality in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.174567Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:e670a381521f73f4c56dc3b370bc8f70d736eed2931d5e6db8e6cbbb43233965","observation_id":"78c35447-c8c8-4279-84f3-d10040e6ade7","resolution":{"observed_at":"2026-08-07T14:18:35.174567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.928533Z","title":"A survey on multimodal large lan- guage models for autonomous driving","venue":null,"work_id":"5d49ef7c-3216-480a-9ad9-011a1fa46a61","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.275408Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:8127f738bf310826e8cd32a7e7edbc1726334070486e92fe33109fde7279fa4e","observation_id":"13a97e78-3cda-4907-89c5-726b66c2a0a2","resolution":{"observed_at":"2026-08-07T14:18:46.069525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01983","last_updated":"2024-07-02T06:41:39Z","snapshot_observed_at":"2026-08-09T20:08:15.960434Z","submitted_at":"2024-07-02T06:41:39Z","title":"SADL: An Effective In-Context Learning Method for Compositional Visual QA","version":1},"cited_work":{"arxiv_id":"2407.01983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01983","snapshot_observed_at":"2026-08-07T14:18:42.210330Z","title":"SADL: An Effective In-Context Learning Method for Compositional Visual QA","venue":"cs.CV","work_id":"0677bc5e-bfc3-4bce-b0c0-e81e7d98b2ee","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.400317Z"},"links":{"cited_paper":"/paper/2407.01983","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:56d8bed73c322cc6a574ae93eabcc37be769ea0518ffdd54133540c9dde9a3eb","observation_id":"32cefc74-1e4c-497f-be3f-85dde206a9b1","resolution":{"observed_at":"2026-08-07T14:18:42.326741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T14:18:35.528263Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.528263Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:b6c771c773a11b72f9da3b59816b71274f1996286719ae91012e53abd71f206a","observation_id":"9926fc8f-9672-4a0a-83c8-5015e96e5818","resolution":{"observed_at":"2026-08-07T14:18:35.528263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.687518Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks.Proceedings of the National Academy of Sciences, 120(30):e2305016120, 2023","venue":null,"work_id":"b8c42786-fe2b-447e-899c-2b8d56f1c712","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.635936Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:4bee10cdb899878a57820fea9a2750a0eb5be8180ce17aedb61f53ef261e750d","observation_id":"f114d59b-79f9-468e-b88c-805afc2873fe","resolution":{"observed_at":"2026-08-07T14:18:45.809696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.424399Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"46b62e11-b1a2-45f7-9628-a587db3fa240","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.765639Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:f14aab1c1608cc3a63c29bb4ebfad472c0b857b5f2ef2a5db7568806ae26a116","observation_id":"b21a7905-088d-4403-bd70-a8c730e38936","resolution":{"observed_at":"2026-08-07T14:18:45.537969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.092486Z","title":"A comprehensive survey of deep learn- ing for image captioning.ACM Computing Surveys (CsUR), 51(6):1–36, 2019","venue":null,"work_id":"62b22be2-986d-432e-8db6-b52923eb4f65","year":2019},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.872329Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:b967484b4fdbbb81e2ddfed00af8e8c1feff78d19bc7dac3f688097236e7712a","observation_id":"ff67bef2-f80c-4967-85dc-e5019a4c77a5","resolution":{"observed_at":"2026-08-07T14:18:45.264134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04920","last_updated":"2023-04-11T01:17:11Z","snapshot_observed_at":"2026-08-09T18:05:48.712665Z","submitted_at":"2023-04-11T01:17:11Z","title":"Advancing Medical Imaging with Language Models: A Journey from N-grams to ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04920","snapshot_observed_at":"2026-08-07T14:18:35.982612Z","title":"Advancing medical imaging with language mod- els: A journey from n-grams to chatgpt.arXiv preprint arXiv:2304.04920, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:35.982612Z"},"links":{"cited_paper":"/paper/2304.04920","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:8c58d5930c8068d2f941a38486124c9eb68a769c8a47bee3204b7e7c2015998f","observation_id":"9881e557-33df-4395-a2b0-ffb5bfd6efa9","resolution":{"observed_at":"2026-08-07T14:18:35.982612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.857568Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"626da12f-54e7-497f-86ed-e51f0c09358f","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.149903Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:1cc81b67133ac8b99702adabd882664773f29d0142eadeeeed6407bfdfc87bda","observation_id":"c627c9d7-cc1b-4f45-8b2d-cd7c1ed60648","resolution":{"observed_at":"2026-08-07T14:18:44.945636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.630365Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"989ea898-cdc9-4146-963a-c949f264338c","year":2019},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.382436Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:fdf9159a712bf7d7d94c7c00fcfbc8bf59a5b4e901a6ad3ec89411ba69b158e2","observation_id":"0f48cfdb-27ee-4522-997d-c56fd9557b5c","resolution":{"observed_at":"2026-08-07T14:18:44.743928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-10T07:13:04.110775Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-07T14:18:36.503540Z","title":"Self-introspective de- coding: Alleviating hallucinations for large vision-language models.arXiv preprint arXiv:2408.02032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.503540Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:9ec3357953ac0887201d318fcee7840895fe66511b441577d20d6b9b7f2ac1c0","observation_id":"de4fc015-8fd4-401e-be1b-5ab70560631c","resolution":{"observed_at":"2026-08-07T14:18:36.503540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:36.671574Z","title":"Survey of hallucination in natural language generation.ACM computing surveys, 55(12):1–38, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.671574Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:64b6b1d99c4cae1393fc991fdf85fe74233d6788c2de754740182e81707b3195","observation_id":"7b122b0f-7388-4b0f-8273-825b5c7e9fbe","resolution":{"observed_at":"2026-08-07T14:18:36.671574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.372439Z","title":"Mitigating object hal- lucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"0313da43-c161-42d7-85df-7865f8a3999b","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:36.847427Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:1ed6bccc1323b0449e269ca162ceb5370b202a0bb0df049190825a9e441abd5f","observation_id":"ac0ec77b-7f88-42fe-ba60-129f0d97725d","resolution":{"observed_at":"2026-08-07T14:18:44.477176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15097","last_updated":"2023-07-10T06:08:55Z","snapshot_observed_at":"2026-08-10T04:03:16.029105Z","submitted_at":"2022-10-27T00:58:21Z","title":"Contrastive Decoding: Open-ended Text Generation as Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15097","snapshot_observed_at":"2026-08-07T14:18:37.002385Z","title":"Contrastive decoding: Open-ended text gen- eration as optimization.arXiv preprint arXiv:2210.15097,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.002385Z"},"links":{"cited_paper":"/paper/2210.15097","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:686b2d79f6ba8c43e40368d178dbde3473bb201041c5248682d3662df71fad2b","observation_id":"8fb4c05c-aad5-4269-bf03-3a6bb44e59eb","resolution":{"observed_at":"2026-08-07T14:18:37.002385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.131762Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks.arXiv e-prints, pages arXiv–2304, 2023","venue":null,"work_id":"db6b56fe-e632-4208-a703-e09a104d2f18","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.112543Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:ce34bf716c500b388a64028e18479086a9fa5cf58024c335b29bac8c499b73df","observation_id":"6056d74f-aeb4-4c4b-9880-abbccfb11d05","resolution":{"observed_at":"2026-08-07T14:18:44.249543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T14:18:37.259357Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.259357Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:aa0d0ad825db72982272bb77d5daf7efe803dc7059d0f84c2d15c7bdbafd0540","observation_id":"698de6d0-4453-4026-8f79-5ae428ea9567","resolution":{"observed_at":"2026-08-07T14:18:37.259357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.936221Z","title":"A survey of multimodel large language models","venue":null,"work_id":"81350637-a887-4b64-94ef-ceabf136fad6","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.405063Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:2207a285f3c9b8170b71d6ef6c7dbde3a370a878f7338476222e84d2fd20c67a","observation_id":"4902dd3d-c455-40a0-9263-3443816fe3a8","resolution":{"observed_at":"2026-08-07T14:18:44.028181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:37.549073Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.549073Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:d931e1b4975ddabfd16d2091fb5d821d801867e12d5a56afe56ffb1290187725","observation_id":"91c838c3-8ed9-4ecd-a6ac-01b8b5f84ab9","resolution":{"observed_at":"2026-08-07T14:18:37.549073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.721752Z","title":"Aligning large multi-modal model with robust instruction tuning.CoRR, 2023","venue":null,"work_id":"e49b45ef-6262-46ae-943f-a4a4f00fc641","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.677362Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:1fb45fe3cf8deba897ec7b33eed3f21e7c39fad70157ce4b8ec78613c6c9863a","observation_id":"d7781a78-38b7-4e9b-a9f5-f481e94ab301","resolution":{"observed_at":"2026-08-07T14:18:43.800320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-07T14:18:37.836220Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.836220Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:3000138178b078b38bb87faed6f98742093f5658d18934a179c549cf9b477830","observation_id":"110de30e-dc64-4d62-9592-269f3d2449ba","resolution":{"observed_at":"2026-08-07T14:18:37.836220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-07T14:18:37.954172Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:37.954172Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:e20572cc1dddcd40867f0ff435fad3813b51ce9dda44341981c6ac6e113d8a60","observation_id":"4e188057-66eb-47e9-bfa5-30fd4b3b69f2","resolution":{"observed_at":"2026-08-07T14:18:37.954172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.573134Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"83a221a5-9822-41ae-86a1-bccb70643d15","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.129342Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:e103be9b37d954b3bcc5b2fbbfbcfc2878ee7557b164b7ea70c4e1f414bf6041","observation_id":"a711fd13-8a82-4043-b4ba-07d4253993ce","resolution":{"observed_at":"2026-08-07T14:18:43.643823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:38.252873Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.252873Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:69bd6bedce6735b6e8f008fa41acf6a353d12ff4ceb45483c663409fcc11a4b6","observation_id":"80bc08a3-7f37-4130-8c97-cd9203b4f55b","resolution":{"observed_at":"2026-08-07T14:18:38.252873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14673","last_updated":"2024-10-04T22:14:09Z","snapshot_observed_at":"2026-08-10T20:03:27.843842Z","submitted_at":"2024-06-20T18:50:44Z","title":"Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14673","snapshot_observed_at":"2026-08-07T14:18:38.394009Z","title":"Insights into llm long-context failures: When transformers know but don’t tell.arXiv preprint arXiv:2406.14673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.394009Z"},"links":{"cited_paper":"/paper/2406.14673","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:842211ba828f1a761990049dfb3e4f6567c543f3a2b7e1ced5633515c9b4d1a3","observation_id":"f94bb474-2d7d-4270-a942-aaf26ec30034","resolution":{"observed_at":"2026-08-07T14:18:38.394009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:38.505601Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.505601Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:3c5bceee27b3e736fb68c218619df76644debc21545883053ff128b77ad3eea0","observation_id":"56dd1117-b617-4ec6-8a8e-e51e528039df","resolution":{"observed_at":"2026-08-07T14:18:38.505601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:38.667164Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.667164Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:802b4b003cb1b91bf46a5d00a2cc0e3809ea91dfb58ed9777dc9a37ee57ae03b","observation_id":"3cc9d383-ae89-415a-9aba-f8c93672ea7f","resolution":{"observed_at":"2026-08-07T14:18:38.667164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-10T08:25:28.506770Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T14:18:38.796832Z","title":"Object hallucination in image cap- tioning.arXiv preprint arXiv:1809.02156, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.796832Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:b5dc01c9c1fe465c44ad59dcbf19fcac661a5198d692d20ab7c070a70eea5097","observation_id":"d5f9ce9b-ebf9-45c7-a4af-4c68bbd6e8a2","resolution":{"observed_at":"2026-08-07T14:18:38.796832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.330762Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"efa385c7-c04b-4033-9f2b-aa92636b805c","year":2022},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:38.915835Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:918f4f024851ea88b7eb3cfe2842c8be73b4c163cfb85fe174331cd9f95415a4","observation_id":"999ebe78-13d1-4a2c-a2d0-c68b26805c3d","resolution":{"observed_at":"2026-08-07T14:18:43.478030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T14:18:39.047457Z","title":"Aligning large multi- modal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.047457Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:274af0be845226df6ed9369ab99aefabb296c465e94df0b54713a5fd5e9c7b1e","observation_id":"d01c58a5-2696-445d-ba40-1613dfdfca06","resolution":{"observed_at":"2026-08-07T14:18:39.047457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.054417Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":"95713a9c-67db-468b-9c90-4979a005c282","year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.198903Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:b27ef0f7dca61e2f568be088d7909af1852892d96815390ca61803a5a0f2d5b3","observation_id":"ea9e165d-095d-46dc-a28b-3a0875f96296","resolution":{"observed_at":"2026-08-07T14:18:43.196522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:18:39.327647Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.327647Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:7983a8e53dd59ec86732ca7382dede2081d7de81cb16973d5ff0c7df631b9cc5","observation_id":"f82bb665-485a-4e88-94fa-ec945cfab64c","resolution":{"observed_at":"2026-08-07T14:18:39.327647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11779","last_updated":"2025-02-23T15:14:47Z","snapshot_observed_at":"2026-08-10T13:18:33.995677Z","submitted_at":"2024-10-15T16:57:44Z","title":"MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11779","snapshot_observed_at":"2026-08-07T14:18:39.471606Z","title":"Mllm can see? dynamic correction decoding for hallucination mitiga- tion.arXiv preprint arXiv:2410.11779, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.471606Z"},"links":{"cited_paper":"/paper/2410.11779","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:5cb71648204b66ae3281c4b871b250b88746cc64166f845f66e950928aee1dd9","observation_id":"d284adb0-9e97-4de5-903e-d4142296ef5c","resolution":{"observed_at":"2026-08-07T14:18:39.471606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:42.812745Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":"9392d504-a3f4-44e3-85ad-bb2e6068c2a5","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.629227Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:6e54fcddcca1cb16bfcd836cfb2d8dea95dd170dc2dd457e91cfd34b5658130a","observation_id":"23b19e25-c978-481b-a472-cd78fdf6645e","resolution":{"observed_at":"2026-08-07T14:18:42.910544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10948","last_updated":"2025-03-16T02:23:30Z","snapshot_observed_at":"2026-08-09T09:12:41.622780Z","submitted_at":"2024-03-22T08:38:27Z","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10948","snapshot_observed_at":"2026-08-07T14:18:39.809780Z","title":"Surgical-lvlm: Learning to adapt large vision-language model for grounded visual question answering in robotic surgery.arXiv preprint arXiv:2405.10948, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.809780Z"},"links":{"cited_paper":"/paper/2405.10948","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:3619df73e698b4ee09a0523851fc5009193ccb07e9830c985cc2117ab4659ca2","observation_id":"8d8cab3d-7066-47c8-a081-242256095dca","resolution":{"observed_at":"2026-08-07T14:18:39.809780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:18:39.958342Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:39.958342Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:70df84ed441e617a2b5a7ff88e931eb426e5d4e7f86d8b0f7a43fd01dc3306e7","observation_id":"c5d2aac4-a924-4f4d-be0f-d31272f4e1a7","resolution":{"observed_at":"2026-08-07T14:18:39.958342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07257","last_updated":"2023-02-14T18:54:06Z","snapshot_observed_at":"2026-08-10T14:10:03.894992Z","submitted_at":"2023-02-14T18:54:06Z","title":"ChatCAD: Interactive Computer-Aided Diagnosis on Medical Image using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07257","snapshot_observed_at":"2026-08-07T14:18:40.068458Z","title":"Chatcad: Interactive computer-aided diag- nosis on medical image using large language models.arXiv preprint arXiv:2302.07257, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.068458Z"},"links":{"cited_paper":"/paper/2302.07257","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:57ce670b1ad124ce6bf11e627bbe6fb14fe477387d4dff25e7a2f173c5d809cc","observation_id":"235c3cd4-3505-467a-94fe-1cedd90abd9c","resolution":{"observed_at":"2026-08-07T14:18:40.068458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-10T19:28:39.434196Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-07T14:18:40.218185Z","title":"Caption anything: Interactive image description with diverse multi- modal controls.arXiv preprint arXiv:2305.02677, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.218185Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:8076cb5065e8c184c4f42c05c26ef90080e3a85f3dcd1ae261defbd7a8ebca9c","observation_id":"59e984b1-7277-4775-aa63-e510b2a2e889","resolution":{"observed_at":"2026-08-07T14:18:40.218185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:40.379779Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for au- tonomous driving.arXiv preprint arXiv:2312.09245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.379779Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:291be52bc7fd9006cdee9dd3c8d695610f7e9d15a1abd03840798cb05b9b54c9","observation_id":"13453da0-ec46-4982-b78a-013dd73a6d8a","resolution":{"observed_at":"2026-08-07T14:18:40.379779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18715","last_updated":"2024-06-05T13:53:42Z","snapshot_observed_at":"2026-08-10T16:33:51.164534Z","submitted_at":"2024-03-27T16:04:47Z","title":"Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18715","snapshot_observed_at":"2026-08-07T14:18:40.494427Z","title":"Mitigating hallucinations in large vision-language models with instruction contrastive decoding.arXiv preprint arXiv:2403.18715, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.494427Z"},"links":{"cited_paper":"/paper/2403.18715","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:97767d64a2c95dacc0f4d2d52124db73d5ca98b653d3b6926b10f5ecff4c672b","observation_id":"9a54c286-d0e4-4615-9f80-2810d89316d9","resolution":{"observed_at":"2026-08-07T14:18:40.494427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:18:40.650777Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.650777Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:daf3ad9918393be705bc43b892cfc56d0d44c67818b1757feccf019f18f535a3","observation_id":"ad36b43e-9f5e-4e51-8c2c-75c1979abe93","resolution":{"observed_at":"2026-08-07T14:18:40.650777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:42.571459Z","title":"Woodpecker: Hallucination correction for multimodal large language models.Science China Information Sciences, 67(12):220105, 2024","venue":null,"work_id":"ac19c2a5-c346-4dc8-88bc-ddcce571dcda","year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.775096Z"},"links":{"citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:6b3730822432e6a72907e9063ec5be0ebbf8c782cc1878db88d01180c99d61dc","observation_id":"17801c05-cec1-42a6-aacc-867ccdf304dd","resolution":{"observed_at":"2026-08-07T14:18:42.622977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-08-09T02:22:19.607073Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-07T14:18:40.942389Z","title":"Less is more: Mitigat- ing multimodal hallucination from an eos decision perspec- tive.arXiv preprint arXiv:2402.14545, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.942389Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:d68295cd96111a422675833aeabac59136f379e995e7653d705ec7c73c6ddb4a","observation_id":"92015d10-50dc-43c7-a817-b1ebbaa634cb","resolution":{"observed_at":"2026-08-07T14:18:40.942389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15075","last_updated":"2023-05-24T11:56:01Z","snapshot_observed_at":"2026-08-07T23:04:52.692705Z","submitted_at":"2023-05-24T11:56:01Z","title":"HuatuoGPT, towards Taming Language Model to Be a Doctor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15075","snapshot_observed_at":"2026-08-07T14:18:41.054437Z","title":"Huatuogpt, towards taming language model to be a doctor.arXiv preprint arXiv:2305.15075, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.054437Z"},"links":{"cited_paper":"/paper/2305.15075","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:b1060e2feedfdb1bcbbbf23c16278d5f9987fd6eae1a2d1d7778fe242c0a6ab0","observation_id":"0e1a60c6-4179-4a62-8d22-b860337d70a4","resolution":{"observed_at":"2026-08-07T14:18:41.054437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-07T14:18:41.235492Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization.arXiv preprint arXiv:2311.16839, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.235492Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:efc9de4a5e9f96ef3e58d0ba7bbac62c4697add335414fdc85016248e7545d7c","observation_id":"d29c0b0d-3e93-47a7-9713-1f3b465572b9","resolution":{"observed_at":"2026-08-07T14:18:41.235492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04780","last_updated":"2025-02-18T12:47:58Z","snapshot_observed_at":"2026-08-08T19:20:34.617360Z","submitted_at":"2024-10-07T06:45:22Z","title":"Mitigating Modality Prior-Induced Hallucinations in Multimodal Large Language Models via Deciphering Attention Causality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04780","snapshot_observed_at":"2026-08-07T14:18:41.382368Z","title":"Mitigating modality prior-induced halluci- nations in multimodal large language models via deciphering attention causality.arXiv preprint arXiv:2410.04780, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.382368Z"},"links":{"cited_paper":"/paper/2410.04780","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:0971e10a703b8086d5b2643e6ef6b7dc41e4afec2ad9005c093acfe872e3c6f1","observation_id":"60c69dda-7610-4e4f-99bf-92abdeafcb71","resolution":{"observed_at":"2026-08-07T14:18:41.382368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:18:41.573398Z","title":"truck” Value-Value attention Query-Key attention “bicycle","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:41.573398Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:cbec25ecc4ead4800d3bb68441cc68a1249b26412c847fe3cb2923f0fc57a36b","observation_id":"6c42e6af-2ab2-49b8-ae91-db9e666073d1","resolution":{"observed_at":"2026-08-07T14:18:41.573398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2505.19498."}