{"as_of":"2026-08-17T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64451770040917172ae394c2fdce032f5457f3c9ae123a76bed584a4a0d57964","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:28:42.275751Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:44:54.981867Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T22:34:01.801514Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12206","snapshot_observed_at":"2026-08-06T21:44:54.981867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23590","last_updated":"2025-06-30T07:52:36Z","snapshot_observed_at":"2026-08-14T04:44:24.931189Z","submitted_at":"2025-06-30T07:52:36Z","title":"CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:44:54.981867Z"},"links":{"cited_paper":"/paper/2501.12206","citing_paper":"/paper/2506.23590"},"observation_digest":"sha256:52ac87341730f63ee1cb6dc73e8a38cfecbd010129da167db53c2a8ae13e0ded","observation_id":"eff686ce-38f4-432d-871b-66cc90968a7d","resolution":{"observed_at":"2026-08-06T21:44:54.981867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12206","snapshot_observed_at":"2026-08-03T23:35:18.882276Z","title":"Paint: Paying attention to informed tokens to mitigate hallucination in large vision-language model.arXiv preprint arXiv:2501.12206,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.882276Z"},"links":{"cited_paper":"/paper/2501.12206","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:22cc928ce5c1800889409d9d0056f47fa9002982cd2c684c1256ed5208b139f3","observation_id":"55ad7066-1187-4b0e-98f2-ea60b2651ddd","resolution":{"observed_at":"2026-08-03T23:35:18.882276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"cited_work":{"arxiv_id":"2501.12206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12206","snapshot_observed_at":"2026-06-29T22:34:01.801514Z","title":"arXiv preprint arXiv:2501.12206 , year=","venue":null,"work_id":"569c73aa-e536-4948-b4c7-8001f430d76d","year":2025},"citing_paper":{"arxiv_id":"2605.04641","last_updated":"2026-07-29T07:14:27Z","snapshot_observed_at":"2026-08-11T12:03:57.511892Z","submitted_at":"2026-05-06T08:32:30Z","title":"CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-08T18:05:38.705480Z"},"links":{"cited_paper":"/paper/2501.12206","citing_paper":"/paper/2605.04641"},"observation_digest":"sha256:8e62f6d6f85c39681e4c574834e252108458f36328b611b5b2593f69d5cf6c20","observation_id":"992b2855-7ec2-4c27-94d7-51fccf0ab630","resolution":{"observed_at":"2026-05-09T06:50:40.327897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"cited_work":{"arxiv_id":"2501.12206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12206","snapshot_observed_at":"2026-06-29T22:34:01.801514Z","title":"arXiv preprint arXiv:2501.12206 , year=","venue":null,"work_id":"569c73aa-e536-4948-b4c7-8001f430d76d","year":2025},"citing_paper":{"arxiv_id":"2605.25799","last_updated":"2026-05-25T12:49:15Z","snapshot_observed_at":"2026-08-12T21:50:10.286887Z","submitted_at":"2026-05-25T12:49:15Z","title":"Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:28:35.155099Z"},"links":{"cited_paper":"/paper/2501.12206","citing_paper":"/paper/2605.25799"},"observation_digest":"sha256:ec434b6109724bee0f00eb5a0c76a68579bfc1e4be324cc7672e1958e0dddfb7","observation_id":"5a8682e6-8c52-484c-a40a-7d4c8aa504b5","resolution":{"observed_at":"2026-06-29T22:34:01.803714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12206/citation-record","integrity":"/paper/2501.12206/integrity","json":"/paper/2501.12206/citation-record.json","paper":"/paper/2501.12206"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:44.007668Z","title":"Agla: Mitigating object hallucinations in large vision- language models with assembly of global and local attention,","venue":null,"work_id":"8124013d-5d30-4dd7-ad17-bcfc3299c1d3","year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.682350Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:6b719ded89a746f7aac02ac80dcec8930036df6b04888dcfec33e76998aa3e9b","observation_id":"cebe75e3-5d93-4e2c-a9d4-cb9422b86fc3","resolution":{"observed_at":"2026-08-10T17:28:44.013954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.988368Z","title":"Nikolopou- los, Hans Vandierendonck, Deepu John, and Bo Ji","venue":null,"work_id":"0adad0d9-5d90-468b-855a-895af6e8080c","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.688182Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:60d766bc4fec31de20de062ecbb22b541979ecc1896b4ca04482b11dea5fafdb","observation_id":"b03c8fa3-eaaa-4928-b31e-5721df12e862","resolution":{"observed_at":"2026-08-10T17:28:43.994796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T17:28:41.693418Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.693418Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:08331aae9e9ad2177a56fc6932ab994ca3c8251017aef518b6bff4ff736ae19e","observation_id":"6036a9a4-08fc-439e-9e78-a8ccd741d871","resolution":{"observed_at":"2026-08-10T17:28:41.693418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-10T17:28:41.699528Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.699528Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:1c9b0b42ba845ba7542f61d97da96fbad9835b01b8433e26cf33cabbcf9e9e91","observation_id":"b9e054b2-8ecd-4667-8a6d-94ff044c3fcd","resolution":{"observed_at":"2026-08-10T17:28:41.699528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.965221Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality, march","venue":null,"work_id":"55fa4f7e-de33-49d1-81f5-2540100b3e22","year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.737287Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:980f1e2a14d6976e22f0820a065ed8ca064bca540c1f1565e89bd37cfb9f3404","observation_id":"ecc5df0d-b8da-4357-a1fd-8e86a9138651","resolution":{"observed_at":"2026-08-10T17:28:43.972223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:41.874186Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.874186Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:8b064b09ba975b1f62d3c93c17d4584695fcc9c5438d017676bd2d516cff609c","observation_id":"a8b4e75c-16e2-4b74-ae90-6c3fcb0dd92a","resolution":{"observed_at":"2026-08-10T17:28:41.874186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.806533Z","title":"Vision transformers need registers, 2024","venue":null,"work_id":"d33b2a16-05f7-448a-9551-96ba60d06ea9","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.895226Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:4d9a49b4ae5a6e41448c9fd80a158940f1469d9235a40477524dbc2c77bb1814","observation_id":"9bbefe5c-b46f-4afb-a089-f07b530e149c","resolution":{"observed_at":"2026-08-10T17:28:43.917685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.680710Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":"b7dd02f9-12be-454a-af70-b5cea52fc023","year":2021},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.938134Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:8f78d0b13b0e4200776f7f829f388f0e2d0a15feccff90d18fefd11159dfc1ab","observation_id":"c6275b5e-986c-42db-8241-63e895ad78c3","resolution":{"observed_at":"2026-08-10T17:28:43.721770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.664861Z","title":"Multi-modal hal- lucination control by visual information grounding, 2024","venue":null,"work_id":"f4cd6dab-eacf-4762-ad74-67ec5919b1e8","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.978123Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:d83c1bdac9996a1651e2f866141f3fa242ec05cf044aede280281323473d0a89","observation_id":"c826dfec-a4a3-4aef-b2cb-89d898e6a202","resolution":{"observed_at":"2026-08-10T17:28:43.669896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-10T17:28:41.984011Z","title":"Llama-adapter v2: Parameter-efficient vi- sual instruction model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.984011Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:3d922080709615ef6cf1116b94313728bd2a9b9c13e760a5ab753060b58cd40f","observation_id":"ecf3c9d3-fd65-4e4c-aa05-f955cc1b0e7a","resolution":{"observed_at":"2026-08-10T17:28:41.984011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.645847Z","title":"Cogagent: A visual lan- guage model for gui agents","venue":null,"work_id":"53d8c21f-7e68-4abb-a6bc-d9e398f413f2","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.990211Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:08cff34f64d859aa2f06db549a897a6e5271d78d79f86adf3b93a22105bf426c","observation_id":"87fffa6a-56c4-4da3-a662-aa0ae5ed28f8","resolution":{"observed_at":"2026-08-10T17:28:43.652632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:41.995721Z","title":"A survey on evaluation of multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.995721Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:6feb379d185bffd03dc033204ea3bde4b47e302e58eccc4757c879979a238423","observation_id":"3b17fd8d-0cfa-4ed7-abac-91afe3a32851","resolution":{"observed_at":"2026-08-10T17:28:41.995721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16602","last_updated":"2023-12-27T14:54:37Z","snapshot_observed_at":"2026-08-16T14:31:22.976095Z","submitted_at":"2023-12-27T14:54:37Z","title":"Visual Instruction Tuning towards General-Purpose Multimodal Model: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16602","snapshot_observed_at":"2026-08-10T17:28:42.001774Z","title":"Visual instruction tuning towards general- purpose multimodal model: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.001774Z"},"links":{"cited_paper":"/paper/2312.16602","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:b9ec9c89040df671d6017b3df5cf9e55b3493999fb8fea8406806cc700ed8beb","observation_id":"c881b9e8-5aee-47a1-bd0e-54d4f3633b19","resolution":{"observed_at":"2026-08-10T17:28:42.001774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.608448Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation, 2024","venue":null,"work_id":"8ec9d14d-caed-47da-855a-37e17c4f27a3","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.007830Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:509b51dd01c76abfb3967ef138a9bc8aa369ccda5463748790d36cb2f1d69db3","observation_id":"f8fc29ef-cc3d-4e1f-bcf3-966aa8fdf8c7","resolution":{"observed_at":"2026-08-10T17:28:43.614059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.591286Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"e14d4b80-1f73-4b02-a84a-84d55e8ad328","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.013537Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:59883ae5ea5f35e7f9b77bb55610d7c90c4b64bbec8f606424b5342c8248a5f3","observation_id":"df7ad794-dd1c-45bb-a9a1-05a52ef16438","resolution":{"observed_at":"2026-08-10T17:28:43.596824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.019215Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.019215Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:45392da7c0a11c70381c66149018d8de134076826e53ecc1f822bb527123d5ea","observation_id":"17e08fe4-9d2d-49ab-b61e-da5919140776","resolution":{"observed_at":"2026-08-10T17:28:42.019215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.524517Z","title":"Code: Contrasting self-generated description to combat hal- lucination in large multi-modal models, 2024","venue":null,"work_id":"d441e539-81cc-42df-970b-c6abcb283682","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.025397Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:3ab062ffe80781f8f9068c7eba3bf051b0d0f23741ebce37efebb978c6d336e6","observation_id":"ded805de-481a-4317-a48b-b0be529cc5be","resolution":{"observed_at":"2026-08-10T17:28:43.567529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.364102Z","title":"Building and better understanding vision- language models: insights and future directions, 2024","venue":null,"work_id":"6eb5700e-dcfc-42ba-a0f8-5cd6a1c8eda6","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.030398Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:d71821bc0664859557cf5bd904a260642af3d167bfc740b45a741689344916fb","observation_id":"16919685-580a-4978-b028-0a81cdea7ffd","resolution":{"observed_at":"2026-08-10T17:28:43.452924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.235185Z","title":"Reference-free hallucination de- tection for large vision-language models, 2024","venue":null,"work_id":"01e91b0b-9c35-4fcc-bddd-7c560f4f94a8","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.036040Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:09127cfc3f02b850054b1294c830f79f97aa545f648db1ac32bfa516f399ff88","observation_id":"b824524f-581f-43b2-a4ae-95953f9b0cd2","resolution":{"observed_at":"2026-08-10T17:28:43.320198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.172176Z","title":"Vlm-eval: A general evaluation on video large language models, 2023","venue":null,"work_id":"6809e473-1007-4ee3-9fd3-9d129a47ffdc","year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.041792Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:c4fd403d248cd4a412fed56e5cef7ff2a5292e8e3a3c910385ad45b5a2b7dad6","observation_id":"81768820-ce7f-4443-94cc-71e13ddb8891","resolution":{"observed_at":"2026-08-10T17:28:43.176831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.155721Z","title":"Evaluating object hallucination in large vision-language models, 2023","venue":null,"work_id":"fd32b5ec-dc03-4cbf-9887-837418a2c863","year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.047052Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:398cce8ac55d605097d806ce4e35b2c5cd1100a1a0998dcecd782894533c075b","observation_id":"269d5e76-cc37-408a-b3e5-0e827378708e","resolution":{"observed_at":"2026-08-10T17:28:43.161168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-10T17:28:42.052071Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.052071Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:d19093969403ab87dd97da8f5b30f2cec695f42584b9587496f9e902707caf17","observation_id":"6c514fb9-1a90-4ae0-bd2f-629d00a3821a","resolution":{"observed_at":"2026-08-10T17:28:42.052071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.139816Z","title":"Gpt- 4 enhanced multimodal grounding for autonomous driving: Leveraging cross-modal attention with large language mod- els","venue":null,"work_id":"0cf614c3-ae84-45fb-9045-a0158b5af290","year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.057574Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:2b62a00ceaa7b4adfcca18ae1320501580d1580fb3b948108987f5d277415be6","observation_id":"a99d5419-917f-41d6-b745-d4b5133f2125","resolution":{"observed_at":"2026-08-10T17:28:43.144719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.063233Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.063233Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:ec0f742b0fee54dfdcba91890bf9b2e7a149141f6feb78961016643e1679c96d","observation_id":"3a5c302d-b6e8-4d6f-a00c-7a4e0e22ad90","resolution":{"observed_at":"2026-08-10T17:28:42.063233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.111946Z","title":"Visual instruction tuning","venue":null,"work_id":"790195bc-9792-4a30-b764-663383c0cf82","year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.068072Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:3e5f4a17f052f709886ee926c1311a40437c86e512f52dfcc4b25d2f5bf1af94","observation_id":"62026cff-aadf-4dc3-8cee-a70033b396ff","resolution":{"observed_at":"2026-08-10T17:28:43.117189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.072757Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.072757Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:8cd4d7acea20d12fab1b9b87a0d87047aa2749366829a829ba31ed328fca5c3a","observation_id":"057b4ae5-1c0b-4f76-b895-e19a0cc7fbb5","resolution":{"observed_at":"2026-08-10T17:28:42.072757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.078333Z","title":"A survey on hallucination in large vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.078333Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:16ba5018b8156c77efe79a07584d82e77df4f777406552afb31901f9b22881a8","observation_id":"45101b8e-64f7-4863-8dc9-6ff86868437d","resolution":{"observed_at":"2026-08-10T17:28:42.078333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.073304Z","title":"Paying more atten- tion to image: A training-free method for alleviating halluci- nation in lvlms, 2024","venue":null,"work_id":"f4a816a9-a245-4b24-84ab-d9bb559bf6e9","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.083660Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:454ccc513b4ac505c5be2752984b66da8387fe23cbb94d6947c17d8a93b1aec2","observation_id":"3c1a433d-e008-4f0b-b33a-998f8934cb7d","resolution":{"observed_at":"2026-08-10T17:28:43.078577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05338","last_updated":"2024-08-13T05:48:31Z","snapshot_observed_at":"2026-08-16T14:54:00.333297Z","submitted_at":"2023-10-09T01:52:27Z","title":"Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05338","snapshot_observed_at":"2026-08-10T17:28:42.088812Z","title":"Negative object presence evaluation (nope) to measure object hallucination in vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.088812Z"},"links":{"cited_paper":"/paper/2310.05338","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:32af35efce3638cf5ef7a4e7a42769f763619a368f0531f1ffcd2669b054ffeb","observation_id":"3df155bd-5f2a-4dda-9762-67548722f339","resolution":{"observed_at":"2026-08-10T17:28:42.088812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-10T17:28:42.094407Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.094407Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:516240972a3c31194f8b896b307866a8cc926a1c7b2cc04e00f1ebb2d7cec786","observation_id":"7fe2a868-7d6f-4edc-8553-eaf011d25820","resolution":{"observed_at":"2026-08-10T17:28:42.094407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.056237Z","title":"Vista-llama: Reducing hallucination in video language models via equal distance to visual tokens","venue":null,"work_id":"8b3a95e4-04e7-4dfa-914e-62e1a2e6501a","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.113158Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:672e4d62ac5a6821ff72c6cd1d7e8c3fdfb16f09f8c439bfe64e4e6451c43b14","observation_id":"784ff819-22cd-4800-ae7c-13a03565c709","resolution":{"observed_at":"2026-08-10T17:28:43.062004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.133517Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.133517Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:68286a8b29599237f6d0124781abbb114a447e31ea12a6000dcc5591473a75c9","observation_id":"0fb71868-bf1b-48c6-afbe-7e6992b059ed","resolution":{"observed_at":"2026-08-10T17:28:42.133517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-16T11:34:00.114590Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-10T17:28:42.155224Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.155224Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:1ccde77645d46d7ab6898bb8cdaf94bddb0dc7ef427d0bca686520d5e5f960be","observation_id":"2204cb83-7859-4382-bb79-c3226c277391","resolution":{"observed_at":"2026-08-10T17:28:42.155224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.024494Z","title":"Arık, and Tomas Pfister","venue":null,"work_id":"55ea6eda-a490-4b65-9917-729407d97a71","year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.208042Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:87b09fbe4f44e102a5dd531d0a27d9027efb8834f84dbb9be079bbd7c8d90d81","observation_id":"181d5f5f-f57e-47c4-a8ee-4ce6e1ce459d","resolution":{"observed_at":"2026-08-10T17:28:43.029973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.004823Z","title":"Visual text meets low-level vision: A comprehen- sive survey on visual text processing, 2024","venue":null,"work_id":"01f2b194-decd-48db-acee-19b32adb4172","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.213290Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:73d8c0598a35789297016c0681faa7caca784ac32c3da4647fcc2a7c076bd971","observation_id":"1bf4b930-e462-4796-bb99-0cc3d3b5724b","resolution":{"observed_at":"2026-08-10T17:28:43.010949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.987352Z","title":"Mitigating entity-level hallu- cination in large language models, 2024","venue":null,"work_id":"0ae443ce-2bbc-4c5a-8eb8-75a82aaabd83","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.218200Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:0d43cd71432b4cf3edb8c371df286680a13eddcccba98fd3a459968da2643960","observation_id":"5b3667b1-1698-4f56-aabb-15a579959005","resolution":{"observed_at":"2026-08-10T17:28:42.992611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15126","last_updated":"2023-10-10T11:57:26Z","snapshot_observed_at":"2026-08-16T15:05:01.482053Z","submitted_at":"2023-08-29T08:51:24Z","title":"Evaluation and Analysis of Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15126","snapshot_observed_at":"2026-08-10T17:28:42.223116Z","title":"Evaluation and analysis of hal- lucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.223116Z"},"links":{"cited_paper":"/paper/2308.15126","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:009f20b915c765fcbe64cf833a464c309b99a2d3887471cd359074f122bca774","observation_id":"b7b701dd-9b22-4faa-a669-2733cd166fbc","resolution":{"observed_at":"2026-08-10T17:28:42.223116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.915733Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks, 2023","venue":null,"work_id":"4bea0a85-db72-4656-bfd5-06d3636f0db5","year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.228495Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:b9d582a9dd5c961d37e3039853d760e6db36332bfd356418ee7155b633e8861f","observation_id":"13b72026-dccb-4dec-ab73-2229e4ff33ff","resolution":{"observed_at":"2026-08-10T17:28:42.972940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-10T17:28:42.233604Z","title":"Huggingface’s transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.233604Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:66370d4701cff35c17cd5de56ef37514fe7e6205ef9adefad39b31a7c35a90de","observation_id":"bfbb2228-5f6f-48df-968f-3b24e1cefcf1","resolution":{"observed_at":"2026-08-10T17:28:42.233604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-08-16T15:23:35.593791Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-10T17:28:42.239225Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.239225Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:2f568379a718073598b6cde1199f7aeb3976a014d0bd99a1bc9499ef1dc3acb6","observation_id":"c8cf76d3-9626-476c-805f-9332bd5a1df1","resolution":{"observed_at":"2026-08-10T17:28:42.239225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-10T17:28:42.244622Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.244622Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:d145296537d8e8165e45e2cffc2b02ddb3ed94cd688a0333e62517ba24b18f62","observation_id":"a692ded4-65dd-4451-a780-7b0152e20d4d","resolution":{"observed_at":"2026-08-10T17:28:42.244622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.714952Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data, 2024","venue":null,"work_id":"1672a60c-f75a-4508-8f54-0188c8dac821","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.250215Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:ada306ce1626a17502339fac72620ff737cbc4314255270a23b0832cc6d6660c","observation_id":"ad07a1d5-f159-43d2-afb0-feda7fa30c31","resolution":{"observed_at":"2026-08-10T17:28:42.765073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.622056Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"45a793d5-613e-4eb6-9694-c8ce7169dbe1","year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.256496Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:965f17952c0c25d0598e456c195251724a5b8ab89e122d95fe5150b5c2fb0895","observation_id":"ba2d2d30-3afc-40e3-9c57-92dae7f0463d","resolution":{"observed_at":"2026-08-10T17:28:42.677767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.260931Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.260931Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:4b2a1ecfc8af8fe8acc131c503e7b42f19cfac799d2a726351e0b16ec03c0f02","observation_id":"6d6e63ca-ed06-4655-a3c2-e71fcbd7a45a","resolution":{"observed_at":"2026-08-10T17:28:42.260931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-10T17:28:42.265647Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.265647Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:2df4ebc898f70f308a458cd35bda7ad543046e8513a6b3231a5830124b8f0da0","observation_id":"868ac95e-4c65-42cb-8a23-46aacd7d3f1e","resolution":{"observed_at":"2026-08-10T17:28:42.265647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T17:28:42.270697Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.270697Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:f9801df8d6d08040f862706f00502e9eda7f99f845192705f41d5f8d628869ef","observation_id":"7a7b035a-aa99-4f35-86c9-ec5c70dc255d","resolution":{"observed_at":"2026-08-10T17:28:42.270697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:42.564940Z","title":"Ibd: Alleviating hallucinations in large vision- language models via image-biased decoding, 2024","venue":null,"work_id":"b56e0767-80eb-4bbb-ba18-7b6378cb4b2b","year":2024},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:42.275751Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:48db723250adaf6a2ca52af64f76d4f9097035d9a5b9f2b0c3aaec950b1b480b","observation_id":"cbf2c9d0-5529-413c-8428-3b77b3aca602","resolution":{"observed_at":"2026-08-10T17:28:42.572620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:28:43.944324Z","title":"org/blog/2023-03-30-vicuna, 3(5),","venue":null,"work_id":"e450288d-8365-4c2e-a6a3-2f444682b4ae","year":2023},"citing_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T17:28:41.784398Z"},"links":{"citing_paper":"/paper/2501.12206"},"observation_digest":"sha256:2c3f04e4856ee0593db0467d92c879ee791da6facf5b7f24af84f6f392f9418a","observation_id":"a24d36d2-2478-4698-b7c6-c8fbed12cf15","resolution":{"observed_at":"2026-08-10T17:28:43.951583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2501.12206."}