{"as_of":"2026-08-09T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8345e13a46ec43ed351ffb3f81097bd4811a2e81195a23e14833310c628ef98","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:38:19.660978Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T23:51:47.724033Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"cited_work":{"arxiv_id":"2507.05056","doi":"10.48550/arxiv.2507.05056","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05056","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"doi:10.48550/arXiv.2507.05056 , abstract =","venue":null,"work_id":"17659760-7c13-4afc-bee2-54b4d53f4e6f","year":null},"citing_paper":{"arxiv_id":"2604.21027","last_updated":"2026-08-02T16:15:42Z","snapshot_observed_at":"2026-08-06T23:24:26.820832Z","submitted_at":"2026-04-22T19:18:36Z","title":"HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering","version":1},"reference_index":272,"source":"arxiv_source","source_observed_at":"2026-05-09T23:51:47.724033Z"},"links":{"cited_paper":"/paper/2507.05056","citing_paper":"/paper/2604.21027"},"observation_digest":"sha256:57370fb16aef6b0dead474a9c6c4ec314a222ada5f6725366a52209bc0370943","observation_id":"77c88cd2-e7eb-4675-afed-c9d9752cefea","resolution":{"observed_at":"2026-05-09T23:54:45.759084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05056/citation-record","integrity":"/paper/2507.05056/integrity","json":"/paper/2507.05056/citation-record.json","paper":"/paper/2507.05056"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.12718","last_updated":"2025-03-14T04:38:44Z","snapshot_observed_at":"2026-07-06T18:33:02.286642Z","submitted_at":"2024-06-18T15:38:41Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12718","snapshot_observed_at":"2026-08-06T19:38:18.543645Z","title":"Agla: Mitigating object hallucinations in large vision- language models with assembly of global and local attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.543645Z"},"links":{"cited_paper":"/paper/2406.12718","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:e69759d12ef4bbd4861b7cd76875534e07221492fc2bb5c56a717d78aa38ce86","observation_id":"cde163f2-8c77-43a1-b3cf-0994f4aace27","resolution":{"observed_at":"2026-08-06T19:38:18.543645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T19:38:18.641082Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.641082Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:1111a64fcc5faa2b9118b34c2c0f32aafbd328af19a9a3d626d8c8d2725be1da","observation_id":"a1fb25db-3cec-43ef-906f-8fc625f13c61","resolution":{"observed_at":"2026-08-06T19:38:18.641082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:38:18.738529Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.738529Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:6103408c0bdd1313729dbc4d8b0bc395e22072cde3494858beb31c6bf135215b","observation_id":"32146d21-d3c0-49b7-836c-928f63a46e6b","resolution":{"observed_at":"2026-08-06T19:38:18.738529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:18.889260Z","title":"Audio chord recognition with recurrent neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.889260Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a681e486d64bdf48055968f9ebd4990da17029f2df7ac1d3d7bf41a9022899f1","observation_id":"abd1f3f1-8060-4670-9419-2bded2f1845b","resolution":{"observed_at":"2026-08-06T19:38:18.889260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.116024Z","title":"Explaining a series of models by propagating shapley values","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.116024Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:79d1311c60500d922bbd53aad3e5c1403b40b1486ee317b43f98ffc8eacaa746","observation_id":"a5f89206-c5b7-4a57-ae89-6a8068f7b646","resolution":{"observed_at":"2026-08-06T19:38:19.116024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01811","last_updated":"2023-12-01T12:27:10Z","snapshot_observed_at":"2026-08-09T05:34:55.907652Z","submitted_at":"2023-04-04T14:08:42Z","title":"HarsanyiNet: Computing Accurate Shapley Values in a Single Forward Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01811","snapshot_observed_at":"2026-08-06T19:38:19.235787Z","title":"Harsanyinet: Computing accurate shapley values in a single forward propagation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.235787Z"},"links":{"cited_paper":"/paper/2304.01811","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:fc817b6a92593cd40045bc51dc2f2ba30cdc86bbed7a46d4965bfc3a08b67835","observation_id":"14a3c217-acfc-41a1-9175-0c4b255ad614","resolution":{"observed_at":"2026-08-06T19:38:19.235787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T19:38:19.295473Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.295473Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:778b2bd57d39c16495bd60fc0b68cd1bf9cde5a0f6b1b98cf8ebc9eae8cd3653","observation_id":"4eec48b3-1663-4ede-a27a-99988b8e0564","resolution":{"observed_at":"2026-08-06T19:38:19.295473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16479","last_updated":"2023-11-27T09:30:02Z","snapshot_observed_at":"2026-08-09T15:58:21.146758Z","submitted_at":"2023-11-27T09:30:02Z","title":"Mitigating Hallucination in Visual Language Models with Visual Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16479","snapshot_observed_at":"2026-08-06T19:38:19.305433Z","title":"Mitigating hallucination in visual language models with visual supervi- sion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.305433Z"},"links":{"cited_paper":"/paper/2311.16479","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:18ab88dbc965704ba30df19c6a7eb52dea2dc78356c7dce2c6c153a0e172c4fc","observation_id":"77c2f478-91d0-4563-8c17-358dd4ebcf98","resolution":{"observed_at":"2026-08-06T19:38:19.305433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T19:38:19.310549Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.310549Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:bc152e5b163982e1cf7f10688c8736d0d66067a82332aebf0a9e36221489a953","observation_id":"b6e23cfd-04b9-40f6-b682-be1301f0a10e","resolution":{"observed_at":"2026-08-06T19:38:19.310549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.315314Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.315314Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:6451a05aa81cfd9e1d514a93ada3a89b48327917d1d24d21f00bd71456f03aca","observation_id":"5adf8b47-d680-4fd8-9a0f-c9cb8648e60d","resolution":{"observed_at":"2026-08-06T19:38:19.315314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-07T09:16:51.378562Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-06T19:38:19.319571Z","title":"Halc: Object hallucination re- duction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.319571Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:826688ba174e39276718a0aa910da68ecff9b8fa547483f6224e8fc36dea3f5a","observation_id":"bb014128-057b-4da0-accb-0fa9e84d5f85","resolution":{"observed_at":"2026-08-06T19:38:19.319571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.323992Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.323992Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0bd7c88239f2f03afb117f79b65740d56d3faf8fff7b7bff136d14ed66598398","observation_id":"27dec42c-0982-4fe4-8aea-80063af9da73","resolution":{"observed_at":"2026-08-06T19:38:19.323992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.328013Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.328013Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:2774813ae8f09206ca573ca6e180d6a79f1da3a2b4af05920655861150325582","observation_id":"9b05a7d3-e268-4b27-9fba-4d7c5a8afa63","resolution":{"observed_at":"2026-08-06T19:38:19.328013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06236","last_updated":"2022-11-07T16:47:51Z","snapshot_observed_at":"2026-08-02T21:42:59.900323Z","submitted_at":"2021-11-11T14:35:20Z","title":"Discovering and Explaining the Representation Bottleneck of DNNs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06236","snapshot_observed_at":"2026-08-06T19:38:19.336977Z","title":"Discovering and explaining the representation bottleneck of dnns","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.336977Z"},"links":{"cited_paper":"/paper/2111.06236","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:6e05cd32db368d07e33dd148be822c34fc0486be6a8a88a3b3d66c9b8a6a9302","observation_id":"c9c02951-86d5-4b28-b4c6-f89920d25ef2","resolution":{"observed_at":"2026-08-06T19:38:19.336977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.342129Z","title":"Explaining deepfake detection by analysing im- age matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.342129Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:74ac996335344602c11c426918693c09b6e07eac7e6176e62b128c2c50cbc116","observation_id":"4a22e055-b58d-4069-afb2-7158c7c8c8b2","resolution":{"observed_at":"2026-08-06T19:38:19.342129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16922","last_updated":"2023-11-28T16:26:35Z","snapshot_observed_at":"2026-08-07T09:15:01.742397Z","submitted_at":"2023-11-28T16:26:35Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16922","snapshot_observed_at":"2026-08-06T19:38:19.346285Z","title":"Mitigating object hallucinations in large vision- language models through visual contrastive decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.346285Z"},"links":{"cited_paper":"/paper/2311.16922","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:b7da10d344458ad62791fe6111231bedc9f249e7c351bc00f395c13c41e0305e","observation_id":"bba5652d-6683-4270-b8d7-0c0cee8a4b2a","resolution":{"observed_at":"2026-08-06T19:38:19.346285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.188788Z","title":"Multi-modal hal- lucination control by visual information grounding","venue":null,"work_id":"d5cad74b-4609-48c3-a172-e9be9d2d511e","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.350419Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:81b7b84127c42172e14153bd4a0f06fe677ec8d3f967aae825ad9e3516fbbf4a","observation_id":"de86c1ac-25fa-4518-8f01-552187d3beb7","resolution":{"observed_at":"2026-08-06T19:38:26.342045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.923517Z","title":"Shapley val- ues for feature selection: The good, the bad, and the axioms","venue":null,"work_id":"4faff866-8e16-4b8b-b7e0-fdc3d760bdb7","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.355250Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:e9884ea3fecfcb29495eaf1b5e449101e61b1060f808510855ae38f42bed52d6","observation_id":"d0b5b00c-a6cc-499a-95e4-7b5538186ba4","resolution":{"observed_at":"2026-08-06T19:38:26.007838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T19:38:19.359965Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.359965Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d63534aa7ef8d930176ba18461533cbbf6cab1ac5c93955253387d81b4cea994","observation_id":"922a97d6-8cd5-40e9-a4f3-86892197d85c","resolution":{"observed_at":"2026-08-06T19:38:19.359965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.664800Z","title":"An axiomatic approach to the concept of interaction among players in cooperative games","venue":null,"work_id":"a009ee10-aba5-470b-bf74-e81fcec4873b","year":1999},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.364795Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:aca1fc98d03c2999d389381dc433fe7b9f7f4ee50e0403889cad0a6283b195c2","observation_id":"77f4446a-42ab-4603-9988-178a70cc16fe","resolution":{"observed_at":"2026-08-06T19:38:25.786723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-06T19:38:19.369136Z","title":"Sequence transduction with recurrent neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.369136Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:e8fea64f202c64246ab1d91f9cea39b61c420d896fa800a43ea17d17492218fa","observation_id":"ec0d1c72-e24f-42c8-bdae-6eaf36412b51","resolution":{"observed_at":"2026-08-06T19:38:19.369136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.328711Z","title":"A simplified bar- gaining model for the n-person cooperative game","venue":null,"work_id":"f3584577-45c9-4098-a3b7-1864c930f659","year":1982},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.373583Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8a89d0f2fbda573a52c44436ed44c63832f414db0f54a54e340d673af92fdac8","observation_id":"187b7394-8d7e-4911-a615-871cd4906a1c","resolution":{"observed_at":"2026-08-06T19:38:25.472728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.012867Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"28ebede6-e950-413b-9894-66e9ba7f28b3","year":2019},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.377534Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:915a1cf0abc0cbe5a43e041664100b8059f2b090cbd07cee375f42b99a6c96e8","observation_id":"fb62258b-cb84-4f16-b3d2-7e649616f458","resolution":{"observed_at":"2026-08-06T19:38:25.162147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.773301Z","title":"spacy 2: Natural language understanding with bloom embeddings, convolutional neural networks and incremental parsing","venue":null,"work_id":"b4a52ff3-ed9e-4ac6-9dc5-dc82c482ceaf","year":2017},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.381831Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:57b3e8d077245561698b734aca6f5b5d16268fcdcee0aaf5e3d5af0ba5454f73","observation_id":"3be5026c-c421-4e8c-b802-c24f8f2571ad","resolution":{"observed_at":"2026-08-06T19:38:24.881163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.603814Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"1fbe21a8-5263-4869-b0e9-18a51df757b0","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.385888Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:815cbca14f07e03448a5e87b7d3e68e6c06fc6e0acaf3c57ce14f590bbcff0d1","observation_id":"d2482827-9a6d-4da5-bc0c-2d06dcbf784d","resolution":{"observed_at":"2026-08-06T19:38:24.669459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.423085Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"81ee3f4c-1e17-481a-bb64-7954a36f5d89","year":2019},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.389940Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:1e0760e98e8b057d800f3451ffe84cac74966633001f0ac08f526faa58bfe631","observation_id":"c0a21d6c-fcd0-4947-9f66-03d72cb4917a","resolution":{"observed_at":"2026-08-06T19:38:24.493981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-06T05:55:18.425562Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-06T19:38:19.394394Z","title":"Self-introspective de- coding: Alleviating hallucinations for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.394394Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:66219b2e9542bd525d1a38f985028abfcc53c7a83497ec6ca03ff073f372cfb8","observation_id":"85fe5ffc-b528-4464-a4d3-eac8446b038e","resolution":{"observed_at":"2026-08-06T19:38:19.394394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T19:38:19.398916Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.398916Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5c84a418093a70ccd576dfe98e1cae9a0937e12578ed0e73b32a0b12db6396b8","observation_id":"7d197cd5-7f59-4a43-988a-e9eb4e90aee4","resolution":{"observed_at":"2026-08-06T19:38:19.398916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.163392Z","title":"Vcoder: Ver- satile vision encoders for multimodal large language models","venue":null,"work_id":"87a6980a-3baf-470b-9b4a-c9e644972654","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.402801Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f3f8ea105c4255e24dd45ae102ac3a08719415bf0dc755b6e22dfa4f39dc9995","observation_id":"ae821b85-f618-48d4-84dd-01223ad74e82","resolution":{"observed_at":"2026-08-06T19:38:24.300730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.940362Z","title":"Hallucination augmented contrastive learn- ing for multimodal large language model","venue":null,"work_id":"bfffbc4a-50d5-49b1-baf1-15b2daa5fc91","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.406874Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:39dd7ea8b92629be79d22e6b655c86b308fd39ede98b4513ac86d79af6f38ed6","observation_id":"9e1fb101-0060-4cb0-a6ea-95f24be9a26a","resolution":{"observed_at":"2026-08-06T19:38:24.043409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-06T19:38:19.410901Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.410901Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:b88663365361e6a621f1291f2b8f3d6722ab2ea262752c3914ef499a35c139b9","observation_id":"650fe551-ea2f-416f-8532-9aa34c0f1079","resolution":{"observed_at":"2026-08-06T19:38:19.410901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15097","last_updated":"2023-07-10T06:08:55Z","snapshot_observed_at":"2026-07-06T14:10:59.567758Z","submitted_at":"2022-10-27T00:58:21Z","title":"Contrastive Decoding: Open-ended Text Generation as Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15097","snapshot_observed_at":"2026-08-06T19:38:19.415802Z","title":"Contrastive decoding: Open-ended text gen- eration as optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.415802Z"},"links":{"cited_paper":"/paper/2210.15097","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:3274e9c4a9c381fdd7f0f6629ee5874d939c4682ef17aa1bed0c8969cc43da5c","observation_id":"8b304bf2-f282-4b24-8413-fbb69e49c2f0","resolution":{"observed_at":"2026-08-06T19:38:19.415802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T19:38:19.425125Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.425125Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:fda13d4530a73803954ebc5ea14bf24df6260e21d686b00a5dba696a783fa72c","observation_id":"3fff2933-8b88-45dc-8687-bb999c88e654","resolution":{"observed_at":"2026-08-06T19:38:19.425125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.705982Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"cfeed009-b410-45ad-a652-de43dc87bf63","year":2014},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.429406Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d8b9a7d5ccfae55167ef6f2309950e5652115da85958cad0c14712fdf16b5c8c","observation_id":"73105847-2c71-450b-9247-d91b87a189c8","resolution":{"observed_at":"2026-08-06T19:38:23.825026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T19:38:19.434030Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.434030Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a7e8064b29ac434bb831392bbc298f1d0b5c93cff53a2fe6674af4e725484368","observation_id":"4e80fea9-ad4e-464c-9660-ffea4130c2d0","resolution":{"observed_at":"2026-08-06T19:38:19.434030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.527406Z","title":"Llava-bench in the wild dataset","venue":null,"work_id":"084e30e0-37e9-40e9-bb5e-1c297068b324","year":2025},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.439024Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:65275aadd27a61522d6f68c46cc7caf519ef41730fff2009e11d1ac589bcdb3e","observation_id":"aeaffdb4-21ca-48e3-aef6-f3b0309677d1","resolution":{"observed_at":"2026-08-06T19:38:23.638230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.255569Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"5961b1ea-827e-4e60-9bf9-56fa531a372e","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.443488Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d7d72d8ba0b1ce1bd71b6e0716b5d8b104bd1e3b7f58336599d75f1f01d92dcf","observation_id":"b0b1efb2-7dcc-450b-a7b4-f8a51466909d","resolution":{"observed_at":"2026-08-06T19:38:23.365231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T19:38:19.448410Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.448410Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:10d2a3fcc271d2fcbe61014d0d40e4994a12908f93f7383012f5518636ac9176","observation_id":"81672b28-54e1-412e-8f76-d4d9f27341a0","resolution":{"observed_at":"2026-08-06T19:38:19.448410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13906","last_updated":"2024-08-25T18:02:36Z","snapshot_observed_at":"2026-07-06T19:05:44.820697Z","submitted_at":"2024-08-25T18:02:36Z","title":"ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13906","snapshot_observed_at":"2026-08-06T19:38:19.453361Z","title":"Convis: Contrastive decoding with hallucination visualiza- tion for mitigating hallucinations in multimodal large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.453361Z"},"links":{"cited_paper":"/paper/2408.13906","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:654a71e2ca8e773179f07a72df289d08d1da93a82005091a561970f272c3b680","observation_id":"6d962263-043a-4890-9fac-f8d2c0a7c1b6","resolution":{"observed_at":"2026-08-06T19:38:19.453361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02904","last_updated":"2024-04-03T17:59:36Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:36Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","version":1},"cited_work":{"arxiv_id":"2404.02904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02904","snapshot_observed_at":"2026-08-06T19:38:19.950880Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","venue":"cs.CV","work_id":"bd073d1b-b57c-458d-bdd0-cb26c2086348","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.457909Z"},"links":{"cited_paper":"/paper/2404.02904","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0bc9bb80f2571b3d1f2a6b711225f6a6cd077cf219b62434083a9c610031231f","observation_id":"9e4ebc1a-37c7-4fcb-8372-16f4320294f6","resolution":{"observed_at":"2026-08-06T19:38:19.955781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17150","last_updated":"2024-08-30T09:40:10Z","snapshot_observed_at":"2026-08-07T02:34:01.294703Z","submitted_at":"2024-08-30T09:40:10Z","title":"Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17150","snapshot_observed_at":"2026-08-06T19:38:19.462703Z","title":"Look, compare, decide: Alleviating hallucination in large vision- language models via multi-view multi-path reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.462703Z"},"links":{"cited_paper":"/paper/2408.17150","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:378b9f3adef540dcc319b62cb739b25e2e339a9f4e8eff39a2ba780ac2b808de","observation_id":"ec5bf09a-d69e-431f-aa31-6fb443969130","resolution":{"observed_at":"2026-08-06T19:38:19.462703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03536","last_updated":"2021-11-08T05:26:14Z","snapshot_observed_at":"2026-07-06T12:05:52.781976Z","submitted_at":"2021-11-05T14:57:49Z","title":"A Unified Game-Theoretic Interpretation of Adversarial Robustness","version":2},"cited_work":{"arxiv_id":"2111.03536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.03536","snapshot_observed_at":"2026-08-06T19:38:19.912617Z","title":"A Unified Game-Theoretic Interpretation of Adversarial Robustness","venue":"cs.LG","work_id":"662ac2bf-4ef8-4163-97c6-a746fb3b5688","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.467577Z"},"links":{"cited_paper":"/paper/2111.03536","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:c41065710ef972659829760d2d388fad76302b7c30fb92de41d6cb2226a09ae5","observation_id":"29eeb48a-e5e8-4c2c-a46b-9dfcece3af37","resolution":{"observed_at":"2026-08-06T19:38:19.917414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10719","last_updated":"2023-05-24T11:36:09Z","snapshot_observed_at":"2026-07-06T11:11:51.862564Z","submitted_at":"2021-05-22T13:03:18Z","title":"Can We Faithfully Represent Masked States to Compute Shapley Values on a DNN?","version":4},"cited_work":{"arxiv_id":"2105.10719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.10719","snapshot_observed_at":"2026-08-06T19:38:19.890676Z","title":"Can We Faithfully Represent Masked States to Compute Shapley Values on a DNN?","venue":"cs.LG","work_id":"98a0183e-0442-4d8a-9c2b-edc370754b85","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.472048Z"},"links":{"cited_paper":"/paper/2105.10719","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:178d5a9c32b0790ca1939146814e22dcd464f7cf47e5a25729e3e48dc8cecfc3","observation_id":"f7b76607-d9c0-49f4-a0e9-d0350ac9c7c2","resolution":{"observed_at":"2026-08-06T19:38:19.895832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.051386Z","title":"Defining and quantifying the emergence of sparse concepts in dnns","venue":null,"work_id":"d46f0969-8076-4f0d-a737-07293c8f194b","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.476497Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5a53e39727e6195c76cfa227abc9c78960fb339429947effa54fcd139abeb162","observation_id":"f529a361-e618-4838-bf63-674bd14f7232","resolution":{"observed_at":"2026-08-06T19:38:23.153811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.480573Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.480573Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0c1c5a56ea33091f59da41348de95946c2ad897ea74b5f635a0b6c7bc509916f","observation_id":"c7583dc6-9f33-4fa0-b27a-04ca6a6e529a","resolution":{"observed_at":"2026-08-06T19:38:19.480573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.489518Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"46af2b38-7d55-4428-bcbc-cea09c26585b","year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.490255Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:eb55dd073c7261394cd78d08ddc4dda63e8ca144d6e51d6ce6646660ac46ba0a","observation_id":"bf777500-2db8-4457-8708-d6c7a1881bef","resolution":{"observed_at":"2026-08-06T19:38:22.623496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.249902Z","title":"A value for n-person games","venue":null,"work_id":"68991584-b9be-4950-a6f2-26aa258e7918","year":1953},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.494518Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0a5a32b30704ea3a11fdaa7d2a3e160ed720522e8f21441771fba6a6d432b707","observation_id":"134f230f-6abd-48f1-bc93-ccac0a28ee95","resolution":{"observed_at":"2026-08-06T19:38:22.352688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10457","last_updated":"2024-07-15T06:12:17Z","snapshot_observed_at":"2026-07-06T18:46:18.540571Z","submitted_at":"2024-07-15T06:12:17Z","title":"The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10457","snapshot_observed_at":"2026-08-06T19:38:19.498886Z","title":"The good, the bad, and the greedy: Evaluation of llms should not ignore non-determinism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.498886Z"},"links":{"cited_paper":"/paper/2407.10457","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:20cb5238b715a8426545d70fa221f273f627dfbafdad1d4f02797be663b2e830","observation_id":"4b4ff39a-1a9f-4ecc-9496-2c30b67cc78b","resolution":{"observed_at":"2026-08-06T19:38:19.498886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T19:38:19.503233Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.503233Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:098adf62ed4f7033b24d1fb99447bd99e012eb85f7410ae4b2cb19fc4e8591a9","observation_id":"cc52176b-9033-4924-9e8f-ff9bf702d255","resolution":{"observed_at":"2026-08-06T19:38:19.503233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.021680Z","title":"The many shapley values for model explanation","venue":null,"work_id":"0f39d179-142e-43a3-8b04-cda8bb806d56","year":2020},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.507571Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:f565c4896302bea87fc9abc2907f4b24389ed55e788460bc84ee2b335452850c","observation_id":"b3985708-eed1-4484-be13-cc06e5b71596","resolution":{"observed_at":"2026-08-06T19:38:22.121952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.821353Z","title":"The shapley taylor interaction index","venue":null,"work_id":"f21acb3d-0bc3-422a-806b-63dca42dc55d","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.511674Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:541c89c4d30943cde9937c49cb025e383a642ad8a2a609ddc415dcc3f39ab67c","observation_id":"483ef97e-44a0-4c56-a920-789bcbdf22de","resolution":{"observed_at":"2026-08-06T19:38:21.928008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.561242Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":"e5c3171e-0ac2-42c9-8e06-b5511c576aec","year":2014},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.515913Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:6851cf0f43952a6cdba40eb2c47b879f6511514da5a1aef09483044ece9c208f","observation_id":"f7bbec4e-1e31-4cd5-bee2-e9a28e5dae72","resolution":{"observed_at":"2026-08-06T19:38:21.648284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:38:19.520881Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.520881Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:9503cb1a442c9f8eb2e05dcde5f745bcba51320028662b9b1fe2376428f6760e","observation_id":"ef6b4625-eaa3-4d29-93ec-b0a1065b24c1","resolution":{"observed_at":"2026-08-06T19:38:19.520881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-06T19:38:19.525397Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.525397Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:bf5002a6f14bf130c24f0a2eb896e85cf5c48c9edd48e6807b88a21b18e61663","observation_id":"c19d4d64-6667-4f9a-991a-0ced4f2edaf2","resolution":{"observed_at":"2026-08-06T19:38:19.525397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17201","last_updated":"2024-05-27T14:22:03Z","snapshot_observed_at":"2026-07-06T18:20:35.626876Z","submitted_at":"2024-05-27T14:22:03Z","title":"Diagnosing the Compositional Knowledge of Vision Language Models from a Game-Theoretic View","version":1},"cited_work":{"arxiv_id":"2405.17201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17201","snapshot_observed_at":"2026-08-06T19:38:19.804227Z","title":"Diagnosing the Compositional Knowledge of Vision Language Models from a Game-Theoretic View","venue":"cs.CV","work_id":"cca05e10-0e54-41a8-bdfe-64ce14348264","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.529779Z"},"links":{"cited_paper":"/paper/2405.17201","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:35def94cc4e8eda68deea95c755848f91b8918e579d14914ff11b2d11fdf8b78","observation_id":"4a4c0d5b-4252-49cc-9412-e49e25669e1c","resolution":{"observed_at":"2026-08-06T19:38:19.809275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.350797Z","title":"A unified approach to interpret- ing and boosting adversarial transferability","venue":null,"work_id":"c176b844-a5a6-4300-8199-ab7b6eb589a5","year":2020},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.534455Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:95cd8c41fd01a29535a55d6ffc7714e3c816d34e24d833e37c5ad47f7a6eb416","observation_id":"318c25dc-19f0-48ea-b975-02a146fb879c","resolution":{"observed_at":"2026-08-06T19:38:21.453645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.027041Z","title":"Interpreting attributions and interactions of adversar- ial attacks","venue":null,"work_id":"4a5bb505-d1c7-44cf-9a0c-3b2c88c666b8","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.538795Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:254186aad62be9f2993188f8fcfcce1b6ba3ea5ab634fbb9447943dc84e5c076","observation_id":"ca4a43e2-58b5-4920-8419-6ad8d5c82730","resolution":{"observed_at":"2026-08-06T19:38:21.177952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17821","last_updated":"2024-12-16T10:27:35Z","snapshot_observed_at":"2026-07-06T18:21:05.410042Z","submitted_at":"2024-05-28T04:41:02Z","title":"RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17821","snapshot_observed_at":"2026-08-06T19:38:19.543126Z","title":"Ritual: Random image transformations as a universal anti-hallucination lever in lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.543126Z"},"links":{"cited_paper":"/paper/2405.17821","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:fa69b53c7de6fdbc023d55b931bc3e77ba2dee73b2ffbe834a6f7279174f4034","observation_id":"77c0045a-de0e-4004-8161-4ae7263fe224","resolution":{"observed_at":"2026-08-06T19:38:19.543126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T19:38:19.547606Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.547606Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8107ab432c0883ff42cc82e49bb45f59da869dcf46294073bdcc789d956d532a","observation_id":"291c248f-be04-408f-ad8b-2f4e79a1109e","resolution":{"observed_at":"2026-08-06T19:38:19.547606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.821181Z","title":"Towards understanding the generalization of deepfake detectors from a game-theoretical view","venue":null,"work_id":"1f6fee67-b918-4b75-9f15-155baa118769","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.552093Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0e9d06c362665af45319f7b102a1838e097610eaf096a1a6f372ea451ee71b35","observation_id":"2012884b-c9c0-4439-b567-4e795a5af1ff","resolution":{"observed_at":"2026-08-06T19:38:20.921201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T19:38:19.557416Z","title":"mplug-owl: Modularization empowers large language models with mul- timodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.557416Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:df447375c35bc5d0a410c5ca919e73dcf6e3b31e1c4223061310dc199b9e8efd","observation_id":"d2164764-afa4-44f7-93a9-57ab4100f894","resolution":{"observed_at":"2026-08-06T19:38:19.557416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.754932Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"82204730-7c8f-4911-a707-73b71e95f927","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.562593Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:51dae2e3312153e85ec3a738666632f5faf700df914abad4de4d5f3c2c845d7e","observation_id":"1249e4de-e633-47bc-a3ec-c0384cf3736e","resolution":{"observed_at":"2026-08-06T19:38:20.772787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.704041Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"65eafd14-e775-4f63-b545-9ffc043a6832","year":2016},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.566697Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5422b3bfba37f4a9c9e7fa42aaacfeceb14cce0a4f7f4b32509e7ef8e98a7246","observation_id":"050f154d-3fe5-4eaf-b8f7-2c0f1e30488e","resolution":{"observed_at":"2026-08-06T19:38:20.724467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.683654Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data","venue":null,"work_id":"931d1b99-a37a-4ece-ab3b-e7b353eadb67","year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.570923Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a7ce6268204e8d2c8f688983dd98736ca6fd7a00f71935b679ed9da6e9aaff94","observation_id":"0161e570-e149-4c75-8a73-c60890974455","resolution":{"observed_at":"2026-08-06T19:38:20.689823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-08-09T02:22:19.607073Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-06T19:38:19.574901Z","title":"Less is more: Mitigat- ing multimodal hallucination from an eos decision perspec- tive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.574901Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:93f451c277bdca5038621fa26fcddf0dfb345cec9f35c8e171175bdff1296c8b","observation_id":"96b9cab1-d2a4-41a3-aa61-3ccb702988e5","resolution":{"observed_at":"2026-08-06T19:38:19.574901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.662461Z","title":"Halle-switch: Controlling ob- ject hallucination in large vision language models","venue":null,"work_id":"305d0d30-6971-47eb-a1ae-051860662982","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.579844Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:549e4098cb5e7e44545f44d3d2221bdf9b8e68fc021c352511a0ae657909dcf8","observation_id":"945083b6-f25e-4346-8cda-b30ad4879084","resolution":{"observed_at":"2026-08-06T19:38:20.669545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.647798Z","title":"Building interpretable interaction trees for deep nlp models","venue":null,"work_id":"6ee8d66e-88c5-45fa-93e9-ad1a5f5af33f","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.584614Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:0791d8e708af8ccc23342a2747f3a1e2b263445683279341bf874d063dd9a898","observation_id":"f0ae7641-632e-49fc-a02b-7846e89581c5","resolution":{"observed_at":"2026-08-06T19:38:20.653107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14978","last_updated":"2021-02-03T09:52:35Z","snapshot_observed_at":"2026-07-06T10:09:27.733347Z","submitted_at":"2020-10-28T13:40:57Z","title":"Technical Note: Game-Theoretic Interactions of Different Orders","version":2},"cited_work":{"arxiv_id":"2010.14978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.14978","snapshot_observed_at":"2026-08-06T19:38:19.717738Z","title":"Technical Note: Game-Theoretic Interactions of Different Orders","venue":"cs.LG","work_id":"9fb1da7d-c6ee-4b2e-abf6-75ba491fc21c","year":2020},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.588776Z"},"links":{"cited_paper":"/paper/2010.14978","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:530c292adee28a6e005d54d14149f1b997373f2a54dca06cc368e0ef1166656b","observation_id":"97bc30db-ad68-4f09-9ef3-52995a9da03f","resolution":{"observed_at":"2026-08-06T19:38:19.724425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.632454Z","title":"Interpreting multivariate shapley interac- tions in dnns","venue":null,"work_id":"2f7b2cd1-6c98-4c67-9889-d0cd7f254409","year":2021},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.593003Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5212b61782d6d712d21985db332bcfe93e806ba8185b44a0b7c1a4767263ee14","observation_id":"ea42423c-a0f1-4822-a4c0-89f4b104e7b0","resolution":{"observed_at":"2026-08-06T19:38:20.637752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.617205Z","title":"Explaining gen- eralization power of a dnn using interactive concepts","venue":null,"work_id":"b43672f1-9f5f-431f-8a02-aefc26e54d27","year":2023},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.597266Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:e419bf9e736651991abbce656df81dc13619cadf95a4897b22d019de714b3e28","observation_id":"624be49e-5c6c-4b77-91a8-fce28c0273bd","resolution":{"observed_at":"2026-08-06T19:38:20.622141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03577","last_updated":"2025-05-08T05:49:30Z","snapshot_observed_at":"2026-08-06T09:14:02.055269Z","submitted_at":"2024-10-04T16:30:54Z","title":"Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03577","snapshot_observed_at":"2026-08-06T19:38:19.601377Z","title":"Look twice before you answer: Memory-space visual retracing for hallucination mitigation in multimodal large language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.601377Z"},"links":{"cited_paper":"/paper/2410.03577","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:c1a01b08d82b62a4dca345a01a89a26d7e076c268bdb049827822f8c44ed13c4","observation_id":"6e02966d-90f4-4502-aaf9-660001192938","resolution":{"observed_at":"2026-08-06T19:38:19.601377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.602219Z","title":"The Polling-based Object Probing Evaluation (POPE) [33] utilizes images sampled from several datasets, including MSCOCO [35], A-OKVQA [47], and GQA [26]","venue":null,"work_id":"b511a979-dc2a-487a-a041-8e974200e8e5","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.605809Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:ec94285b9083cf046f083bb7dfb4902d96483cf9f3cf0f9f4fed9ee3682fdd6b","observation_id":"6f633e1e-5a50-4c4b-bc46-ee9819a304bc","resolution":{"observed_at":"2026-08-06T19:38:20.607116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.588549Z","title":"As shown in Tab","venue":null,"work_id":"8d2dae3b-4dc0-4819-8b20-3c806f655131","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.610211Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:6ccb719009e99aa00311e533602da085e03801c475dd6c72540499648fa9d4ed","observation_id":"c0db2e3d-7c47-4cc1-a523-b4e07dd744a7","resolution":{"observed_at":"2026-08-06T19:38:20.592658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.575015Z","title":null,"venue":null,"work_id":"f2691d49-0b19-4e67-b187-873976b4c275","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.614489Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:62a96492dbd3bc94512a3a7be97fe87a381c4d9f44a2707d414a3481d6c5d2b7","observation_id":"a5f312c9-410c-4083-aed1-bceda856df19","resolution":{"observed_at":"2026-08-06T19:38:20.579002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.560774Z","title":"Through experiments on CHAIR [46] and MME [19] benchmarks, we analyze how the interaction guidance co- efficient k affects the performance of INTER","venue":null,"work_id":"753c8006-3145-4514-8b4f-516298e75328","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.618717Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:bd458dfe482934dad1acba71ca0d7771c649706a0755cb0205c9d36455cd05b9","observation_id":"2428d4a3-430c-417d-9f43-2122bc72bdff","resolution":{"observed_at":"2026-08-06T19:38:20.565237Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.545464Z","title":"The results, as shown in the Tab","venue":null,"work_id":"fdfad88b-ab28-4daf-b9b9-7a72d89fe542","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.623097Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:ed187385ff8cce426cad00fdd301362540466ecd49971ab3134fba011932081b","observation_id":"b98024fe-4daa-4488-939a-18b2d5b3dd89","resolution":{"observed_at":"2026-08-06T19:38:20.549878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.530647Z","title":"As shown in Tab","venue":null,"work_id":"24695990-0f9f-45bc-9102-4286de95af75","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.627527Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:8bd621d330dbf8cb14f6bdf88cc3556d451bb0446079ec873f8706ea3b7855f0","observation_id":"ddc901fa-c9c4-4dd7-ba52-e189e078691b","resolution":{"observed_at":"2026-08-06T19:38:20.534946Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.515069Z","title":"10, 19 and 20","venue":null,"work_id":"d58afe82-dc82-4c70-b47d-260689943475","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.632418Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:a44c7cf5d77b7f4a1c987d96722868152c645a8fa4ab69ccabba20dd64dfd0b6","observation_id":"defe6cd6-866c-4951-8aa3-a9cd43e97b6e","resolution":{"observed_at":"2026-08-06T19:38:20.519750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.499828Z","title":"12, 23 and 24","venue":null,"work_id":"5c01470c-4313-43a6-b8d1-193e53891617","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.636734Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:38f350ab56acb06f80f6711b547bee0726987d126b7126f92fac651d4ae2bf5f","observation_id":"af3be004-b5ae-4e4c-a261-b1d82dcf65b4","resolution":{"observed_at":"2026-08-06T19:38:20.504515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.483469Z","title":"8 to 13, 15, 16 and 19 to 26, we demonstrated the effectiveness of INTER in correcting the Greedy Search across various benchmarks","venue":null,"work_id":"644eb96f-baf7-45ef-aec9-c00324570a1a","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.640857Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:aad47e1accf3cf29bef4f66c84fc195abfab91ec4f3dfcabf6fe28f74e29937b","observation_id":"8de149a9-a5a9-414d-a7db-9902c042dea8","resolution":{"observed_at":"2026-08-06T19:38:20.488666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.467433Z","title":null,"venue":null,"work_id":"40627827-2cd5-4ebb-92ee-39cb6e72d8a0","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.644875Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:43fae2f2cc30abaa373e33e1a5b0e5b65c88509d96a1bca1c7cea5c21fe2f34c","observation_id":"89c1f77e-73c8-4eb8-bcf2-9fbf0235e02b","resolution":{"observed_at":"2026-08-06T19:38:20.472206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.452375Z","title":null,"venue":null,"work_id":"5336746e-c7d8-4a97-b1e2-0ca659463b87","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.648885Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:42007da690d4d8d2e8812f13f03f69f0c8e38f6ae83280d75fe2ad958c495e48","observation_id":"37e6d830-d325-497c-b8e6-b96d45aab416","resolution":{"observed_at":"2026-08-06T19:38:20.456978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.437645Z","title":"We conducted experiments with M3ID [17], Ritual [59] and SID [27] in Tab","venue":null,"work_id":"7bf33d07-40ef-4514-897d-5c276ad0408c","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.652910Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:80dc8e29b88b7a7a88dd593f06fdf48c632e7d82edb25810a6071dbd70560c54","observation_id":"4b41057f-1334-46b1-aaad-5288789c308d","resolution":{"observed_at":"2026-08-06T19:38:20.441900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.422649Z","title":"We conducted experiments with DeepSeek-VL2 [60] on the visual grounding task","venue":null,"work_id":"cdb5dc56-69db-4fd9-963f-216e69cad8dd","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.656842Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:3f6f7480b2e24cc1da824df553b5a3789ba0b65eac9dcccf5a96766777bf65fa","observation_id":"92dbc7f1-a87a-49c6-844f-70792efc36be","resolution":{"observed_at":"2026-08-06T19:38:20.427414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.406660Z","title":"The value range of I(A)yt could be influenced by several factors, e.g., benchmarks, LVLMs, etc","venue":null,"work_id":"9bca9dd3-6518-40af-bd1c-49a38f301cdd","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.660978Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:c7bb3f8437138063a5da6cde2646763d800feabf1166b6d570ca033a6c40d786","observation_id":"f7ea1276-1890-405f-8bde-6650a8abbb3f","resolution":{"observed_at":"2026-08-06T19:38:20.412188Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.744052Z","title":null,"venue":null,"work_id":"3996e562-cd6e-4e47-9384-3b58e5a6a94f","year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.485115Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:31b2d13ccd6e9c868c88ff8cd2a39e9d18c9b85794100a5ec3627fd4b6cbe209","observation_id":"9d487f5e-a3a1-4ef4-b53f-64c24dd8b809","resolution":{"observed_at":"2026-08-06T19:38:22.871959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.332718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.332718Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:d58f6abaae4064edce0a5a21420743c635bc43741e574b11f9a3be90095716e8","observation_id":"7d3728dc-8d71-4c22-b751-2ea4a757c123","resolution":{"observed_at":"2026-08-06T19:38:19.332718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:19.300877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.300877Z"},"links":{"citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:30db5e918795834a8130bf668935ce95467e1e8a1a8f564bed9830771332f8f3","observation_id":"4feeb5fa-42da-4d45-8334-fdff83141b03","resolution":{"observed_at":"2026-08-06T19:38:19.300877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:47:01.555437Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":5,"verified_fuzzy":37},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2507.05056."}