{"as_of":"2026-08-14T18:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ffa190ee78882ba2a28c491e9f8c100bbf0f48144d3f9099dd13269ec940c5f","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:57.959423Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:44:03.224842Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:56.636833Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-07-03T20:18:56.636833Z","title":"Bench- marking multimodal knowledge conflict for large multimodal models.ArXiv, abs/2505.19509","venue":null,"work_id":"4fec24e9-06d4-4c9e-8268-76f2c9610a2b","year":2025},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-13T15:34:40.798376Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:224f05808ce171b42981a6de5b87a1e19af5cb5fe20d2e9474c6092a34f407b2","observation_id":"e0494347-3837-40a3-95e8-2e0c2420a272","resolution":{"observed_at":"2026-05-14T20:59:27.451890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-07-03T20:18:56.636833Z","title":"Bench- marking multimodal knowledge conflict for large multimodal models.ArXiv, abs/2505.19509","venue":null,"work_id":"4fec24e9-06d4-4c9e-8268-76f2c9610a2b","year":2025},"citing_paper":{"arxiv_id":"2605.15710","last_updated":"2026-05-15T08:00:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-15T08:00:46Z","title":"SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T19:11:15.761831Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2605.15710"},"observation_digest":"sha256:afb60ae274eec626cbb62008fcbf1d4b40799ae8e1c7131bd9db7811f7a7d0e7","observation_id":"b7ebd128-f15e-420e-a573-22f0002f653e","resolution":{"observed_at":"2026-05-20T19:13:40.530116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-07-03T20:18:56.636833Z","title":"Bench- marking multimodal knowledge conflict for large multimodal models.ArXiv, abs/2505.19509","venue":null,"work_id":"4fec24e9-06d4-4c9e-8268-76f2c9610a2b","year":2025},"citing_paper":{"arxiv_id":"2606.17953","last_updated":"2026-06-16T14:05:46Z","snapshot_observed_at":"2026-08-08T03:30:33.979416Z","submitted_at":"2026-06-16T14:05:46Z","title":"MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T01:28:50.021432Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2606.17953"},"observation_digest":"sha256:06fba8dd7978797afe2d54448efc9d203ec8cea2da97eedaa2d74b506b2007de","observation_id":"fb9280d8-94ae-424a-af30-83d8e846645c","resolution":{"observed_at":"2026-07-03T20:18:56.638205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-08-01T14:44:03.224842Z","title":"Benchmarking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18673","last_updated":"2026-08-03T23:44:52Z","snapshot_observed_at":"2026-08-11T00:30:48.785629Z","submitted_at":"2026-07-21T03:43:50Z","title":"MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T14:44:03.224842Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2607.18673"},"observation_digest":"sha256:b062de2bf771dd2f8468463ad4f9adf6ae973ba51747832f1eeb6670ebcb6851","observation_id":"347d6381-151a-4498-ba4c-25dcf1bfd55d","resolution":{"observed_at":"2026-08-01T14:44:03.224842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19509/citation-record","integrity":"/paper/2505.19509/integrity","json":"/paper/2505.19509/citation-record.json","paper":"/paper/2505.19509"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:16:53.288144Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.288144Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:39c4ac38574819b9414df392bc8f7af5ae0b03c3aaedaaf5b9d0f6e9033faadf","observation_id":"4e1c7e12-f576-49fe-928c-0489a0730825","resolution":{"observed_at":"2026-08-07T14:16:53.288144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:53.350846Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.350846Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:584d762f0816d2fb7cca987930b95f982faa1456ee2276ae11a7f3834497a6c4","observation_id":"c7d0d6ff-3ce7-4146-b9be-5c195a1575eb","resolution":{"observed_at":"2026-08-07T14:16:53.350846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:53.441172Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.441172Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:3f1e6b93b214456cc8d1dd8d632791ffc134aeff14cee2e1090df68d09eceeb0","observation_id":"01e2cd52-62e3-49de-a71d-611d17d70005","resolution":{"observed_at":"2026-08-07T14:16:53.441172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:53.549192Z","title":"A survey on multimodal large language models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.549192Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:bdb92e35ea449c016ecdd3840daf888f4828bacd21f52aca821b30648121a3f0","observation_id":"6ce1d9ad-58e1-4044-8633-28878cd28bbd","resolution":{"observed_at":"2026-08-07T14:16:53.549192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-07T14:16:53.615102Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning.arXiv preprint arXiv:2505.08617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.615102Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:2caaebf207bd138916a0c60ec41e3a7ee73cfa57d0fc616823ed550649ea31c8","observation_id":"a30c6368-55f9-42b7-bf76-ecec9cfd96a7","resolution":{"observed_at":"2026-08-07T14:16:53.615102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:02.389454Z","title":"A survey on rag meeting llms: Towards retrieval-augmented large language models","venue":null,"work_id":"85d39458-8e72-4d47-91f9-89771627ecdb","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.708183Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:6df02f911d9dd88d1c6fcbbb3f503d3b88fa6c5c15bd35c87c4857ad4647bda3","observation_id":"0d6df923-6e61-417e-a95a-3d6f81846ea3","resolution":{"observed_at":"2026-08-07T14:17:02.460446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-13T23:12:39.142794Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T14:16:53.793245Z","title":"A survey of multimodal retrieval- augmented generation.arXiv preprint arXiv:2504.08748, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.793245Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:09e5a4b6486b057f006d382542c2e8cfd514c459d635375727b33541f30ca114","observation_id":"fd11a890-692d-48c2-8917-d8f7d020f9f6","resolution":{"observed_at":"2026-08-07T14:16:53.793245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:02.237448Z","title":"Knowledge conflicts for llms: A survey.EMNLP, 2024","venue":null,"work_id":"096a5b65-bfd1-46a6-ac78-0c0bd6f69977","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.861819Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:920565f0027b2efde9ae582d0d6110801c33cba6c8f3667840a2db2556a80076","observation_id":"1abeb804-e43d-4b96-b67e-e51415a2d6ea","resolution":{"observed_at":"2026-08-07T14:17:02.307981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:02.058779Z","title":"Resolving knowledge conflicts in large language models.COLM, 2024","venue":null,"work_id":"99fa7c96-c93f-4838-9544-9af0efd7d6ec","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.949372Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:870705b0fbb55f80e965cc9e9089e9584a0e3930eac70593599c652b0af7fdd4","observation_id":"7a882889-cb12-4607-a26d-bf276bd25c56","resolution":{"observed_at":"2026-08-07T14:17:02.164448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.832062Z","title":"Wikicontradict: A benchmark for evaluating llms on real-world knowledge conflicts from wikipedia.Advances in Neural Information Processing Systems, 37:109701–109747, 2024","venue":null,"work_id":"754c133b-c494-4763-9e77-9555f814f5e0","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.079887Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:cf271ee973edc85627311654327c5c5954697f42ea4cf4ba804bbed7e5e9f3c8","observation_id":"f9b0a995-b122-4deb-b3aa-6f5765ad6c21","resolution":{"observed_at":"2026-08-07T14:17:01.966896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.649066Z","title":"Conflictbank: A benchmark for evaluating the influence of knowledge conflicts in llms.Advances in Neural Information Processing Systems, 37:103242–103268, 2024","venue":null,"work_id":"0c21b7a3-2cae-4cc0-9f76-6ae0499cd2c3","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.208218Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:db415315d2c21478064c01c89469e576ca2e9b2cc2dc5b0f7d54c3ec351e9d38","observation_id":"eb578382-2152-45a7-ba50-f6d9d28163c6","resolution":{"observed_at":"2026-08-07T14:17:01.727966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08145","last_updated":"2025-05-31T02:59:15Z","snapshot_observed_at":"2026-08-12T22:26:05.762543Z","submitted_at":"2024-10-10T17:31:17Z","title":"Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08145","snapshot_observed_at":"2026-08-07T14:16:54.402819Z","title":"Insight over sight? exploring the vision-knowledge conflicts in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.402819Z"},"links":{"cited_paper":"/paper/2410.08145","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:600d31fde8ec347dcd47e5f7143311243f64246f61b43362052954b2c6d1e0ff","observation_id":"c4524538-a42c-4eaf-a5f5-b89e1770a19e","resolution":{"observed_at":"2026-08-07T14:16:54.402819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.07722","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:58.335748Z","title":"Is cognition consistent with perception? assessing and mitigating multimodal knowledge conflicts in document understanding.arXiv preprint arXiv:2411.07722, 2024","venue":null,"work_id":"8290a953-2272-4241-a043-53a682b8fb3a","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.522026Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:93e4b6c5003868a07ab6f9fcc65285ac5e891c30e53dd866b68c37aefd0b92a1","observation_id":"f410f9fe-3937-4dc7-8003-7f2c35e5bad2","resolution":{"observed_at":"2026-08-07T14:16:58.384722Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03659","last_updated":"2024-10-11T15:07:31Z","snapshot_observed_at":"2026-08-12T22:30:30.632665Z","submitted_at":"2024-10-04T17:59:28Z","title":"Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03659","snapshot_observed_at":"2026-08-07T14:16:54.646826Z","title":"Unraveling cross-modality knowledge conflicts in large vision-language models.arXiv preprint arXiv:2410.03659, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.646826Z"},"links":{"cited_paper":"/paper/2410.03659","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:6d00a03980ee2df477c487640e41a33d00b0423b6dc93533285ad952aea0b8b8","observation_id":"7dc98abf-b225-4c39-85c8-175ef4573d84","resolution":{"observed_at":"2026-08-07T14:16:54.646826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:16:54.741327Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.741327Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:2862daa315c29fbc0ac2e14366bee5d6aef625048a1a4c9ea9485d878930a2b2","observation_id":"68370baa-f6fd-4626-9c4e-34af8b7f9cf4","resolution":{"observed_at":"2026-08-07T14:16:54.741327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:16:54.993984Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.993984Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:f27c95176c82e72c13f02d635082e3a13b8152ef39437942e6eaf766eda60cfe","observation_id":"6749619a-c194-47f3-8b9b-00d6631ff043","resolution":{"observed_at":"2026-08-07T14:16:54.993984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.430320Z","title":"The revolution of multimodal large language models: a survey.ACL, 2024","venue":null,"work_id":"adc62bba-5a23-4f51-b779-9066101f021f","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.112996Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:927171dcd539faba54862212987df218859772b21fc85d8838cacbfefc6590b9","observation_id":"6a175781-5712-4812-be12-c32901234b7d","resolution":{"observed_at":"2026-08-07T14:17:01.534360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:16:55.202229Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.202229Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:8ac2af8a06730ff660d6985f5f11342099c53bf446ea8d7cb25ba06dd9234129","observation_id":"418f979b-fd5d-4873-8ba0-8985a042e48a","resolution":{"observed_at":"2026-08-07T14:16:55.202229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:16:55.285949Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.285949Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:079744e1fd0456789daec915f03775e42551a1929147585d345dae13ee666f17","observation_id":"640f1b77-a3ce-4e31-bd86-e1288a213f49","resolution":{"observed_at":"2026-08-07T14:16:55.285949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:16:55.402884Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.402884Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:aae8f0db063c9177acaebe403bd64636aec75bdd00d945ec70d3694c95e040bd","observation_id":"074984d8-e329-4f96-8f3a-31afca65b5f1","resolution":{"observed_at":"2026-08-07T14:16:55.402884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.277132Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.ICLR, 2020","venue":null,"work_id":"3e703ac0-c88d-4305-b404-431b75c903bf","year":2020},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.510436Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:a1df2a3e45e8a6e735d03183034614d8fd761e5e721a984c46cf9e6541aafe59","observation_id":"9ed7f2ed-829b-4a71-a792-08ec5e6737f0","resolution":{"observed_at":"2026-08-07T14:17:01.372686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:16:55.605857Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.605857Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:4e8889c539afa558a03885b0d2939fdef95fec73f0dc4c88898f9bb30a1ee123","observation_id":"3c97a7b7-3b6a-40a8-959d-3a065bd0e19d","resolution":{"observed_at":"2026-08-07T14:16:55.605857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:01.098110Z","title":"Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"ac681064-d360-4873-9788-858bb19fcb2e","year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.729330Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:6458d6a6fe5019c832f59f210e346c9f0f8da1f81b0b1741971c289b8f570d58","observation_id":"d8320f76-a640-4a05-a88d-a8a974895333","resolution":{"observed_at":"2026-08-07T14:17:01.190238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.889387Z","title":"Mllm-compbench: A comparative reasoning bench- mark for multimodal llms.Advances in Neural Information Processing Systems, 37:28798– 28827, 2024","venue":null,"work_id":"02a201e6-87f0-4322-afcb-3bd4a74418a1","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.839934Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:0baa84363d7e3b3a340d7a5a26de8cd12300d4938e67852a6c617aeea6cbf31d","observation_id":"4cbcf3c7-bab1-41db-9043-3fa99e70af8e","resolution":{"observed_at":"2026-08-07T14:17:00.983963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15769","last_updated":"2024-08-28T13:05:55Z","snapshot_observed_at":"2026-08-12T22:55:54.609290Z","submitted_at":"2024-08-28T13:05:55Z","title":"A Survey on Evaluation of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15769","snapshot_observed_at":"2026-08-07T14:16:55.906329Z","title":"A survey on evaluation of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.906329Z"},"links":{"cited_paper":"/paper/2408.15769","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:a22d939d9e753381430322d4c75cfd5660359bbd411ef7b934c223584855f7ab","observation_id":"6023184c-710a-4066-a4cb-332ab1951308","resolution":{"observed_at":"2026-08-07T14:16:55.906329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.694747Z","title":"Clova: A closed-loop visual assistant with tool usage and update","venue":null,"work_id":"540bdfce-e295-4432-872f-04876cefe22c","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.030622Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:35b61681f3a71f882ec3a4fecbad42d04d1bd2f245a473b0514e2d8be83bb1fb","observation_id":"5f522402-95a2-4abd-84f4-6a0f8e974221","resolution":{"observed_at":"2026-08-07T14:17:00.801917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:56.224366Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.224366Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:0b03c6d6b7346c9828a2193457ed3ffb15a250d5e69cc223b8b7ae9507469650","observation_id":"46fea237-d177-49f6-92a6-231bbbe5c8fd","resolution":{"observed_at":"2026-08-07T14:16:56.224366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:56.423955Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.423955Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:e026d0cbde7c3ea0f925cff68f599b17c5265e20691b61709e741b7247fbe2b2","observation_id":"c03cfc87-1ddf-41f5-9148-c88a0d459eb2","resolution":{"observed_at":"2026-08-07T14:16:56.423955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.508154Z","title":"Rich knowledge sources bring complex knowledge conflicts: Recalibrating models to reflect conflicting evidence.EMNLP, 2022","venue":null,"work_id":"3e7402de-5952-44c9-b70d-571c4e18f575","year":2022},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.591250Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:aea7cff641f17e39b0a8eb5cf579a3ac22865df8180191fa0716880ba9b1be0b","observation_id":"701a6a19-afcd-4f82-8bde-d80c358e148b","resolution":{"observed_at":"2026-08-07T14:17:00.603329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.320437Z","title":"Adaptive chameleon or stubborn sloth: Revealing the behavior of large language models in knowledge conflicts","venue":null,"work_id":"c5128e2a-8d96-4218-99bd-e1029fde9eb1","year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.746881Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:39ec3023326cf490255854ef249834100bad5d0d8f6b131a7892df3c211972ad","observation_id":"4e8ac675-fa4b-48ea-be94-5f805b46bef7","resolution":{"observed_at":"2026-08-07T14:17:00.379877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:00.177419Z","title":"Entity-based knowledge conflicts in question answering.EMNLP, 2021","venue":null,"work_id":"20fe6baa-e014-4cc6-bf3a-561385f6def9","year":2021},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:56.875035Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:2d53416f14820e996fb90fd20555eb7569f054f695a56d4799054878824f4816","observation_id":"bda3af74-c18b-47e6-acfa-e8f78e5d8e53","resolution":{"observed_at":"2026-08-07T14:17:00.246356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.994822Z","title":"Intuitive or dependent? investigating llms’ behavior style to conflicting prompts.ACL, 2024","venue":null,"work_id":"8467390e-9de3-42c2-ad28-b1de636172cb","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.035272Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:f196be2ce677756f82deff1fe513b9c7e448cca2ddd4672fd8028d95b707464a","observation_id":"7a0b5327-cdfb-4fb7-85b1-7026bacd9e34","resolution":{"observed_at":"2026-08-07T14:17:00.107246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.807832Z","title":"Contradoc: understanding self-contradictions in documents with large language models.NAACL, 2024","venue":null,"work_id":"5f5d0b6a-4378-4ee8-a21c-355f61166ec0","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.190240Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:7f4f07154097d15f5096f1ae1d0a1885bbd12de39d45cbbc0d47b856696d9f6f","observation_id":"148ff244-7622-40ea-93f2-c5954bfc14c6","resolution":{"observed_at":"2026-08-07T14:16:59.880833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.595008Z","title":"Trueteacher: Learning factual consistency evaluation with large language models.EMNLP, 2023","venue":null,"work_id":"eaed1532-471e-49a0-b2ca-9a5262dd370a","year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.321271Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:d7fe47b821e97259e8c41f013a4af06864257961697287f11576282c76b1ebb2","observation_id":"6fce640f-37fb-467f-9f3b-331e5fe59ff8","resolution":{"observed_at":"2026-08-07T14:16:59.711402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.361087Z","title":"Dola: Decoding by contrasting layers improves factuality in large language models.ICLR, 2024","venue":null,"work_id":"acc2ef00-b331-4e92-8bb1-c399611fe945","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.514451Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:38d6d822cf1f166706734ddebeabd3d70ebad7a7f6ca3b4514c9f130e6009d68","observation_id":"92998a26-1d0b-48b4-8ae5-9d148cdc3d63","resolution":{"observed_at":"2026-08-07T14:16:59.473399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:59.155903Z","title":"Factllama: Optimizing instruction-following language models with external knowledge for automated fact-checking","venue":null,"work_id":"bde701e3-e0e1-4196-b77c-07ef57478e04","year":2023},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.684465Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:0f9a022b725e32d6eb60890780f706b3e96c01454ac6a82d24152d2298797cbf","observation_id":"53d8985e-9f17-4987-bcb7-f1febcae1b50","resolution":{"observed_at":"2026-08-07T14:16:59.254826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:58.834896Z","title":"Mmke- bench: A multimodal editing benchmark for diverse visual knowledge.ICLR, 2025","venue":null,"work_id":"3dcf3538-9942-46e1-8e7e-174faeb51d75","year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.810863Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:ecac96b748b9b210bca9e5b95c80489b9322ff18a74b21a2ce3088831694d7d6","observation_id":"51653bb8-82f3-4510-8221-cc1cd0aa7b03","resolution":{"observed_at":"2026-08-07T14:16:59.015749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:58.562611Z","title":"happy\" with","venue":null,"work_id":"f4015c1e-5c4e-4ec4-a6b6-8c3db97f139f","year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:57.959423Z"},"links":{"citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:93b49c3a9d237d4e85b405cbf96307ea24dacf6345b962cd6dd75d756d223952","observation_id":"25cd1c30-bbc1-4744-bcdf-4bdf4ab8217b","resolution":{"observed_at":"2026-08-07T14:16:58.669013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 4 inbound Pith citation observations for arXiv:2505.19509."}