{"as_of":"2026-08-17T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e8048155dc154d54bfa5cf6ad3ccbc899962d046d9d488f7020f97db9f02065","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:13:38.669736Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T20:53:15.920563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:55:15.290281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"cited_work":{"arxiv_id":"2505.10541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10541","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9268e64-e0e5-447d-9c91-9a908dd75e8b","year":2025},"citing_paper":{"arxiv_id":"2511.13415","last_updated":"2026-05-09T06:27:59Z","snapshot_observed_at":"2026-08-11T13:51:01.613197Z","submitted_at":"2025-11-17T14:28:41Z","title":"Attention Grounded Enhancement for Visual Document Retrieval","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T20:53:15.920563Z"},"links":{"cited_paper":"/paper/2505.10541","citing_paper":"/paper/2511.13415"},"observation_digest":"sha256:f8db554b0978f759f827d370ca69dd2e246b4f42d069016cdad08dda0c4b5acc","observation_id":"5cfd14b8-5ae3-4165-9053-3f6bcb53be59","resolution":{"observed_at":"2026-05-17T20:55:15.293168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10541/citation-record","integrity":"/paper/2505.10541/integrity","json":"/paper/2505.10541/citation-record.json","paper":"/paper/2505.10541"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:36.127029Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.127029Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:b5f9af0d47f471f2efed35a5782583479776af26bef00847d1829599e900dd59","observation_id":"8e65b50f-6a00-4907-aeca-e697b5d9b09d","resolution":{"observed_at":"2026-08-15T21:13:36.127029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:42.961477Z","title":"Claude 3 haiku: our fastest model yet","venue":null,"work_id":"cb393db2-f9db-48a4-b40f-fbba025ca6d2","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.149728Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:7e06d86fea79bfe808866d226071b7411b52d4d17df90a97ba4e90d93652b810","observation_id":"9e63ff9a-cf2b-4e2f-91ef-9f8f5f1bdbf2","resolution":{"observed_at":"2026-08-15T21:13:42.973460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:36.255024Z","title":"Y., Bhiwandiwalla, A., Tseng, S.-Y., Olson, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.255024Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:46c2926fb2c027ac1bb0179bafa0cfec54b4e8121e79aea7b76ad00b6a517506","observation_id":"c0766cfa-f7b5-4a79-b752-4cc7ea13fd01","resolution":{"observed_at":"2026-08-15T21:13:36.255024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:36.277213Z","title":"F., G \\'o mez, L., and Karatzas, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.277213Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:c237c9bc15211c66cf3b1022012635818aaf5832438fb35dd7dc10c2dbb3235d","observation_id":"3d037445-bc1f-4ad0-95b6-eb6646212a53","resolution":{"observed_at":"2026-08-15T21:13:36.277213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:36.303024Z","title":"H., Vora, S., Liong, V","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.303024Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:094d04671633f3b13d1a60c96ec37031acd404e3f951299e9280ec29dc063dbc","observation_id":"dcfe01a4-b34e-4c45-8b1f-319cbbd9dea6","resolution":{"observed_at":"2026-08-15T21:13:36.303024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T21:13:36.403553Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.403553Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:2ece333ce063b58bf308c9a15d34ba173d1a23292b4f063974d015b15abb2e23","observation_id":"439fd75e-fe80-46f7-8b96-def93d14fa28","resolution":{"observed_at":"2026-08-15T21:13:36.403553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:42.814555Z","title":"Dress: Instructing large vision-language models to align and interact with humans via natural language feedback","venue":null,"work_id":"27694992-5a1b-40d7-93b4-ef8c54d02e6f","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.508976Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:de58675b91d45ff28e2617b5e9b469c215637ea54cf4e1c5c0d24c6b0b2269a4","observation_id":"e6d834d3-9ba7-4424-8e7b-6145d80a4a3a","resolution":{"observed_at":"2026-08-15T21:13:42.824259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-15T21:13:36.523424Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.523424Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:d26361ca172cfa4afc7aeec2735c063ad2b352248fa2e85539ce195256d0cbfa","observation_id":"95434e8c-a688-45e2-ba2d-08060f68889f","resolution":{"observed_at":"2026-08-15T21:13:36.523424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:42.706682Z","title":"H., Yu, F., Wan, X., and Wang, B","venue":null,"work_id":"72dfbd94-fff2-42ff-ac09-75f6ffeabdb1","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.535151Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:2027922c56eafe2b694c3595c15a1da07a079fbb3055c2f988f0c4070914f156","observation_id":"037abd1d-c667-4fd2-9824-58e20bdac74c","resolution":{"observed_at":"2026-08-15T21:13:42.751673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-16T14:33:14.231104Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-08-15T21:13:36.556970Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.556970Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:9e87acc22a36a7576f8faeccd6362b3c6f38a121d588427d89f6837cb0841e38","observation_id":"b6de1c68-313a-4035-a964-4ac65c790d2c","resolution":{"observed_at":"2026-08-15T21:13:36.556970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-15T21:13:36.663456Z","title":"A., Ma , W.-C., and Krishna , R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.663456Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:56bcadee9d90daf8f04fc051734a9197bd1fb8e7a77171dafeacf1f1672283b7","observation_id":"13945699-3fac-49b0-8aaa-ca25d471b533","resolution":{"observed_at":"2026-08-15T21:13:36.663456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-15T21:13:36.802693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.802693Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:322ce0890789c5a7e856a59d809dddcf252a3e696ffc04a19e68a8f79decef84","observation_id":"ddefc0fa-4660-4846-9098-4672dd91a1b8","resolution":{"observed_at":"2026-08-15T21:13:36.802693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:36.853423Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.853423Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:4f0eaa81cd3ebd5a2c07bee6a7f6fd123ca33840ce30e7da5c904044bb2eda62","observation_id":"623384f0-0c02-49c4-889a-0dac13b88e5e","resolution":{"observed_at":"2026-08-15T21:13:36.853423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14011","last_updated":"2024-05-08T07:34:06Z","snapshot_observed_at":"2026-08-16T14:24:38.945790Z","submitted_at":"2024-01-25T08:22:10Z","title":"CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14011","snapshot_observed_at":"2026-08-15T21:13:36.873714Z","title":"Cmmu: A benchmark for chinese multi-modal multi-type question understanding and reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.873714Z"},"links":{"cited_paper":"/paper/2401.14011","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:2d6f74f0275973e0704fe7d2054fbccf9596569da5d621b4f3febabb0a136158","observation_id":"8059e091-9fd4-45f9-a8cb-c97e28baca0f","resolution":{"observed_at":"2026-08-15T21:13:36.873714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-15T21:13:36.894005Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.894005Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:8aaff5f165c25edde1ba2308a4b3b3dd9118841887a7bd16dd36c14c838cc61f","observation_id":"e05b8189-4235-45af-b516-9166d7fce7c3","resolution":{"observed_at":"2026-08-15T21:13:36.894005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-16T13:28:40.445118Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-15T21:13:36.988347Z","title":"Self-introspective decoding: Alleviating hallucinations for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:36.988347Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:a31d4abc047130b855b097d537df9dbeec579d243ca41920cafcd2c519a5b6d4","observation_id":"4162649e-6b6a-4df6-a251-80f50038dad4","resolution":{"observed_at":"2026-08-15T21:13:36.988347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-16T13:55:52.665411Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-15T21:13:37.013746Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.013746Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:3c784fe68feb6db61846a5b11ac06f1107728970f979a87bf5907fe87f4568c2","observation_id":"4418e467-ff88-4fec-9f4a-7231c02a0469","resolution":{"observed_at":"2026-08-15T21:13:37.013746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:42.537385Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":"3da09a44-78d4-4dbb-b973-cb4692c1d14f","year":2017},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.036793Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:9f002c3a994eb052a8562dce640b2cb0cac6e3a2785af4544b5898ba92f0ab07","observation_id":"b42bf34f-0c98-41eb-9012-0ec11b9c3f63","resolution":{"observed_at":"2026-08-15T21:13:42.590512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:42.279627Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"c0e1b3d1-6857-4c11-a429-2554e46543b9","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.097040Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:96da2506f43f3ebf15aac7aaf2ac14da1ba32ec41441b25cd84dd7a4828d3f0b","observation_id":"e5144ad0-7b10-472d-8470-5b5cb7e2a691","resolution":{"observed_at":"2026-08-15T21:13:42.394832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-08-16T13:08:42.338170Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-08-15T21:13:37.161934Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.161934Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:343bfb85580fc7f1d6daabed962b53c5e3f942983088984ccc4d69cce6d03e92","observation_id":"f4188452-f5df-4d9d-939a-372a2929b963","resolution":{"observed_at":"2026-08-15T21:13:37.161934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-15T21:13:37.184098Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.184098Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:7bc214cedce38f42c9f3c68bb61e4eada1ea8ae661b6f1d5197ecbbf86b240d1","observation_id":"3f50f6ce-c668-4786-bf7a-dfe77276435a","resolution":{"observed_at":"2026-08-15T21:13:37.184098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T21:13:37.251991Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.251991Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:1b52cb8b6c702fe16d13d3c62390f955e98652fadc96dc82c7ca482df0619ad5","observation_id":"5415a960-083b-48b7-8ea6-a74e4d64db68","resolution":{"observed_at":"2026-08-15T21:13:37.251991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-15T21:13:37.333684Z","title":"H., Yatskar, M., Yin, D., Hsieh, C.-J., and Chang, K.-W","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.333684Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:1574813871bae6d99d666a3445484fbebd8b2937654f19db3643f9f64406a4fc","observation_id":"e174b456-dba6-4805-9865-ac6a25267585","resolution":{"observed_at":"2026-08-15T21:13:37.333684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:37.386927Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.386927Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:f4293ae12dff78a2001e2a2792a0cdf38ea553fdae5076eb70cf619907dc80ba","observation_id":"15a68c54-70e4-428d-beab-f690768d86f4","resolution":{"observed_at":"2026-08-15T21:13:37.386927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:37.418823Z","title":"X., Tian, P., Yin, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.418823Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:4e9ec59bcb615fb3bed1b1ca02e42e5cdb0bb867056d4d4de5af62b19e4caccd","observation_id":"4d3d3625-3f5b-4bdf-84d0-70b160d07d33","resolution":{"observed_at":"2026-08-15T21:13:37.418823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:37.498864Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.498864Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:8df5485ba2db4d1d932ad45a951aa6ee84e664589b9e7b98215404a19b26cbb8","observation_id":"4e7cd78a-e8f8-4978-b5c4-17ebfe5758b7","resolution":{"observed_at":"2026-08-15T21:13:37.498864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11833","last_updated":"2024-10-29T12:34:11Z","snapshot_observed_at":"2026-08-16T13:42:07.554429Z","submitted_at":"2024-06-17T17:59:47Z","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11833","snapshot_observed_at":"2026-08-15T21:13:37.587409Z","title":"Mmdu: A multi-turn multi-image dialog understanding benchmark and instruction-tuning dataset for lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.587409Z"},"links":{"cited_paper":"/paper/2406.11833","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:c89057fdb7a7384d4b81d11ba616e62cf2f61915ff5557ad50c37d3b3d91fa5f","observation_id":"a838b0bf-022e-4f1e-a280-44925a1c28ed","resolution":{"observed_at":"2026-08-15T21:13:37.587409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:42.129617Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ddc6349f-da43-41c0-8c4c-c56eb955ead2","year":2022},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.661696Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:14a61ff1372105f99007ffa4d1cad32a2b82f61d5792b0b0045b01b220b8d731","observation_id":"56f88c9f-0cc8-4441-92be-cc0b506b312b","resolution":{"observed_at":"2026-08-15T21:13:42.182714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:41.975219Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"8d18687e-a8f7-4204-9166-a52ae54c0ea0","year":2021},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.689152Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:ce24eae72b8adb7a0f6ea78781a0d86cd7af6fc4190f0fcb21d432645d4e8cc2","observation_id":"48c02c35-1732-4f56-938d-96686c26fb47","resolution":{"observed_at":"2026-08-15T21:13:42.031472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-08-16T17:40:56.177453Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-15T21:13:37.699635Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.699635Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:827355c28fcf02995a8f227441eb60e686f652da892c614d2b56825a331137fb","observation_id":"ec068e0e-6881-40ee-a553-be31aee913a8","resolution":{"observed_at":"2026-08-15T21:13:37.699635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:41.870665Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"cf35173f-a91b-46e9-b7c3-125d7fd8e9eb","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.708140Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:8a134923835b6e189e8c059cb843a4b5d9e61ed963f067b8e7b37403a83be3fa","observation_id":"39528761-a855-4a0a-b23f-2cfde322fefa","resolution":{"observed_at":"2026-08-15T21:13:41.881845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:41.824907Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"4a9db9a6-f02e-49c1-befb-2003b3aa1993","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.717062Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:dc1940ca2a52aa061ebf285bd071ef8c669d5c04c63f99c4d006f97fc7679e37","observation_id":"64bdf4d0-5e00-49c9-a0c5-9e3fbce4c7da","resolution":{"observed_at":"2026-08-15T21:13:41.835948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:41.761411Z","title":"U., Hezel, N., and Jung, K","venue":null,"work_id":"6519ef14-3843-4a42-8d2a-fbcdda7774a6","year":2022},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.788172Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:45e5234b3dc33ef5ac1ea4a760ac967d1510921752db92d059eba29f0ce2f4e7","observation_id":"9e4ba0fa-2975-4356-a414-f8cd75e51486","resolution":{"observed_at":"2026-08-15T21:13:41.793389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-15T21:13:37.804909Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.804909Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:959f5453addbff257cc36f8810b5ab0f4f660096f044d30650879adc28563fd3","observation_id":"814fce51-8e6c-4722-8abc-abe0fbc87f9d","resolution":{"observed_at":"2026-08-15T21:13:37.804909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:37.819200Z","title":"Aligning large multimodal models with factually augmented RLHF","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.819200Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:b3a0305499aee972fc0f689ff725c3730a1fc7a4d4cb369e9387692483ce8d48","observation_id":"778cad13-ab66-4424-84f3-0101bbc5fa4e","resolution":{"observed_at":"2026-08-15T21:13:37.819200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:41.605217Z","title":"Slidevqa: A dataset for document visual question answering on multiple images","venue":null,"work_id":"48b6dc0c-0978-4745-bf4c-df239ee471f4","year":2023},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.907391Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:330d15bacc56c2e1f884eed14c1e4c97acb6dbcadc6b76da71a435d5cd5fcdd3","observation_id":"1cd8ac92-a3bd-4306-9da4-355dff4b3e83","resolution":{"observed_at":"2026-08-15T21:13:41.692449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:37.958941Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:37.958941Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:10260bc49d4fabdc1deb8318daacf4f61fefe2b5c86f5d07075503e6ca4d996c","observation_id":"e3284111-3a0a-4561-b56b-95fd3705422a","resolution":{"observed_at":"2026-08-15T21:13:37.958941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:38.051212Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.051212Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:80fd10173d52f92ffe616221e9be79fa61f41974809fdc975ad3c185029196d8","observation_id":"09fd7815-4961-4df3-a3dd-66e6ed87c57e","resolution":{"observed_at":"2026-08-15T21:13:38.051212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04284","last_updated":"2019-06-18T19:42:31Z","snapshot_observed_at":"2026-08-14T23:42:11.415122Z","submitted_at":"2019-06-07T13:58:49Z","title":"Analyzing the Structure of Attention in a Transformer Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04284","snapshot_observed_at":"2026-08-15T21:13:38.071899Z","title":"and Belinkov, Y","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.071899Z"},"links":{"cited_paper":"/paper/1906.04284","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:f1ed23087b78b411bbf4f4ff807c48c193fac06dfdf7f6160490765eb7821f1b","observation_id":"740686f6-9c71-45a0-bb11-87c78d0b8654","resolution":{"observed_at":"2026-08-15T21:13:38.071899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-16T18:06:01.131900Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-15T21:13:38.088801Z","title":"Y., Li, Z., Liu, Q., Liu, X., Ma, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.088801Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:12ba2f4ae5c6b49752df2c127baa6d841797462ce870831f7ee5f7fd9ebf72e0","observation_id":"6808bb5d-b3d9-4bc9-a85d-98138846febf","resolution":{"observed_at":"2026-08-15T21:13:38.088801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T21:13:38.101688Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.101688Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:5ebf6988ab0799e5c6ccf3722c345a33e7b2e1d63210e9316e8be8af4ced61d0","observation_id":"c105421a-acd4-4a3d-a25b-ea67ef4f8f3f","resolution":{"observed_at":"2026-08-15T21:13:38.101688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:41.462958Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"a2b5d7f3-4e2f-4aa5-b5be-5a3f890b65f6","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.124510Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:4f8b7731232cfc7d754cd6ca9b4c7510ee86365dcad919b7623d2bb42bf8573c","observation_id":"69ca77c9-7cfb-49ff-b405-fd6937c4d8f9","resolution":{"observed_at":"2026-08-15T21:13:41.482125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:41.344433Z","title":"H., Le, Q","venue":null,"work_id":"8a4fa3bd-03aa-4284-bb2f-a2cf4d0fc2bb","year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.212476Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:25b9f6b1ccccc226c87759ec566af3b216980c17072056b8a25e8ebb78bff23b","observation_id":"66a3c391-a451-4848-b51d-fb017986a3a7","resolution":{"observed_at":"2026-08-15T21:13:41.428374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10139","last_updated":"2025-03-31T02:59:50Z","snapshot_observed_at":"2026-08-16T13:09:46.661182Z","submitted_at":"2024-10-14T04:15:00Z","title":"MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10139","snapshot_observed_at":"2026-08-15T21:13:38.283855Z","title":"Mmie: Massive multimodal interleaved comprehension benchmark for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.283855Z"},"links":{"cited_paper":"/paper/2410.10139","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:f59015cf6ccf637d69307e63e6540b76036ffe65c3fdb52130904a25f4d748fb","observation_id":"0fbb95f1-2556-4a89-a1a0-5148abc81d3f","resolution":{"observed_at":"2026-08-15T21:13:38.283855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T21:13:38.332827Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.332827Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:259512929594957f6ccc61e57e4d4139e71308d5b263a469063e6b6001f3f95f","observation_id":"66753a6f-05d7-4180-9997-5c9abc452796","resolution":{"observed_at":"2026-08-15T21:13:38.332827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-15T21:13:38.380837Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.380837Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:59f304b212fb8e367f2df24bc226af8a9123356d0a2ec78040d96e89586f25f1","observation_id":"64d88026-b91b-4d5e-947d-0caff1f3308d","resolution":{"observed_at":"2026-08-15T21:13:38.380837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:38.425106Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.425106Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:fbc13cda247eef9e9a0410efcc3e375361de897e4d980679f7dd5b69154940dd","observation_id":"ef60c97a-fed6-4657-8c78-8620ef2887a4","resolution":{"observed_at":"2026-08-15T21:13:38.425106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:38.518278Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.518278Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:7aad4ac7dedec1b06e3e2470eb5d4402549a338b4d7655e5c00691c93d8ad67d","observation_id":"6574eee5-562a-4fbb-b353-15b4f62a7736","resolution":{"observed_at":"2026-08-15T21:13:38.518278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:13:38.618356Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.618356Z"},"links":{"citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:f2fe8337d361f1133a8bcd2a617c79dd5390bf577041aaa9f5aab2bab5d6e434","observation_id":"0aaaecd9-e590-4823-902f-79a487135dfb","resolution":{"observed_at":"2026-08-15T21:13:38.618356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-15T21:13:38.669736Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T21:13:38.669736Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.10541"},"observation_digest":"sha256:7d899a53aaddd1bd44182f6a43f6b1f93cf4b2cfaf445b4b6a6efcd46b22f866","observation_id":"b1ab4e11-b315-46b1-9795-1d51107345e7","resolution":{"observed_at":"2026-08-15T21:13:38.669736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.10541","last_updated":"2025-05-23T14:26:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T05:35:08.184243Z","submitted_at":"2025-05-15T17:52:40Z","title":"Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2505.10541."}