{"as_of":"2026-08-13T20:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67126791d2fc915198f590674808a0f4ae65000e042688b9792e21c9cbbf8d1e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:25:31.975509Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:44:45.178051Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:29:29.186840Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-08-05T05:02:23.812923Z","title":"Hidden in plain sight: Vlms overlook their visual representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05773","last_updated":"2025-09-06T16:55:52Z","snapshot_observed_at":"2026-08-09T19:55:36.349681Z","submitted_at":"2025-09-06T16:55:52Z","title":"PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone Characters","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T05:02:23.812923Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2509.05773"},"observation_digest":"sha256:0580db9965a58c94ec3b75a5824948fd078239fbeeee3f317e447ea8dc19a872","observation_id":"db4f2ae1-7184-47fd-8352-468f01ff091c","resolution":{"observed_at":"2026-08-05T05:02:23.812923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2510.16416","last_updated":"2026-05-17T05:54:56Z","snapshot_observed_at":"2026-08-13T02:46:53.432768Z","submitted_at":"2025-10-18T09:22:40Z","title":"SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T20:24:02.748854Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2510.16416"},"observation_digest":"sha256:ad41858f064a0a89f327edfdf8930429e8f0b97550bf1f9982a9ba1ff5ff4fce","observation_id":"3a901a8f-b164-4932-a899-d8b48b76f59b","resolution":{"observed_at":"2026-05-21T20:24:21.380035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-08-11T07:20:28.569646Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T22:57:04.802871Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2512.10941"},"observation_digest":"sha256:8e65ab1f460223923e5c293351a73124c5641ef5d6f3ad0c8775c285d7e941ee","observation_id":"906c870a-fb4f-47a1-bc78-34f6579d5ef1","resolution":{"observed_at":"2026-05-16T22:58:38.582363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-08-03T03:04:42.981300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-08T23:46:38.596764Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.981300Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:65cc7ef85d6733b1780b3461479918f54b546794d554d880161b6d989c13ff75","observation_id":"0ece36ae-f997-4c5f-aced-1b408dbee82a","resolution":{"observed_at":"2026-08-03T03:04:42.981300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2603.02667","last_updated":"2026-05-17T06:09:20Z","snapshot_observed_at":"2026-08-13T09:48:03.824557Z","submitted_at":"2026-03-03T06:54:19Z","title":"Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T12:15:57.019720Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2603.02667"},"observation_digest":"sha256:30745687c798b8a6e4a3c91c9b534126e47f3c43c1f4653315926a661e81fbef","observation_id":"e02c4924-6ba0-4eec-9be2-0cddcca0ab73","resolution":{"observed_at":"2026-05-21T12:20:07.008117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-15T13:27:51.848177Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.07109","last_updated":"2026-05-30T07:36:55Z","snapshot_observed_at":"2026-08-13T02:31:23.722239Z","submitted_at":"2026-03-07T08:40:09Z","title":"Vision Language Models Cannot Reason About Physical Transformation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-15T13:27:51.848177Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2603.07109"},"observation_digest":"sha256:976ae7c564c005905dcc4770eb20e1d6de3cd698bced7d22092ae33de4074c79","observation_id":"843cc588-bcef-45b4-ad02-e53dfa76a3d0","resolution":{"observed_at":"2026-07-15T13:27:51.848177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-08-04T17:24:30Z","snapshot_observed_at":"2026-08-11T10:39:22.741285Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:11b268580974ffb0f5a712b7dde49f02c773c5b2f020c0bd80cdebac1df7f466","observation_id":"4825b433-659f-4773-8bee-187497140f64","resolution":{"observed_at":"2026-05-13T21:58:19.843334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2604.05117","last_updated":"2026-04-06T19:22:48Z","snapshot_observed_at":"2026-08-10T20:58:01.238928Z","submitted_at":"2026-04-06T19:22:48Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:13.305374Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2604.05117"},"observation_digest":"sha256:f602c5f8cd0c8e22870fec9efd51fa8291e2ba4590b3c82989b61e4296c36ecc","observation_id":"e41c6df5-c7aa-4fd7-9275-eec59f7b92e8","resolution":{"observed_at":"2026-05-10T22:20:46.803606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2604.08333","last_updated":"2026-04-09T15:07:26Z","snapshot_observed_at":"2026-08-11T13:11:38.292964Z","submitted_at":"2026-04-09T15:07:26Z","title":"Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:13.523021Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2604.08333"},"observation_digest":"sha256:158c3a2d9c5e5084972e93d668a256254dd35b471a650edfb4cd0cc951adb14f","observation_id":"deee1951-098a-4113-85f5-857b9badc27d","resolution":{"observed_at":"2026-05-11T05:21:00.893146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2604.09425","last_updated":"2026-04-10T15:38:00Z","snapshot_observed_at":"2026-08-11T12:26:16.700135Z","submitted_at":"2026-04-10T15:38:00Z","title":"Do Vision Language Models Need to Process Image Tokens?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:26:37.371488Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2604.09425"},"observation_digest":"sha256:f8873f0ecbb23170d4130810187cadd8bbf1077d41bb981b4119dab73036251b","observation_id":"934e2904-d7e1-4c89-978d-3a8e55ac61cf","resolution":{"observed_at":"2026-05-11T00:35:50.692738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2604.12966","last_updated":"2026-04-14T16:59:53Z","snapshot_observed_at":"2026-08-11T12:20:32.015969Z","submitted_at":"2026-04-14T16:59:53Z","title":"Boosting Visual Instruction Tuning with Self-Supervised Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:52.208827Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2604.12966"},"observation_digest":"sha256:3f9ca289611bd8f0df26320b205b3d4ddbcac55fa45215bf9dd399e02df5e59d","observation_id":"2c8aec45-5da4-4685-9d43-3c26b0e35eca","resolution":{"observed_at":"2026-05-11T08:50:58.634642Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2604.14363","last_updated":"2026-08-08T10:21:17Z","snapshot_observed_at":"2026-08-13T19:12:05.743866Z","submitted_at":"2026-04-15T19:26:30Z","title":"The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:27.762910Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2604.14363"},"observation_digest":"sha256:9c1d7f69878a57132d0819da3285f7ae55c8a569c3d888440c6a551221cb5717","observation_id":"df2215f2-cab2-497c-97a8-f12aad1d624d","resolution":{"observed_at":"2026-05-10T13:35:26.811566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2605.09693","last_updated":"2026-05-10T18:25:52Z","snapshot_observed_at":"2026-08-11T14:36:51.006168Z","submitted_at":"2026-05-10T18:25:52Z","title":"Do multimodal models imagine electric sheep?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:24:01.933339Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2605.09693"},"observation_digest":"sha256:05915a02872acbda212544e9afaf5e0d1c43aef240da454fa37b70e31ff36242","observation_id":"575432cf-dadc-494c-807f-1a53dc2b3433","resolution":{"observed_at":"2026-05-12T03:26:19.524703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2605.13161","last_updated":"2026-05-15T18:29:50Z","snapshot_observed_at":"2026-08-12T17:36:13.807329Z","submitted_at":"2026-05-13T08:24:55Z","title":"A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T19:14:03.809826Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2605.13161"},"observation_digest":"sha256:36cab37b59ab1cfb164738cdc5e465930985910c91f80bb37e889158b7b59e8d","observation_id":"9dc668a8-f105-4526-8b89-61ae92877cf9","resolution":{"observed_at":"2026-05-14T19:17:51.063386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2605.13161","last_updated":"2026-05-15T18:29:50Z","snapshot_observed_at":"2026-08-12T17:36:13.807329Z","submitted_at":"2026-05-13T08:24:55Z","title":"A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T22:07:35.021986Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2605.13161"},"observation_digest":"sha256:2abbdbcdc83e3b0c29d9cc69f03bf3d9fed448b4a72bb14333fb95e688caa187","observation_id":"dc64514a-24f0-456a-b219-b2dbf321a2ba","resolution":{"observed_at":"2026-05-20T22:09:07.103332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2606.06890","last_updated":"2026-06-05T04:16:01Z","snapshot_observed_at":"2026-08-07T06:48:45.162974Z","submitted_at":"2026-06-05T04:16:01Z","title":"Diagnosing Visual Ignorance in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T22:51:25.269986Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2606.06890"},"observation_digest":"sha256:2ae557ab3acca9226173ba6fdf91217e8d469ed47ea41470534743f2131c238e","observation_id":"b957b92a-4bcf-4ae6-8c5e-30ce662dcb60","resolution":{"observed_at":"2026-07-02T16:17:09.193506Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-06-18T10:52:49Z","snapshot_observed_at":"2026-08-04T07:49:21.370818Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:f6b8d651408bae2561a190cb205e365d35689fd925aad1b03c69e3a7fac6057a","observation_id":"43114add-9cbc-41f2-99ff-81fde306c970","resolution":{"observed_at":"2026-07-04T03:29:29.190447Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-08-02T06:24:27.325903Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12815","last_updated":"2026-07-18T02:07:01Z","snapshot_observed_at":"2026-08-08T00:31:08.602182Z","submitted_at":"2026-07-14T14:27:58Z","title":"Visual Access Boundaries in Vision-Language Model Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:24:27.325903Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2607.12815"},"observation_digest":"sha256:75354163a0f9ed9595647ef06d0dd90a00472a425049d81cec829f5379faf329","observation_id":"4ab637ef-2e2c-4309-8082-436d893e5348","resolution":{"observed_at":"2026-08-02T06:24:27.325903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-08-06T18:44:45.178051Z","title":"arXiv preprint arXiv:2506.08008 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04698","last_updated":"2026-08-05T11:07:22Z","snapshot_observed_at":"2026-08-08T23:12:18.742707Z","submitted_at":"2026-08-05T11:07:22Z","title":"Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:44:45.178051Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2608.04698"},"observation_digest":"sha256:148703eb5128287b81db73f1380568055f12177624391f7d8942506055a3bbbc","observation_id":"3fd8021e-4afd-4b44-89b7-8baeb11f729c","resolution":{"observed_at":"2026-08-06T18:44:45.178051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08008/citation-record","integrity":"/paper/2506.08008/integrity","json":"/paper/2506.08008/citation-record.json","paper":"/paper/2506.08008"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T05:25:31.827278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.827278Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:34c13a60f450e3d0f32452e842ba878a506b79e784afedc6358f4a75072f640e","observation_id":"d1878cd5-cea2-4902-b674-fde8032d49ac","resolution":{"observed_at":"2026-08-07T05:25:31.827278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T05:25:31.832536Z","title":"Flamingo: a Visual Language Model for Few - Shot Learning , November 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.832536Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:433ea1733fcb6e8f0d3f49297d063eccf8ad6b9147a597e0f6978c325667a678","observation_id":"3da569a7-e35e-43b7-831e-8a15fb0eeb92","resolution":{"observed_at":"2026-08-07T05:25:31.832536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T05:25:31.836549Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.836549Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:f0a7ec5ab301ac18242f54ad52019b7b7b741f23dbfb025243482b883bae60aa","observation_id":"4f5f4e8e-52ec-447f-a42e-25e53966848f","resolution":{"observed_at":"2026-08-07T05:25:31.836549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:25:31.840203Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.840203Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:dd3901543bcc77afbacc0a6cd95299840c1c8ce1150be33b538312c457a203f9","observation_id":"d29bfddc-1992-4023-be6f-1dcf41c3317c","resolution":{"observed_at":"2026-08-07T05:25:31.840203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:32.655146Z","title":"Hpatches: A benchmark and evaluation of handcrafted and learned local descriptors","venue":null,"work_id":"3ef84890-6d7f-4c3a-a809-f75200e8eeb6","year":2017},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.843707Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:a394ef5a710b17cf0c6497029e0b9cee33cfd7807cab0f1f545e20f8e27bc551","observation_id":"faf576ad-2880-4a83-927c-45829b2203b0","resolution":{"observed_at":"2026-08-07T05:25:32.658742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08636","last_updated":"2024-04-12T17:58:04Z","snapshot_observed_at":"2026-08-13T00:31:07.251379Z","submitted_at":"2024-04-12T17:58:04Z","title":"Probing the 3D Awareness of Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08636","snapshot_observed_at":"2026-08-07T05:25:31.847196Z","title":"Probing the 3D Awareness of Visual Foundation Models , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.847196Z"},"links":{"cited_paper":"/paper/2404.08636","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:d10c9f094d3d6d5e3035a66bfc5d07d11aa73160aa5b781fcd428885fd11009a","observation_id":"580c1030-0ba6-4645-b8a8-c33cea9c1479","resolution":{"observed_at":"2026-08-07T05:25:31.847196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T05:25:31.851720Z","title":"Paligemma: A versatile 3b vlm for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.851720Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:56a90d942fdcdf74471ecc1b8485ce9c3c9b49ee6b4867c068fef326c01f3303","observation_id":"e26744c1-08d4-4e66-a479-43e0be18273b","resolution":{"observed_at":"2026-08-07T05:25:31.851720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05862","last_updated":"2024-09-10T02:28:40Z","snapshot_observed_at":"2026-08-12T22:48:21.374825Z","submitted_at":"2024-09-09T17:59:13Z","title":"Evaluating Multiview Object Consistency in Humans and Image Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05862","snapshot_observed_at":"2026-08-07T05:25:31.855332Z","title":"Tenenbaum, and Alexei A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.855332Z"},"links":{"cited_paper":"/paper/2409.05862","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:ee39012df8e4c7b5e296c3a58f92a32525fe96cad5be68a885aa5fcc3c8572be","observation_id":"7cd8f14e-8f94-4bec-a68b-2d43b66e6b0c","resolution":{"observed_at":"2026-08-07T05:25:31.855332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10660","last_updated":"2023-03-24T00:42:18Z","snapshot_observed_at":"2026-08-13T14:59:16.594749Z","submitted_at":"2022-07-21T17:56:22Z","title":"Omni3D: A Large Benchmark and Model for 3D Object Detection in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10660","snapshot_observed_at":"2026-08-07T05:25:31.858960Z","title":"Omni3d: A large benchmark and model for 3d object detection in the wild, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.858960Z"},"links":{"cited_paper":"/paper/2207.10660","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:38a4d3dab9469f44ec43df736d83f69c33720d463f9c5145ae61b2adced4fe66","observation_id":"c760c7e7-9e4f-4753-a33c-653eb22cef32","resolution":{"observed_at":"2026-08-07T05:25:31.858960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-13T14:41:45.148742Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-07T05:25:31.862693Z","title":"Chang, Thomas Funkhouser, Leonidas Guibas, Pat Hanrahan, Qixing Huang, Zimo Li, Silvio Savarese, Manolis Savva, Shuran Song, Hao Su, Jianxiong Xiao, Li Yi, and Fisher Yu","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.862693Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:54779af093e798beb9fbddfb3f6d84bd2f665e7314551e1ea8a604635b3d72cd","observation_id":"bde34bae-c1ab-4412-b835-e865f41fe766","resolution":{"observed_at":"2026-08-07T05:25:31.862693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02057","last_updated":"2021-08-16T17:40:21Z","snapshot_observed_at":"2026-08-13T19:45:18.204822Z","submitted_at":"2021-04-05T17:59:40Z","title":"An Empirical Study of Training Self-Supervised Vision Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02057","snapshot_observed_at":"2026-08-07T05:25:31.866030Z","title":"An empirical study of training self-supervised vision transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.866030Z"},"links":{"cited_paper":"/paper/2104.02057","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:717cdfe07bfb7e69fe2658c4f7f3fdab0bdc3b91dfbfaac3e40877141e9705e6","observation_id":"6bf1eaae-e437-4f15-9902-44650ed9bd71","resolution":{"observed_at":"2026-08-07T05:25:31.866030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:32.644842Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"074b9de3-6fce-4662-8e4b-293e729ee098","year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.870323Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:92347a820b7357f9f6ffe5f7ead8ba9c79e7f77313bd85ce70dfd5fe5cec39dd","observation_id":"5dab55f0-ed59-4e5a-8f40-64a1bd16929b","resolution":{"observed_at":"2026-08-07T05:25:32.648354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.873622Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.873622Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:c1939d2218073be81d3431e833adffd5a1757177b281efbd8d39725a9abbf4a2","observation_id":"f89ad20a-b7b2-4269-8be2-b30b28854f2a","resolution":{"observed_at":"2026-08-07T05:25:31.873622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.877003Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.877003Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:c0dafc145e696c6130bdcdb3157927062e45ef9eebaf91446f509949b65fd2c3","observation_id":"b9705a3f-eb6c-4689-b927-f444ef4c5b14","resolution":{"observed_at":"2026-08-07T05:25:31.877003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T05:25:31.880937Z","title":"An Image is Worth 16x16 Words : Transformers for Image Recognition at Scale , June 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.880937Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:5116debc43929a603bb073204a2638b709582d71c62df8989e793f63146835f2","observation_id":"6324917d-df62-4403-96b1-d25a6accdb8f","resolution":{"observed_at":"2026-08-07T05:25:31.880937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17221","last_updated":"2024-01-30T18:09:11Z","snapshot_observed_at":"2026-08-13T06:57:05.095859Z","submitted_at":"2024-01-30T18:09:11Z","title":"MouSi: Poly-Visual-Expert Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17221","snapshot_observed_at":"2026-08-07T05:25:31.884425Z","title":"Mousi: Poly-visual-expert vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.884425Z"},"links":{"cited_paper":"/paper/2401.17221","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:68e9d9e9ade9c62dd0924695d4a36ed016439b6f9fa2e711c4b97328ca27fd33","observation_id":"37462020-3f3a-46e7-8157-55b8d09095c0","resolution":{"observed_at":"2026-08-07T05:25:31.884425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-13T05:38:11.293178Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T05:25:31.888488Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.888488Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:3b179221385261296dd0f66733d777c0cf760c632f92f3a41fac7338044241d7","observation_id":"fb1d3bfd-f903-4eff-8b91-cd78b2677d51","resolution":{"observed_at":"2026-08-07T05:25:31.888488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.06576","last_updated":"2015-09-02T08:24:59Z","snapshot_observed_at":"2026-07-06T04:27:45.692332Z","submitted_at":"2015-08-26T17:14:42Z","title":"A Neural Algorithm of Artistic Style","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.06576","snapshot_observed_at":"2026-08-07T05:25:31.892084Z","title":"Gatys, Alexander S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.892084Z"},"links":{"cited_paper":"/paper/1508.06576","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:6c47ed4f8f6a300941b3e64d160fe7861e36e97f7ab5d394fa01f4ba8e6a9c3c","observation_id":"535000f8-1b2d-4c6a-9863-30297af8d5d9","resolution":{"observed_at":"2026-08-07T05:25:31.892084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-13T04:20:22.694273Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-07T05:25:31.895470Z","title":"Prismatic VLMs : Investigating the Design Space of Visually - Conditioned Language Models , May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.895470Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:da03842b9dbb73711097c1b8b491cdf444d29b83c878224ff22c90df5e50cb51","observation_id":"28b990cb-d837-4715-8c96-4b3604a8777f","resolution":{"observed_at":"2026-08-07T05:25:31.895470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:32.628589Z","title":"The functional correspondence problem","venue":null,"work_id":"01e3f478-55b6-4196-9594-0ec93debdae0","year":2021},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.899045Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:d790bf62fb82b0099fa4edd3357ab0e42dc2ec1c4cda8e5786ac0e44a46de2ba","observation_id":"9200f337-18a2-4632-9222-10fe1cd965fd","resolution":{"observed_at":"2026-08-07T05:25:32.632004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-13T00:15:14.556734Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T05:25:31.902130Z","title":"What matters when building vision-language models?, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.902130Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:2d72d1ad919038ae26b8c4837ead51168e562abd77b963b496b03c2d6ed6e300","observation_id":"b3675a38-0f23-4adb-a3f8-4399078d05e8","resolution":{"observed_at":"2026-08-07T05:25:31.902130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-07T05:25:31.905842Z","title":"The Power of Scale for Parameter - Efficient Prompt Tuning , September 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.905842Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:96df94e53a8a77bf1a6c2115da88874ebeb1e96a018683f474e61a0a5b2e530d","observation_id":"aa320425-5567-4e1b-a1b2-e289f5b01d27","resolution":{"observed_at":"2026-08-07T05:25:31.905842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T05:25:31.909053Z","title":"Improved Baselines with Visual Instruction Tuning , October 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.909053Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:a137b8ce4de73b3fd35e8fa4ff8178167e0217d7213ddf87973cb8e9f40823f5","observation_id":"5150e7b4-13cd-457a-9a7f-9b7b2c84bded","resolution":{"observed_at":"2026-08-07T05:25:31.909053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.912439Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.912439Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:a72c8d73964c5925f6b2409f0f6c6a739b9c706225645fcee4173ec5b03efa80","observation_id":"361ab3f8-5750-485e-9c03-72e1fa7965f0","resolution":{"observed_at":"2026-08-07T05:25:31.912439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2353.35123","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:32.337169Z","title":"Transformer-based neural texture synthesis and style transfer","venue":null,"work_id":"93234cae-653b-4a93-b5b6-783868176bc0","year":2022},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.915449Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:0b7ad464b5d794c07dcd6da5a4848c93fb9ab6b813f11bda5b9577cc324d731a","observation_id":"e94772e6-f240-42d1-a7de-8f870d376c8f","resolution":{"observed_at":"2026-08-07T05:25:32.344244Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10543","last_updated":"2019-08-28T04:16:52Z","snapshot_observed_at":"2026-08-11T20:36:49.773677Z","submitted_at":"2019-08-28T04:16:52Z","title":"SPair-71k: A Large-scale Benchmark for Semantic Correspondence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10543","snapshot_observed_at":"2026-08-07T05:25:31.919369Z","title":"Spair-71k: A large-scale benchmark for semantic correspondence, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.919369Z"},"links":{"cited_paper":"/paper/1908.10543","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:aa5f3d20bc5b2565fc7bc9d970dce5a13718157dc3f9601bc1ec681146367f58","observation_id":"b9114a3f-163d-495a-a67c-fd0091df70d4","resolution":{"observed_at":"2026-08-07T05:25:31.919369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.922941Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.922941Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:e8c1bfe8d28005bf31012300b4e9fae259763eccc308349b059299c5b49562cf","observation_id":"44a2ae01-b915-4b82-bab3-8e94fa98192a","resolution":{"observed_at":"2026-08-07T05:25:31.922941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T05:25:31.926174Z","title":"DINOv2 : Learning Robust Visual Features without Supervision , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.926174Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:89ba426ae53f9bcb713d8d6f04595c598c716bc348c34ec270e4a755d411b86e","observation_id":"e001612a-9f8c-484f-94b2-ab6402190f12","resolution":{"observed_at":"2026-08-07T05:25:31.926174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T05:25:31.930340Z","title":"Learning Transferable Visual Models From Natural Language Supervision , February 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.930340Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:54a347f4d86743b5c8b3f097f5eea32b0373a4af1601e3c9454ad0cc3287e3da","observation_id":"e89a713b-4577-4ba0-9b57-9d3534bdff1b","resolution":{"observed_at":"2026-08-07T05:25:31.930340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.933811Z","title":"Vision Transformers for Dense Prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.933811Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:39aa4bca417d147623ee3349d6fd97244f69e46cc10c71834c5a5d85847fe3a5","observation_id":"a61c7834-0bfd-4419-8d62-6bfe83bf8bad","resolution":{"observed_at":"2026-08-07T05:25:31.933811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-07T05:25:31.936899Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.936899Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:269d97d2cd2ef7940cf7b1216890317c2b4f7513b3a6979d07ddea3c1daa6e56","observation_id":"1cb2a407-73a5-493f-bfe7-de063c93e6c1","resolution":{"observed_at":"2026-08-07T05:25:31.936899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10270","last_updated":"2022-06-23T10:51:04Z","snapshot_observed_at":"2026-08-13T19:00:44.169969Z","submitted_at":"2021-06-18T17:58:20Z","title":"How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10270","snapshot_observed_at":"2026-08-07T05:25:31.940685Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.940685Z"},"links":{"cited_paper":"/paper/2106.10270","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:70c9f7c494095411a3ca186c6fe2bab4443726d603536d7f8df6d4b5d908d049","observation_id":"96bd96aa-b993-4134-9747-392bb262feb0","resolution":{"observed_at":"2026-08-07T05:25:31.940685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T05:25:31.944023Z","title":"Cambrian-1: A Fully Open , Vision - Centric Exploration of Multimodal LLMs , June 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.944023Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:9d3c93707037be9c9def128273381cb7b691a33b721517393a09a5cd54a7804e","observation_id":"944a45ef-63b3-4ef9-b4f7-15b93ad1ce04","resolution":{"observed_at":"2026-08-07T05:25:31.944023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.947615Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.947615Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:a5f83337815439c76b46dc11086e000543e5ccec8c7d57900231107c8f3f0c16","observation_id":"6972fb65-294c-42bc-b23c-9462b1bfbb11","resolution":{"observed_at":"2026-08-07T05:25:31.947615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:32.600898Z","title":"Disn: Deep implicit surface network for high-quality single-view 3d reconstruction","venue":null,"work_id":"f0209ff0-c2d1-4588-8388-af84118fb0ac","year":2019},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.950731Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:a95b1fb3fadc571fd28e2c41db94b94e62dd38f782ae336aff3f7d64a9476233","observation_id":"237f0622-530e-4866-bb3b-e867106bf4de","resolution":{"observed_at":"2026-08-07T05:25:32.604495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T05:25:31.954005Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.954005Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:807e2f7132d6eeb92e3a01b203c7bbb28e5803b8267d720b84896462ee9a4cb7","observation_id":"8b48f5f0-46a2-4ef5-aaaf-6c5027b37b2d","resolution":{"observed_at":"2026-08-07T05:25:31.954005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T05:25:31.957341Z","title":"Sigmoid Loss for Language Image Pre - Training , September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.957341Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:f32962f6bba9e4f694ba8ccbfbac22909f6132f27487f0dc946955d91ef9ca47","observation_id":"aec4e2d1-989f-45d6-b10f-c0998f888da2","resolution":{"observed_at":"2026-08-07T05:25:31.957341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06836","last_updated":"2024-06-10T09:10:07Z","snapshot_observed_at":"2026-08-13T05:52:48.391855Z","submitted_at":"2023-10-10T17:59:28Z","title":"A General Protocol to Probe Large Vision Models for 3D Physical Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06836","snapshot_observed_at":"2026-08-07T05:25:31.960678Z","title":"A General Protocol to Probe Large Vision Models for 3D Physical Understanding , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.960678Z"},"links":{"cited_paper":"/paper/2310.06836","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:46a8ec157079440429f2d82b8e4434c2c6be65b730b60c555a6f13944c9fe311","observation_id":"f66242d9-6b7d-4b1b-bf6c-4d27d675e400","resolution":{"observed_at":"2026-08-07T05:25:31.960678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.964053Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.964053Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:736eee5bf45e5ac4cdfd38482465a122ba418bd770dc4aa34d823db3a5d403f1","observation_id":"097b52e8-2d6e-47ad-9065-505b1eeaa5d6","resolution":{"observed_at":"2026-08-07T05:25:31.964053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.967916Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.967916Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:71e73430747d707f805722917f1b9cc5286d78c6da5820c5e855f3f5ba638c25","observation_id":"5aeb6766-572d-484d-9d53-34305de2ff79","resolution":{"observed_at":"2026-08-07T05:25:31.967916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.971733Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.971733Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:319987e072b0f9021a940a09da1abf3b8154152717c4e997b7657ab646c826c6","observation_id":"8edfdc6e-430b-43eb-b4c3-34f7e275f8d4","resolution":{"observed_at":"2026-08-07T05:25:31.971733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.975509Z","title":"A, B, C, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.975509Z"},"links":{"citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:6c5d66e25623384749116787fa84b8f47834a906deaa952bfe03a612506e0ad7","observation_id":"f879e721-808e-4138-b4c2-9b7742b2229a","resolution":{"observed_at":"2026-08-07T05:25:31.975509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 19 inbound Pith citation observations for arXiv:2506.08008."}