{"as_of":"2026-08-10T01:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc24c212b37afafff7887f208204d14c1b643c351413ef375d8309e12382d321","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:06:08.321921Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:57:07.449816Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:17:26.125055Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11976","snapshot_observed_at":"2026-08-06T13:57:07.449816Z","title":"How visual representations map to language feature space in multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19891","last_updated":"2025-07-30T04:47:07Z","snapshot_observed_at":"2026-08-09T03:50:13.576578Z","submitted_at":"2025-07-26T09:43:09Z","title":"Interpretable Open-Vocabulary Referring Object Detection with Reverse Contrast Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:07.449816Z"},"links":{"cited_paper":"/paper/2506.11976","citing_paper":"/paper/2507.19891"},"observation_digest":"sha256:4a38c355456e170a11d2b5ce886fcae1fbc200740988cd8d2514e5e9cdc5bab5","observation_id":"7f81683f-e654-4363-ad77-03ebc2dffce9","resolution":{"observed_at":"2026-08-06T13:57:07.449816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2506.11976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11976","snapshot_observed_at":"2026-07-02T22:17:26.125055Z","title":"How visual representations map to language feature space in multimodal llms.CoRR, abs/2506.11976, 2025","venue":null,"work_id":"f15d5da5-0c74-4daf-9c18-b069198f1aa9","year":2025},"citing_paper":{"arxiv_id":"2606.08511","last_updated":"2026-06-07T08:32:13Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:32:13Z","title":"Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:02:59.403688Z"},"links":{"cited_paper":"/paper/2506.11976","citing_paper":"/paper/2606.08511"},"observation_digest":"sha256:7c7f36215d4f62c0e2e0b9bbd2e8d9e61f5bfe9b476ac7d7764cf315007c5b55","observation_id":"ab9ce2f3-d682-4f24-bbce-0a77ab76cb60","resolution":{"observed_at":"2026-07-02T22:17:26.126763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11976","snapshot_observed_at":"2026-07-12T03:03:11.110105Z","title":"arXiv preprint arXiv:2506.11976 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03358","last_updated":"2026-07-03T14:15:08Z","snapshot_observed_at":"2026-08-09T16:06:42.048951Z","submitted_at":"2026-07-03T14:15:08Z","title":"Pathways of Visual Information Flow in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-12T03:03:11.110105Z"},"links":{"cited_paper":"/paper/2506.11976","citing_paper":"/paper/2607.03358"},"observation_digest":"sha256:d22e3383dd08e19010285f8e7d0ec593856928cab8dea33c17ee95d1cd7d58d2","observation_id":"4f28d0ec-44f2-4d3f-927d-2075dbb823b4","resolution":{"observed_at":"2026-07-12T03:03:11.110105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11976/citation-record","integrity":"/paper/2506.11976/integrity","json":"/paper/2506.11976/citation-record.json","paper":"/paper/2506.11976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.108109Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning, 2023","venue":null,"work_id":"00181d0d-6146-4e66-8ec1-ee4544599db0","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.197245Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:eb30ae780cacb2146ad7457eac3c3c65075e5190123d36d15a902db2979f6ff2","observation_id":"d3699c23-1c90-4763-8c70-44707168202f","resolution":{"observed_at":"2026-08-07T01:06:12.186433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10591","last_updated":"2023-10-16T17:12:06Z","snapshot_observed_at":"2026-08-07T04:47:37.971137Z","submitted_at":"2023-10-16T17:12:06Z","title":"Interpreting and Controlling Vision Foundation Models via Text Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10591","snapshot_observed_at":"2026-08-07T01:06:06.285352Z","title":"Interpreting and controlling vision foundation mod- els via text explanations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.285352Z"},"links":{"cited_paper":"/paper/2310.10591","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:0084b9ae65141d31bae1c64fff6f7368d873cef411170bc9019c6dd38a468318","observation_id":"07ce8781-2025-4982-8acf-de1552b550a7","resolution":{"observed_at":"2026-08-07T01:06:06.285352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.866477Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"ace65fd2-5470-4ae3-a7a5-2fc1165baad5","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.381515Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:e2e566d0ce044dce9ad399517c45ee7204c90afac4a49e3c10316039646541b0","observation_id":"66ce3c5d-6bcf-4256-b409-918c0da41987","resolution":{"observed_at":"2026-08-07T01:06:11.979935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.666169Z","title":"The cognitive revolution in interpretability: From explaining behavior to interpreting representations and algorithms, 2024","venue":null,"work_id":"c106cc3b-e0f4-4044-a4e9-ee773aa0819f","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.453896Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:6380060357673607d07da2d803a38042495ba4e0da947361b3f2ded7e28e34a8","observation_id":"7e7d4643-cb6b-4356-abae-16728f76041d","resolution":{"observed_at":"2026-08-07T01:06:11.736793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.438693Z","title":"Arik, Tejas Nama, and Tomas Pfister","venue":null,"work_id":"50675781-c04b-4759-8006-f9684a551fb4","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.522248Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:a6e8c580f5a0ab46fd8c33a400c9bb693176a738476548ce69ac0900c989f99f","observation_id":"7c89694a-e792-44b8-a725-35da8d656625","resolution":{"observed_at":"2026-08-07T01:06:11.548557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.211937Z","title":"A mathemati- cal framework for transformer circuits","venue":null,"work_id":"66aea9af-0286-4cd6-be87-71074981bce3","year":2021},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.622671Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:de0d724919c03040c1932dbfef898bebd4059a6ec763ca5e0eacedb8bbeb1429","observation_id":"5236b704-0e78-42c1-9656-03a507e1ed67","resolution":{"observed_at":"2026-08-07T01:06:11.309715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:06.715063Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.715063Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:cf12b9407b7d6261d51ad2a1af62a25c6f5eb4e059d8b6d2276a0698859860a5","observation_id":"b317eb25-217e-4507-9681-f25af730f1b5","resolution":{"observed_at":"2026-08-07T01:06:06.715063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05916","last_updated":"2024-03-29T03:40:47Z","snapshot_observed_at":"2026-08-09T16:06:08.831990Z","submitted_at":"2023-10-09T17:59:04Z","title":"Interpreting CLIP's Image Representation via Text-Based Decomposition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05916","snapshot_observed_at":"2026-08-07T01:06:06.784761Z","title":"In- terpreting clip’s image representation via text-based decom- position","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.784761Z"},"links":{"cited_paper":"/paper/2310.05916","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:b5f08236ce5d9deb52b8727e70ea9065bb69c43507c9459f4d6b861cff74eb04","observation_id":"7a117c9c-7741-4049-a70a-582d506c319e","resolution":{"observed_at":"2026-08-07T01:06:06.784761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.010498Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":"ca4f8d06-b726-434a-b2fc-7b8769a42094","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.856612Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:0401de18bac39ea89f68b838bf058fc3884670dbe6848f3bfb063ce55446ad4c","observation_id":"b1144db9-52c8-4570-8c84-dbfcb944205a","resolution":{"observed_at":"2026-08-07T01:06:11.122586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.844047Z","title":"Hudson and Christopher D","venue":null,"work_id":"4a3dae88-726a-40ed-8693-956524a8aa65","year":2019},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.898241Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:03f419e183b58b7a4da1d14bc90b98476ca8d2e2882a5eff2bcbbebc2a3bd688","observation_id":"404ab531-414f-4122-a3e4-11bce77cf204","resolution":{"observed_at":"2026-08-07T01:06:10.917163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02762","last_updated":"2025-02-10T20:13:31Z","snapshot_observed_at":"2026-08-09T16:06:26.088504Z","submitted_at":"2024-10-03T17:59:57Z","title":"Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02762","snapshot_observed_at":"2026-08-07T01:06:06.969709Z","title":"Interpreting and editing vision-language rep- resentations to mitigate hallucinations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.969709Z"},"links":{"cited_paper":"/paper/2410.02762","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:1a80045e96af1bc8a00c54e315ccd9b240a97d397643d978fa797bd24f521e7c","observation_id":"25f00dca-de3e-4cfd-883d-653b0b12c346","resolution":{"observed_at":"2026-08-07T01:06:06.969709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.615838Z","title":"Evaluating object hallucination in large vision- language models","venue":null,"work_id":"9dc8e404-1828-49e2-8617-749857fe5c57","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.035217Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:13a2d46c72196f606698200ff9e3ce31e6483dcf25ce035503dba56720c078cc","observation_id":"f8983eb4-1142-47d0-a99a-f09f64e827d3","resolution":{"observed_at":"2026-08-07T01:06:10.725401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-07T01:06:07.108965Z","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.108965Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:746bed6a57b454d96061e9c7867d0c26ff3e57dafd310918035415a39e90028b","observation_id":"bc6efdc3-a151-4fdc-8221-4521bf9c9819","resolution":{"observed_at":"2026-08-07T01:06:07.108965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.418166Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"d31aef53-0a1f-4c89-8936-2b078eed827c","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.179332Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:2f9bbf249093230361ceda59d1b2b2eae733cdae93f0c694f94d6564fad64fa6","observation_id":"fd8c4433-db51-480c-9055-8664a4eeb97a","resolution":{"observed_at":"2026-08-07T01:06:10.496925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:07.260602Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.260602Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:1aae24544579f1c0c5374de8ac22512170afdd8ab1bd592ac3a5b92f2d461270","observation_id":"effa39d3-0c87-4fb8-82dc-ef0a4cb5c2e6","resolution":{"observed_at":"2026-08-07T01:06:07.260602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.172936Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"1de07137-c34e-437a-944c-14ccd62119c5","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.352145Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:85018a191d169ba203a7fa5eedd904dc5cf9ebdd93e2584e1cd24619bca3c9ad","observation_id":"84d95b6d-8393-4dd3-8645-5dce02161448","resolution":{"observed_at":"2026-08-07T01:06:10.270709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.960187Z","title":"Linearly mapping from image to text space","venue":null,"work_id":"f8975236-368d-421e-b3e1-e1d4060b73ef","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.431580Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:801b7eba22411e6cf400aaa86704006f32856c38eb9358536e02931781cbd9b0","observation_id":"f6af390d-ded8-46ac-8748-6fbbe7850e37","resolution":{"observed_at":"2026-08-07T01:06:10.054001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-03T16:26:26.684826Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T01:06:07.506978Z","title":"Towards interpreting visual infor- mation processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.506978Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:034439d712d17860e6868d91c021c0e08d6c368be547299278f7c3fecc65dd69","observation_id":"92687b32-7c75-438b-814d-b08c34cffdf8","resolution":{"observed_at":"2026-08-07T01:06:07.506978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.787136Z","title":"Interpreting GPT: The Logit Lens","venue":null,"work_id":"f9e5b2b3-ee98-4db4-883b-3284fae5dd84","year":2020},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.567052Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:6c6b0f251ded044b0fdd8bb57b2b7f5a2ec0cc18dd21070c38cd5e796ef0a1a1","observation_id":"847a9d7a-2e48-49a5-be4d-14db007b01ea","resolution":{"observed_at":"2026-08-07T01:06:09.841272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:07.644453Z","title":"Towards vision-language mechanistic interpretabil- ity: A causal tracing tool for blip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.644453Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:b65864d0912f3fa043f0ff6d5a67fa8c4a09672985254512d86a050bbc1d7529","observation_id":"5022e038-1a89-4d2d-97d9-b8f83fd8bd5a","resolution":{"observed_at":"2026-08-07T01:06:07.644453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.593635Z","title":"Bridg- ing vision and language spaces with assignment prediction","venue":null,"work_id":"f5310099-4321-4766-9e9f-cafe0a800c7c","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.743327Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:fe2f258d3a42701141f26caaea95c7c9cd95b7d9f204d80cd26884004ffd1ac8","observation_id":"d98f162a-bd02-4070-869c-7b659162ab52","resolution":{"observed_at":"2026-08-07T01:06:09.654978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.437616Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"abdf2df2-276d-44a1-b4ed-9b8fc95255a5","year":2021},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.811626Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:1600c33c00dcb7be8cb2ff09a80c2307ab929281493c30bcea4413b4de45b44c","observation_id":"ca3e0edd-32ae-4375-bd68-ed81739091d9","resolution":{"observed_at":"2026-08-07T01:06:09.493256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.258911Z","title":"Multimodal neurons in pre- trained text-only transformers","venue":null,"work_id":"5f13fa4e-15db-4ea7-aad4-b9a886ccdac4","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.913318Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:9106147d2d27cca838ba2d8868a0ce7d8e760587d4c04684d80e668aaa25e385","observation_id":"5f3e4212-a992-4b9f-8e5d-e364113e2139","resolution":{"observed_at":"2026-08-07T01:06:09.338873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T01:06:07.977614Z","title":"Open problems in mechanistic interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.977614Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:5e67fc1af94fe11722d3c1eaf6e220577965c306fb0a7046cbc805f3307dd547","observation_id":"54ecaa4c-e899-43b5-925b-20aa394b7bd5","resolution":{"observed_at":"2026-08-07T01:06:07.977614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.087301Z","title":"Paligemma 2: A family of versatile vlms for transfer, 2024","venue":null,"work_id":"8933ecf2-613a-4c27-a449-c46973a380fd","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.055607Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:1a3faa1524c199bc880ce62584a443bae8933b5fcf00984791b4b18fce3dc1f2","observation_id":"1937f5de-3784-4034-89c3-3e0a890480da","resolution":{"observed_at":"2026-08-07T01:06:09.161200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T01:06:08.123176Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.123176Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:669a8334e56c33adf6c31dca0b6197207aa60e1d2e6bea949d17c8a44343785a","observation_id":"2083da55-8b62-4185-94f9-0d851b8bdc27","resolution":{"observed_at":"2026-08-07T01:06:08.123176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.911935Z","title":null,"venue":null,"work_id":"c968e2f3-fcfe-4526-aba4-c287f472503c","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.199039Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:c5517c7e5d0b2242cc7e0f52d8b4b44e80f29da3c5795959f45a81e52b52a211","observation_id":"b9431d42-e8cf-47df-9a14-6e6a98d5e4d6","resolution":{"observed_at":"2026-08-07T01:06:08.998912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.756522Z","title":"Metamorph: Multimodal un- derstanding and generation via instruction tuning, 2024","venue":null,"work_id":"fe364717-872b-4d7d-b3ef-04f79e674d09","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.244823Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:cb2e7551ca26599eeaff1e6e279b17513ef355f6c17565541da6d8a502862a23","observation_id":"35c4f53e-89b3-4c81-81b7-9e89d9844c1c","resolution":{"observed_at":"2026-08-07T01:06:08.844753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.611890Z","title":"Too late to recall: The two-hop prob- lem in multimodal knowledge retrieval","venue":null,"work_id":"44b74816-4f87-43d3-a2a7-c41153b4e0c6","year":2025},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.321921Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:47090f04e629946eae49ed4e064c814fae3e5c23a8da29a4699c24ee9355db72","observation_id":"85d98845-988b-458e-8ad4-bda971176a71","resolution":{"observed_at":"2026-08-07T01:06:08.657295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2506.11976."}