{"as_of":"2026-08-11T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca1de93a7eee37275691147f75f70dec8827d6b33445351cacce2c4997900a3a","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:17:56.224644Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09928/citation-record","integrity":"/paper/2608.09928/integrity","json":"/paper/2608.09928/citation-record.json","paper":"/paper/2608.09928"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.734741Z","title":"Pixtral 12b: A new frontier in image and text understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.734741Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:13669222c2eb571aa61907967d4a5002fae7f014a289cd1a4a9995d7e9f97de4","observation_id":"63a68806-aeda-41aa-8974-f329e2ebba67","resolution":{"observed_at":"2026-08-11T04:17:55.734741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.740439Z","title":"Golden gate Claude","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.740439Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:81b5f6de4b45969e94abd98d8328ebc7ace34a296ee0d1fe3199e78dea2a1d55","observation_id":"e980897a-63ad-4ab4-9cae-ab1bace9e2e9","resolution":{"observed_at":"2026-08-11T04:17:55.740439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.744964Z","title":"SAE on activation differences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.744964Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:5405a6254345b60cc2270b94d2a083425b205039a69cfcb6fa01b82e441fdadc","observation_id":"b478f42b-d307-42c5-b16b-5954735aa5a1","resolution":{"observed_at":"2026-08-11T04:17:55.744964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-11T04:17:55.749442Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.749442Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:8a7bb55cb5fba0cd604360d1ba161907e9566b607e32ca30a9e81b816476e7ec","observation_id":"eed6e3f5-9874-4c87-b480-11f0d9fdb4ad","resolution":{"observed_at":"2026-08-11T04:17:55.749442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.754302Z","title":"Revisiting model stitching to compare neural representations.Advances in neural information processing systems, 34:225–236, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.754302Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:368f7455201f5a6f204658271d7be9c80bde2db4ac7cdc5b793e54367bb4aadc","observation_id":"15f9a23f-fb05-4140-b13b-89fcd2bd4712","resolution":{"observed_at":"2026-08-11T04:17:55.754302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00058","last_updated":"2022-06-28T22:35:25Z","snapshot_observed_at":"2026-08-01T15:47:09.133676Z","submitted_at":"2021-12-31T21:08:56Z","title":"Representation Topology Divergence: A Method for Comparing Neural Network Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00058","snapshot_observed_at":"2026-08-11T04:17:55.758852Z","title":"Representation topology divergence: A method for comparing neural network representations.arXiv preprint arXiv:2201.00058, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.758852Z"},"links":{"cited_paper":"/paper/2201.00058","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:972f1517d893b5a7a49231b4bfa4557fa904afcbd60c571667900516b40a5040","observation_id":"99bad67a-8f11-4798-a8d3-1e4ee9868bcc","resolution":{"observed_at":"2026-08-11T04:17:55.758852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.764254Z","title":"Understanding information storage and transfer in multi-modal large language models.Advances in Neural Information Processing Systems, 37:7400–7426, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.764254Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ce9d1a7a35c420351f901cd972e84e0c5ef29b44b62d30f0db636b2fc88961df","observation_id":"fb3300c3-6ac8-4870-bef9-0d7a1e819f96","resolution":{"observed_at":"2026-08-11T04:17:55.764254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.768697Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning.Transformer Circuits Thread, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.768697Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:f2c9dea812971c335a37dfceede9eb6c014fdd303479264936527cc81413c6d2","observation_id":"775b35d7-5787-42c1-b28c-727175dec30e","resolution":{"observed_at":"2026-08-11T04:17:55.768697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.773486Z","title":"Stage-wise model diffing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.773486Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ad6a4e944179c179c0811233bc68f7ff770e859f910d69c6897ad0dbc881b314","observation_id":"bfb2af8f-ac38-41fa-a848-228a761cca3a","resolution":{"observed_at":"2026-08-11T04:17:55.773486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.778192Z","title":"Observing and controlling features in vision-language-action models.arXiv preprint arXiv:2603.05487, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.778192Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:c71589aeb474cb7b842a067e43895507c4fa4ae74f1ecf9e11d28fdd54188265","observation_id":"96afae2d-fab5-435d-bf48-229175c2211e","resolution":{"observed_at":"2026-08-11T04:17:55.778192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-09T11:08:29.370811Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-11T04:17:55.782849Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.782849Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:8f650fb93fd13a3554370c84f65a2f16e22c58260977ee2fca12b5250f50093a","observation_id":"bae5706b-c4c3-4713-829f-3cfd8479df19","resolution":{"observed_at":"2026-08-11T04:17:55.782849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.788114Z","title":"Pappas, Florian Tramer, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.788114Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ba8697498128b30fb25024a17c20932434dcd766beafb552cb2d9301ae8b00f8","observation_id":"21aef9b8-39d4-4a4a-bb5e-514a373a0a0d","resolution":{"observed_at":"2026-08-11T04:17:55.788114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10591","last_updated":"2023-10-16T17:12:06Z","snapshot_observed_at":"2026-08-11T03:45:20.222623Z","submitted_at":"2023-10-16T17:12:06Z","title":"Interpreting and Controlling Vision Foundation Models via Text Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10591","snapshot_observed_at":"2026-08-11T04:17:55.793237Z","title":"Interpreting and controlling vision foundation models via text explanations.arXiv preprint arXiv:2310.10591, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.793237Z"},"links":{"cited_paper":"/paper/2310.10591","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:203eb1bde7fdbb389d29ad2a817cd56de99e1f71446c6127be74ac5b09cc6205","observation_id":"943068ae-9db0-4d97-a492-eea47ed36f53","resolution":{"observed_at":"2026-08-11T04:17:55.793237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15621","last_updated":"2025-07-31T12:41:25Z","snapshot_observed_at":"2026-08-07T16:50:53.680156Z","submitted_at":"2025-03-19T18:10:12Z","title":"LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15621","snapshot_observed_at":"2026-08-11T04:17:55.798668Z","title":"Llava-more: A comparative study of llms and visual backbones for enhanced visual instruction tuning.arXiv preprint arXiv:2503.15621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.798668Z"},"links":{"cited_paper":"/paper/2503.15621","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:79e9a562cec72c183f8698934260d326c1bfd1ee55dfcdff57ff129b11524b2e","observation_id":"729e283c-fe58-406d-a371-03d8e94288e4","resolution":{"observed_at":"2026-08-11T04:17:55.798668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18512","last_updated":"2025-07-24T15:33:31Z","snapshot_observed_at":"2026-08-06T14:30:07.130911Z","submitted_at":"2025-07-24T15:33:31Z","title":"Explaining How Visual, Textual and Multimodal Encoders Share Concepts","version":1},"cited_work":{"arxiv_id":"2507.18512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.18512","snapshot_observed_at":"2026-08-11T04:17:57.277219Z","title":"Explaining How Visual, Textual and Multimodal Encoders Share Concepts","venue":"cs.CV","work_id":"e5fb4660-8952-4520-8d20-bd1557f34584","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.803988Z"},"links":{"cited_paper":"/paper/2507.18512","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:5372934ab36c8a4f8f3c87c3384e39e3564b9fb44e6aa802544c958617a16596","observation_id":"47c9ed4e-1705-4432-9bf6-b809e4061e02","resolution":{"observed_at":"2026-08-11T04:17:57.283192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-11T07:21:14.568175Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-11T04:17:55.809262Z","title":"Sparse autoen- coders find highly interpretable features in language models.arXiv preprint arXiv:2309.08600, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.809262Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:9413ec6d27d42535278adc1b2f16714fc42b05d7225c8def29b968474347294a","observation_id":"9ea49434-9b1f-4ea9-b45e-0b22dc3bbf00","resolution":{"observed_at":"2026-08-11T04:17:55.809262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.814349Z","title":"Case study: Interpreting, manipulating, and controlling CLIP with sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.814349Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:5ff933f94b5629d688a89d4eecfce5240899859fb03c3329eca12bde50093bc2","observation_id":"ef347515-df97-4217-990c-bac9c5c5f962","resolution":{"observed_at":"2026-08-11T04:17:55.814349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-11T04:17:55.819230Z","title":"Toy models of superposition, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.819230Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:1c252747ad544c4f298a6ef60905f8096767666db39ac3d69892b977a81bf06e","observation_id":"c03b7f1f-509a-432a-bf1a-565eab037242","resolution":{"observed_at":"2026-08-11T04:17:55.819230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.824530Z","title":"Why does unsupervised pre-training help deep learning? 11:625–660, March","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.824530Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:248eee975c0bdae73a69bc46ed96946bb80491e5e60e7042f81a10ece8ea3e26","observation_id":"907a2509-8501-4d4e-b1ce-4313ef05a681","resolution":{"observed_at":"2026-08-11T04:17:55.824530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05916","last_updated":"2024-03-29T03:40:47Z","snapshot_observed_at":"2026-08-09T16:06:08.831990Z","submitted_at":"2023-10-09T17:59:04Z","title":"Interpreting CLIP's Image Representation via Text-Based Decomposition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05916","snapshot_observed_at":"2026-08-11T04:17:55.829626Z","title":"Interpreting clip’s image representa- tion via text-based decomposition.arXiv preprint arXiv:2310.05916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.829626Z"},"links":{"cited_paper":"/paper/2310.05916","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:d53e363cf92caa487d9328822403b8f3974ec7731443ce936250a1afaa7507d4","observation_id":"5dc90ba2-6e4d-4bbf-98b4-ace19979d697","resolution":{"observed_at":"2026-08-11T04:17:55.829626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-11T04:17:55.834643Z","title":"Scaling and evaluating sparse autoencoders.arXiv preprint arXiv:2406.04093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.834643Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:d8d31f02afc9ce5875c189d721217aefb5e8cc3ae1db4e0a4bac30b5294c4447","observation_id":"4227ee35-1ef9-4683-9e9f-b03e81994704","resolution":{"observed_at":"2026-08-11T04:17:55.834643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-11T04:17:55.839825Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.839825Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:7f5d711ceb80ae632f90504f8d773aec1ed7b793d174b31a4edb2b6d232d8dc3","observation_id":"a67d0a03-cb2c-48bc-99b6-5077d2ca94a8","resolution":{"observed_at":"2026-08-11T04:17:55.839825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.845475Z","title":"FigStep: Jailbreaking large vision-language models via typographic visual prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.845475Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:e861d2f322b460e7efb0590d2cf6d6fa405f4d2a7b6799b08a0bcff594632291","observation_id":"2891bc5a-3300-4926-b5a2-2e673fc4e1d2","resolution":{"observed_at":"2026-08-11T04:17:55.845475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.850637Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.850637Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:509710933eaab48ea94ab565e2b38b40a02e7f0d5287d21febc2632b1ef7826e","observation_id":"eb7628dc-8244-471c-97d8-776e74cf4700","resolution":{"observed_at":"2026-08-11T04:17:55.850637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.856252Z","title":"Not all features are created equal: A mechanistic study of vision-language-action models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.856252Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:b71d7e28ae1aab79c525be8d3c83f75b71bddcbab9e754435edb6de8b151fb1e","observation_id":"383f8bd4-0f3d-4f1e-8663-f5c8552e8985","resolution":{"observed_at":"2026-08-11T04:17:55.856252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T04:17:55.861229Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.861229Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:c09f801cd1a62db4079e8a38a3265a4f137f0d48cce26268ce3cd6a9fe82db7c","observation_id":"594550ea-48d5-4b18-a375-73064b1a6c2e","resolution":{"observed_at":"2026-08-11T04:17:55.861229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00328","last_updated":"2025-08-30T03:01:57Z","snapshot_observed_at":"2026-08-09T01:42:33.969493Z","submitted_at":"2025-08-30T03:01:57Z","title":"Mechanistic interpretability for steering vision-language-action models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00328","snapshot_observed_at":"2026-08-11T04:17:55.865869Z","title":"Mechanistic interpretability for steering vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.865869Z"},"links":{"cited_paper":"/paper/2509.00328","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:b4bdf73c31b30e74f4159533f4f4463064d50f3eee4d70d0a09297a0fc42b3ae","observation_id":"51b802d7-af4b-4cde-979e-97fc6d7c7e49","resolution":{"observed_at":"2026-08-11T04:17:55.865869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20526","last_updated":"2024-10-27T17:33:49Z","snapshot_observed_at":"2026-08-10T11:13:13.559357Z","submitted_at":"2024-10-27T17:33:49Z","title":"Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20526","snapshot_observed_at":"2026-08-11T04:17:55.870806Z","title":"Llama scope: Extracting millions of features from llama-3.1-8b with sparse autoencoders.arXiv preprint arXiv:2410.20526, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.870806Z"},"links":{"cited_paper":"/paper/2410.20526","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:5b8140b43775500e3303f994230c21f62956a613057b3b0db400351047c9a312","observation_id":"3b640386-0590-4017-8b10-8dcab1ed9d2b","resolution":{"observed_at":"2026-08-11T04:17:55.870806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.875585Z","title":"In-context learning creates task vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.875585Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:86ee5c2916b72ef7106cc21fd8a5acad80996dd03446e0015592fe9006eb81dc","observation_id":"e94666bd-7d15-4980-b0a4-2c789fe46bb3","resolution":{"observed_at":"2026-08-11T04:17:55.875585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19939","last_updated":"2025-05-17T15:14:14Z","snapshot_observed_at":"2026-08-08T01:24:10.875048Z","submitted_at":"2024-11-29T18:56:37Z","title":"VLSBench: Unveiling Visual Leakage in Multimodal Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19939","snapshot_observed_at":"2026-08-11T04:17:55.880064Z","title":"VLSBench: Unveiling visual leakage in multimodal safety.arXiv preprint arXiv:2411.19939, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.880064Z"},"links":{"cited_paper":"/paper/2411.19939","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:baa10ee3fb89c0253c969165d32eecda1cb4b2ec0bdbeb67b9fd2c5f27220799","observation_id":"ed622c66-b2d4-4498-8016-67dc19488d7e","resolution":{"observed_at":"2026-08-11T04:17:55.880064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-11T04:17:55.885168Z","title":"Sleeper agents: Training deceptive llms that persist through safety training.arXiv preprint arXiv:2401.05566, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.885168Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:2332fc626e68c00e41879b514eae3f41435fa0fddf627cef3fea712834cf5095","observation_id":"92e3a5d3-924f-4d22-961c-de23b2368db0","resolution":{"observed_at":"2026-08-11T04:17:55.885168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02762","last_updated":"2025-02-10T20:13:31Z","snapshot_observed_at":"2026-08-09T16:06:26.088504Z","submitted_at":"2024-10-03T17:59:57Z","title":"Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02762","snapshot_observed_at":"2026-08-11T04:17:55.889674Z","title":"Interpreting and editing vision-language representations to mitigate hallucinations.arXiv preprint arXiv:2410.02762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.889674Z"},"links":{"cited_paper":"/paper/2410.02762","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:d45c1999298a6cefa3cd72840b1174e7ab3a07ad8c86b83164c5937f8d882a58","observation_id":"60bfe481-7159-4238-b912-6accdf089da1","resolution":{"observed_at":"2026-08-11T04:17:55.889674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.894475Z","title":"A “diff” tool for AI: Finding behavioral differences in new models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.894475Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:24201f68a181ae87aabee35a6f79998eb18b8c7c09a0a9bd658fd16ddeafdd8c","observation_id":"dd219166-8d27-475a-a1c4-06ce11c66684","resolution":{"observed_at":"2026-08-11T04:17:55.894475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.900408Z","title":"Bridging the VLM and mech interp communities for multimodal interpretability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.900408Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:e8cf2f39767270774ab65ad41864f0dcbab0570a212403d487f57c6cc0c7b13d","observation_id":"7bdee4c9-2165-49f5-a2c8-8a114e2a8644","resolution":{"observed_at":"2026-08-11T04:17:55.900408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08729","last_updated":"2025-04-11T17:56:09Z","snapshot_observed_at":"2026-08-07T16:06:27.536555Z","submitted_at":"2025-04-11T17:56:09Z","title":"Steering CLIP's vision transformer with sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08729","snapshot_observed_at":"2026-08-11T04:17:55.905911Z","title":"Steering CLIP’s vision transformer with sparse autoencoders.arXiv preprint arXiv:2504.08729, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.905911Z"},"links":{"cited_paper":"/paper/2504.08729","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:1701ae435c916d48985c4d9b8c84112ff7fa55a7422cadf79ed3f424edda0020","observation_id":"0a1b3935-db61-4b7d-b663-d9f6cdf18b9d","resolution":{"observed_at":"2026-08-11T04:17:55.905911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19475","last_updated":"2025-06-03T06:43:53Z","snapshot_observed_at":"2026-08-08T06:14:47.169680Z","submitted_at":"2025-04-28T04:31:24Z","title":"Prisma: An Open Source Toolkit for Mechanistic Interpretability in Vision and Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19475","snapshot_observed_at":"2026-08-11T04:17:55.911157Z","title":"Prisma: An open source toolkit for mechanistic interpretability in vision and video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.911157Z"},"links":{"cited_paper":"/paper/2504.19475","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ae3a659cf395aee834bad69ee9bbb5b8ff5a6fcad46a14070ef1273b1e6804f0","observation_id":"02d7cbe7-c662-4f20-a2f1-8f252dca6f28","resolution":{"observed_at":"2026-08-11T04:17:55.911157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03012","last_updated":"2025-08-13T13:42:57Z","snapshot_observed_at":"2026-08-11T03:14:04.497536Z","submitted_at":"2025-01-06T13:37:13Z","title":"Analyzing Finetuning Representation Shift for Multimodal LLMs Steering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03012","snapshot_observed_at":"2026-08-11T04:17:55.916191Z","title":"Analyzing fine-tuning representation shift for multimodal llms steering alignment.arXiv preprint arXiv:2501.03012, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.916191Z"},"links":{"cited_paper":"/paper/2501.03012","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:2d8aded3057eae11e9c6b9ab54fc40dd52bd6c52f6280bcf840cef34c704ec3c","observation_id":"4e56b9bf-2caf-4a64-8b63-4fffadd4fa48","resolution":{"observed_at":"2026-08-11T04:17:55.916191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.921070Z","title":"Saes (usually) transfer between base and chat models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.921070Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:5c87bc2a8633fa6cbd5cce19db1f7d0a1917d76e0cedddd4e1602d46d32be6cd","observation_id":"bb729be5-e31f-4c6f-95d7-d9726ae0138e","resolution":{"observed_at":"2026-08-11T04:17:55.921070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.926358Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.926358Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:c2710b3b647d7d1de292641c6fae890fd1c2d09dc5569b2c3f9471d5f650db61","observation_id":"16f919f1-5867-4ed1-b1a8-49dea9800dbf","resolution":{"observed_at":"2026-08-11T04:17:55.926358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.931559Z","title":"Sakla, and Kowshik Thopalli","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.931559Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:62dafc720eb9681329e3734b7db146163f1b80a00c5656cfd6b7779257086710","observation_id":"07a5bec2-b757-4592-8d0b-4eccf85b6d89","resolution":{"observed_at":"2026-08-11T04:17:55.931559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.936739Z","title":"Understanding image representations by measuring their equivariance and equivalence","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.936739Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:0f3e2309437e65874ddbace8117f259a1d813e428c17505f73752bb1a0dc56f8","observation_id":"62157067-b288-4ad7-97cb-c5b4e1633c98","resolution":{"observed_at":"2026-08-11T04:17:55.936739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T04:17:55.941614Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.941614Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:c6bf7a7c8eb915e9404d9530f9fd10310c7de253045b357da5a9bf08ba2dfd0b","observation_id":"ef4f6fd3-9c05-4ffc-8be7-8a071882afe6","resolution":{"observed_at":"2026-08-11T04:17:55.941614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.946783Z","title":"Inference- time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.946783Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:c34e61bb758038964f29ec54ae477cd4f912cfe617ebb153ade212bbd0a17b04","observation_id":"ae34dab8-af93-4449-8e3a-061503ffd727","resolution":{"observed_at":"2026-08-11T04:17:55.946783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.964116Z","title":"Images are Achilles’ heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models","venue":null,"work_id":"fb10721f-f0eb-4d5e-8519-2eed00403bb9","year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.951510Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:0b91bf369b01263bc73a8e0e758f7c43935f917645d99dedd43f0a60e7fbed44","observation_id":"f66078d7-2322-48be-8ac4-5c1c808c4191","resolution":{"observed_at":"2026-08-11T04:17:57.969271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07543","last_updated":"2016-02-28T22:04:54Z","snapshot_observed_at":"2026-08-03T16:55:19.885866Z","submitted_at":"2015-11-24T02:31:46Z","title":"Convergent Learning: Do different neural networks learn the same representations?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07543","snapshot_observed_at":"2026-08-11T04:17:55.956223Z","title":"Convergent learning: Do different neural networks learn the same representations?arXiv preprint arXiv:1511.07543, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.956223Z"},"links":{"cited_paper":"/paper/1511.07543","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:6e88ab6c55673f1fadaa2460954a7ae1a93819651876e7cec5893baf93c088bf","observation_id":"7c5cf49e-69d0-46fc-b00c-d062e287ae2c","resolution":{"observed_at":"2026-08-11T04:17:55.956223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-11T04:17:55.961255Z","title":"Gemma Scope: Open sparse autoencoders everywhere all at once on Gemma 2.arXiv preprint arXiv:2408.05147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.961255Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ea7dc22af133e6bb979c1062965af32ba7610dab0745a5102f434978cb46d151","observation_id":"b362ad44-4a2b-4a9d-9394-b8618f4cc42d","resolution":{"observed_at":"2026-08-11T04:17:55.961255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05276","last_updated":"2025-03-21T13:02:14Z","snapshot_observed_at":"2026-07-06T20:02:57.733746Z","submitted_at":"2024-12-06T18:59:51Z","title":"Sparse autoencoders reveal selective remapping of visual concepts during adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05276","snapshot_observed_at":"2026-08-11T04:17:55.967019Z","title":"Sparse autoencoders reveal selective remapping of visual concepts during adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.967019Z"},"links":{"cited_paper":"/paper/2412.05276","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:6c822f7229470524d60c9d7c6717c5e9b042568eee4f5f9100fdcc682b6d8357","observation_id":"f5eddaa7-8d8b-40f1-9231-425afcca5f9e","resolution":{"observed_at":"2026-08-11T04:17:55.967019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17516","last_updated":"2025-02-22T20:55:26Z","snapshot_observed_at":"2026-08-08T10:56:10.786814Z","submitted_at":"2025-02-22T20:55:26Z","title":"A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17516","snapshot_observed_at":"2026-08-11T04:17:55.972218Z","title":"A survey on mecha- nistic interpretability for multi-modal foundation models.arXiv preprint arXiv:2502.17516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.972218Z"},"links":{"cited_paper":"/paper/2502.17516","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:7433541f286e5e478ad03fabd3561ed3f348fb6c6268d08fa271f1a8e2ab3afc","observation_id":"74cb08c5-3e38-4f66-b5a3-cf3e6d9061f1","resolution":{"observed_at":"2026-08-11T04:17:55.972218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.946780Z","title":"Sparse crosscoders for cross-layer features and model diffing, October 25 2024","venue":null,"work_id":"f5b94ef0-da8d-4b4a-aca8-72e7272b2ef6","year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.977277Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ca966a477c07bbbf2c3601e80899c09ddc5414150a28086cabdb8417eb7791c1","observation_id":"50c39459-8359-4d8a-8f3b-06a5764fccdb","resolution":{"observed_at":"2026-08-11T04:17:57.952495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.928716Z","title":"Visual spatial reasoning.Transactions of the Association for Computational Linguistics, 2023","venue":null,"work_id":"0e18a0d1-d6af-4c8f-a589-46e25f093be4","year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.981926Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:72651247b3098cbf567632d339d0006e110b9c1f5ad30ab61ca6c5b607f65862","observation_id":"e242e417-d6d1-466c-8c67-75d87eb17f48","resolution":{"observed_at":"2026-08-11T04:17:57.934987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.986160Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.986160Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:1c8019becf62290f975273c6dcc5c427e337a8d95389cc5fe42cd743d1cc77f0","observation_id":"428d81df-84f7-4297-95c6-84ba78dfca31","resolution":{"observed_at":"2026-08-11T04:17:55.986160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:55.990284Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.990284Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:008f61104f62104a0c02c34a72eecc59af24c89b0f41dac67b00452580b4b223","observation_id":"159ce224-eb30-4005-bd03-3e7034b33e31","resolution":{"observed_at":"2026-08-11T04:17:55.990284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.891978Z","title":"MM-SafetyBench: A benchmark for safety evaluation of multimodal large language models","venue":null,"work_id":"bf28f7cf-41f1-4aa2-814c-afa38f63bfb7","year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.994689Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:4ae794054ab892553221a9f9a7743f4aec31bd76e9d837807ffdf4d20e2f49c8","observation_id":"a8f7a635-04af-41c1-9058-446d263e58fb","resolution":{"observed_at":"2026-08-11T04:17:57.897139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T04:17:55.999133Z","title":"OCRBench: On the hidden mystery of OCR in large multimodal models.Science China Information Sciences, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.999133Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:a247571ffa92b7c7fc5870c64fded20538143eb77817b9d723ea8d000fb46bda","observation_id":"4cc32df0-f6f3-4a06-9080-8ad98d0fa6c4","resolution":{"observed_at":"2026-08-11T04:17:55.999133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.874868Z","title":"Michaud, Yonatan Belinkov, David Bau, and Aaron Mueller","venue":null,"work_id":"ed906814-f056-4469-832c-6bf3d9bcc38d","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.003768Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:a61959e4a0f4be25f781c1f14ba16b79f7c3d2cb24ac7e314911e6df7c53be80","observation_id":"2db28554-8e14-41be-8bc8-fc9bd7333573","resolution":{"observed_at":"2026-08-11T04:17:57.880397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.008128Z","title":"Locating and editing factual associations in GPT","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.008128Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:f5e5008a23a17e184800b575c24551e16706e6689b7e36a4299cf669b8f109a1","observation_id":"1012ade3-0d1d-4240-a17c-094795998f39","resolution":{"observed_at":"2026-08-11T04:17:56.008128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.012960Z","title":"Robustly identifying concepts introduced during chat fine-tuning using crosscoders.arXiv preprint arXiv:2504.02922, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.012960Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:37a045f8c77fa3b3b423f3a4fb464862ca94b203df0cec901d063221904d9df8","observation_id":"464d7b55-d456-457f-86c9-7b103017259e","resolution":{"observed_at":"2026-08-11T04:17:56.012960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.847979Z","title":"What we learned trying to diff base and chat models (and why it matters).LessWrong, 2025","venue":null,"work_id":"ad227817-cda2-4294-8440-803ea87d3bad","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.017719Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:a5a21e06acf023562fd6e932d3bc83afa1dc75b89e0495913723dc4a128d9ff8","observation_id":"cc5bc455-3eba-42e8-901f-b572d332ca4a","resolution":{"observed_at":"2026-08-11T04:17:57.853986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.831102Z","title":"Insights on crosscoder model diffing","venue":null,"work_id":"5211a430-248a-466a-8763-4f5633ab776d","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.022501Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:68d7ebbd223aad05f6fc1924470173c3d58335c39f11d59244cee80e2792290a","observation_id":"8451658b-066d-4558-848c-483cfff8b398","resolution":{"observed_at":"2026-08-11T04:17:57.837250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.811618Z","title":"Attribution patching: Activation patching at industrial scale","venue":null,"work_id":"2da96e75-91a7-44c3-a567-684104521d73","year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.027425Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:c4cc1cf95eadc9c008bd787513cf02d90a3fc1794f78a6c125552d945f53dfe0","observation_id":"5db2cfa0-3178-48d0-9c2f-245259e280e8","resolution":{"observed_at":"2026-08-11T04:17:57.818307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-10T12:49:45.245447Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-11T04:17:56.032176Z","title":"To- wards interpreting visual information processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.032176Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:3a20a14e545d49151062970e4f85b7576eb4bfa8e29f852bb37f63c156bb8ecd","observation_id":"cdd46c79-02f1-4c4e-86bb-b856ba020424","resolution":{"observed_at":"2026-08-11T04:17:56.032176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11296","last_updated":"2025-05-22T23:03:47Z","snapshot_observed_at":"2026-08-09T11:09:57.531466Z","submitted_at":"2024-11-18T05:47:02Z","title":"Steering Language Model Refusal with Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11296","snapshot_observed_at":"2026-08-11T04:17:56.038373Z","title":"Steering language model refusal with sparse autoencoders.arXiv preprint arXiv:2411.11296, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.038373Z"},"links":{"cited_paper":"/paper/2411.11296","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:054b8a11df34a3877a779989c75424fa0e642b0bd33ea0de2176f901f1108ea3","observation_id":"623a2370-84b8-4f4a-bf0b-0b8c4a7bd95c","resolution":{"observed_at":"2026-08-11T04:17:56.038373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.044310Z","title":"Zoom in: An introduction to circuits.Distill, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.044310Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:90309c23bc6d4c5a16dc7d912f2c06af50618512f64d0c610a3add31b8205fec","observation_id":"bbc722ed-96ce-4a69-89d5-624cf509d697","resolution":{"observed_at":"2026-08-11T04:17:56.044310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.793501Z","title":"Visualizing representations: Deep learning and human beings","venue":null,"work_id":"a0e2f214-e987-4c48-8dc1-6de1822a8291","year":2015},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.049202Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:31f28cfe488e33e2e329b81d7328d9849b4d49c56090717e3c92fa8c7da60db0","observation_id":"058d2038-410f-42cd-9c2b-798bf255d421","resolution":{"observed_at":"2026-08-11T04:17:57.798542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.11277","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.736858Z","title":"Probing the representational power of sparse autoencoders in vision models","venue":null,"work_id":"40e23fdb-7689-43e1-a863-63f63734de87","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.054083Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:0a8b8ca2347720974106d1c49168d23e55425117ccf34d11819deb6015acf7e2","observation_id":"60c5603e-ea1d-40e2-b130-362652456e2b","resolution":{"observed_at":"2026-08-11T04:17:56.747243Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.777611Z","title":"Gpt-4o-mini: Advancing cost-efficient intelligence","venue":null,"work_id":"26acf1d7-c3ef-4b74-91ed-362754f23202","year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.058945Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:efbe6356c577b3ffe2d402d4a41e46714581cb7eccebaaef0a05368a9298be80","observation_id":"5b9793e9-4c4a-4e7c-862e-920e5d638bbe","resolution":{"observed_at":"2026-08-11T04:17:57.782692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.063731Z","title":"Sparse autoencoders learn monosemantic features in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.063731Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:3f77edd64028e0cc231e6d70248adfd46739e96dd80ae8e29e521c4d3cf9ffd0","observation_id":"377960dc-cb41-4e38-a7f4-d2932749b680","resolution":{"observed_at":"2026-08-11T04:17:56.063731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.761306Z","title":"Towards vision-language mechanistic interpretability: A causal tracing tool for blip","venue":null,"work_id":"7df5a156-61b5-4464-aef8-e5ce2788eec0","year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.068462Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:cdb581fed08c406f9071928fc7597012af0fae1006839bb2a88ad2aed6fa8589","observation_id":"1c619101-97ef-42f1-aae8-e70c8d36057a","resolution":{"observed_at":"2026-08-11T04:17:57.766065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09708","last_updated":"2026-04-28T03:29:39Z","snapshot_observed_at":"2026-08-10T21:52:19.966437Z","submitted_at":"2025-09-07T02:29:07Z","title":"Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09708","snapshot_observed_at":"2026-08-11T04:17:56.073278Z","title":"I’m sorry, I can’t","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.073278Z"},"links":{"cited_paper":"/paper/2509.09708","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:74d9a346af0238bdb0e9413697a20a53b49a626519b41cf78f5736d8b7308eee","observation_id":"94b2dead-18bc-4a07-af33-a10015ae3873","resolution":{"observed_at":"2026-08-11T04:17:56.073278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.745220Z","title":"Visual adversarial examples jailbreak aligned large language models","venue":null,"work_id":"5be6512c-6252-434f-bbed-3201ec09ef6c","year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.078497Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:60927b3edf03d776ddcd58086779375a40c04f66ed68bb9468cae43f18260139","observation_id":"eacb6670-9287-4508-b7cc-10e65ab0b142","resolution":{"observed_at":"2026-08-11T04:17:57.750674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.728429Z","title":"Qwen-Scope: An open sparse autoencoder suite for the Qwen model family","venue":null,"work_id":"4ff78c88-55ee-4c64-8500-5e3af0878dec","year":2026},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.083263Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:cc36cd473d3c4447689ac79bbfb787004c840e22365008d698a2ee86f041965c","observation_id":"d5566a4c-bbc4-4029-82c9-0268f9e08351","resolution":{"observed_at":"2026-08-11T04:17:57.733675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.088107Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.088107Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:fd9cfa92731d50649977216dc9a7391f816b3e03a299a5fcbaccd4e345433f2f","observation_id":"fe447d69-874d-4cbd-b5a0-ea082f32f82e","resolution":{"observed_at":"2026-08-11T04:17:56.088107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14435","last_updated":"2024-08-01T17:42:04Z","snapshot_observed_at":"2026-08-08T18:10:15.134088Z","submitted_at":"2024-07-19T16:07:19Z","title":"Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14435","snapshot_observed_at":"2026-08-11T04:17:56.092721Z","title":"Jumping ahead: Improving reconstruction fidelity with JumpReLU sparse autoencoders.arXiv preprint arXiv:2407.14435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.092721Z"},"links":{"cited_paper":"/paper/2407.14435","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:bc18053bea89e70b237260f1ac70d59a04984ca83af0430c38f7544a543f4cf0","observation_id":"eadbd835-4e5f-45e3-8fea-de3c5e559122","resolution":{"observed_at":"2026-08-11T04:17:56.092721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-11T04:17:56.097463Z","title":"Steering Llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.097463Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:55f028be8bf582e6f195f4585ee993d003f8ffc13769e9c2c54eca2ea96dbc7b","observation_id":"4641de98-7e7b-4fc5-a4ab-6302312a8412","resolution":{"observed_at":"2026-08-11T04:17:56.097463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.699795Z","title":"Multi- modal neurons in pretrained text-only transformers","venue":null,"work_id":"eefde3ea-f939-4d49-904d-c6fa5ba37549","year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.102224Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:b9407f0e5b19f289a9617bb0b8ab32ad724a4afe4dd529a5fa1c488d28947541","observation_id":"8c892395-c64d-4597-88bb-e01c606b2917","resolution":{"observed_at":"2026-08-11T04:17:57.705410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.683064Z","title":"SteerVLM: Robust model control through lightweight activation steering for vision language models","venue":null,"work_id":"7fbe20d3-5ad0-4763-911c-e5e7dfef8d4f","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.106645Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:a6c8c81ce98432e33c5c4996ea338e48b8251808b11530abb27d359fa7c16662","observation_id":"f298f62e-2df4-4676-8705-f70f9d84fe17","resolution":{"observed_at":"2026-08-11T04:17:57.688536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03118","last_updated":"2024-06-24T22:45:20Z","snapshot_observed_at":"2026-07-06T17:55:24.972926Z","submitted_at":"2024-04-03T23:57:34Z","title":"LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03118","snapshot_observed_at":"2026-08-11T04:17:56.111721Z","title":"Lvlm-interpret: an interpretability tool for large vision-language models.arXiv preprint arXiv:2404.03118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.111721Z"},"links":{"cited_paper":"/paper/2404.03118","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:6bbaa0372ba5e7f7423fad06cbc428ec240a9450dd3c7838c3a755c979dff39b","observation_id":"830f7044-5311-48c7-b4a4-e492efe747ce","resolution":{"observed_at":"2026-08-11T04:17:56.111721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-11T04:17:56.116317Z","title":"PaliGemma 2: A family of versatile VLMs for transfer.arXiv preprint arXiv:2412.03555, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.116317Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ce80d2a669e889c27599e5199c54b55f450608c0f12e0482c87cf7ab53a22835","observation_id":"ea2aabab-eee9-460d-ba2a-2b5538ff20e5","resolution":{"observed_at":"2026-08-11T04:17:56.116317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.122564Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.122564Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:0a3eb0e8ed3006997f085a700a34dc9f3c5e5ba2eea9e03ff50a0eb9c0d74174","observation_id":"652c6242-0c83-45b3-84c8-a17a7d903b88","resolution":{"observed_at":"2026-08-11T04:17:56.122564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.654572Z","title":"Li, Arnab Sen Sharma, Aaron Mueller, Byron C","venue":null,"work_id":"aae89190-8118-4c46-aea5-50f3d933edb9","year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.127927Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:b9edb0bf045ae92bd560b67c8930741e52f7b5ffd74244e1bf9a6314aa579b12","observation_id":"ad666547-3921-415d-9f0d-0f41acd4ac5e","resolution":{"observed_at":"2026-08-11T04:17:57.659875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.132540Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.132540Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:8fe3ccc1203cd70eba89d0f055f352964ed36053632c283324f3a2a321ca27b7","observation_id":"d37558b3-dc39-493d-bf70-b84cb8eedef5","resolution":{"observed_at":"2026-08-11T04:17:56.132540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-11T04:17:56.137372Z","title":"Vazquez, Ulisse Mini, and Monte MacDiarmid","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.137372Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:419e037985d859f3b49513ac06b06123d34b89648134f0aebf9aacf94a613e8f","observation_id":"4f30b446-4ab4-4a1a-a778-10e1ba21a3ed","resolution":{"observed_at":"2026-08-11T04:17:56.137372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.622333Z","title":"Too late to recall: The two-hop problem in multimodal knowledge retrieval","venue":null,"work_id":"5147a85d-fed6-44bf-8876-35a792810d15","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.142365Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:d93c6ca0ce13ed7bdd4586e9b0a41d4a7911482c18766f617076fa3495d62495","observation_id":"a5e3ee40-f7fd-46f4-9da1-684f3115af2c","resolution":{"observed_at":"2026-08-11T04:17:57.628662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11976","snapshot_observed_at":"2026-08-11T04:17:56.147155Z","title":"How visual representations map to language feature space in multimodal llms.arXiv preprint arXiv:2506.11976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.147155Z"},"links":{"cited_paper":"/paper/2506.11976","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:f82e7706f01c56e0df061b5daded53ac14dbc534644da42adb395069578ebf88","observation_id":"e97f989c-c33a-4426-8979-5210adbd71a5","resolution":{"observed_at":"2026-08-11T04:17:56.147155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.606190Z","title":"Steering away from harm: An adaptive approach to defending vision language model against jailbreaks","venue":null,"work_id":"4350efb8-e7cd-429f-9804-53ba6cb3d0dd","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.152172Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:8168943390c7b47c79927b645e18799c275bcdbe2d2dad378132c464a4fec91a","observation_id":"9ddfa148-7c15-4249-9c65-72225f1a76bd","resolution":{"observed_at":"2026-08-11T04:17:57.611779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-11T04:17:56.156829Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.156829Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:0663b121cc0aaab33ef40ae52e020844ee54bd3c4c6f56a6bc7773842bc409be","observation_id":"3ad407f8-f160-46c8-9936-e40a5904103c","resolution":{"observed_at":"2026-08-11T04:17:56.156829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.589906Z","title":"AdaShield: Safeguarding multimodal large language models from structure-based attack via adaptive shield prompting","venue":null,"work_id":"59a81038-a373-4d48-965f-25a4d75b88df","year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.162853Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:50acd8a503befb0925ddb5f25fcfe02352ce922525b9f8ab5b8f43c248c6e57c","observation_id":"3b14a2e9-6053-4aa2-9b6a-279769fe4d46","resolution":{"observed_at":"2026-08-11T04:17:57.595098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-11T04:17:56.167527Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.167527Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:a94614f4ac6b4d31768287fb0ad4678b93504878eb87821cbd4e5c54f43918ef","observation_id":"47a8435a-2c41-4f4a-81e8-3c19919d4f69","resolution":{"observed_at":"2026-08-11T04:17:56.167527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T04:17:56.172320Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.172320Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:e1e95000d037028cabc9ad1ef96f557057ca18497628e1b256aeca82a9233f18","observation_id":"95f2b71b-43ef-4498-9931-0584ebf2d855","resolution":{"observed_at":"2026-08-11T04:17:56.172320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.177100Z","title":"SafeSteer: Adaptive subspace steering for efficient jailbreak defense in vision-language models.arXiv preprint arXiv:2509.21400, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.177100Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:2c819381c96d5cbe13144768acf133ce1837ebb1203fc1120d9e09c30fd28f49","observation_id":"581e9dcf-2c1f-4833-b068-0610fedbe8bf","resolution":{"observed_at":"2026-08-11T04:17:56.177100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:56.181619Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.181619Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:6016f89e0f6522efa6fca42e366bdac5db587c23583a2ebddae591366e702251","observation_id":"c093c9d3-d5cc-4865-8131-636221f4691f","resolution":{"observed_at":"2026-08-11T04:17:56.181619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16042","last_updated":"2024-01-17T04:07:06Z","snapshot_observed_at":"2026-08-08T04:58:14.317234Z","submitted_at":"2023-09-27T21:53:56Z","title":"Towards Best Practices of Activation Patching in Language Models: Metrics and Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16042","snapshot_observed_at":"2026-08-11T04:17:56.186065Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.186065Z"},"links":{"cited_paper":"/paper/2309.16042","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:d0a5c80224256df1a09752fc2e5b971d5410ee6bcb45b7b39b345539738a701b","observation_id":"112922d6-827d-42aa-a3d2-3aea70380e8f","resolution":{"observed_at":"2026-08-11T04:17:56.186065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.561818Z","title":"Cross-modal information flow in multimodal large language models","venue":null,"work_id":"8fee5435-a1b6-4bda-b122-997b9f440cef","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.190937Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:27a15d283092e825fc3266a542c0d9ab5cf77d62df23baa0c35323bb483de164","observation_id":"f2b68228-1a9b-4451-b843-561f9a915118","resolution":{"observed_at":"2026-08-11T04:17:57.566959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.543903Z","title":"Multimodal situational safety","venue":null,"work_id":"0834f60f-bd6c-4161-b7e1-f43954ba7c54","year":2025},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.195809Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:6528d099bccf0a1489502d505522477450ec704e0bf710b55b10a9b8b0d98528","observation_id":"2619e432-0229-4ce4-9384-2c2445bcae20","resolution":{"observed_at":"2026-08-11T04:17:57.549778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.524183Z","title":"Relocated","venue":null,"work_id":"336b2c1e-8b60-42ef-a753-80cbb8ed8b3b","year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.201760Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:6b6a4c4cf20a7a1bb709ba8ae6c98157d019a5bb48d4bdc0e5f521488dcc7494","observation_id":"e7d95dd4-96b3-42a8-bfa2-b16e8a5e4b3e","resolution":{"observed_at":"2026-08-11T04:17:57.530047Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.507104Z","title":null,"venue":null,"work_id":"be8ed473-e650-4a4b-a6b2-a22b66518988","year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.208372Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:7262a3fa68dc257509db4f185f8e9726bd41af3d14918cb47120bec5a338dd5a","observation_id":"dd40ce95-4dfb-4b0e-bb9f-d4bfd52a465d","resolution":{"observed_at":"2026-08-11T04:17:57.512239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.489571Z","title":null,"venue":null,"work_id":"209a0b93-94bc-4235-bd2b-5c3a41f0abb4","year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.214057Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:ecf412c5a3bb53b7e036b0e6fe998d199cd41149c9e37505c1f46a403dd6da0c","observation_id":"7bbbfb87-1a52-4a94-8530-dc262d50d734","resolution":{"observed_at":"2026-08-11T04:17:57.494613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.473134Z","title":null,"venue":null,"work_id":"f41c804b-96bd-4d6b-ab6d-a6a36470e516","year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.219618Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:1d2978c726a2710551346367a413da5ae2342f526a626c661cb3c92e101e5033","observation_id":"418b9983-293a-4b05-83aa-d201d05c83b7","resolution":{"observed_at":"2026-08-11T04:17:57.478120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:57.456836Z","title":"this neuron activates for","venue":null,"work_id":"22c4ec09-0c11-411f-8514-e43b926ef579","year":null},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.224644Z"},"links":{"citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:4fa634371cbabb4af105d0026b44fb9166c5c90873caa21a1e90a62fd4337596","observation_id":"4447cbf9-6ef0-4020-9860-8acf0b877876","resolution":{"observed_at":"2026-08-11T04:17:57.462367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:26:01.308328Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2608.09928."}