{"as_of":"2026-08-17T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45dba4a1da7e7db5d804b08dde6808945a8354c1d71439ccdf1d07bb732ca9af","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T20:17:06.897180Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.08031/citation-record","integrity":"/paper/2606.08031/integrity","json":"/paper/2606.08031/citation-record.json","paper":"/paper/2606.08031"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"Proceedings of the Workshop on Cognitive Modeling and Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:26f40eeda69a32ca76f6e85305d33a5ace0b698be7a0d89052749470064ddd69","observation_id":"03f1da69-12eb-47cd-8ded-b0d38a185f2a","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"Ehinger and Sarah Monazam Erfani and James Bailey , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:7598784e0085d5b72a690783427ac0826f101a4caafd0cfcf5e0f8e37db9ab18","observation_id":"d3efab20-0263-4fb0-bbb2-1d2ac062f8d1","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:8c3b9837905ffc0cdaa75fb852d6cd465eb2171aa78764a1fb11883eec413456","observation_id":"3684d9f6-b820-4491-8e21-52840f97d6ed","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08729","last_updated":"2025-04-11T17:56:09Z","snapshot_observed_at":"2026-08-16T12:41:56.807417Z","submitted_at":"2025-04-11T17:56:09Z","title":"Steering CLIP's vision transformer with sparse autoencoders","version":1},"cited_work":{"arxiv_id":"2504.08729","doi":"10.48550/arxiv.2504.08729","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08729","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering CLIP’s vision transformer with sparse autoencoders","venue":"arXiv (Cornell University)","work_id":"f1d7c9f3-14ee-42eb-8b5a-1059948b953b","year":2025},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"cited_paper":"/paper/2504.08729","citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:c055886d9ddf10c5eefa79410ffc46282379e8e901f67b6e073e6905953de18b","observation_id":"60660a5b-47e4-4e5c-b7bb-3adff6a1f9ad","resolution":{"observed_at":"2026-07-02T20:47:22.486788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:4ede73ce6bf64bd0215af63a6345c6457d718ddddbda76cbadaa51abdd80e724","observation_id":"b1d48104-f242-490a-b735-72ad41065a65","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:545cb61a1bd6f302e416b55d2a87ff93a73bd3c6f3c9da503e6e64b6b4ecb91f","observation_id":"767d8829-e07c-4c6f-8aab-29a53c722804","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:88072ff1de2a10897ee06c896a4fbe518e0e3431576a5a67a06bf44e34a08a62","observation_id":"4a83004f-12aa-49a8-9b48-779488a7b70e","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"and Stoica, Ion and Xing, Eric P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:e779f807a1660e385250b67b7d6b896170fa2ca840e28cadf686084a81778aaf","observation_id":"903dced5-cd4f-4d4a-8768-064e1c46eb4d","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:22787875d00302654646c89e3cca18b93e351ce66a1aad163a842daf07337c71","observation_id":"ef49a2f5-b74d-4d6f-a2be-d9a634b71392","resolution":{"observed_at":"2026-07-02T20:47:22.495148Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"2010 , publisher=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:0075046fb7951409e2a0a75911ede2e8add925bc4058293c5d1c9a35585f927e","observation_id":"501859b4-8ca7-422f-9536-e31bf0a1b965","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"1958 , publisher=","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:85c77e1863f61147976c3bf339930648c83ac6c79247babf225947ee4e336c4f","observation_id":"9fc635d6-a3c1-4501-9e50-c902449a1de1","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"2012 , publisher=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:36642e43bd307ae413f0dffbf736551fd8b747b33117f3f8a2dcf8e2337c38f9","observation_id":"6fb78772-631c-4d45-8ab4-39c538ff379a","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:17:06.897180Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:872b765150597e622d449489290b6619e58e5f1a49b2ce9409d2a6d50fc87c4c","observation_id":"7e55ba5f-8065-4899-8d55-bbe82653b97b","resolution":{"observed_at":"2026-06-27T20:17:06.897180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03207","last_updated":"2024-05-06T07:12:45Z","snapshot_observed_at":"2026-08-16T13:55:10.027757Z","submitted_at":"2024-05-06T07:12:45Z","title":"A Philosophical Introduction to Language Models - Part II: The Way Forward","version":1},"cited_work":{"arxiv_id":"2405.03207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03207","snapshot_observed_at":"2026-07-02T20:47:22.490890Z","title":"arXiv preprint arXiv:2405.03207 , year=","venue":null,"work_id":"7a9ef346-165e-42ca-9587-7ca3a520e509","year":2024},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"cited_paper":"/paper/2405.03207","citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:a23fae34e9bedb3992fa02c84f014c2daf8f55726b25b1eed9b43fda051816e4","observation_id":"b45238c7-7f53-43e0-8f21-1f29a51dd12c","resolution":{"observed_at":"2026-07-02T20:47:22.492641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18852","last_updated":"2026-05-19T12:40:52Z","snapshot_observed_at":"2026-08-16T18:38:16.010052Z","submitted_at":"2025-06-23T17:13:30Z","title":"Mechanistic Interpretability Needs Philosophy","version":2},"cited_work":{"arxiv_id":"2506.18852","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18852","snapshot_observed_at":"2026-07-02T20:47:22.493974Z","title":"Williams, Oldenburg, Dhar, Hatherley, Fierro, Rajcic, Schiller, Stamatiou, and Søgaard, Mechanis- tic interpretability needs philosophy, arXiv preprint 12 arXiv:2506.18852 (2025)","venue":"cs.CL","work_id":"b44b2bad-b44b-4083-adb9-4fd5fc658e45","year":2025},"citing_paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T20:17:06.897180Z"},"links":{"cited_paper":"/paper/2506.18852","citing_paper":"/paper/2606.08031"},"observation_digest":"sha256:d242a3d965517db36c1f0129c783e6462e3d682ef44983b968e5e13b13ed9a81","observation_id":"a563afd7-7cd7-43b5-a426-189ca1463bfe","resolution":{"observed_at":"2026-07-02T20:47:22.495345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.08031","last_updated":"2026-06-06T07:48:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T06:15:02.633485Z","submitted_at":"2026-06-06T07:48:25Z","title":"Vision-Language Asymmetry in Bistable Image Captioning"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2606.08031."}