{"as_of":"2026-08-12T13:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91b6c08ef19f727b0f4c0f3656b58350a339d06aa020ae479af4ea06d8a2e806","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:08.895546Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T11:08:17.571722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:49:57.002506Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.02946","last_updated":"2026-05-01T11:54:55Z","snapshot_observed_at":"2026-08-11T20:13:05.820581Z","submitted_at":"2026-05-01T11:54:55Z","title":"RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:22:00.217729Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.02946"},"observation_digest":"sha256:8ba7ceca913b9350c8994004332ffcc1651942152c06b61b96daf35845eeeef4","observation_id":"70274d98-43c8-4562-bdd8-b51bc6ccbdfe","resolution":{"observed_at":"2026-05-11T15:46:13.825157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.10664","last_updated":"2026-05-14T04:08:33Z","snapshot_observed_at":"2026-08-11T14:36:05.962753Z","submitted_at":"2026-05-11T14:44:32Z","title":"Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:27:15.490694Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.10664"},"observation_digest":"sha256:057fd00f6536c949f757b9c413edb1d45c3e68ef96a09298de7050c5ee2a0fef","observation_id":"69162c32-1c61-409f-b86e-267231d7d9cd","resolution":{"observed_at":"2026-05-12T06:16:25.939080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.10664","last_updated":"2026-05-14T04:08:33Z","snapshot_observed_at":"2026-08-11T14:36:05.962753Z","submitted_at":"2026-05-11T14:44:32Z","title":"Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T05:27:59.011749Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.10664"},"observation_digest":"sha256:af20966342659116b5b1fab50ccb0bbec5cb8e18d6f5bca808c151b9410a0b7f","observation_id":"71c24dca-f1f9-44a7-b847-9c1a5afd1c8e","resolution":{"observed_at":"2026-05-15T05:29:47.076007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-08-08T14:31:30.008895Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T22:36:12.466550Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:954a41f1f5d80ccdc3e0cc7c46ce954a926f1e1da4dbb534f163eab5c148d867","observation_id":"1e77b7e1-96eb-4d6f-92e0-237f38dca4b5","resolution":{"observed_at":"2026-05-20T22:39:10.703623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-08-08T14:31:30.008895Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T09:59:32.201925Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:73c0ea3f389cc91be2903159a2b7227894ae286d56668ffc7c982b933e836dfe","observation_id":"b48fd55b-ee3c-4512-a253-0d40a3b82cbb","resolution":{"observed_at":"2026-05-22T10:01:23.525559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:ebed42c2feb8b2bc4d9a119679fe0619c5e1a696bcfff144b40761ae08d21bd9","observation_id":"3f421cf8-48ca-41b2-a447-55420c0c24c7","resolution":{"observed_at":"2026-07-01T14:05:47.215257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:af109a79599bbfab339f94beae45d5d5cc240ec89d3293f65be63b837dd8fddf","observation_id":"19796388-a601-4242-a1c8-02fb3a196a44","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2606.07696","last_updated":"2026-06-05T07:40:34Z","snapshot_observed_at":"2026-08-07T11:50:33.434267Z","submitted_at":"2026-06-05T07:40:34Z","title":"Adversarial Robustness of Activation Steering in Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T22:30:36.839964Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.07696"},"observation_digest":"sha256:5cafab38f92871173176829b337f2c30af7a650b64f3764fc8d858cd607cddc5","observation_id":"d460774b-6a78-4912-8e56-f903b96b75df","resolution":{"observed_at":"2026-07-02T16:37:09.432517Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":"2505.22637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-04T15:49:57.002506Z","title":"Understanding (un)reliability of steering vectors in language models","venue":null,"work_id":"de563140-cf5f-4bd9-bcc9-8cdc63c5aab8","year":2025},"citing_paper":{"arxiv_id":"2606.26155","last_updated":"2026-06-23T20:10:53Z","snapshot_observed_at":"2026-08-08T17:28:45.253426Z","submitted_at":"2026-06-23T20:10:53Z","title":"Detecting and Controlling Sycophancy with Cascading Linear Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T01:24:56.600219Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2606.26155"},"observation_digest":"sha256:f6f83ecf8fb5c79197a79e70a95575acd025d65e82fed18f3c864d0cf70b73a9","observation_id":"4d6c0238-a48e-4825-ae00-cabcc32cf3ed","resolution":{"observed_at":"2026-07-04T15:49:57.005467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22637","snapshot_observed_at":"2026-07-14T11:08:17.571722Z","title":"Understanding (un) reliability of steering vectors in language models.arXiv preprint arXiv:2505.22637,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10517","last_updated":"2026-07-12T00:36:46Z","snapshot_observed_at":"2026-08-04T04:06:03.775953Z","submitted_at":"2026-07-12T00:36:46Z","title":"Conditional Optimal Bridge for Riemannian Activation Steering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T11:08:17.571722Z"},"links":{"cited_paper":"/paper/2505.22637","citing_paper":"/paper/2607.10517"},"observation_digest":"sha256:683f741d3841fe6e3969db238554b6c47ca45a84ba936925faaf0d037a2064d2","observation_id":"ab15ab25-369b-452d-91c7-3fb5f45bc50c","resolution":{"observed_at":"2026-07-14T11:08:17.571722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22637/citation-record","integrity":"/paper/2505.22637/integrity","json":"/paper/2505.22637/citation-record.json","paper":"/paper/2505.22637"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:03.289827Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.289827Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:e07d40c75079afd66c9eed687db4854c5a17dd6acd539b5192af7dcf0d0a8676","observation_id":"bd450999-42e0-4f54-877d-862e670f8720","resolution":{"observed_at":"2026-08-07T13:10:03.289827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-07T13:10:03.419878Z","title":"Refusal in language models is mediated by a single direction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.419878Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:a38ffe863de56a78b4a39d13bb28b145634263ae7410b0a485f020ef71796e7e","observation_id":"b12abee5-3591-465f-a777-29e583a26be2","resolution":{"observed_at":"2026-08-07T13:10:03.419878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:03.548101Z","title":"Cats: Customizable abstractive topic-based summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.548101Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:d9576ff6f028d1ed2855fcfe5c6dedc7e32a7496417169f8e4671cb3b6c8d438","observation_id":"4955598a-7f3d-400c-ae32-003701625648","resolution":{"observed_at":"2026-08-07T13:10:03.548101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:03.715918Z","title":"NEWTS : A corpus for news topic-focused summarization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.715918Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:e7a959e1896f555ad4e03b6cbc50476aef773d313088bf120637886b1b5b98db","observation_id":"6d857f70-6587-4148-a88f-847eab514349","resolution":{"observed_at":"2026-08-07T13:10:03.715918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06724","last_updated":"2023-11-12T03:51:38Z","snapshot_observed_at":"2026-07-06T16:46:10.142093Z","submitted_at":"2023-11-12T03:51:38Z","title":"Controllable Topic-Focused Abstractive Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06724","snapshot_observed_at":"2026-08-07T13:10:03.927972Z","title":"Controllable topic-focused abstractive summarization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:03.927972Z"},"links":{"cited_paper":"/paper/2311.06724","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:e69f25755b0d68ed977d78c8d8ea2c3cf6e44ddd9454740ec5306a7b321a1d2b","observation_id":"8ae392d8-655e-4c49-a154-3e3524d501bf","resolution":{"observed_at":"2026-08-07T13:10:03.927972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.392","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Text simplification via adaptive teaching","venue":null,"work_id":"703f1aa1-fb49-4c54-a5be-b742917ee57d","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.074437Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:df17f9f1658edb2a3bb09e245a5800337b635895eecf52b68fa96d71c5c48365","observation_id":"7062c719-3fd9-49f0-ac2d-cf6212c10207","resolution":{"observed_at":"2026-08-07T13:10:09.638480Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.552","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"SIMSUM : Document-level text simplification via simultaneous summarization","venue":null,"work_id":"3c612327-657b-47fd-a3ff-fa1fe82e3969","year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.258231Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:19fdee5f8f61e6b4f1cdcfd12fadd5deab6615b0116f2ef83cad2db8c2806a55","observation_id":"e5da340c-198b-477c-b853-a1b095413748","resolution":{"observed_at":"2026-08-07T13:10:09.260944Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.150362Z","title":"A sober look at steering vectors for llms","venue":null,"work_id":"b0b8b4a7-3a1b-4ad8-9d7e-6b119340a6a2","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.453529Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:a51640552a765ec8cffef10708571f346d38e04a5e38cdb5357110ae545e86a5","observation_id":"2a3eaa2a-7361-4b48-a088-8e8edad3ab5a","resolution":{"observed_at":"2026-08-07T13:10:12.329122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07213","last_updated":"2024-11-11T18:36:17Z","snapshot_observed_at":"2026-08-11T14:10:22.816881Z","submitted_at":"2024-11-11T18:36:17Z","title":"Comparing Bottom-Up and Top-Down Steering Approaches on In-Context Learning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07213","snapshot_observed_at":"2026-08-07T13:10:04.575056Z","title":"Comparing bottom-up and top-down steering approaches on in-context learning tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.575056Z"},"links":{"cited_paper":"/paper/2411.07213","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:df0ae31330cb560c5f2d728ee94cdb8b34506f6ac7a2e446df217d2d73b70286","observation_id":"7110b613-adc6-48fa-a5cd-ec86b0bfb4b0","resolution":{"observed_at":"2026-08-07T13:10:04.575056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00045","last_updated":"2024-07-29T18:19:35Z","snapshot_observed_at":"2026-08-07T01:32:56.141077Z","submitted_at":"2024-05-28T05:10:40Z","title":"Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00045","snapshot_observed_at":"2026-08-07T13:10:04.717862Z","title":"Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.717862Z"},"links":{"cited_paper":"/paper/2406.00045","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:617d06c32adff5b1ca398523a5561f2c6ae8191669d985acbdab01e606ade605","observation_id":"30fa9f24-32c4-46c4-b4aa-88e21828886b","resolution":{"observed_at":"2026-08-07T13:10:04.717862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:04.898405Z","title":"In-context learning creates task vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.898405Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:b3277ea8a69e2cdb7d373f5725247f38e1c0e12514fb3e71ee848be56ffdc01a","observation_id":"3701d840-1f93-448f-a62d-ef5ace6f7da4","resolution":{"observed_at":"2026-08-07T13:10:04.898405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:04.974038Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:04.974038Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:ca2f07e3688799f57c3a13f2fc239e205e38e0eefa326c92d3de1826f5471adc","observation_id":"11affa31-d0f5-42b0-847d-02f596676574","resolution":{"observed_at":"2026-08-07T13:10:04.974038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:11.801266Z","title":"Style Vectors for Steering Generative Large Language Models","venue":null,"work_id":"b87764b3-177f-47f5-b033-b23764dd10b8","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.093975Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:664de293c35991b279c0b56d523ebffd02dc2035262617cebf27ba0b5e13fa4b","observation_id":"87fc6599-bc67-431b-ba03-3660781afacb","resolution":{"observed_at":"2026-08-07T13:10:11.949019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:11.512303Z","title":"Steering clear: A systematic study of activation steering in a toy setup","venue":null,"work_id":"0433d6c5-bed1-480a-96b9-eafbfbf9fa7b","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.218312Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:7724576ec0dc9e0d48bfe12d1f8328e97ae6442b67fc97cc1b73f9e9aef2721a","observation_id":"514b7c2d-d754-4bc9-8e5e-7bd005f009f9","resolution":{"observed_at":"2026-08-07T13:10:11.664519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:05.387255Z","title":"Inference-time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.387255Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:7e058051d8cd3e0ce374b1a1687e05e1d37369c778c29f429741a5e84e84f90c","observation_id":"7da431f6-36ab-49cf-a44e-f9ce9e74cf2a","resolution":{"observed_at":"2026-08-07T13:10:05.387255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-07T13:10:05.520729Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.520729Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:a20df9170a154a24d0cf7f6d98dd3963740d5b223189ce75182da212d6ebafb4","observation_id":"49a3bbf8-7c4b-4cd6-bbe5-b215a7fb408f","resolution":{"observed_at":"2026-08-07T13:10:05.520729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:11.154250Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":"7efb5d14-198f-465d-af3e-ee94db168cac","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.648088Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:e24da7f2c3e5e13b4026dc1548323cd56e410516cdaac474caee80f342c3471d","observation_id":"58eb0b15-9f5f-4252-a074-fa17f2772e13","resolution":{"observed_at":"2026-08-07T13:10:11.347820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09003","last_updated":"2025-01-28T03:59:40Z","snapshot_observed_at":"2026-08-05T22:07:10.175145Z","submitted_at":"2024-11-13T20:12:55Z","title":"Refusal in LLMs is an Affine Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09003","snapshot_observed_at":"2026-08-07T13:10:05.846705Z","title":"Refusal in llms is an affine function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:05.846705Z"},"links":{"cited_paper":"/paper/2411.09003","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:158249cbb20467feccdd3d28b4a52aa4cfad1c4f6faddb8ce02c7e3dfea65665","observation_id":"0bc45b64-edcd-4965-a435-cc549a2067eb","resolution":{"observed_at":"2026-08-07T13:10:05.846705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17245","last_updated":"2024-10-22T17:59:39Z","snapshot_observed_at":"2026-07-06T19:38:00.663759Z","submitted_at":"2024-10-22T17:59:39Z","title":"Towards Reliable Evaluation of Behavior Steering Interventions in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17245","snapshot_observed_at":"2026-08-07T13:10:06.057729Z","title":"Towards reliable evaluation of behavior steering interventions in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.057729Z"},"links":{"cited_paper":"/paper/2410.17245","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:edc771e14f49a50b6e0bc477db0c6c13ca3061196377209f7bd07db8b34926e9","observation_id":"89d8d63f-d64f-4a5e-93a8-1b2ced9f909a","resolution":{"observed_at":"2026-08-07T13:10:06.057729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.173597Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.173597Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:d4dcaa28474100eb3d3783a35e5501b5bd5e423da7a7e7935a2d1dd5ee34b8fb","observation_id":"116acc5e-5900-466e-bca0-86616e6a68de","resolution":{"observed_at":"2026-08-07T13:10:06.173597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.293291Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations, Toronto, Canada, July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.293291Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:27c8dbca1a182ab50bd0a23cd017b9353206f95c7a72cc82405e56cd01a2608a","observation_id":"dad2db02-e247-492c-b995-e6a20608a38d","resolution":{"observed_at":"2026-08-07T13:10:06.293291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:10.780685Z","title":"Representation surgery: Theory and practice of affine steering","venue":null,"work_id":"8cc5bff3-bdc0-43ff-8dc1-b620153e6196","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.461530Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:5b91258eb52af8d8628b9166ef7708b389e494415dbb3dbb4b3d570f1e3510b5","observation_id":"83e09f5f-6664-46c3-bb9c-07f5ade319fd","resolution":{"observed_at":"2026-08-07T13:10:10.985849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:10.460457Z","title":null,"venue":null,"work_id":"98d23739-0307-456b-b695-44e4ff3824b2","year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.605117Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:3b8f1be6a6f8d78964d9f1e1b73c24997acd7963377602dc2e80b9138fbe1803","observation_id":"e234c100-7387-4af3-943b-c7b0bbf7c2df","resolution":{"observed_at":"2026-08-07T13:10:10.614343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.744243Z","title":"Extracting Latent Steering Vectors from Pretrained Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.744243Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:e952c4210d894c1eb2873524f13cd186c26375e356f7bc1d2b532a98fb3935d3","observation_id":"df5ab5eb-3fdb-4ef0-95a3-796919775ffb","resolution":{"observed_at":"2026-08-07T13:10:06.744243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:06.928187Z","title":"Analysing the generalisation and reliability of steering vectors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:06.928187Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:efe31582fda24e68c61d74d17aa8a69c922f845d98aa211c791bf9079be5fc77","observation_id":"e27cad75-e919-4e0a-968b-829da0f359a5","resolution":{"observed_at":"2026-08-07T13:10:06.928187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-08-08T01:44:57.952179Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-07T13:10:07.072130Z","title":"Linear representations of sentiment in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.072130Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:82274aff26ff0fb2c570b4ec8c938dcb08a1fbbac76544c8c1d0b8ae98618148","observation_id":"012e9b4e-7a8b-4feb-b47d-7865abd582f6","resolution":{"observed_at":"2026-08-07T13:10:07.072130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:07.202080Z","title":"Hollinsworth, Atticus Geiger, and Neel Nanda","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.202080Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:e6ada3c21a90dd394f8461795fb4a91a07ba6049719b7de2a96121e58b0dda7b","observation_id":"0b1763f6-acb5-41dc-871c-d36007e80b69","resolution":{"observed_at":"2026-08-07T13:10:07.202080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-08T01:23:24.701475Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-07T13:10:07.335261Z","title":"Function vectors in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.335261Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:38126b060cbff6305d9f87fc137b54311c9922b732ebff8f5f574138dff5b23f","observation_id":"96dbf721-bcbc-4538-8d96-a39327a76187","resolution":{"observed_at":"2026-08-07T13:10:07.335261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:07.486495Z","title":"Function vectors in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.486495Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:633d551ed7d30c9814fbe84a8eea626e1cab6b00a0c1234ac93c08ecce9a4bd9","observation_id":"1608ff49-3205-4878-9d8d-633a7ba8e9d4","resolution":{"observed_at":"2026-08-07T13:10:07.486495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:10:07.663220Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.663220Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:17b72b004b46b2a66c502f77bcc176f83a21a31c2f50c829460fe1996ee5a057","observation_id":"71d1e75e-8ae7-4697-9eaf-bf08c20d67c3","resolution":{"observed_at":"2026-08-07T13:10:07.663220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:10.296609Z","title":"Activation addition: Steering language models without optimization","venue":null,"work_id":"68d31813-dff7-469f-a9a1-83370bf7a2ab","year":2023},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.830192Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:7df159b709e07ccd37ecbfbf1f96e1ee9947aea84e27b03bc08706867b4446a0","observation_id":"f0ddce0c-bb20-4bec-a1c4-608a2c6799e3","resolution":{"observed_at":"2026-08-07T13:10:10.366568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:07.935345Z","title":"Controllable text summarization: Unraveling challenges, approaches, and prospects - a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:07.935345Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:cd8ce6ff9f017c74ee4afa4e99c1ac9c199ff9a39afc87cf64a3d0a634e5190b","observation_id":"b11d6994-d56f-4cb9-ba92-94582b225ee5","resolution":{"observed_at":"2026-08-07T13:10:07.935345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.060573Z","title":"A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.060573Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:7af9c42a35cf30d9477b6f462fa66cc32857cfa3e5f17c4bdc87d4da964ba8cc","observation_id":"e52a79ce-8217-4802-8fe8-e87911df09bb","resolution":{"observed_at":"2026-08-07T13:10:08.060573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-07T13:10:08.399853Z","title":"Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.399853Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:bbeb0dc97167d7945f0c4b80fb9517359eb8f07b97790faa585f35ee5a89890a","observation_id":"30e6f97d-3aac-4854-8e10-5df3e4d72504","resolution":{"observed_at":"2026-08-07T13:10:08.399853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.563640Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.563640Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:1648dbbcbf784c32cebce53e26135ac1f3e8ee496f313a4857493cf58f20d7f1","observation_id":"8b8eca33-f2ad-4632-8d6c-55f6e08636e5","resolution":{"observed_at":"2026-08-07T13:10:08.563640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.737088Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.737088Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:25cef18df21561f1e7fc6555619ff7892dfe7df11055c38ef958cda6b73c3af6","observation_id":"400ebaa9-c888-45ae-ae67-5b09f2f630c2","resolution":{"observed_at":"2026-08-07T13:10:08.737088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:08.895546Z","title":"3!( 4˜ \"3!( 4˒","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:08.895546Z"},"links":{"citing_paper":"/paper/2505.22637"},"observation_digest":"sha256:1ac1791807712d3442867a2947f9454739eca1e8ae5781ecca3eacdd0b6236ec","observation_id":"d56fbc92-ed8d-4e88-b60b-b678e757acee","resolution":{"observed_at":"2026-08-07T13:10:08.895546Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22637","last_updated":"2025-05-28T17:53:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T02:05:47.814472Z","submitted_at":"2025-05-28T17:53:31Z","title":"Understanding (Un)Reliability of Steering Vectors in Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 10 inbound Pith citation observations for arXiv:2505.22637."}