{"as_of":"2026-08-10T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3c901d89af095bd382dc3ff94c2c8cd561e969a2f4237f011e32517a7cd9e6a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:57:44.976131Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T16:03:12.728352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:29:39.399032Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:1ce5c5f64c66bd95a40de5019efcc772e28499646ef4ab33e6997c11beec1cc2","observation_id":"5dffa089-944e-407c-9c27-475a836514af","resolution":{"observed_at":"2026-05-10T06:06:19.523835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:10.263663Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:47ada735f920427919886a76cf681bda7193600f41ca899f7d609055a8e43281","observation_id":"27eaeb93-936b-4df8-99e9-37edfaa29333","resolution":{"observed_at":"2026-05-13T01:57:06.385931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:06.989077Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:a4c124cee9bcebf24d989e6c909ce97e19babc228da2d736337ffbc3070650f2","observation_id":"155ce5e3-1110-4b05-9f61-83d5fcff2aee","resolution":{"observed_at":"2026-05-14T21:12:58.856739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2605.24154","last_updated":"2026-05-22T19:22:17Z","snapshot_observed_at":"2026-07-06T23:34:13.859813Z","submitted_at":"2026-05-22T19:22:17Z","title":"Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T16:03:12.728352Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2605.24154"},"observation_digest":"sha256:2c6f847e1f3af7d0375417ec4b5e6c80fc1d3db2b1182c8c5ce4cb5cb26c0e96","observation_id":"a1ba78f2-a143-49b2-b127-53827db5d500","resolution":{"observed_at":"2026-06-30T16:04:52.603163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2606.07335","last_updated":"2026-06-05T14:49:26Z","snapshot_observed_at":"2026-07-06T23:47:00.425715Z","submitted_at":"2026-06-05T14:49:26Z","title":"Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:48.561400Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2606.07335"},"observation_digest":"sha256:2e1f1679f50f3c3e69001d6926a457b8fb7a9599fead449ec3007b1b2b9e61cb","observation_id":"04bef1af-3585-4424-8c72-813677dafedb","resolution":{"observed_at":"2026-07-02T17:37:14.873093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2606.21147","last_updated":"2026-06-19T06:37:32Z","snapshot_observed_at":"2026-07-06T23:56:12.374739Z","submitted_at":"2026-06-19T06:37:32Z","title":"AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T13:22:12.541923Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2606.21147"},"observation_digest":"sha256:50ece0b369b57a7b369c19e1d904901feaf6486b0b8ff70439993727851656f9","observation_id":"7a11ef31-8b4d-48ac-a05c-09782b7accf7","resolution":{"observed_at":"2026-07-04T07:29:39.400611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04250/citation-record","integrity":"/paper/2507.04250/integrity","json":"/paper/2507.04250/citation-record.json","paper":"/paper/2507.04250"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-07-06T19:08:48.648862Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-06T19:57:43.379859Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.379859Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:c28231296bc50bda029043e9c284280d4ea33c02bc9a697dc42741f9108c6fb7","observation_id":"8d3d4fb5-83c3-42de-a7a6-611ceb89fe6f","resolution":{"observed_at":"2026-08-06T19:57:43.379859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-06T19:57:43.420384Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.420384Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:305a2ac9c298d09bd96eec88a309fe6e6836e74ad763a66c721cfda9f122afba","observation_id":"ad634ece-212a-4348-a4c2-84b347ce5ad0","resolution":{"observed_at":"2026-08-06T19:57:43.420384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:46.230321Z","title":null,"venue":null,"work_id":"980be427-d00c-4124-b1ed-3549a4306e99","year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.505443Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:eb0c45c514e8fd6e7a7eed980722f215e01fc357353c86a5d3584cff5dbd517b","observation_id":"01d7e062-d6e8-4049-bd09-02442604577d","resolution":{"observed_at":"2026-08-06T19:57:46.335341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11491","last_updated":"2024-12-17T13:32:36Z","snapshot_observed_at":"2026-08-10T01:18:58.918234Z","submitted_at":"2024-08-21T10:01:34Z","title":"SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering","version":2},"cited_work":{"arxiv_id":"2408.11491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11491","snapshot_observed_at":"2026-08-06T19:57:45.383088Z","title":"SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering","venue":"cs.AI","work_id":"d6b62303-b70c-425d-b2b1-4ba9b62b1c99","year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.549520Z"},"links":{"cited_paper":"/paper/2408.11491","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:e5141cddf3d115940d2fb8e8f8c957b2063ed7565984cffc30b5cdae5d050b08","observation_id":"6363d2f3-5563-4c94-9ffc-1ed0b9af19d9","resolution":{"observed_at":"2026-08-06T19:57:45.412418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-06T19:57:43.629886Z","title":"Or-bench: An over-refusal benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.629886Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:5972be856408471ba4e9d3f692ebed2018954cea0d2878a77cdd1d5c6732e48d","observation_id":"245fc8a6-5db8-4ccb-8ce6-e13192ca047c","resolution":{"observed_at":"2026-08-06T19:57:43.629886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T19:57:43.694438Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.694438Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:d8dbfa03167a089b4d11bbae18f9456ace1672030bcd94ad7df216f5b4f1c3fc","observation_id":"7c88bbe9-127b-40f4-9ca0-8bab13ac7b53","resolution":{"observed_at":"2026-08-06T19:57:43.694438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-06T19:57:43.738959Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.738959Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:1a9d05a0e5c144ba17aec7b6102bf14aaaefe78f13a7b3b37861a2d63b8771e0","observation_id":"63cb46a6-5c23-4a45-ad36-46c5ebbd73f1","resolution":{"observed_at":"2026-08-06T19:57:43.738959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-08-06T19:57:43.796231Z","title":"Trustllm: Trustworthiness in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.796231Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:167d5595d5755c7c8ee6c96c65a65a452c6a7dba0dd7d0802929ddc377070105","observation_id":"3159a8a9-bde1-48bc-8dda-7e11eb0f4802","resolution":{"observed_at":"2026-08-06T19:57:43.796231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T19:57:43.829835Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.829835Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:ea082a4d1656d98fd604ffce5241238091fe6d4293605105a8cb03360c005d1a","observation_id":"7af4eff9-96b4-41c6-a3f4-5c45c0eb443d","resolution":{"observed_at":"2026-08-06T19:57:43.829835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:46.072756Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"ba4f8eb2-0a0c-490c-bd85-0cd755038f54","year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.856574Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:7954fbc60cbf38b450c953e3b0ab6fa42db2102e0e1c49fc6f3f452193c99776","observation_id":"34744acc-9d3e-467f-8461-8daf47ba30b2","resolution":{"observed_at":"2026-08-06T19:57:46.158196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:43.914249Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.914249Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:3425f15f5b3a814d7770efc2671441c5f7ac76b4ae2291ef1037635943978c9d","observation_id":"c5e47030-9380-439f-a9cc-566b8510edc1","resolution":{"observed_at":"2026-08-06T19:57:43.914249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17003","last_updated":"2025-04-07T07:23:33Z","snapshot_observed_at":"2026-08-07T07:23:22.071348Z","submitted_at":"2024-08-30T04:35:59Z","title":"Safety Layers in Aligned Large Language Models: The Key to LLM Security","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17003","snapshot_observed_at":"2026-08-06T19:57:43.958573Z","title":"Safety layers in aligned large language models: The key to llm security","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.958573Z"},"links":{"cited_paper":"/paper/2408.17003","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:9c59ee546af242533687a1c177e570445dfc4f4d9699254a422ab7f58f48731c","observation_id":"7cc02672-ba13-4cb4-8174-ab22e8cf3187","resolution":{"observed_at":"2026-08-06T19:57:43.958573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-06T19:57:43.979623Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.979623Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:79d34a9cd86c129b9d49edf52ec7be486db9798048014e9e3e830416cdc2eef9","observation_id":"d8f4e40e-329a-4c5d-aa15-0a3e987f0f32","resolution":{"observed_at":"2026-08-06T19:57:43.979623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T19:57:44.013076Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.013076Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:6b84961bb81787f7f255b6ecb647a0dc32f7560eab82d9b7176c00bf92ce755f","observation_id":"6f78b735-0c61-4eb6-91af-9259c8a13a8a","resolution":{"observed_at":"2026-08-06T19:57:44.013076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.069618Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.069618Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:ae7626da1f139d7ce9ad37ded226394e4bbf6c83e546a55c11ed0a9bc2ad1e07","observation_id":"d719852f-f4d1-4777-b158-d313ce2019ae","resolution":{"observed_at":"2026-08-06T19:57:44.069618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:45.931139Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!, 2023","venue":null,"work_id":"58a1a3bd-e7cd-4a27-b7d4-bae57356bee5","year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.107947Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:dd00e837f6ef008e797d76775e31a7a7ef31135c627b55b71d363b92b6a1e63d","observation_id":"d2b9753c-600a-4924-b2f5-462fc90e12d9","resolution":{"observed_at":"2026-08-06T19:57:45.977389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05418","last_updated":"2024-08-29T14:50:10Z","snapshot_observed_at":"2026-08-08T01:27:18.632422Z","submitted_at":"2024-05-08T20:39:54Z","title":"Mitigating Exaggerated Safety in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05418","snapshot_observed_at":"2026-08-06T19:57:44.141968Z","title":"and Bhalani, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.141968Z"},"links":{"cited_paper":"/paper/2405.05418","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:0751b23c053b5663ad87904270a4f24b22beba4ea93955365c975f10058b9a2e","observation_id":"3a62f8b4-c2ec-41f9-992b-39d757f069fd","resolution":{"observed_at":"2026-08-06T19:57:44.141968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-06T19:57:44.190147Z","title":"R., Vidgen, B., Attanasio, G., Bianchi, F., and Hovy, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.190147Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:7bd0e5f0000548a2c02ae009fcc1770e7dccbf367c0950e58b2d905702198292","observation_id":"ced8ca4f-2b94-4e70-9c0a-ba241d4ad76d","resolution":{"observed_at":"2026-08-06T19:57:44.190147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.251439Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.251439Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:fc90d72802b4f3691bc90b41f8b18977610747124c9ded0ce1446bee9165f827","observation_id":"c75906bb-a888-4fc8-8a57-a2d0f659bbe1","resolution":{"observed_at":"2026-08-06T19:57:44.251439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17633","last_updated":"2024-01-31T07:26:47Z","snapshot_observed_at":"2026-08-05T14:33:09.669272Z","submitted_at":"2024-01-31T07:26:47Z","title":"Navigating the OverKill in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17633","snapshot_observed_at":"2026-08-06T19:57:44.284799Z","title":"Navigating the overkill in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.284799Z"},"links":{"cited_paper":"/paper/2401.17633","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:eb19fcc679c9ec2cf8a71b996db086f9a1b29b8df497b004665cbded55fa0ef6","observation_id":"b9e105cc-1196-42d2-a5d7-6a6921395e5f","resolution":{"observed_at":"2026-08-06T19:57:44.284799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T19:57:44.329662Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.329662Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:d29664766e4ce4b1483aa33defb08be5dcc96da38987b77cd46839801357a6f3","observation_id":"0d864902-e309-40c2-9228-8090fcdddf14","resolution":{"observed_at":"2026-08-06T19:57:44.329662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:57:44.388456Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.388456Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:d21edb0cc10327d799d0afd77cef7d1bf0790f197918db124f0ce17339fe0c9b","observation_id":"9f41f133-8e1b-42a4-96e3-fe5307c65c16","resolution":{"observed_at":"2026-08-06T19:57:44.388456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:45.720618Z","title":"and Hinton, G","venue":null,"work_id":"9ef4ed3d-897c-47fd-83b7-5d9fdb1a5c8d","year":2008},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.415871Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:1aa3a6662c9382759e008b45c683deec4ae2190f5b7c863a350db3f33315792c","observation_id":"113f4a0c-e4e9-4fc3-8c43-9b0ccdfa1a4f","resolution":{"observed_at":"2026-08-06T19:57:45.827219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03415","last_updated":"2025-03-03T23:46:14Z","snapshot_observed_at":"2026-08-04T03:49:36.273488Z","submitted_at":"2024-10-04T13:25:32Z","title":"Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03415","snapshot_observed_at":"2026-08-06T19:57:44.461260Z","title":"Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.461260Z"},"links":{"cited_paper":"/paper/2410.03415","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:efb03d9438a0ac8f314be5a975b96fcd8ad5ce5b781ef3e2f4e675a84ee2bf36","observation_id":"003f4759-e069-41a3-b2a5-b6a1e2628d3f","resolution":{"observed_at":"2026-08-06T19:57:44.461260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03592","last_updated":"2024-05-22T17:52:31Z","snapshot_observed_at":"2026-08-10T07:33:08.587475Z","submitted_at":"2024-04-04T17:00:37Z","title":"ReFT: Representation Finetuning for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03592","snapshot_observed_at":"2026-08-06T19:57:44.494978Z","title":"D., and Potts, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.494978Z"},"links":{"cited_paper":"/paper/2404.03592","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:515dde7a0a74973f87f15abe56fb607c87691311b4796a2f4da29aa9ffe9e9a2","observation_id":"a418dee3-7334-447b-b896-45a9f0069e5e","resolution":{"observed_at":"2026-08-06T19:57:44.494978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-06T19:57:44.540195Z","title":"Y., and Poovendran, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.540195Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:729e517e8e8c76e0eed4733ce9fc041047c9bccf65bf7569b7f1f3fa9ccb23c0","observation_id":"6063ade9-b576-467b-acb4-3cb2196d7f7e","resolution":{"observed_at":"2026-08-06T19:57:44.540195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01563","last_updated":"2024-10-31T02:04:53Z","snapshot_observed_at":"2026-08-02T15:06:52.727609Z","submitted_at":"2024-06-03T17:45:41Z","title":"LoFiT: Localized Fine-tuning on LLM Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01563","snapshot_observed_at":"2026-08-06T19:57:44.575405Z","title":"Lofit: Localized fine-tuning on llm representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.575405Z"},"links":{"cited_paper":"/paper/2406.01563","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:a32f53355c7be82a1d41186e5ea0848e21ee1ec2726d8de66b1c0e8291a37359","observation_id":"59991026-be87-47d5-9ec8-ebff5c8296be","resolution":{"observed_at":"2026-08-06T19:57:44.575405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:45.571826Z","title":"Scope: Scalable and adaptive evaluation of misguided safety refusal in llms","venue":null,"work_id":"fbc4d08b-a704-4793-b181-ee44a41d8d95","year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.646800Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:6cc8c62cea6c5a5f0fd32280665aa820ad6de5ae7a3a6ecd62d95c1b5865e9b6","observation_id":"2da464bd-d208-4966-a920-d39ebb5d9d92","resolution":{"observed_at":"2026-08-06T19:57:45.642516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13820","last_updated":"2024-12-17T02:35:30Z","snapshot_observed_at":"2026-07-06T18:18:03.254618Z","submitted_at":"2024-05-22T16:51:07Z","title":"Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13820","snapshot_observed_at":"2026-08-06T19:57:44.683011Z","title":"Towards comprehensive and efficient post safety alignment of large language models via safety patching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.683011Z"},"links":{"cited_paper":"/paper/2405.13820","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:2fb8937e7171150fe2c0746bf30b14a9780dc83371c6853182734fd95e65e7a6","observation_id":"53efe874-0171-43da-9d23-0d106ff907c2","resolution":{"observed_at":"2026-08-06T19:57:44.683011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-08-09T19:38:39.757845Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T19:57:44.717885Z","title":"Prompt-driven llm safeguarding via directed representation optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.717885Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:ddb900b14d46702b5d2af63ac14bcc3c0a057ce38f92c867fc26dab43273b42b","observation_id":"36cde0a9-52cb-47df-8885-9a0c480d83cd","resolution":{"observed_at":"2026-08-06T19:57:44.717885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.785662Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.785662Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:d6b2d8c54b94dbdceedc69141975dde62e3cb690a8b5a5e37194461be6ff024b","observation_id":"656ec8c5-a639-4a8d-8595-528d21bac811","resolution":{"observed_at":"2026-08-06T19:57:44.785662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-06T19:57:44.836509Z","title":"Representation engineering: A top-down approach to ai transparency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.836509Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:3935f5ba59ddb88e39324f18b06f0f05f896e51bc8e3d4f505fedb1de46c5bb1","observation_id":"5fe881a2-87c0-421d-929c-8c8ad971607a","resolution":{"observed_at":"2026-08-06T19:57:44.836509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:57:44.883812Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.883812Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:c08c4bfdf0528c57d9fe30a535811a17504a3d83f8f1c0b7b76a632f66c76b0e","observation_id":"af12dd0b-7f73-46b2-b5eb-5f4f0ab62693","resolution":{"observed_at":"2026-08-06T19:57:44.883812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.976131Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.976131Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:790aebb9be255999a83de9870f9ed56142de971ff13b6cb053b76383ed03fc4e","observation_id":"e505e4b7-5dbd-4cf7-9021-f49fb8640126","resolution":{"observed_at":"2026-08-06T19:57:44.976131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 6 inbound Pith citation observations for arXiv:2507.04250."}