Pith. sign in

Paper Citation Record · LEDGER

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control

As of 9 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2607.10226.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.10226 v1

Coverage vector

measured 14 of 14 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-14T13:23:22.708604Z

measured 14 of 14 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

14 of 14 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cf4ded39-27c8-4b13-ac80-12b0a360004d · outbound

This paper cites Refusal in Language Models Is Mediated by a Single Direction.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Refusal in Language Models Is Mediated by a Single Direction

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:3c6fb8a35a8a706021656333118db64e3b516f81e95b2deba4659577109fea3b

Observation 8ec33f83-6c48-449f-8bf7-0c651fe993d9 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Training Verifiers to Solve Math Word Problems

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:e61bd572dce33c13a5d75e2fd6d114cd32015c5b3132b04f2bc858f64c4e5896

Observation 97537d91-5005-47c6-9585-ee8f53865476 · outbound

This paper cites Sparse Autoencoders Find Highly Interpretable Features in Language Models.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Sparse Autoencoders Find Highly Interpretable Features in Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:7a336f46ed5e609ad7db85e082c64bc2dcdf37b1c537fd2ddd180d048a7d95e2

Observation 538b963b-2a7d-41fe-ac9e-80a08fa3bca6 · outbound

This paper cites The Llama 3 Herd of Models.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control The Llama 3 Herd of Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:d2543dad9cea4a002833b52ff15881d6f53cae6bd8468abc007e430b2a6f6e3a

Observation 794b1101-7735-42a0-a3d8-a53e13c7148a · outbound

This paper cites Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:53734a05e23b72becdf96e83b2ed9aac5c59ed754b87822997d27e27d92e2298

Observation 9854b652-f25d-4651-8f55-1cc62a74f677 · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Gemma 2: Improving Open Language Models at a Practical Size

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:0d4137897b82838f83ba476f8436cac81965334394bff0d248b8300fdd047422

Observation 60b03b10-a014-49a2-907e-824206c2bffa · outbound

This paper cites Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:488f87db92ed54913a6ef3e5469ef8a7e7aeda6c99016e8a0103d3a7f8d2a08a

Observation bd962976-c7e0-4b71-9f83-010c868e279c · outbound

This paper cites Measuring Massive Multitask Language Understanding.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Measuring Massive Multitask Language Understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:186147cac4e0947ed144a4651cb03274a4162ebe12de404f4f4b09c56bed94d8

Observation 2e1d3879-bf63-4e4d-b305-87c584e031db · outbound

This paper cites WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:d241921d400e532b2f812b25d6c2a3e8f90d75124889a2f0d50c821d42674457

Observation 81b2608a-47c8-4ec4-9b14-1a2c108bec51 · outbound

This paper cites Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:3637da5aad29a7461eb1f34e8dd75d2f66af76cde0c9046ee41de976c68ee4ce

Observation f57db782-a748-44c2-89dc-ecb498631e99 · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:87822ea61c85651e131a73fbf990bef9e99aa121ab19c426fc6f198bfb64ba57

Observation cecc21b7-45be-4dc0-8944-977367f56a2b · outbound

This paper cites XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:fd4f3f965f4cec0e53a4b9df44379fe378ca2d0d2efb55f42f2ebe42b03e497d

Observation 69d632b0-843a-4e42-adc5-1abec4b73da1 · outbound

This paper cites Steering Language Models With Activation Engineering.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Steering Language Models With Activation Engineering

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:635726b9a6866cd05a306766bfb697931f9120f0c904a88080a760bc99572135

Observation dba96bb6-5e97-4caf-91c9-d146da754562 · outbound

This paper cites Representation Engineering: A Top-Down Approach to AI Transparency.

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Representation Engineering: A Top-Down Approach to AI Transparency

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-14T13:23:22.708604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T13:23:22.708604Z digest=sha256:d4f15918a98ea26c181beab1162ae496f8a543ad40d8a25da8c6ec725a0d57a1

Pith citing papers

No inbound Pith citation observations are available.