Pith. sign in

Paper Citation Record · LEDGER

Toward Preference-aligned Large Language Models via Residual-based Model Steering

As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2509.23982.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.23982 v2

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T14:43:21.314750Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-25T05:01:31.560963Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-25T05:05:23.125298Z

Reference resolution

50 of 50 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved50
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a7066031-e74f-455a-ac42-96f14ad64a3a · outbound

This paper cites Refusal in language models is mediated by a single direction.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Refusal in language models is mediated by a single direction

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.143999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.143999Z digest=sha256:1e02592b13e2c5955dc93105958b3bf68b430b361961617c27872a69f96948e1

Observation 53860acd-dc0b-4902-8e5d-b863240d7234 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.267212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.267212Z digest=sha256:714555c389893467077eacb4796257713f5310c5b3ca861c96a1ebb06f54cae3

Observation 81c04a43-bacc-4e83-a1c8-54a8cb859a74 · outbound

This paper cites Steering large language model activations in sparse spaces.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering large language model activations in sparse spaces

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.464748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.464748Z digest=sha256:86e6b56bef65b5a3d625f38b99c1266e5b382a448d965358b103e5284a00d0d8

Observation cbc1bf02-1480-43e3-a56e-5845f910b198 · outbound

This paper cites LEACE: perfect linear concept erasure in closed form.

Toward Preference-aligned Large Language Models via Residual-based Model Steering LEACE: perfect linear concept erasure in closed form

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.557998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.557998Z digest=sha256:e7dda71012099a015f6dae1696f9995de7e4040ce362ccab565930daed640d69

Observation 79fb6bcf-b1ae-45ca-9f9d-1bea87fb9b93 · outbound

This paper cites Diff-in-means concept editing is worst-case optimal: Explaining a result by Sam Marks and Max Tegmark , 2023.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Diff-in-means concept editing is worst-case optimal: Explaining a result by Sam Marks and Max Tegmark , 2023

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.644750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.644750Z digest=sha256:34c2306d92c6569c637166610d21656c740d2b1662600927476b03c981d2947c

Observation 93b1b66c-fcb1-4b37-b0a3-e71106b7986c · outbound

This paper cites Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.724861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.724861Z digest=sha256:58afe42530ef67c8236ef8fd9816f787eb506f9b402ac7686b876229165d9541

Observation 7fcab025-31aa-4e6c-9a80-1a423dbc3d41 · outbound

This paper cites Discovering latent knowledge in language models without supervision.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Discovering latent knowledge in language models without supervision

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.824752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.824752Z digest=sha256:0b795a4cf82a90a7f26ff7f23306dd27007e020ff2c392262889efb3e80a88a5

Observation 1e6d257d-25aa-41b1-a6b3-84ef18312515 · outbound

This paper cites Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.974928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.974928Z digest=sha256:992f8ae09bf811d6f6f9171f7890cb3c5c86f80e7265a2fb2074d2d706dfd330

Observation fad29e6a-2439-4a5d-b368-a508aab4ba19 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Evaluating Large Language Models Trained on Code

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.209027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.209027Z digest=sha256:14cfedc881d77a382f08f5f8a80f79bcfeb042bc227dcafbe88bd2d1acf40890

Observation d7d4c956-8082-4345-a93a-7cc84eff10b1 · outbound

This paper cites Parallel structures in pre-training data yield in-context learning.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Parallel structures in pre-training data yield in-context learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.409349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.409349Z digest=sha256:4f0cfc56f6ad690822058cfa345653476cab1bae4aff792ac7da5c06cf730572

Observation 308757df-3df9-4a29-b1f1-ca5d0e7799c5 · outbound

This paper cites Persona Vectors: Monitoring and Controlling Character Traits in Language Models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Persona Vectors: Monitoring and Controlling Character Traits in Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.544748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.544748Z digest=sha256:5eae4719e55b6007420e36e297a65d9199b77f48e1934599d8da23afdc34d8a0

Observation bfc6b6e5-971a-44ac-b6cd-f96a35498b64 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Training Verifiers to Solve Math Word Problems

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.683380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.683380Z digest=sha256:48f40f8e9f2b34bd711861528178c8eeb1eaabddf07990cb4f717c38c731c34d

Observation e4cff832-77cb-417d-897f-6cb8392e6a17 · outbound

This paper cites The Llama 3 Herd of Models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The Llama 3 Herd of Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.887790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.887790Z digest=sha256:b56326d6549b3c9ade08eb02d7a866d80f2535f64515723c6bb168c8128257f0

Observation 4ea6cd76-a948-420e-9a44-749d40a393fe · outbound

This paper cites Toy Models of Superposition.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Toy Models of Superposition

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.064746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.064746Z digest=sha256:98b40479410c374a4f7d115d343b67d31548a43b1fa5751255b1a879256b61ff

Observation 70b8e7d6-bf7a-4837-a42a-f6d4e5999812 · outbound

This paper cites The language model evaluation harness, 2024.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The language model evaluation harness, 2024

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.254757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.254757Z digest=sha256:a64d54ba4a62db7f62572cbac433ae82f52303d5db02941de613df08023948a7

Observation 88198547-a9b0-4c5f-9827-30a2996c8b06 · outbound

This paper cites Measuring massive multitask language understanding.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Measuring massive multitask language understanding

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.434762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.434762Z digest=sha256:812c36c5131c7b30f87d91a457e78da7ac9f3eb70b46761cba49eaf8011445b2

Observation 4a2dbd9f-48c3-434c-8c7f-bb105eef19c9 · outbound

This paper cites The low-dimensional linear geometry of contextualized word representations.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The low-dimensional linear geometry of contextualized word representations

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.594748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.594748Z digest=sha256:ea0b54b4432bfa4bd382968955f0f38d0cc732f3e5eae8f5bcd7bf93c4656a33

Observation ae43ee9f-22be-4d38-ad16-5a6dc0b5b37a · outbound

This paper cites ORPO : Monolithic preference optimization without reference model.

Toward Preference-aligned Large Language Models via Residual-based Model Steering ORPO : Monolithic preference optimization without reference model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.704843Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.704843Z digest=sha256:831e2b5b07fb34ef00161078bdc62f3379b665d134baff2452e9ca878cb982a4

Observation d91f008a-f6fe-461b-8b17-f99be0565563 · outbound

This paper cites Sparse autoencoders find highly interpretable features in language models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Sparse autoencoders find highly interpretable features in language models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.875750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.875750Z digest=sha256:b8a720493dd1219fbd5a5bf51df748c3cdbc9debc8aecba668aba909ced5d411

Observation d828aca1-dacb-47ea-a1b7-aaf22f829161 · outbound

This paper cites Mistral 7B.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Mistral 7B

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.054748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.054748Z digest=sha256:63cdd805ce75575e269f6d9e3abdb867e184927d2fa2e1bd6f9f5d9c6cbe7e08

Observation ebf5bc74-e24a-44e4-90e2-a0a6b39cf570 · outbound

This paper cites LMD 3: Language model data density dependence.

Toward Preference-aligned Large Language Models via Residual-based Model Steering LMD 3: Language model data density dependence

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.184754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.184754Z digest=sha256:265d146ee28fb42a2ba08325469314052af0f99c16c934de3363f3b042deb52c

Observation 79422e0a-7acd-4d2f-b4c3-dbe52f5adca3 · outbound

This paper cites o pf, Yannic Kilcher, Dimitri von R \.

Toward Preference-aligned Large Language Models via Residual-based Model Steering o pf, Yannic Kilcher, Dimitri von R \

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.361603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.361603Z digest=sha256:e8d7ddd2bd92085bdaa3c03cb09238225b3244de5ba6365c4edfac9ad60d3db6

Observation 0702b72c-a1bd-4e7f-8bff-6e7e8eaa4cd0 · outbound

This paper cites Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.444750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.444750Z digest=sha256:c46b562c2ac7b7a069a0bcafd8d44670fc0b7e7ebdb66e622f81323054853773

Observation 1b81097b-bd36-49f7-ac2b-dd113474472b · outbound

This paper cites Li, Maxwell Nye, and Jacob Andreas.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Li, Maxwell Nye, and Jacob Andreas

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.644877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.644877Z digest=sha256:8cde99fa35898de5fd75758940180289838b5f2b6a2d585ac04631153b7fcd66

Observation 144fb43e-21ca-4e76-8233-a559922e3fee · outbound

This paper cites Vi \' e gas, and et al.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Vi \' e gas, and et al

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.774753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.774753Z digest=sha256:bae09f49e9d277ae0d765580e0de3eb2410a4a7123f2eddf7ad660609ceb9c8d

Observation db5ad6e3-b19c-4156-b97f-150516ef1319 · outbound

This paper cites Fundamental capabilities and applications of large language models: A survey.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Fundamental capabilities and applications of large language models: A survey

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.134752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.134752Z digest=sha256:e9703a000deb36c700d9a0dd286d3f12c3650000d2d62c859c6a03ef6d42e1de

Observation c05607f3-0148-471f-8d49-674894a6d486 · outbound

This paper cites T ruthful QA : Measuring how models mimic human falsehoods.

Toward Preference-aligned Large Language Models via Residual-based Model Steering T ruthful QA : Measuring how models mimic human falsehoods

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.315534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.315534Z digest=sha256:06e316a25b78c211d706d24c02f74a78a9a8cf143d408ca6787b8a9432699bc3

Observation fd3602db-1976-4a9d-ab23-b1e2fa136f63 · outbound

This paper cites Aligning large language models with human preferences through representation engineering.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Aligning large language models with human preferences through representation engineering

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.561775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.561775Z digest=sha256:1394d78007ca329f3adaba0e360aa4a10c4ca28fa29983ff649706e2718e0da2

Observation 46232db0-ecbd-4603-b717-3cf494164c19 · outbound

This paper cites SimPO: Simple Preference Optimization with a Reference-Free Reward.

Toward Preference-aligned Large Language Models via Residual-based Model Steering SimPO: Simple Preference Optimization with a Reference-Free Reward

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.795032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.795032Z digest=sha256:6a2c49ede7adefb823d05760ee94727b782e5c8f2b683365ace9ed5739c31b40

Observation f3418d53-1c4a-482d-9a50-0af3de03c489 · outbound

This paper cites Emergent linear representations in world models of self-supervised sequence models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Emergent linear representations in world models of self-supervised sequence models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.994750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.994750Z digest=sha256:6e27403aa30747fdf574368c3d74fc2dbb8edd1fafada6fd89dc6bd671633b9d

Observation c1c33619-4d4f-49d3-a22b-f65c2f731370 · outbound

This paper cites 2 OLMo 2 Furious.

Toward Preference-aligned Large Language Models via Residual-based Model Steering 2 OLMo 2 Furious

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.173482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.173482Z digest=sha256:b648a33cb4680a36a922b678634acca91abcd7bbc4d14ea8514c75b890beac5e

Observation b687dfa6-ada5-4291-89bb-763c0a15ba51 · outbound

This paper cites Training language models to follow instructions with human feedback.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Training language models to follow instructions with human feedback

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.394752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.394752Z digest=sha256:530ecc0b9d98b45f0d90cd5195c67788d551b090d19be1d51a35db2f11b5d202

Observation 35565024-5e6a-4aaa-bf2b-d375c635f2d8 · outbound

This paper cites The linear representation hypothesis and the geometry of large language models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The linear representation hypothesis and the geometry of large language models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.528077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.528077Z digest=sha256:f851bdbfd31beb5a97cca9fde073c15a73307faf214a8c646f6c1009350d0e12

Observation 865360a5-6247-4fe1-ae79-ceba8e5774cc · outbound

This paper cites tinyBenchmarks: evaluating LLMs with fewer examples.

Toward Preference-aligned Large Language Models via Residual-based Model Steering tinyBenchmarks: evaluating LLMs with fewer examples

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.824932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.824932Z digest=sha256:807ae64dbbc0cf0d00d62d18505f712604716207f8e7e242aae5acc6e5f5b508

Observation bf62e150-484b-417a-a4a2-21b94c10a541 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Manning, Stefano Ermon, and Chelsea Finn

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.005111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.005111Z digest=sha256:3354f2d57a87ec8b98d77612f75a0ea50a1a04e2c3341f7173a8647424f1fc03

Observation a5a1b8a8-7a7d-470d-8626-f37f722e63d6 · outbound

This paper cites Steering llama 2 via contrastive activation addition.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering llama 2 via contrastive activation addition

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.294744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.294744Z digest=sha256:af992887d9285331192ac571987e1c9e0da4fec4bda45652731efb97725d03ac

Observation 5810186a-a2da-4be2-87ce-31d1ec6678d3 · outbound

This paper cites Winogrande: An adversarial winograd schema challenge at scale.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Winogrande: An adversarial winograd schema challenge at scale

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.525598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.525598Z digest=sha256:cdc882053fb994440a47df9d3d8d04a995544b41965b25fc38f97b42accbbd9f

Observation 72010ca9-59cd-4097-9f61-d4d4c9ec3fed · outbound

This paper cites Detection and measurement of syntactic templates in generated text.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Detection and measurement of syntactic templates in generated text

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.684758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.684758Z digest=sha256:1dc3a0acc7b8fea4e493fbf3a131fed153d85f26c03b916ebd60d2ca18537436

Observation 4e8b61c0-0c8b-4831-af0b-c82385093b46 · outbound

This paper cites Large Language Model Alignment: A Survey.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Large Language Model Alignment: A Survey

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.824756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.824756Z digest=sha256:99f2ca2e0edd3c8a567750473097d8787d9c40b894a3de714bf16b55a44991fe

Observation d640ac31-b7a3-443d-ab2d-580c908be2ec · outbound

This paper cites A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.924873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.924873Z digest=sha256:82eb3421c1adc27aeba6f557b37c74d44912a3f0581a738d4cc59ae125926c3b

Observation b433cce3-906b-48bf-81fb-7309d8d40feb · outbound

This paper cites Learning to summarize with human feedback.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Learning to summarize with human feedback

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.144752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.144752Z digest=sha256:76f5209e8498e2a6732bd3b76cd94f8bc6f7fcda4ff0dcf11ef0c2855ff04b0b

Observation 09a566d0-9bda-4445-b51a-bb13fa396788 · outbound

This paper cites Hollinsworth, Atticus Geiger, and Neel Nanda.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Hollinsworth, Atticus Geiger, and Neel Nanda

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.393688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.393688Z digest=sha256:11aa0f83864bb543f72ade32ba1362058886e1420129c7ea1a162b2088ca84d1

Observation 821e0b59-0ad4-4bdb-bafc-cdfb2c97d404 · outbound

This paper cites Steering Language Models With Activation Engineering.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering Language Models With Activation Engineering

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.610006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.610006Z digest=sha256:6725f79f808d0934fd95326ba4ae34c3161d1873e5a6830a034a669d4188cd1a

Observation deaaa5d5-8995-4668-994d-06a8fac37e73 · outbound

This paper cites Aligning Large Language Models with Human: A Survey.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Aligning Large Language Models with Human: A Survey

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.875156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.875156Z digest=sha256:7efa9f9968f359d78c3fc0ce55e4c6030117f683c1d3d7cdf4608ba5cdf0bee6

Observation 1ceb96b0-9f8b-430c-9200-967ca2c7e115 · outbound

This paper cites Beyond prompt engineering: Robust behavior control in LLM s via steering target atoms.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Beyond prompt engineering: Robust behavior control in LLM s via steering target atoms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.014570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.014570Z digest=sha256:da8ab1bb534221a33f964c06f8a11a25889a6c7a0fe85d25342c42f084041cf2

Observation ad6bd5f0-081f-4f96-874c-54d299b1e61c · outbound

This paper cites Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.214767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.214767Z digest=sha256:c4c17329e33c7e35768557f01aebd41d7ddb4df6955074e501ed879d979588d7

Observation a9906af5-d761-4b23-b467-e090e82befde · outbound

This paper cites Generalization v.s.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Generalization v.s

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.394762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.394762Z digest=sha256:b581d3967bd04280a42de3710885695596304dd54d6f040e90c61c47bd068112

Observation 3ef2c149-b0eb-4d06-be40-08bda14f1821 · outbound

This paper cites H ella S wag: Can a machine really finish your sentence? In Proc.

Toward Preference-aligned Large Language Models via Residual-based Model Steering H ella S wag: Can a machine really finish your sentence? In Proc

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.764759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.764759Z digest=sha256:12fc746fab50d53f6d48b458364cb1bd18dcf94bde733ecd6c87bdc7c51e9458

Observation 1b5e7c8f-fa56-41d5-a870-6d1aeb4794dd · outbound

This paper cites Towards best practices of activation patching in language models: Metrics and methods.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Towards best practices of activation patching in language models: Metrics and methods

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:21.054749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:21.054749Z digest=sha256:064efb2f5335ac7eef69dc8a65fe17b25278e1e3b16c3def86969faaa0b902dc

Observation 04735ae7-d6cb-4e15-8027-d9165c427c76 · outbound

This paper cites Representation Engineering: A Top-Down Approach to AI Transparency.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Representation Engineering: A Top-Down Approach to AI Transparency

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:21.314750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:21.314750Z digest=sha256:74982b1c368252f7ef65eb952ce797fd2e5b78e612c46b176c6def86f2911c05

Pith citing papers

Observation 2d53874f-e7fb-4f91-81b1-79e2043f9197 · inbound

Convex Optimization for Alignment and Preference Learning on a Single GPU cites this paper.

Convex Optimization for Alignment and Preference Learning on a Single GPU Toward Preference-aligned Large Language Models via Residual-based Model Steering

Reference 89

Resolution
verified exact
arxiv_id, observed 2026-06-11T02:09:25.231208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-25T05:01:31.560963Z digest=sha256:88547dbc177aaeae1f79c94d061a560a4f3375809ce7263ed60231030a7e30f4