If-guide: Influence function- guided detoxification of llms.arXiv preprint arXiv:2506.01790,

Zachary Coalson, Juhan Bae, Nicholas Carlini, Sanghyun Hong · arXiv 2506.01790

2 Pith papers cite this work. Polarity classification is still indexing.

2 Pith papers citing it

representative citing papers

DRIFT: Refining Instruction Data via On-Policy Data Attribution

cs.LG · 2026-06-16 · unverdicted · novelty 6.0

DRIFT applies on-policy influence functions with signed weighting and debiasing to attribute and refine SFT data, raising performance on 7B instruction and reasoning models over prior curation methods.

PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning

cs.LG · 2026-05-20 · unverdicted · novelty 6.0

PRISM weights target examples by model preference to build an improved direction for influence-based data selection in LLM fine-tuning.

citing papers explorer

Showing 2 of 2 citing papers.

DRIFT: Refining Instruction Data via On-Policy Data Attribution cs.LG · 2026-06-16 · unverdicted · none · ref 3
DRIFT applies on-policy influence functions with signed weighting and debiasing to attribute and refine SFT data, raising performance on 7B instruction and reasoning models over prior curation methods.
PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning cs.LG · 2026-05-20 · unverdicted · none · ref 10
PRISM weights target examples by model preference to build an improved direction for influence-based data selection in LLM fine-tuning.

If-guide: Influence function- guided detoxification of llms.arXiv preprint arXiv:2506.01790,

fields

years

verdicts

representative citing papers

citing papers explorer