Pith. sign in

Paper Citation Record · LEDGER

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

As of 18 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 11 inbound Pith citation observations for arXiv:2506.07468.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.07468 v4

Coverage vector

measured 87 of 87 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:41:58.270264Z

measured 98 of 98 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:37:16.854295Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T20:58:57.626705Z

Reference resolution

87 of 87 outbound references displayed

  • verified exact0
  • verified fuzzy17
  • unresolved70
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7d261ee4-5244-4b40-9872-858655a6dbdf · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.833620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.833620Z digest=sha256:6867ac080682616cd16c5b1f16a3e05b62f048521f6ad93f2985a628265c5cb0

Observation 11699782-5518-422b-a26d-43cb5a3b2d4f · outbound

This paper cites Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.839478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.839478Z digest=sha256:8f97f8086e453c814210ec022e7281b101b31b61233e0c5a8114a12bbacd067a

Observation 276d90cd-b58e-4a68-9377-9ae5c08dc941 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.844270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.844270Z digest=sha256:8d9ece8b8f04f32732ad0d51d65d3079dcf1e9ac9869698cf79658b2e82b0249

Observation cf27c3fe-c28b-4318-809e-1aff70e2ef3d · outbound

This paper cites Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.849623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.849623Z digest=sha256:76a43b58ff03d8477d4c5d5553d174407269462aacc0fd7c5470f154eb27ecdc

Observation 238d1b8e-68dc-460b-a349-73820b167a38 · outbound

This paper cites Explore, establish, exploit: Red teaming language models from scratch, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Explore, establish, exploit: Red teaming language models from scratch, 2023

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.854313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.854313Z digest=sha256:81d7283c7ad224cc35f3d02368ecdd8d55824ab72216ffca6ef5b1f86ce98809

Observation bd4d2d05-6319-4083-a92a-ae9082dbd620 · outbound

This paper cites Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.859038Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.859038Z digest=sha256:1ab187dc84ed9e77ae6af5924260e8438bb349bc175af652365a800ffe052100

Observation e9f41345-bd26-4ffa-ba8e-c90e1c5864d1 · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.864889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.864889Z digest=sha256:aa2da1bcdb356a4e768200cecaf381ef9b563b01c12a7e2fb2d9dda8610a9986

Observation f3a95e10-5b87-43bc-8a9e-6e6fe8e47765 · outbound

This paper cites Self-playing Adversarial Language Game Enhances LLM Reasoning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-playing Adversarial Language Game Enhances LLM Reasoning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.869806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.869806Z digest=sha256:8faaf91b774a99e330a5b9a5cc52544927a326f3dcc39d8bdf4af1cd1403bc81

Observation 736cc6d9-6aba-4426-8e5f-cc9747cf4850 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.874726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.874726Z digest=sha256:2716cca2d84651be44a2bc1dc06a4f4fd86860ca4691de2eb2dc8cc9e1e641c2

Observation ec01d375-b3e0-4d45-9f75-b2c8ae63ffbb · outbound

This paper cites Or-bench: An over-refusal benchmark for large language models, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Or-bench: An over-refusal benchmark for large language models, 2024

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.879647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.879647Z digest=sha256:604203b5fa13a6c667af5bfdeb34ce61931f9712394baa542ade8688f8d78abf

Observation 80d2ced1-f453-47ee-84d7-3cd18e1ccd69 · outbound

This paper cites Safe rlhf: Safe reinforcement learning from human feedback, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safe rlhf: Safe reinforcement learning from human feedback, 2023

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.884214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.884214Z digest=sha256:bdfcf751d5fffb6da77522838e20d87cff848d5d7da5ecac964ebbad32dee2e2

Observation 31038389-1278-4256-9c39-f2b57d92a12a · outbound

This paper cites Safe rlhf: Safe reinforcement learning from human feedback.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safe rlhf: Safe reinforcement learning from human feedback

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.888900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.888900Z digest=sha256:f9e93793cf80dfb2a1adf095d6186d8b2412fb1107d724554065dd87494fd309

Observation 25554758-1d74-4ad9-9ddf-13007b966ef8 · outbound

This paper cites Duoguard: A two-player rl-driven framework for multilingual llm guardrails, 2025.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Duoguard: A two-player rl-driven framework for multilingual llm guardrails, 2025

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.893347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.893347Z digest=sha256:a884500b4188adcd9aa8036ff1410e6d5a2896d4ed083d76bb242e08f40b7b86

Observation 9ff7b10b-9387-4878-8504-4fd80aff043d · outbound

This paper cites Qlora: Efficient finetuning of quantized llms.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Qlora: Efficient finetuning of quantized llms

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.898130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.898130Z digest=sha256:19ce79ea9a971132a86561eb50bdb9e16cfa25514e854db55ccac6f9f6f69695

Observation a5c22db3-0a74-4d65-bb86-117c9fd7719e · outbound

This paper cites RLHF Workflow: From Reward Modeling to Online RLHF.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models RLHF Workflow: From Reward Modeling to Online RLHF

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.903053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.903053Z digest=sha256:de52f203c7dcf89dd7fa2444ef8fc214c51d982c3a33a649641b4be567410ca9

Observation bbe488b0-2f52-4006-8f78-4dd7352411af · outbound

This paper cites Google’s gemini tops apple’s app store, snagging lead spot from chatgpt.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Google’s gemini tops apple’s app store, snagging lead spot from chatgpt

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.582649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.907741Z digest=sha256:d8bf070fccb9beb3b332389a960b6196316a52f179e0d376f200280d155c01df

Observation 7a3b73d6-2d97-483a-91cb-3a0eaf190491 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models KTO: Model Alignment as Prospect Theoretic Optimization

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.912354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.912354Z digest=sha256:33193a4e36bc950a051b04fb77ae762f59c6840dc8fbecc193a396332d28d22b

Observation 001aecab-5aa4-466b-a62a-e2ca9896332f · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.917162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.917162Z digest=sha256:2d9b65530d2f6287effe399da569e6d77eb64d6b8e27178fb1bbed5567d61a23

Observation 7e55409a-7862-43c4-a474-62ce901c1d23 · outbound

This paper cites Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022 b.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022 b

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.568608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.921874Z digest=sha256:6ed9e6f184bd0d4abc995a139c2385564bd921e88570843f4db4d02c8c3aed93

Observation 627da4da-6f88-49d2-a020-11ff4cd4daf7 · outbound

This paper cites The language model evaluation harness, 07 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models The language model evaluation harness, 07 2024

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.927089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.927089Z digest=sha256:06af54dd92cc7f150bcdec52b5ab36580b946008735d69faf0c9b3e39137527f

Observation b5b39e20-9c79-4cd0-a001-af7ac9eb3b26 · outbound

This paper cites OLMES: A Standard for Language Model Evaluations.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models OLMES: A Standard for Language Model Evaluations

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.931539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.931539Z digest=sha256:5d0f510a8586bd7be798c307e93dd3e4f270b51613eb28a5f57d2dbb71819c55

Observation b8bf5e3e-c1d6-42f1-9ee3-0344a4c82260 · outbound

This paper cites Elon musk's ai chatbot, grok, started calling itself 'mechahitler'.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Elon musk's ai chatbot, grok, started calling itself 'mechahitler'

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.553774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.941178Z digest=sha256:b6979eea7930f47bf803040548d60681a90b47e1921a8fde31f5a3510b4f2e17

Observation 612acdc7-9ce5-4332-9223-b0c6a5c688af · outbound

This paper cites WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.945774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.945774Z digest=sha256:487b6f60bdbb85b55933f3ff52a112d496fe4ae841ff3f85b0481140ea0f0f2f

Observation 911dc80a-16f0-44d0-91ff-8f92c15b148e · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Measuring Massive Multitask Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.950270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.950270Z digest=sha256:9cb3f5bb9c82da7a81c6ed5bfe539f8ab61b8985926411268bb54df57d05fae6

Observation 8e9e53ba-eaf1-4794-8499-e0c016149cf6 · outbound

This paper cites Curiosity-driven Red-teaming for Large Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Curiosity-driven Red-teaming for Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.954768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.954768Z digest=sha256:ebf6abb9d1d514bb3a945fde9a02f3e1bba86bab3893aa0f7490db627e5480e0

Observation 8c906f45-c952-4d92-92d0-cca9c9943bc3 · outbound

This paper cites Scaling Trends in Language Model Robustness.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Scaling Trends in Language Model Robustness

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.959395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.959395Z digest=sha256:eac2c57317b4c0e85500542090fa6533479cbfcfd67e77c70af4b13d2b0f60fe

Observation c832e925-7b0f-4213-a087-17c664d4a33e · outbound

This paper cites REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.964115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.964115Z digest=sha256:d7be9e936c18e005dd9800d66be9cd3fc3bd86f18696bfb52b00d1a3b4587b27

Observation 400b3502-a835-44db-b926-b07dbdb40fa6 · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.968902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.968902Z digest=sha256:bbae51dd9d06467b826891131e216188fe1c4c53df96ad655007926a984463a9

Observation 6135fdf7-8acb-41c6-9e3d-450ef74083c6 · outbound

This paper cites Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.973759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.973759Z digest=sha256:e8b1cc72df0c0e35b7ef3605c21a61e0b3a4bb1ab0f2cfbf65a5cf826ea8e6f4

Observation c8c0d244-4ce6-4ab2-9651-e07ad646e999 · outbound

This paper cites Baseline Defenses for Adversarial Attacks Against Aligned Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Baseline Defenses for Adversarial Attacks Against Aligned Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.978623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.978623Z digest=sha256:2c3f6054592276856fcdf4e887597f786a1a8a4d011e94023ad1630504798625

Observation 1d4631da-3dbf-4b81-a8e2-0ebaa6f6f048 · outbound

This paper cites Sequence tutor: Conservative fine-tuning of sequence generation models with kl-control.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Sequence tutor: Conservative fine-tuning of sequence generation models with kl-control

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.529827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.983647Z digest=sha256:e6133913a8fb4711e8d85303a96bf9124268d59ded20758a30715bf3ceb5535c

Observation 3283b948-1bed-4db5-863a-4b3704b0b63e · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.988453Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.988453Z digest=sha256:e31954a84b28085223dadca3aa6c5096eb90e0356df080f8f23011d17137c9cf

Observation 68d765d4-6336-4559-a5e8-5a5249849e36 · outbound

This paper cites Beavertails: Towards improved safety alignment of llm via a human-preference dataset.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Beavertails: Towards improved safety alignment of llm via a human-preference dataset

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.993791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.993791Z digest=sha256:caea548c7760a5aa3ec60a7165b54ed077da724b353d783bbf82d9bd375b37bd

Observation d7939376-e6bb-4e6a-8b88-1260bd1d7db8 · outbound

This paper cites Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.506744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.998312Z digest=sha256:3bd2e82cea5b5bad9dbe19c311422bd7d72ee83a8264bb265841dda357eb1614

Observation ac29a75d-8bcc-4624-9b9f-dc96c0929b45 · outbound

This paper cites Predicting vs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Predicting vs

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.492900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.002907Z digest=sha256:49f081fd97e3dba2edb71f93936435e08b5fdfecf47accd59affc223782d69f3

Observation 72fc32e3-f478-45f8-be3d-41168b4fac42 · outbound

This paper cites Deepinception: Hypnotize large language model to be jailbreaker, 2024 b.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Deepinception: Hypnotize large language model to be jailbreaker, 2024 b

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.479736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.007546Z digest=sha256:36bdc33abcf794f4e67b90097361d1b27d0c80b615606bf125cbd84133044ec8

Observation 4d5ff083-06ec-4d68-84e3-62399fafd648 · outbound

This paper cites Hashimoto.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Hashimoto

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.466162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.012180Z digest=sha256:2d2afc0c9e07a971e9bfdd331221a78f2cea8aecd049a4d73c4f8bdda3144f55

Observation 11df9874-f606-47d4-b944-f2b6b3ae4a03 · outbound

This paper cites MARFT: Multi-Agent Reinforcement Fine-Tuning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models MARFT: Multi-Agent Reinforcement Fine-Tuning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.017209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.017209Z digest=sha256:8709be4b8b4a9e0a6cd2fc344761a3973f2553d78fae971e80603670a2403970

Observation 45c214d2-fdcb-40ae-a871-f0bc9fa452ad · outbound

This paper cites Truthfulqa: Measuring how models mimic human falsehoods.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Truthfulqa: Measuring how models mimic human falsehoods

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.022458Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.022458Z digest=sha256:ac20975267cb979d8d9005e58883b60d9eee6e0e914363cc48e3f7ec7cfab4f4

Observation b3b15b35-152e-4027-8720-41b22493dde3 · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Understanding R1-Zero-Like Training: A Critical Perspective

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.027258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.027258Z digest=sha256:d833254bb4705573b86b8f95e7a465f51c2c0e6995ed0eb2869d796bf779fedb

Observation 0dbae9cc-0219-4840-a4df-cde030eb9e45 · outbound

This paper cites Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.032351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.032351Z digest=sha256:2d5df6c29445789c507f111200645a4720da69c6a1abd8daecd86b3dd3153756

Observation 9c929570-bff5-4ab6-a133-54b36f7a951f · outbound

This paper cites Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.442470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.037273Z digest=sha256:5a0ffc685f89877131a207016c9c2b4294b565905b76231c575cdadca28a0da7

Observation 12d4ecb8-0176-444b-a1e8-50d3080f3aae · outbound

This paper cites Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.041850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.041850Z digest=sha256:88556d5fb801b276e304b8e3ca0117273afe2bcba55af6596c7f535289b5a088

Observation 1c4ffa3c-d4dd-43d9-893d-b34d50776a08 · outbound

This paper cites Tree of attacks: Jailbreaking black-box llms automatically, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Tree of attacks: Jailbreaking black-box llms automatically, 2024

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.046382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.046382Z digest=sha256:09993c5af802323ab5ec09effd2e78a47c9ae7d5c6f618e94b33ea0458868e9a

Observation fbef0415-1371-4519-ac9b-cf890d9961a4 · outbound

This paper cites Confronting Reward Model Overoptimization with Constrained RLHF.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Confronting Reward Model Overoptimization with Constrained RLHF

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.050861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.050861Z digest=sha256:11740f53103cc2dfe71db630476ca381eec471f0770fd9dddc3ae64c7daa4b34

Observation 11dc78f5-d5ff-4a48-acf5-c2a833370c82 · outbound

This paper cites Equilibrium points in n-person games.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Equilibrium points in n-person games

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.408665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.055770Z digest=sha256:6df4ca518dfe926d6bb91c698ca178fa7952edc3f04ddd7289cfb7c20efc75d8

Observation 78b3e19f-3ea4-4b0a-9287-eeace28b5644 · outbound

This paper cites DAN (do anything now): A jailbreaking prompt technique, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DAN (do anything now): A jailbreaking prompt technique, 2023

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.394055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.060615Z digest=sha256:c3d7710e92ab8040dcf4c7f0716937b415c147ee077481d7646e4dae71f9d97e

Observation f2b8332c-8bab-4803-a17e-9ec09b2f0463 · outbound

This paper cites Training language models to follow instructions with human feedback.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training language models to follow instructions with human feedback

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.065234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.065234Z digest=sha256:5064a1fb10f16cfd558a2ab1c30cd3391f78b0ea48c3a9a2095c551584376950

Observation 799ca465-aabf-48c9-b93f-b6cff9914bb4 · outbound

This paper cites Tinyzero.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Tinyzero

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.069914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.069914Z digest=sha256:be2da021d8d10d62b66e09598993349c13509aeef5925954f3c1f3467daf160c

Observation 59f1180e-7ae6-4f72-bc1d-b3c437690746 · outbound

This paper cites MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.074609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.074609Z digest=sha256:2b79251dfb48bd7159d5397c1494083ada5936c45f4f4d70f3b0f92b38c1474f

Observation 3da9b7f8-e844-4f40-a316-4b4e72ebc973 · outbound

This paper cites Red Teaming Language Models with Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red Teaming Language Models with Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.084007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.084007Z digest=sha256:caf3fe31990e4507962db12edaf614f10c165e6e702ac27362e6dfca63135a63

Observation 39c0e848-ed86-4518-8e3b-27ff5d32088a · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.088585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.088585Z digest=sha256:849e689ad782016ce3cb2134f1367a05974aa48fef6b7ef6bcad6c39a44270e1

Observation 318aa9e8-b1de-4ad9-8dc2-597ff52aa0f6 · outbound

This paper cites X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.098869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.098869Z digest=sha256:9ff2cfa7623b48347b3acf1220bfcdd7de7e1dbdf79bfb6eeb8dbc5e5ece0a42

Observation 697dfc84-876c-4ae9-aa38-08e04f0e13de · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.103356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.103356Z digest=sha256:091f1a2cc776ad4cf6599fc4db6d45e7e602fd1b5be304406405d6cac1bffb1a

Observation e3652854-611a-4c51-a4c3-ef6bb6ab6981 · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.108249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.108249Z digest=sha256:e50eabb16255bdde4bee9aeecb4a50af3ba56408456663a9304f243ecc6f45d7

Observation 23558116-2263-46ae-ac37-811de7a087f4 · outbound

This paper cites XST est: A test suite for identifying exaggerated safety behaviours in large language models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models XST est: A test suite for identifying exaggerated safety behaviours in large language models

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.370355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.113010Z digest=sha256:94463fb571d1220315acb1741cbeccf6c66d7e5b3e783272eb6d1ba5791454eb

Observation 195be6b8-681c-42b3-8ed0-dd4c458f7a3a · outbound

This paper cites Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.117338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.117338Z digest=sha256:ae20caadcaf298f52a4f22f740745c519a042e31510739fe4198b998a646d805

Observation 6ed57130-317f-43e1-add1-ca4c61bd1a67 · outbound

This paper cites Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.121890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.121890Z digest=sha256:6b06db03ea35b2e493d999e24536191aa0e69c5b1feeaf4fb68f40fd4439c8cb

Observation 4705f74b-db8f-4a4e-be1d-db187af308b8 · outbound

This paper cites Google’s Gemini headaches spur \ 90 billion selloff.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Google’s Gemini headaches spur \ 90 billion selloff

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.356514Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.126717Z digest=sha256:00542dc859d955e0272e43cc4ca023c4073bafc5ed73c56d1b97695d39751ea3

Observation 6931b790-1272-4a6a-b1e2-5de808fc569b · outbound

This paper cites Proximal Policy Optimization Algorithms.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Proximal Policy Optimization Algorithms

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.131236Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.131236Z digest=sha256:6435896b1fea9f6f40459712875ab7c540704ec4fba7cace3f30aa86dc5fc0c1

Observation e3d0b708-cbd7-48dd-bed7-1385abed1db6 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.140834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.140834Z digest=sha256:289aa6d126262ccea86708bbb816956ca441298abbe08755f78650530b9fd3d5

Observation 01fccca1-03f1-4526-a286-11d1c5afe604 · outbound

This paper cites Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.145271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.145271Z digest=sha256:0f5ff1363372e768eaa13861117f25641e44a4ece252d0413bda9cb62de6fed6

Observation 248627d4-afb2-4c48-9b89-2d01ce445424 · outbound

This paper cites Ai effect openai’s chatgpt to hit 700 million weekly users, up 4x from last year.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Ai effect openai’s chatgpt to hit 700 million weekly users, up 4x from last year

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.342595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.150126Z digest=sha256:c823677abdeb7de07f40850a9e7bc2b0c4983825a7fde28a76f1cfe9a51ea2b6

Observation 1e2400ad-0e2c-4929-8496-50220b099551 · outbound

This paper cites A strongreject for empty jailbreaks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models A strongreject for empty jailbreaks

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.328396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.154578Z digest=sha256:db399de31cca9050c673ec0a9d1dbbb6839d7faddc5379e8e1b1a9db08c7a041

Observation 351222e8-1589-4ce1-9833-6a0d19e4e170 · outbound

This paper cites Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.159431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.159431Z digest=sha256:4d2d904e493f931fb673ca4d596a3c1c029ba71ef1b037ead8ac7afc0a891c6c

Observation eb2ab06e-0633-4105-852f-39b1eeade8a3 · outbound

This paper cites Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.164616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.164616Z digest=sha256:935b916d8feec6fde8c106ede36d761f9f61e3af0a3d534b2663a9e693274473

Observation 599bad6f-02f6-4358-84ad-e21cd6c4f3af · outbound

This paper cites RSPO: Regularized Self-Play Alignment of Large Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models RSPO: Regularized Self-Play Alignment of Large Language Models

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.169779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.169779Z digest=sha256:a35f3477c5f1e065e702d3750e14133b6bb640680aebf31ec898acd2a616a5eb

Observation 674068a5-93ff-481c-b563-d1921219dbd9 · outbound

This paper cites Theory of games and economic behavior, 2nd rev.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Theory of games and economic behavior, 2nd rev

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.174758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.174758Z digest=sha256:5ef1870287230834bb98d8bd6edf8259ded34f7adf8573663011a2fdb23f2202

Observation fc19154d-e67d-478e-ae7f-bfe09d439d4e · outbound

This paper cites Interpretable preferences via multi-objective reward modeling and mixture-of-experts.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Interpretable preferences via multi-objective reward modeling and mixture-of-experts

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.179620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.179620Z digest=sha256:ef93b1ae0e4fe9be6b21cbd1ac39ff21173d32b7bf7eb53c3b3438a5e3a02bf6

Observation ca722a10-4741-4f16-b0d7-6c0ed56a0c7f · outbound

This paper cites Co-evolving llm coder and unit tester via reinforcement learning, 2025 a.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Co-evolving llm coder and unit tester via reinforcement learning, 2025 a

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.184490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.184490Z digest=sha256:4d40196c7c15c8aeab9d86f65677d8341e8d6b5c109f43d961c73af2b54a9998

Observation a39d22f1-4ff5-4198-b742-58d1984e87cb · outbound

This paper cites HelpSteer2-Preference: Complementing Ratings with Preferences.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models HelpSteer2-Preference: Complementing Ratings with Preferences

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.189073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.189073Z digest=sha256:b81c3768dc6e3cf7800795731b2e59faf8cdec2c05139affe3d886cd375f48f2

Observation 7c84cc59-ee22-4a02-a768-fd7b8743d59b · outbound

This paper cites HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.194293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.194293Z digest=sha256:c62fe313edd362961f4beedb41e3157cfc41bad497b5a6c0b598f8c826c0280e

Observation af33fe80-2280-4136-bebb-dc81c7ca64fa · outbound

This paper cites Jailbroken: How does llm safety training fail?, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Jailbroken: How does llm safety training fail?, 2023

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.199448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.199448Z digest=sha256:1a8d5d0bf8b9b5f1b41e53d44152b6b05a690af0366e1fca699fa6af3777a806

Observation 31f83caf-473a-4dc5-a0cf-c022c626e965 · outbound

This paper cites Self-Play Preference Optimization for Language Model Alignment.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-Play Preference Optimization for Language Model Alignment

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.204232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.204232Z digest=sha256:db4fde0ae09dc77c4dff9817c744a24473c2905e188e6f2388c4b97babe1348f

Observation 9c4d8962-1812-4646-a31b-5e688df9cacb · outbound

This paper cites Efficient adversarial training in llms with continuous attacks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Efficient adversarial training in llms with continuous attacks

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.286695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.209633Z digest=sha256:922f6da01b0d5b8212fa0d7756b8e6680ef5f60268cb523af4e3985a60a664ad

Observation 2c59671d-2dda-47a3-bf6b-0e3e0383f23e · outbound

This paper cites Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.214209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.214209Z digest=sha256:b19e4b8ab897ff5cf12706ef08be9a4416f578dfc7d2f1e3d2ac41d4486bc0f5

Observation d49a9bb5-c74c-41b5-b597-caccd9fa8c15 · outbound

This paper cites Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.219409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.219409Z digest=sha256:1077e029f136becc42aace4b44d13a417aed21551df178a8bc0933dd2e476bec

Observation 32bd10b1-7c45-47e1-9654-29027edc5667 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.224328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.224328Z digest=sha256:8ec44c0c9bf474e8c4d2cd854cdf9d5b90c2be1f98ffe25e060a33230efd7a1f

Observation d2e0e32b-b44f-4354-b195-4c694489609b · outbound

This paper cites Absolute Zero: Reinforced Self-play Reasoning with Zero Data.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Absolute Zero: Reinforced Self-play Reasoning with Zero Data

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.229345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.229345Z digest=sha256:353c643680d73c925f855780c33a66f04a29b9121074407951ca8844580528ad

Observation 9c6c182b-8b7f-4fc7-a72f-4e7fedd0fdec · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Instruction-Following Evaluation for Large Language Models

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.234241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.234241Z digest=sha256:53a97a3a1a7ee702a1840f1348ec12ac155d1d832adfc960a4cda2393f75ae46

Observation 7448d546-462a-47b6-bb0a-3b9a27ab379e · outbound

This paper cites Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.239660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.239660Z digest=sha256:0d093bfe429eb32712c0088042298c8cdce1f6d7fc13c36c8a4b7cc76e4899a9

Observation b1d1767a-6470-4c2a-ad17-378a7eb6ddf8 · outbound

This paper cites Texygen: A benchmarking platform for text generation models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Texygen: A benchmarking platform for text generation models

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.271124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.244603Z digest=sha256:c38d237eb5d9c867160874cecdc08c1c33df7c7a981f7820330021876516510c

Observation f110a48a-0d01-4560-85db-ea063ccf73b7 · outbound

This paper cites Improving alignment and robustness with circuit breakers, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Improving alignment and robustness with circuit breakers, 2024

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.249861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.249861Z digest=sha256:b2249a02acecbdcdbbc73f0023e8a87193858493af2d7f267d962d6ae5b49730

Observation 0ea31367-5761-4aa2-b07d-6cd0959ea725 · outbound

This paper cites write newline.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models write newline

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.254350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.254350Z digest=sha256:79828f1af393ccdab2f1644a2d0143b85223ac64b57a088bc08a662112b3208a

Observation 88cd25d4-adc9-4c6d-9bba-ecef568fbe62 · outbound

This paper cites @esa (Ref.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models @esa (Ref

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.259905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.259905Z digest=sha256:4278756a73acfa5ea3d7a1cc3c89fab76b31554aab3c4d2c912bdba3af270e4a

Observation dd5c7f15-ce84-4a1d-b87b-f2c170afa4cc · outbound

This paper cites an unresolved cited work.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Unresolved cited work

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.265418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.265418Z digest=sha256:5723ccab30fddf94b6e6a638e60027cbee65573825547102db80b1247c29bf41

Observation 16a43cf8-2d79-487b-a5c6-23a335ddea32 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.270264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.270264Z digest=sha256:48bbabc14c0a47188ccdd6d4efb43e75f946fd48e814badc9cf2447a706efa3d

Pith citing papers

Observation af2a7c98-a995-49b3-b87c-53ff752c7b78 · inbound

Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers cites this paper.

Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 173

Resolution
unresolved
no resolver link, observed 2026-08-07T22:50:33.282186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T22:50:33.282186Z digest=sha256:309c8b5a51a002b6f00f8fbcd34c97bd78eb9bef6244ee4e44e19bbe47f53e8f

Observation 0122cf54-546d-493c-bbdb-139728a28dcf · inbound

Learning in Structured Stackelberg Games cites this paper.

Learning in Structured Stackelberg Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-22T21:19:07.958963Z digest=sha256:c7889061f7881f59cda20bbe4b87803105c6267a7874273b25b1ebcb63d2c646

Observation 87fb0fde-85a3-444f-bd59-22107d08e435 · inbound

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models cites this paper.

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 160

Resolution
unresolved
no resolver link, observed 2026-08-05T10:39:07.051052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:39:07.051052Z digest=sha256:c69b8b8858569524253739f10bbb7a1758012b6e36fcc9ad1dc4d3dda448a2f1

Observation 3ce5c752-b121-4c84-817f-6ad9d19affd0 · inbound

Safety Alignment of LMs via Non-cooperative Games cites this paper.

Safety Alignment of LMs via Non-cooperative Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:22.502308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T14:24:22.502308Z digest=sha256:f3183c1bc9263980d94b67016988384a93e17f2b0f8824136e4e02d5f626eec6

Observation 5cf49950-f877-4f14-98ac-021460384fb4 · inbound

ProbeLLM: Automating Principled Diagnosis of LLM Failures cites this paper.

ProbeLLM: Automating Principled Diagnosis of LLM Failures Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T23:43:07.037472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T23:43:07.037472Z digest=sha256:0dac4e9751b0654ff27f182dea3644facfc3e6c2e91a7aad7c769595d4a76547

Observation 49079c01-45c4-4303-b942-dd408376f364 · inbound

Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents cites this paper.

Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-08T03:31:16.838064Z digest=sha256:311aa7cfc31f58adc9b143901cf6f12788663230607dd8d96455abf39068e579

Observation 971b4905-a101-4658-8b8c-00ce6d42e8fd · inbound

Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment cites this paper.

Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-09T17:24:54.796037Z digest=sha256:0186e0546c413a83626f31bcf7d4ba3412dd212d540c9b84d68c1f8dab7c6729

Observation 34ccd0d5-654f-4dd5-aff8-f4f4b8adbc6e · inbound

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play cites this paper.

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-12T00:51:44.093659Z digest=sha256:8ba207d28a51f9d1002ff82cb7cee21c17bf363b1b4a772926395debea24c52b

Observation b6e96ab9-4f73-44ad-865a-c8da413936cf · inbound

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games cites this paper.

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-27T01:03:49.101568Z digest=sha256:df05335dfcf03c26be72d3bc64b3eb9f27e1cef0acf9dfdf2db9fffef3ac08af

Observation f2d594ef-34e0-4153-be32-593cc41954b0 · inbound

Addressing Over-Refusal in LLMs with Competing Rewards cites this paper.

Addressing Over-Refusal in LLMs with Competing Rewards Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 103

Resolution
metadata mismatch
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-07-01T06:59:12.695984Z digest=sha256:0aea0c5f771596c5127ef0ea86d19fc7d8b8109ccf23f7d31a794da63c3c6857

Observation 26dabc8e-f355-4d52-bde7-a64608f341c9 · inbound

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs cites this paper.

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T00:37:16.854295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:37:16.854295Z digest=sha256:564b9b4a4d3168477ef6962005183e2800b78c6aac0db5310c64a1292be73dd3