Pith. sign in

Paper Citation Record · LEDGER

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

As of 7 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 9 inbound Pith citation observations for arXiv:2506.07468.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.07468 v4

Coverage vector

measured 87 of 87 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:41:58.270264Z

measured 96 of 96 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 9 of 9 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T10:39:07.051052Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T20:58:57.626705Z

Reference resolution

87 of 87 outbound references displayed

  • verified exact0
  • verified fuzzy17
  • unresolved70
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7d261ee4-5244-4b40-9872-858655a6dbdf · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.833620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.833620Z digest=sha256:0d3eece86f2682b1a94a201eafc08b77f1c703b7aef07e5dfc70a4cc73fa7e19

Observation 11699782-5518-422b-a26d-43cb5a3b2d4f · outbound

This paper cites Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.839478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.839478Z digest=sha256:c6fdfbc6ae786cf1d14f18d499929a9ccf26dded13db941461f468d284495715

Observation 276d90cd-b58e-4a68-9377-9ae5c08dc941 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.844270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.844270Z digest=sha256:a935ad3ad47a341ca0ba6a2f56a14d10abb0951f65cfc4356ea102afc068287d

Observation cf27c3fe-c28b-4318-809e-1aff70e2ef3d · outbound

This paper cites Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.849623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.849623Z digest=sha256:b4ed5ac2da0e1627e1a281311b8439c956744d7d54ba7022837eea7c53e84208

Observation 238d1b8e-68dc-460b-a349-73820b167a38 · outbound

This paper cites Explore, establish, exploit: Red teaming language models from scratch, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Explore, establish, exploit: Red teaming language models from scratch, 2023

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.854313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.854313Z digest=sha256:16928945e2336415b4994c83c4ff88d4088806bb1840b33885527b7c1320e43a

Observation bd4d2d05-6319-4083-a92a-ae9082dbd620 · outbound

This paper cites Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.859038Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.859038Z digest=sha256:d1e6a3e53cfa8aae2e819439e12b6cb1de5a2fe2ad6ff9cb9fd67d28cb4b7cc2

Observation e9f41345-bd26-4ffa-ba8e-c90e1c5864d1 · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.864889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.864889Z digest=sha256:233716ebe9fe03863755b229436b42a222399f90db9a1f331836df314e7591c0

Observation f3a95e10-5b87-43bc-8a9e-6e6fe8e47765 · outbound

This paper cites Self-playing Adversarial Language Game Enhances LLM Reasoning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-playing Adversarial Language Game Enhances LLM Reasoning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.869806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.869806Z digest=sha256:992a66f3456f5018fc6aee23a3dc97409b71adcc138d1718751a65eb7aa9fcd6

Observation 736cc6d9-6aba-4426-8e5f-cc9747cf4850 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.874726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.874726Z digest=sha256:8a5ecb7505d7c5db9c830cdb30466578c91d067be86df9c776cbae12a5ba3618

Observation ec01d375-b3e0-4d45-9f75-b2c8ae63ffbb · outbound

This paper cites Or-bench: An over-refusal benchmark for large language models, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Or-bench: An over-refusal benchmark for large language models, 2024

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.879647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.879647Z digest=sha256:b81f2860c2936205dc079963f8800d28a1bd1c933a2cd61aed8dee0257e6c04b

Observation 80d2ced1-f453-47ee-84d7-3cd18e1ccd69 · outbound

This paper cites Safe rlhf: Safe reinforcement learning from human feedback, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safe rlhf: Safe reinforcement learning from human feedback, 2023

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.884214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.884214Z digest=sha256:eef35799374694649c3a219018691c878cb17986e0a631becb45ce3293a36a4e

Observation 31038389-1278-4256-9c39-f2b57d92a12a · outbound

This paper cites Safe rlhf: Safe reinforcement learning from human feedback.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safe rlhf: Safe reinforcement learning from human feedback

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.888900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.888900Z digest=sha256:48cb3a1f0324e54d9fb47aab9e3bc7c2994846419a9cac6d920cf29ef9a44d5a

Observation 25554758-1d74-4ad9-9ddf-13007b966ef8 · outbound

This paper cites Duoguard: A two-player rl-driven framework for multilingual llm guardrails, 2025.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Duoguard: A two-player rl-driven framework for multilingual llm guardrails, 2025

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.893347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.893347Z digest=sha256:eaf3f7580c0e87595e29f0fd1e56660350513cebca3bbb3de01987359d582712

Observation 9ff7b10b-9387-4878-8504-4fd80aff043d · outbound

This paper cites Qlora: Efficient finetuning of quantized llms.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Qlora: Efficient finetuning of quantized llms

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.898130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.898130Z digest=sha256:616a30395ba6d4661168f84db0879a6cc5d8d3b97a4bbe32f9cd66bbf7e950bd

Observation a5c22db3-0a74-4d65-bb86-117c9fd7719e · outbound

This paper cites RLHF Workflow: From Reward Modeling to Online RLHF.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models RLHF Workflow: From Reward Modeling to Online RLHF

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.903053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.903053Z digest=sha256:d6e46b886342668cd214cde83a488df1c758ac4549df993c622b8f725c23dc68

Observation bbe488b0-2f52-4006-8f78-4dd7352411af · outbound

This paper cites Google’s gemini tops apple’s app store, snagging lead spot from chatgpt.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Google’s gemini tops apple’s app store, snagging lead spot from chatgpt

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.582649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.907741Z digest=sha256:09416b86f8d9b61e06b4a412b4fc5bdd95143a0bdcaeb5c01a30d67dcfa63006

Observation 7a3b73d6-2d97-483a-91cb-3a0eaf190491 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models KTO: Model Alignment as Prospect Theoretic Optimization

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.912354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.912354Z digest=sha256:c3090dccdc94eaa3ff5b30bba1817f239f23e6cf56d436b0bdb76c383e63ba7a

Observation 001aecab-5aa4-466b-a62a-e2ca9896332f · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.917162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.917162Z digest=sha256:12591292dd3111da4939c1d79c63e357f5816645ca40f83fd5d7af8846c8aef4

Observation 7e55409a-7862-43c4-a474-62ce901c1d23 · outbound

This paper cites Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022 b.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022 b

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.568608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.921874Z digest=sha256:9669961f920e6341dae317adc53226ad0c794831352ad824f474d4e593c7a775

Observation 627da4da-6f88-49d2-a020-11ff4cd4daf7 · outbound

This paper cites The language model evaluation harness, 07 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models The language model evaluation harness, 07 2024

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.927089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.927089Z digest=sha256:0632fb8d5933d53b40ee91011c465e0b7d71214b612333afbd9e7f911ebe79dc

Observation b5b39e20-9c79-4cd0-a001-af7ac9eb3b26 · outbound

This paper cites OLMES: A Standard for Language Model Evaluations.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models OLMES: A Standard for Language Model Evaluations

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.931539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.931539Z digest=sha256:bfb2925ee256b999171b92a0b868298344b45e0db4de4b573832b7b9c51dc0a4

Observation b8bf5e3e-c1d6-42f1-9ee3-0344a4c82260 · outbound

This paper cites Elon musk's ai chatbot, grok, started calling itself 'mechahitler'.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Elon musk's ai chatbot, grok, started calling itself 'mechahitler'

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.553774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.941178Z digest=sha256:c8aab3ed18199ab2ebdfae3e916a52189b179a182fe5d1666cc4b32200599888

Observation 612acdc7-9ce5-4332-9223-b0c6a5c688af · outbound

This paper cites WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.945774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.945774Z digest=sha256:9c3e64a305332e6f497e8d6de8e58a9e746e76a37c52f674efdb77de5458b45f

Observation 911dc80a-16f0-44d0-91ff-8f92c15b148e · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Measuring Massive Multitask Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.950270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.950270Z digest=sha256:170f4f8386442d7ec14740a009509f843c707758ab91034dc79934d31066acd1

Observation 8e9e53ba-eaf1-4794-8499-e0c016149cf6 · outbound

This paper cites Curiosity-driven Red-teaming for Large Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Curiosity-driven Red-teaming for Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.954768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.954768Z digest=sha256:2ed810261e1a99a0fa81513a54dfe82a9d93c0952625a3e9dcafc2a0ee82a4ad

Observation 8c906f45-c952-4d92-92d0-cca9c9943bc3 · outbound

This paper cites Scaling Trends in Language Model Robustness.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Scaling Trends in Language Model Robustness

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.959395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.959395Z digest=sha256:18563cf36748e1d2b01a8d36404ac39c0aa4124fc95fdf9f9d5786ed1e09c60e

Observation c832e925-7b0f-4213-a087-17c664d4a33e · outbound

This paper cites REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.964115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.964115Z digest=sha256:3148f6402971388ad8dd1e63e863cb8b0d4481629e7de44108fd3bb931427fce

Observation 400b3502-a835-44db-b926-b07dbdb40fa6 · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.968902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.968902Z digest=sha256:0f488d10de38cf448126db6a5e733fec9dae00c64aedb13de9df0de014b54219

Observation 6135fdf7-8acb-41c6-9e3d-450ef74083c6 · outbound

This paper cites Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.973759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.973759Z digest=sha256:e5f593d648869a1fe2dbfdc450bbc8ce496515b5f61b3ab1d3ffced2c6b465a3

Observation c8c0d244-4ce6-4ab2-9651-e07ad646e999 · outbound

This paper cites Baseline Defenses for Adversarial Attacks Against Aligned Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Baseline Defenses for Adversarial Attacks Against Aligned Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.978623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.978623Z digest=sha256:9fbabc0f43520e9e8d444e2d29a4cbaff5fc2fe7372b902dc1f2fa802675b458

Observation 1d4631da-3dbf-4b81-a8e2-0ebaa6f6f048 · outbound

This paper cites Sequence tutor: Conservative fine-tuning of sequence generation models with kl-control.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Sequence tutor: Conservative fine-tuning of sequence generation models with kl-control

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.529827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.983647Z digest=sha256:00872b69b21df445a9f17aaf95ab504f2dabc12bec1fd1582f99a00eeda2da17

Observation 3283b948-1bed-4db5-863a-4b3704b0b63e · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.988453Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.988453Z digest=sha256:771f26bca19c5e475e99e33103635796cf92daf3c2bfa3f3192bfc557c0543a3

Observation 68d765d4-6336-4559-a5e8-5a5249849e36 · outbound

This paper cites Beavertails: Towards improved safety alignment of llm via a human-preference dataset.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Beavertails: Towards improved safety alignment of llm via a human-preference dataset

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:57.993791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:57.993791Z digest=sha256:3ad923a7e7f46331e13b27f714b7d9314baa422fb233e7192caa3a5506277b20

Observation d7939376-e6bb-4e6a-8b88-1260bd1d7db8 · outbound

This paper cites Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.506744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:57.998312Z digest=sha256:7a0204445f49f9acf9e88ff520097bc85cf1a10ff66be52498cd60ee2ca798d4

Observation ac29a75d-8bcc-4624-9b9f-dc96c0929b45 · outbound

This paper cites Predicting vs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Predicting vs

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.492900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.002907Z digest=sha256:f3c6a72cb8ee2cfe2a09181316631057c69d896788a07d0061f46a6e7d555fdd

Observation 72fc32e3-f478-45f8-be3d-41168b4fac42 · outbound

This paper cites Deepinception: Hypnotize large language model to be jailbreaker, 2024 b.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Deepinception: Hypnotize large language model to be jailbreaker, 2024 b

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.479736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.007546Z digest=sha256:5d4766176f085294bbe82524b488bc347ff28f7e0000457129649f8529a965d2

Observation 4d5ff083-06ec-4d68-84e3-62399fafd648 · outbound

This paper cites Hashimoto.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Hashimoto

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.466162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.012180Z digest=sha256:0bacc1c942b5b61aac9547928dc61c8592c64bb39ebacd105b30a0aaaff681c2

Observation 11df9874-f606-47d4-b944-f2b6b3ae4a03 · outbound

This paper cites MARFT: Multi-Agent Reinforcement Fine-Tuning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models MARFT: Multi-Agent Reinforcement Fine-Tuning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.017209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.017209Z digest=sha256:f843858de4f109af2c949cb7d05f4c9ab66adf9fa871aacca8b21dd54ef59f0c

Observation 45c214d2-fdcb-40ae-a871-f0bc9fa452ad · outbound

This paper cites Truthfulqa: Measuring how models mimic human falsehoods.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Truthfulqa: Measuring how models mimic human falsehoods

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.022458Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.022458Z digest=sha256:6c572f6b4356339e1e8979742660b8583f234a45a84563925af4d28a72e529c2

Observation b3b15b35-152e-4027-8720-41b22493dde3 · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Understanding R1-Zero-Like Training: A Critical Perspective

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.027258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.027258Z digest=sha256:f6906c6e796b0d5fb6278f0c580bf41e7cc79becffda47b64df60f24c27b6689

Observation 0dbae9cc-0219-4840-a4df-cde030eb9e45 · outbound

This paper cites Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.032351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.032351Z digest=sha256:d97cef668435c8b8d9c70ddad94ee849a6db03788cb4845820531cac7f92c580

Observation 9c929570-bff5-4ab6-a133-54b36f7a951f · outbound

This paper cites Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.442470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.037273Z digest=sha256:fbb408b37628f79d9e9b96ee2e7343597b36b17825b4b9b6fa9973a6b9bb4d95

Observation 12d4ecb8-0176-444b-a1e8-50d3080f3aae · outbound

This paper cites Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.041850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.041850Z digest=sha256:c4b9e3db4ed5afd907f433610e382fc82527992a72c8fd6a2d6ae0f27b73a0e4

Observation 1c4ffa3c-d4dd-43d9-893d-b34d50776a08 · outbound

This paper cites Tree of attacks: Jailbreaking black-box llms automatically, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Tree of attacks: Jailbreaking black-box llms automatically, 2024

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.046382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.046382Z digest=sha256:f796954d04dd9fe51b57e507bced4f9d57c3cd06ef89d8dfc09df22b7f57114d

Observation fbef0415-1371-4519-ac9b-cf890d9961a4 · outbound

This paper cites Confronting Reward Model Overoptimization with Constrained RLHF.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Confronting Reward Model Overoptimization with Constrained RLHF

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.050861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.050861Z digest=sha256:eab0f6b43030de5a9d8c5b97e854fb0c96c4cc264e1357d10974beb4059afc2a

Observation 11dc78f5-d5ff-4a48-acf5-c2a833370c82 · outbound

This paper cites Equilibrium points in n-person games.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Equilibrium points in n-person games

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.408665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.055770Z digest=sha256:561b6951b4ee9469a80f897b4c18c0e13bbe0cdb1a83f49e16ea6cd381faed14

Observation 78b3e19f-3ea4-4b0a-9287-eeace28b5644 · outbound

This paper cites DAN (do anything now): A jailbreaking prompt technique, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DAN (do anything now): A jailbreaking prompt technique, 2023

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.394055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.060615Z digest=sha256:a9a8efb592963f9e590e711137def6b43965c4b89113feba6f31d1342a8fa231

Observation f2b8332c-8bab-4803-a17e-9ec09b2f0463 · outbound

This paper cites Training language models to follow instructions with human feedback.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training language models to follow instructions with human feedback

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.065234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.065234Z digest=sha256:27138a0848a380178ea6f6d62c5865dd0ff3c578b9df136faa63a803d259af38

Observation 799ca465-aabf-48c9-b93f-b6cff9914bb4 · outbound

This paper cites Tinyzero.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Tinyzero

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.069914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.069914Z digest=sha256:1c8ffb966f3f71a6b4b4e8d3f3cac5b02a30fcda1ca3d55081a72cfe5e6de7d4

Observation 59f1180e-7ae6-4f72-bc1d-b3c437690746 · outbound

This paper cites MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.074609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.074609Z digest=sha256:71f31ccaea8c1b890a6603214830edcf9d3b41357568f2a04497a1ba4384fed8

Observation 3da9b7f8-e844-4f40-a316-4b4e72ebc973 · outbound

This paper cites Red Teaming Language Models with Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red Teaming Language Models with Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.084007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.084007Z digest=sha256:7b8a17426415a64363c3271d2d6d0959332dc18e31965944650be7c12ef2f1b5

Observation 39c0e848-ed86-4518-8e3b-27ff5d32088a · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.088585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.088585Z digest=sha256:834ada6fd9c3476fa84000ef82b511062efc26e6f83e7e1215b7eac5793904af

Observation 318aa9e8-b1de-4ad9-8dc2-597ff52aa0f6 · outbound

This paper cites X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.098869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.098869Z digest=sha256:44452e814cab91f88765f2ff8906b7c52b405b654ea536b405d620f4d7b8ed58

Observation 697dfc84-876c-4ae9-aa38-08e04f0e13de · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.103356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.103356Z digest=sha256:8bbcfd359bb874625b1dd5d0af55070d8f1a190e5e86ed3e695c39357c11d99d

Observation e3652854-611a-4c51-a4c3-ef6bb6ab6981 · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.108249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.108249Z digest=sha256:5c767faf60c0e9898b29dc84d177bb36767602d4317450064d990d12eb157f36

Observation 23558116-2263-46ae-ac37-811de7a087f4 · outbound

This paper cites XST est: A test suite for identifying exaggerated safety behaviours in large language models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models XST est: A test suite for identifying exaggerated safety behaviours in large language models

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.370355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.113010Z digest=sha256:bfd875b54bb04b9d4f378074ce5d91b88f29eca5ccf099897e5733a964f55c95

Observation 195be6b8-681c-42b3-8ed0-dd4c458f7a3a · outbound

This paper cites Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.117338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.117338Z digest=sha256:d3d43fbfbf2daa92aff1867e243436ad021bc087fdb333ebdab201d44cd5f8b9

Observation 6ed57130-317f-43e1-add1-ca4c61bd1a67 · outbound

This paper cites Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.121890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.121890Z digest=sha256:f78a3c8dabf8d87cfa3daa39e922dec6ff65fcc91aa377db00739ec34eba03e5

Observation 4705f74b-db8f-4a4e-be1d-db187af308b8 · outbound

This paper cites Google’s Gemini headaches spur \ 90 billion selloff.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Google’s Gemini headaches spur \ 90 billion selloff

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.356514Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.126717Z digest=sha256:7e234d8d843919d73cbaad3255289ea19c2e2efc08e5da09efe2ac0fdc0c6a3b

Observation 6931b790-1272-4a6a-b1e2-5de808fc569b · outbound

This paper cites Proximal Policy Optimization Algorithms.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Proximal Policy Optimization Algorithms

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.131236Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.131236Z digest=sha256:364270fa7ecce41d5638724290db92520bee51d3eabd1c183675a434b46a21dc

Observation e3d0b708-cbd7-48dd-bed7-1385abed1db6 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.140834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.140834Z digest=sha256:66f1eafde9c4266d02efcf0cd32a68dbddf96351271dceb657e6f5ad716e729e

Observation 01fccca1-03f1-4526-a286-11d1c5afe604 · outbound

This paper cites Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.145271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.145271Z digest=sha256:b5327d0af5f7c584f39dc76640a6d7016bf421d19507cf97a7a3ebea7a085b33

Observation 248627d4-afb2-4c48-9b89-2d01ce445424 · outbound

This paper cites Ai effect openai’s chatgpt to hit 700 million weekly users, up 4x from last year.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Ai effect openai’s chatgpt to hit 700 million weekly users, up 4x from last year

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.342595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.150126Z digest=sha256:e0aa0a10504db0fcc1adcf47b6085653406853f0e8f62b7fa657e0391e534495

Observation 1e2400ad-0e2c-4929-8496-50220b099551 · outbound

This paper cites A strongreject for empty jailbreaks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models A strongreject for empty jailbreaks

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.328396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.154578Z digest=sha256:a95e6be814ca883328729cc34e54c8e161af2024de5281be6ece7b91cbe1287a

Observation 351222e8-1589-4ce1-9833-6a0d19e4e170 · outbound

This paper cites Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.159431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.159431Z digest=sha256:020c2a3e2990abcaadda872b0799ef87bd6560364de781b5bde9455e98c18cf7

Observation eb2ab06e-0633-4105-852f-39b1eeade8a3 · outbound

This paper cites Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.164616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.164616Z digest=sha256:1b3052a8fe3765e41d53f75885b502805cf8f53217e9382e7ff8e4318506e99c

Observation 599bad6f-02f6-4358-84ad-e21cd6c4f3af · outbound

This paper cites RSPO: Regularized Self-Play Alignment of Large Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models RSPO: Regularized Self-Play Alignment of Large Language Models

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.169779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.169779Z digest=sha256:229b2e5dd6ae94ffc7d9b509707d8653ec9528b9e95e85a0163eb9833c435bd8

Observation 674068a5-93ff-481c-b563-d1921219dbd9 · outbound

This paper cites Theory of games and economic behavior, 2nd rev.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Theory of games and economic behavior, 2nd rev

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.174758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.174758Z digest=sha256:a014b78f45caa1c58416c57755599b6580a1456d78e3ad4d607585a0346eac6a

Observation fc19154d-e67d-478e-ae7f-bfe09d439d4e · outbound

This paper cites Interpretable preferences via multi-objective reward modeling and mixture-of-experts.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Interpretable preferences via multi-objective reward modeling and mixture-of-experts

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.179620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.179620Z digest=sha256:93adb68f0f7c89321bb8e66be1c202af3aa75cbe96304270f5a2516ba79f99d0

Observation ca722a10-4741-4f16-b0d7-6c0ed56a0c7f · outbound

This paper cites Co-evolving llm coder and unit tester via reinforcement learning, 2025 a.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Co-evolving llm coder and unit tester via reinforcement learning, 2025 a

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.184490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.184490Z digest=sha256:55696d63ddf19f24b9d47d3c023d33d226bf696e64694f77a3e4b03c04a4c8b1

Observation a39d22f1-4ff5-4198-b742-58d1984e87cb · outbound

This paper cites HelpSteer2-Preference: Complementing Ratings with Preferences.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models HelpSteer2-Preference: Complementing Ratings with Preferences

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.189073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.189073Z digest=sha256:f906d6b76fd710bb250d17795af2f2b1f1cace44f28dc367048471ab0af882eb

Observation 7c84cc59-ee22-4a02-a768-fd7b8743d59b · outbound

This paper cites HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.194293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.194293Z digest=sha256:bc76927d9ed46fa19b6bb538266c9e20985170458ecb17d60b636f94a15525ab

Observation af33fe80-2280-4136-bebb-dc81c7ca64fa · outbound

This paper cites Jailbroken: How does llm safety training fail?, 2023.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Jailbroken: How does llm safety training fail?, 2023

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.199448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.199448Z digest=sha256:fc7142974c96b1ef0f9961b254283ca5464be206f322939b4b72d1e6875f7d6f

Observation 31f83caf-473a-4dc5-a0cf-c022c626e965 · outbound

This paper cites Self-Play Preference Optimization for Language Model Alignment.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-Play Preference Optimization for Language Model Alignment

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.204232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.204232Z digest=sha256:78ac1abe5b6589e51b0c607b955b278c55cab0b1f382e3c808eea6ee38284d06

Observation 9c4d8962-1812-4646-a31b-5e688df9cacb · outbound

This paper cites Efficient adversarial training in llms with continuous attacks.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Efficient adversarial training in llms with continuous attacks

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.286695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.209633Z digest=sha256:748995f6140bcd38d0cdca5ccdeef21b564b3577a6e5c48847d3111fcaf9615d

Observation 2c59671d-2dda-47a3-bf6b-0e3e0383f23e · outbound

This paper cites Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.214209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.214209Z digest=sha256:34056bc0856afd715bc0d633a25fefe4d18f1652c832de001daa1bce7e28c11d

Observation d49a9bb5-c74c-41b5-b597-caccd9fa8c15 · outbound

This paper cites Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.219409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.219409Z digest=sha256:13fcada353b366bd7226df949af880cbcb2d8357bffbf938cd0ab13baf3d2636

Observation 32bd10b1-7c45-47e1-9654-29027edc5667 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.224328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.224328Z digest=sha256:283497a70eb9ec6ecb9955b903aa8ee95cdece74fbd968f9439717849984fb7c

Observation d2e0e32b-b44f-4354-b195-4c694489609b · outbound

This paper cites Absolute Zero: Reinforced Self-play Reasoning with Zero Data.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Absolute Zero: Reinforced Self-play Reasoning with Zero Data

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.229345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.229345Z digest=sha256:dd84ffcf81b6ee4c321ba51f71cdc1e42ab75ecaf024d1e5f7fc5098cb7e4ebe

Observation 9c6c182b-8b7f-4fc7-a72f-4e7fedd0fdec · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Instruction-Following Evaluation for Large Language Models

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.234241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.234241Z digest=sha256:e01a2af4fb7fedb6d1921e4cf6989a942d42c81e54603f694bd797eebdf69464

Observation 7448d546-462a-47b6-bb0a-3b9a27ab379e · outbound

This paper cites Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.239660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.239660Z digest=sha256:d238efc9c1d6b3b071014316974d2273e599eeb42e8ec1c51858158ed6d25895

Observation b1d1767a-6470-4c2a-ad17-378a7eb6ddf8 · outbound

This paper cites Texygen: A benchmarking platform for text generation models.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Texygen: A benchmarking platform for text generation models

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:59.271124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-07T05:41:58.244603Z digest=sha256:5bfb9d3b2b74c3541d94a738b0f39e5d5f22cacf3e79c0118e1850c1fe21c1b2

Observation f110a48a-0d01-4560-85db-ea063ccf73b7 · outbound

This paper cites Improving alignment and robustness with circuit breakers, 2024.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Improving alignment and robustness with circuit breakers, 2024

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.249861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.249861Z digest=sha256:1a24e116673c5a65d2ef20f2cf199e2a8755b1d0dc793da9fa48ada6fb9c5898

Observation 0ea31367-5761-4aa2-b07d-6cd0959ea725 · outbound

This paper cites write newline.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models write newline

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.254350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.254350Z digest=sha256:1ad77a757d04b749c53f1f3a1106216b2a74ef8c1c8811c403903a88660fa766

Observation 88cd25d4-adc9-4c6d-9bba-ecef568fbe62 · outbound

This paper cites @esa (Ref.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models @esa (Ref

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.259905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.259905Z digest=sha256:623750035491d4bc13e8b83b8f17aa5bb9b55485df25b094c8fc6940151e7f40

Observation dd5c7f15-ce84-4a1d-b87b-f2c170afa4cc · outbound

This paper cites an unresolved cited work.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Unresolved cited work

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.265418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.265418Z digest=sha256:e852bb80387affa93b8808c5fed6afbf3f76af24fce1ef6c4a4f3f96ec84a7bb

Observation 16a43cf8-2d79-487b-a5c6-23a335ddea32 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:58.270264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:58.270264Z digest=sha256:e3dda610a6ed2ba06cc75d53e4e1e992046d4ab85eef907adee7f74b3107f746

Pith citing papers

Observation 0122cf54-546d-493c-bbdb-139728a28dcf · inbound

Learning in Structured Stackelberg Games cites this paper.

Learning in Structured Stackelberg Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-22T21:19:07.958963Z digest=sha256:2f568a05027d09f600f8bbb0b3cb22909af553723640cb7f52d6a07375aa0f47

Observation 87fb0fde-85a3-444f-bd59-22107d08e435 · inbound

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models cites this paper.

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 160

Resolution
unresolved
no resolver link, observed 2026-08-05T10:39:07.051052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:39:07.051052Z digest=sha256:cc10877ed8e04128c5deab14b0a0f6bc3af2dbea004ab69cb9d4cd8aa7718b44

Observation 3ce5c752-b121-4c84-817f-6ad9d19affd0 · inbound

Safety Alignment of LMs via Non-cooperative Games cites this paper.

Safety Alignment of LMs via Non-cooperative Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:22.502308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T14:24:22.502308Z digest=sha256:90774f58dceea34ed75b78e86eebdd9c61d0bb847d7a49e6e5ca9e100e077e69

Observation 5cf49950-f877-4f14-98ac-021460384fb4 · inbound

ProbeLLM: Automating Principled Diagnosis of LLM Failures cites this paper.

ProbeLLM: Automating Principled Diagnosis of LLM Failures Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T23:43:07.037472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T23:43:07.037472Z digest=sha256:87f021def5f21b1fba0c29089578cb7eca93512a230d27391f7ffa8e7f8bbb42

Observation 49079c01-45c4-4303-b942-dd408376f364 · inbound

Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents cites this paper.

Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-08T03:31:16.838064Z digest=sha256:5edf016a7aab2a79ff3ac3814be28eb20faf8507c61af08976776d475b247ced

Observation 971b4905-a101-4658-8b8c-00ce6d42e8fd · inbound

Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment cites this paper.

Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-09T17:24:54.796037Z digest=sha256:200ad03bfaa7f5bb909c77af85343662f3eb59b3b80e3444275a938379cb974e

Observation 34ccd0d5-654f-4dd5-aff8-f4f4b8adbc6e · inbound

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play cites this paper.

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-12T00:51:44.093659Z digest=sha256:aa5630b4a516fb406326361153207a81701ef58fc92c038b942cd1a38d0fde3f

Observation b6e96ab9-4f73-44ad-865a-c8da413936cf · inbound

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games cites this paper.

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T01:03:49.101568Z digest=sha256:2173752cda041a81cf7a0ef64b48c681bc4818bd7fb13c35964bb0c32061cf5e

Observation f2d594ef-34e0-4153-be32-593cc41954b0 · inbound

Addressing Over-Refusal in LLMs with Competing Rewards cites this paper.

Addressing Over-Refusal in LLMs with Competing Rewards Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

Reference 103

Resolution
metadata mismatch
arxiv_id, observed 2026-07-07T03:18:47.218133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-07-01T06:59:12.695984Z digest=sha256:5cf1e4273a734dcba38d266c3fc11672e33b64d9f47fc27a7c80fc9d1669d10c