Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T05:41:58.270264Z
Paper Citation Record · LEDGER
As of 7 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 9 inbound Pith citation observations for arXiv:2506.07468.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T05:41:58.270264Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-05T10:39:07.051052Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-03T20:58:57.626705Z
87 of 87 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 7d261ee4-5244-4b40-9872-858655a6dbdf · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 11699782-5518-422b-a26d-43cb5a3b2d4f · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 276d90cd-b58e-4a68-9377-9ae5c08dc941 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Constitutional AI: Harmlessness from AI Feedback
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cf27c3fe-c28b-4318-809e-1aff70e2ef3d · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 238d1b8e-68dc-460b-a349-73820b167a38 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Explore, establish, exploit: Red teaming language models from scratch, 2023
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bd4d2d05-6319-4083-a92a-ae9082dbd620 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e9f41345-bd26-4ffa-ba8e-c90e1c5864d1 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f3a95e10-5b87-43bc-8a9e-6e6fe8e47765 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-playing Adversarial Language Game Enhances LLM Reasoning
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 736cc6d9-6aba-4426-8e5f-cc9747cf4850 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ec01d375-b3e0-4d45-9f75-b2c8ae63ffbb · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Or-bench: An over-refusal benchmark for large language models, 2024
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 80d2ced1-f453-47ee-84d7-3cd18e1ccd69 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safe rlhf: Safe reinforcement learning from human feedback, 2023
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 31038389-1278-4256-9c39-f2b57d92a12a · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Safe rlhf: Safe reinforcement learning from human feedback
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 25554758-1d74-4ad9-9ddf-13007b966ef8 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Duoguard: A two-player rl-driven framework for multilingual llm guardrails, 2025
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9ff7b10b-9387-4878-8504-4fd80aff043d · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Qlora: Efficient finetuning of quantized llms
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a5c22db3-0a74-4d65-bb86-117c9fd7719e · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models RLHF Workflow: From Reward Modeling to Online RLHF
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bbe488b0-2f52-4006-8f78-4dd7352411af · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Google’s gemini tops apple’s app store, snagging lead spot from chatgpt
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 7a3b73d6-2d97-483a-91cb-3a0eaf190491 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models KTO: Model Alignment as Prospect Theoretic Optimization
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 001aecab-5aa4-466b-a62a-e2ca9896332f · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e55409a-7862-43c4-a474-62ce901c1d23 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022 b
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 627da4da-6f88-49d2-a020-11ff4cd4daf7 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models The language model evaluation harness, 07 2024
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b5b39e20-9c79-4cd0-a001-af7ac9eb3b26 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models OLMES: A Standard for Language Model Evaluations
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b8bf5e3e-c1d6-42f1-9ee3-0344a4c82260 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Elon musk's ai chatbot, grok, started calling itself 'mechahitler'
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 612acdc7-9ce5-4332-9223-b0c6a5c688af · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 911dc80a-16f0-44d0-91ff-8f92c15b148e · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Measuring Massive Multitask Language Understanding
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8e9e53ba-eaf1-4794-8499-e0c016149cf6 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Curiosity-driven Red-teaming for Large Language Models
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8c906f45-c952-4d92-92d0-cca9c9943bc3 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Scaling Trends in Language Model Robustness
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c832e925-7b0f-4213-a087-17c664d4a33e · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 400b3502-a835-44db-b926-b07dbdb40fa6 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6135fdf7-8acb-41c6-9e3d-450ef74083c6 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c8c0d244-4ce6-4ab2-9651-e07ad646e999 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Baseline Defenses for Adversarial Attacks Against Aligned Language Models
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1d4631da-3dbf-4b81-a8e2-0ebaa6f6f048 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Sequence tutor: Conservative fine-tuning of sequence generation models with kl-control
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 3283b948-1bed-4db5-863a-4b3704b0b63e · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 68d765d4-6336-4559-a5e8-5a5249849e36 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Beavertails: Towards improved safety alignment of llm via a human-preference dataset
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d7939376-e6bb-4e6a-8b88-1260bd1d7db8 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation ac29a75d-8bcc-4624-9b9f-dc96c0929b45 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Predicting vs
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 72fc32e3-f478-45f8-be3d-41168b4fac42 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Deepinception: Hypnotize large language model to be jailbreaker, 2024 b
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 4d5ff083-06ec-4d68-84e3-62399fafd648 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Hashimoto
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 11df9874-f606-47d4-b944-f2b6b3ae4a03 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models MARFT: Multi-Agent Reinforcement Fine-Tuning
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 45c214d2-fdcb-40ae-a871-f0bc9fa452ad · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Truthfulqa: Measuring how models mimic human falsehoods
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b3b15b35-152e-4027-8720-41b22493dde3 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Understanding R1-Zero-Like Training: A Critical Perspective
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0dbae9cc-0219-4840-a4df-cde030eb9e45 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9c929570-bff5-4ab6-a133-54b36f7a951f · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning
Reference 43
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 12d4ecb8-0176-444b-a1e8-50d3080f3aae · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1c4ffa3c-d4dd-43d9-893d-b34d50776a08 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Tree of attacks: Jailbreaking black-box llms automatically, 2024
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fbef0415-1371-4519-ac9b-cf890d9961a4 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Confronting Reward Model Overoptimization with Constrained RLHF
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 11dc78f5-d5ff-4a48-acf5-c2a833370c82 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Equilibrium points in n-person games
Reference 47
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 78b3e19f-3ea4-4b0a-9287-eeace28b5644 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DAN (do anything now): A jailbreaking prompt technique, 2023
Reference 48
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f2b8332c-8bab-4803-a17e-9ec09b2f0463 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training language models to follow instructions with human feedback
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 799ca465-aabf-48c9-b93f-b6cff9914bb4 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Tinyzero
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 59f1180e-7ae6-4f72-bc1d-b3c437690746 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3da9b7f8-e844-4f40-a316-4b4e72ebc973 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Red Teaming Language Models with Language Models
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 39c0e848-ed86-4518-8e3b-27ff5d32088a · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 318aa9e8-b1de-4ad9-8dc2-597ff52aa0f6 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 697dfc84-876c-4ae9-aa38-08e04f0e13de · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
Reference 57
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e3652854-611a-4c51-a4c3-ef6bb6ab6981 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models GPQA: A Graduate-Level Google-Proof Q&A Benchmark
Reference 58
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 23558116-2263-46ae-ac37-811de7a087f4 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models XST est: A test suite for identifying exaggerated safety behaviours in large language models
Reference 59
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 195be6b8-681c-42b3-8ed0-dd4c458f7a3a · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
Reference 60
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6ed57130-317f-43e1-add1-ca4c61bd1a67 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
Reference 61
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4705f74b-db8f-4a4e-be1d-db187af308b8 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Google’s Gemini headaches spur \ 90 billion selloff
Reference 62
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 6931b790-1272-4a6a-b1e2-5de808fc569b · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Proximal Policy Optimization Algorithms
Reference 63
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e3d0b708-cbd7-48dd-bed7-1385abed1db6 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 65
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 01fccca1-03f1-4526-a286-11d1c5afe604 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
Reference 66
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 248627d4-afb2-4c48-9b89-2d01ce445424 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Ai effect openai’s chatgpt to hit 700 million weekly users, up 4x from last year
Reference 67
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 1e2400ad-0e2c-4929-8496-50220b099551 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models A strongreject for empty jailbreaks
Reference 68
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 351222e8-1589-4ce1-9833-6a0d19e4e170 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains
Reference 69
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation eb2ab06e-0633-4105-852f-39b1eeade8a3 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
Reference 70
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 599bad6f-02f6-4358-84ad-e21cd6c4f3af · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models RSPO: Regularized Self-Play Alignment of Large Language Models
Reference 71
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 674068a5-93ff-481c-b563-d1921219dbd9 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Theory of games and economic behavior, 2nd rev
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fc19154d-e67d-478e-ae7f-bfe09d439d4e · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Interpretable preferences via multi-objective reward modeling and mixture-of-experts
Reference 73
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ca722a10-4741-4f16-b0d7-6c0ed56a0c7f · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Co-evolving llm coder and unit tester via reinforcement learning, 2025 a
Reference 74
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a39d22f1-4ff5-4198-b742-58d1984e87cb · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models HelpSteer2-Preference: Complementing Ratings with Preferences
Reference 75
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7c84cc59-ee22-4a02-a768-fd7b8743d59b · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks
Reference 76
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation af33fe80-2280-4136-bebb-dc81c7ca64fa · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Jailbroken: How does llm safety training fail?, 2023
Reference 77
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 31f83caf-473a-4dc5-a0cf-c022c626e965 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Self-Play Preference Optimization for Language Model Alignment
Reference 78
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9c4d8962-1812-4646-a31b-5e688df9cacb · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Efficient adversarial training in llms with continuous attacks
Reference 79
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 2c59671d-2dda-47a3-bf6b-0e3e0383f23e · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
Reference 80
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d49a9bb5-c74c-41b5-b597-caccd9fa8c15 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play
Reference 81
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 32bd10b1-7c45-47e1-9654-29027edc5667 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Reference 82
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d2e0e32b-b44f-4354-b195-4c694489609b · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Absolute Zero: Reinforced Self-play Reasoning with Zero Data
Reference 83
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9c6c182b-8b7f-4fc7-a72f-4e7fedd0fdec · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Instruction-Following Evaluation for Large Language Models
Reference 84
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7448d546-462a-47b6-bb0a-3b9a27ab379e · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
Reference 85
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b1d1767a-6470-4c2a-ad17-378a7eb6ddf8 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Texygen: A benchmarking platform for text generation models
Reference 86
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f110a48a-0d01-4560-85db-ea063ccf73b7 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Improving alignment and robustness with circuit breakers, 2024
Reference 87
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0ea31367-5761-4aa2-b07d-6cd0959ea725 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models write newline
Reference 88
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 88cd25d4-adc9-4c6d-9bba-ecef568fbe62 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models @esa (Ref
Reference 89
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dd5c7f15-ce84-4a1d-b87b-f2c170afa4cc · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Unresolved cited work
Reference 90
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 16a43cf8-2d79-487b-a5c6-23a335ddea32 · outbound
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 91
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0122cf54-546d-493c-bbdb-139728a28dcf · inbound
Learning in Structured Stackelberg Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 87fb0fde-85a3-444f-bd59-22107d08e435 · inbound
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 160
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3ce5c752-b121-4c84-817f-6ad9d19affd0 · inbound
Safety Alignment of LMs via Non-cooperative Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5cf49950-f877-4f14-98ac-021460384fb4 · inbound
ProbeLLM: Automating Principled Diagnosis of LLM Failures Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 49079c01-45c4-4303-b942-dd408376f364 · inbound
Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 971b4905-a101-4658-8b8c-00ce6d42e8fd · inbound
Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 34ccd0d5-654f-4dd5-aff8-f4f4b8adbc6e · inbound
The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation b6e96ab9-4f73-44ad-865a-c8da413936cf · inbound
Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f2d594ef-34e0-4153-be32-593cc41954b0 · inbound
Addressing Over-Refusal in LLMs with Competing Rewards Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Reference 103
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.