Pith. sign in

Paper Citation Record · LEDGER

Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2403.03185.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2403.03185 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 15 of 15 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 15 of 15 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T21:10:44.092970Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T10:05:40.200096Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 4842cd52-f304-418a-b188-f2215cc35f9f · inbound

CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback cites this paper.

CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T21:10:44.092970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T21:10:44.092970Z digest=sha256:7d23dee3e48714376de843f3749d8628b66366008c2cab3d5f4abf11d1b2f8e5

Observation d9fa1578-028d-400b-9587-c93bdb7b4e1e · inbound

CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs cites this paper.

CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T11:53:55.424663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:53:55.424663Z digest=sha256:b0dcd765a06966bc2589515dd84163ae7ba91fa1cde65a1077a760d53ff434a4

Observation 2670194a-a4ac-4f5c-9ff8-66c87f5a78b3 · inbound

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary cites this paper.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.540210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.540210Z digest=sha256:b6b30a0303529aa5c6152149eb301a3dbca48574b0962715ef5ddd1524dc014e

Observation a2f7b982-d8b7-489f-a195-dd984d220137 · inbound

Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges cites this paper.

Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 206

Resolution
unresolved
no resolver link, observed 2026-08-06T14:13:07.054604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T14:13:07.054604Z digest=sha256:f6266a69f64dae8b09864653be806812d2d930facb47e1acc578aea94a6d8171

Observation 2fc8c0f6-865f-4505-82a2-67754d8d0c58 · inbound

Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems cites this paper.

Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-13T10:37:39.719847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-13T10:37:39.719847Z digest=sha256:a5f6d752e0249c768c5699150224b2c89049df11f60ac226a1c1c818effcbc21

Observation 06d2ddd8-1325-45e9-89bb-dc941196c020 · inbound

ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training cites this paper.

ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:20:57.524394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T18:12:55.726473Z digest=sha256:237bdb9ef8903b5c384f3317956e8317291cd24bd513f85fe1df4ce4efe381f1

Observation 52d9be29-3de1-4273-8d07-116dd9203852 · inbound

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation cites this paper.

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-11T21:11:10.343291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-08T06:38:32.413172Z digest=sha256:c58809158842c74b42e974bbf882d6c926b87a3d1a83f3072ab193f5034e862b

Observation 96ff174c-932e-4786-99af-19862dfa8c28 · inbound

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation cites this paper.

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-01T10:05:40.203539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-07-01T09:56:48.019404Z digest=sha256:e68e90d2061e16287b311f904d1a27d44c27d9cc6e0ba26789856ca32c806ae6

Observation c54b6007-68b2-4640-b5a6-73b3efa9d85b · inbound

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation cites this paper.

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T05:25:40.960460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T05:25:40.960460Z digest=sha256:9eb0a693a54c58f66a1b91ed9b804256294de640ccd32eaad03a0972af275d5f

Observation 9340113c-aa56-4a4b-8ee1-294f5aa71c62 · inbound

Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models cites this paper.

Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-06-30T12:24:39.629009Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-30T12:22:49.708718Z digest=sha256:ea4dac79547caa1f947310ed03c332e600f0e5527d4ce49b6b75da245f714522

Observation 1ab4c228-9c42-4b17-9b41-9cef9a2c692a · inbound

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks? cites this paper.

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks? Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:42:49.591672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-28T23:38:33.520625Z digest=sha256:ecdbcb7b2e5d9412c6bebc188097bffad55085ef9798a179d12a434cc7a6297e

Observation e7eaca9b-a368-4663-9a76-c2e67284a7b7 · inbound

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks? cites this paper.

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks? Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-06-29T05:43:07.713266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-29T05:42:55.457904Z digest=sha256:b5e29768a94a89fb502a644f154e0e5b181629016f9309bbfd18b47432c9c2bc

Observation b1ca5bd7-1be9-443c-9cc7-91332aac482f · inbound

Reframing AGI Confrontation with Off Earth Autonomy cites this paper.

Reframing AGI Confrontation with Off Earth Autonomy Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T08:35:34.310983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-07-01T07:18:55.451342Z digest=sha256:e981b08a18e26b3ce4ea280782d2b84046f02b5aec71700006a11a55f4c7892e

Observation 8c85bc5c-0dc3-42ae-98d0-eac8dca4d909 · inbound

MentalThink: Shaping Thoughts in Mental SVG World cites this paper.

MentalThink: Shaping Thoughts in Mental SVG World Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 175

Resolution
unresolved
no resolver link, observed 2026-07-12T01:50:59.184754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-12T01:50:59.184754Z digest=sha256:84d7d2ea309eef2bc79d082357431e802dd00a8d666ac64b75f3f4f241b962fc

Observation 51def8e8-b57b-4a8b-bbac-6f7c6bdffadd · inbound

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models cites this paper.

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T21:10:19.761669Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:10:19.761669Z digest=sha256:f352e5c517b201ea158e4580b5f34298ac360e905dc2739f48ffc11dc975a38c