Pith. sign in

Paper Citation Record · LEDGER

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback

As of 7 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.26094.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.26094 v1

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-01T03:14:13.563948Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

20 of 20 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 51040481-5837-49d3-8358-f99c6d01eb97 · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:10.842492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:10.842492Z digest=sha256:195068a6b23d7b1d49ab2825a88a15bebfccff6e8be85467bfe6e3b061104c26

Observation 8fb2c7a8-6ead-4e92-b780-9321a19dc83a · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:11.128584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:11.128584Z digest=sha256:ad7a9d03d3ca279ea5b6914398b1fd0dfd5282cf88be8b39bf52520a18c5bc77

Observation d10d2cd2-a4c2-4cb7-88a7-3f85aa373f0c · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback RewardBench: Evaluating Reward Models for Language Modeling

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:11.464266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:11.464266Z digest=sha256:6751c36c85a0365c003c04517cf3b1ef91133a117cd60047ada95a18c1bcf807

Observation 48a605e5-6313-47ef-8ce5-c44dc9c7a684 · outbound

This paper cites RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:11.626530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:11.626530Z digest=sha256:9843244eaee0734066bb56dce2f633f457f8b5db60a5598437c84ec6c2ca8da6

Observation 0645fb08-2d27-4bd5-8b20-734940f2ba5c · outbound

This paper cites Let's Verify Step by Step.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Let's Verify Step by Step

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:11.774881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:11.774881Z digest=sha256:ca467073f499ab4e99e4345a78bbd1e54b57ccbd9e4d12fd34af1b244465475f

Observation 60712595-d350-4103-9b40-62289167d629 · outbound

This paper cites Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:11.955077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:11.955077Z digest=sha256:c5b95c7d4984e6f02d841e675750a49ed38aaf436ef2db3d61bbc05921f3fb80

Observation e68c4f83-74cb-4aa6-ae17-d92108e4637f · outbound

This paper cites SimPO: Simple Preference Optimization with a Reference-Free Reward.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback SimPO: Simple Preference Optimization with a Reference-Free Reward

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.096567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.096567Z digest=sha256:1262c3d1f10c27a5ea5522bf6f8af27e60238a0312f158da8a980f5af1382fff

Observation 994fa857-840e-4df8-8a72-8c376f28cd8e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Proximal Policy Optimization Algorithms

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.268409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.268409Z digest=sha256:40a3cf0c72bade741e8ed0181aeca10b86394b7d60f77f26a6584494d22ef83d

Observation 463e2fcb-5601-4877-bee7-ed326d82e249 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.436765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.436765Z digest=sha256:1cc8bcf003980eeb76e49b25f309c72f8cc4729fa11184c35e3c49ea44c0a9fb

Observation ee29d25c-1280-4512-ba25-21417f06d751 · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Solving math word problems with process- and outcome-based feedback

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.620290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.620290Z digest=sha256:bf3696190dd291f3505c225a8738dae6d1b3a943e9634bb317f4bbbe1b039366

Observation 36eec2bb-fe64-48d6-9715-b767de896496 · outbound

This paper cites Secrets of RLHF in Large Language Models Part II: Reward Modeling.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Secrets of RLHF in Large Language Models Part II: Reward Modeling

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.745471Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.745471Z digest=sha256:2f6bd10d9408a20258f830640dd5b5b1509af2a386bd77c36b1e893454aa8b73

Observation b7d42c34-5f16-46a9-9cb9-82521729b748 · outbound

This paper cites Shepherd: A Critic for Language Model Generation.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Shepherd: A Critic for Language Model Generation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.848281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.848281Z digest=sha256:e7022be270d248bac7e0390b56a5c520d34178af36bd307a2d4ac9d02e3d8ef0

Observation 78f09d93-52dd-4add-9bea-8dfd62e6d254 · outbound

This paper cites Text2Reward: Reward Shaping with Language Models for Reinforcement Learning.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.941468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.941468Z digest=sha256:a6f3bedc224ff856f0a0983de794d99d59c1f56b6ebd0a4cebac147f60fb2b8f

Observation 547954f7-9c66-4dd1-af5b-2907541648ac · outbound

This paper cites Self-Rewarding Language Models.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Self-Rewarding Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:13.190121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:13.190121Z digest=sha256:fd2abae202ebf107638b840a15111d2f20e0d456e2ca560b1a6f64335b91303c

Observation afc01fc8-d4da-4fb7-83db-221c62e941f5 · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Instruction-Following Evaluation for Large Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:13.379937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:13.379937Z digest=sha256:2e24cf9b13b11003e594ddea132bb6e67bcea06f3d776a0ffcef0f063d5bb445

Observation 03ec0e56-5877-4bdf-856e-e1f22df7607a · outbound

This paper cites Reward Shaping via Meta-Learning.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Reward Shaping via Meta-Learning

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:13.563948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:13.563948Z digest=sha256:887c3108a0051a72b568d2882323f87717d77212c55bbb110f4cbc37c879db3d

Observation fbeb53db-f0cd-4a26-8a74-66021b08a0fb · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback LoRA: Low-Rank Adaptation of Large Language Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:11.329925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:11.329925Z digest=sha256:525b7c1084c4adfd93e19846dcc428f3223605915f7d37be3dfa71ed688b30a0

Observation ff93314f-7801-4b9c-9a7d-3773201a0dfc · outbound

This paper cites Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:10.992998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:10.992998Z digest=sha256:8258056f86bb0331bb12073f0285f0a92b1c91e943d99766f24f11f2364503f0

Observation 2e737dde-6869-45d3-9274-77ad0eb7785c · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:11.207266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:11.207266Z digest=sha256:440a38574b9ee2a6408677427ff85970680e8ecc18297a0aaf2c264c547585f0

Observation 2e3c978e-8427-4234-aef3-759f534a98e3 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:13.058627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:13.058627Z digest=sha256:b4f8e20c90f7c694ae78bec4d9f0dcd697a2a2eedb0a8610c482ffcf59e65dd0

Pith citing papers

No inbound Pith citation observations are available.