Pith. sign in

Paper Citation Record · LEDGER

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 9 inbound Pith citation observations for arXiv:2507.21931.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.21931 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T12:17:54.087304Z

measured 67 of 67 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 9 of 9 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T14:55:56.722273Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T04:19:33.983480Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact6
  • verified fuzzy6
  • unresolved45
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd436bbb-8825-4501-b8b7-f5db942d9c04 · outbound

This paper cites online" 'onlinestring :=.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback online" 'onlinestring :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.820835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.820835Z digest=sha256:72cfd8511a0d0d42255084d6bb59f82d56744c25711ef94386da6102f5257cc2

Observation 898f1862-0fd3-4dd8-aa93-459a74075cbe · outbound

This paper cites write newline.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.826146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.826146Z digest=sha256:e1826c1c7cb5c05323495308fc0fca3c7e65bc33956c3a79d8fb1b377fb91d21

Observation 5d1cb278-b2eb-41ec-84eb-347d2bb2759d · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.831713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.831713Z digest=sha256:86e485f92e2d341bb919c9d9617f1d98c0162d7257c324a10a8b186b495c4af6

Observation 103e03ea-5066-47f2-a743-bb3e04ec315f · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Constitutional AI: Harmlessness from AI Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.836605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.836605Z digest=sha256:36e1b796af207a1789cfb7ba0758800c1055456b2c0a1a33ecf0ba4f02d701ae

Observation b87270d0-8ae5-4356-a111-ecbc97cb7063 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.113630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.842077Z digest=sha256:58a17384dac5211e37d3b3da771769d9820efa305fe9b21102c559d69539e71e

Observation 3bbc3fcd-2454-42d5-83a3-86301205b4fb · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.847563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.847563Z digest=sha256:8300de8d788ca8d0ceee8f127a3347e4a5a21733af0b5ad78061b643b095c0b5

Observation b9e01c82-0882-4d41-9d5d-7f8d951f6bf4 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.852515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.852515Z digest=sha256:78ad878ca9233ec5023cabd386fd6cd15f8da4ba0949d448de80ed6a438ee5b8

Observation c0dc7cd6-39cc-4876-ab86-db2a37ae961b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 8

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.432406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.857460Z digest=sha256:77128a17bb32e63088912b8639ff2f5d0db5e82d5a3036ddf214326b634a4dad

Observation ed71b569-643b-4543-88cd-57a3c01ac363 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.088245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.862686Z digest=sha256:3f7b4706ff1fb0861025ef1768fdd2e429e21d7d87ba087c132b2d2cf572f496

Observation 8c077c2b-629d-401b-9c09-fee464e66b55 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.074237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.867059Z digest=sha256:54371947667d4a1978f938fe62bc28779ce98a3646b6c39c8451cd175d05303e

Observation 184fa3dc-9100-46db-8a09-cf44577f28ff · outbound

This paper cites Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:55.060022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.871556Z digest=sha256:20678ba0c8cb5ea3543e8ea1a24fd83030b3f56ba60144e05fbc2e3d64631e41

Observation ef13e93f-ef6b-4205-a098-6de76c0b9c85 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.876094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.876094Z digest=sha256:7dfa92469302bd12e4b8e960b029e26e0b5bea1c496d21123d52229b676d3cea

Observation 4a223979-1815-4589-afd9-50d12be8bbe5 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Training Verifiers to Solve Math Word Problems

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.880989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.880989Z digest=sha256:8e5d9bd9005e5b2396115a8465519783c82b7d3038242058d282f6101a1153ea

Observation af25b509-5705-434e-8bfc-5038d932b14f · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.885704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.885704Z digest=sha256:bb391187be909fffc718d7a32a32390980d5bf9af1f1c77c5525030d6c512561

Observation ecf33ae4-b3f1-4596-87c7-8277a295c5ae · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.890650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.890650Z digest=sha256:49ce0243456de53da7c1af33fc97b223f858d80bc4cb78a5f727806ea6512e7a

Observation 33048014-125a-43ab-99e2-e3c720b8ab88 · outbound

This paper cites Quantile Regression for Distributional Reward Models in RLHF.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Quantile Regression for Distributional Reward Models in RLHF

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.895202Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.895202Z digest=sha256:00d4aa702950ba12c471c234dee39a23f446a84457e4ff4a1245ed7cd028e085

Observation 65a6c262-66ef-40d4-a2c1-58753086e028 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.045249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.899825Z digest=sha256:f47a80ae8fbecbd51699e0787e8a6ce690602ff510f8a884643ea958e86f6f82

Observation 1d3cd083-fc4f-4586-bcaf-2e37104afeb7 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 18

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.351568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.904052Z digest=sha256:b4195cff41db899a68e54f2611f0f4de5eb375c70e1e470497ce2e26792ce0b4

Observation 2d9f3ea0-e767-4144-82ea-27d427b4b898 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 19

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.334249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.908585Z digest=sha256:c78cc492d2171ca8b2850b4ac4154abfead9b2e2d1290ba9a8fbb77dd82a5777

Observation a2726703-344f-4cee-92b3-d18b74a2efd5 · outbound

This paper cites Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.912913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.912913Z digest=sha256:01be7bdc5e89f9f4dd9e1064654b6d5b27e0a63fb8ec5de006474973daeae98b

Observation 8e4b5a15-b8c8-4ebb-af48-d535e3ef61c6 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 21

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.301436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.917564Z digest=sha256:d9c1bf7d13fd18ee05ed20e0002733f91ab6b9a10a6f1c002ed4d951316c298f

Observation 8b33bcec-5f80-4b65-8a12-45dc2f00570e · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.029029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.922177Z digest=sha256:d476c148514d08451004b780a2d3ad96e07448c1a1380d05b8896d818cb10511

Observation 1a70b161-2ca9-48d1-b7b0-524b93f117c3 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.926526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.926526Z digest=sha256:92f6a73260fb349eea8c91ee110691230de0624479b50551959e26ca51e3fa64

Observation eec53b52-b622-4393-90a2-5a5b8cc340b1 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.012714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.930960Z digest=sha256:b174c2d77a2a9c9b123e81551c380661b6d6be976cc71bd81afce067f08c2ccc

Observation 2332ff48-cbd4-4132-a0b9-16d7673924a5 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.996760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.935155Z digest=sha256:6ac761334dda6124ce9c85a9746dc0448b00f8fb7df28edd7b1b59277d94347b

Observation b3f475a8-3e21-4716-a4c6-e37faa252aaf · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.981811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.939221Z digest=sha256:0d84dd7453f0a43a565f1de1604b76a348be5747913fb9fe519ce352b075790b

Observation ddcc5375-fc42-4927-8101-504dfaeeccc0 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.966669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.944321Z digest=sha256:a81bf0339cac2a58d0cde6f5204eababc88aceccf5179b8c86dfb279701ff6dc

Observation aed7f9e3-5650-4f7c-9cce-ec449f2a3c7f · outbound

This paper cites LLM Post-Training: A Deep Dive into Reasoning Large Language Models.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback LLM Post-Training: A Deep Dive into Reasoning Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.948795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.948795Z digest=sha256:91776b2c6ae0826883b12051bde1d883c437a0b5ad6869edb55b3d5ed51decfa

Observation 65508360-c5de-4996-9683-89ad4182cfa7 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.953322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.953322Z digest=sha256:7eb111f67d18c78105a6e90c35d5b01dab705829e3683c8c36fd8f5fc9d81e60

Observation 6305eda4-de57-41e8-8892-6d7d97443ecc · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback RewardBench: Evaluating Reward Models for Language Modeling

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.957953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.957953Z digest=sha256:0c7df9bc720d78650531b7efc8b65cfe9ee7bd1135565ea6a4bf0ab2a6c06f01

Observation 78f6f9e4-e7eb-4c0d-b853-0b34620982c8 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.951308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.962726Z digest=sha256:77e0fc012dcf171630d2c36183607fbab9c19731c7bd026d1ba69a7fa88355da

Observation 5c1ddf74-63ee-42a0-973b-49555015e06f · outbound

This paper cites Hashimoto.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Hashimoto

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.967178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.967178Z digest=sha256:844ac604e709692a118178f1a7213c694a24b07e3881071315600e8670d14990

Observation 73bda382-13c6-4c90-8b42-9ab188b7af6c · outbound

This paper cites Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.971631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.971631Z digest=sha256:340ffac4123f9fe0294fbe30869304dea1f9cf3b9ecf8776d6bc2ca9981e0a92

Observation 1fdf2191-ddb2-476a-95fe-3bbacccb8a8f · outbound

This paper cites Machado and Michael Bowling.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Machado and Michael Bowling

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.926167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.976351Z digest=sha256:9522171d43ec8392d93b0f75fcccfec057565eadd5c178dfe09f825cba6f4656

Observation 5ae024b5-e315-41e5-a8e8-1f749576accd · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.908405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.980788Z digest=sha256:a94c17164052c0dcc33d25dd9c57f5c3b1d976c743eaa141ac39a0b11acb503e

Observation 1607dbc4-e6fb-4267-ae5a-aa5a061a0536 · outbound

This paper cites GPT-4 Technical Report.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback GPT-4 Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.985221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.985221Z digest=sha256:a6ae5442b63a20fb0638d1d7756d26707a8e33108474a003add8fbab6641e321

Observation 920a9cf9-af70-4a6e-b69b-31596cf5a4c4 · outbound

This paper cites OpenAI o1 System Card.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback OpenAI o1 System Card

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.989752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.989752Z digest=sha256:0e87fde27f3405c99f582560a9d1d6a8d4385f042aa13d816b86a723b557b6c5

Observation 7c5b48e5-f810-4442-8ae8-a20d5599757a · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 38

Resolution
metadata mismatch
raw_fallback, observed 2026-08-06T12:17:54.674179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.994478Z digest=sha256:fad61456e136d4abcd3dbac4afe4fed041205a55edff79ac70a3babd99229825

Observation 2ccb806d-4f12-4181-81e4-6828331e75dc · outbound

This paper cites Christiano, Jan Leike, and Ryan Lowe.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Christiano, Jan Leike, and Ryan Lowe

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.892689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.999449Z digest=sha256:8a9589c4baae0ac8b9ddefef9ffccb30e96415f41960e6f703a66a5714daa829

Observation 1eb2c9ef-dce7-4f9b-9ba2-0212cadc9381 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 40

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.245322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.003905Z digest=sha256:49aaf2502dd454d19ecc70aa3053977d5764e149e9419d8e6290648685381e13

Observation aba441ef-11c8-42b4-8b56-9b462885af30 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Manning, Stefano Ermon, and Chelsea Finn

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.876404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.008412Z digest=sha256:f6c8e2190c016682747d754ac3a51f91c6cb9f7b99f18c9bf19ed231c0d5c58a

Observation 974b5b5b-e63f-4abf-ab67-11cfec510a20 · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Gemma 2: Improving Open Language Models at a Practical Size

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.012877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.012877Z digest=sha256:c70d5a7e29c5032f5a6c7ed023ce6dc7902f7552e7b147c464624843f12a0dbe

Observation 18261e3f-3215-4bd2-af58-e902cb91da09 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.017693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.017693Z digest=sha256:8716bc2e925f24f1acc5fda7ed7e80d2997240b7edc00debb703413d75636c1f

Observation f36d5dd8-6196-4ed5-b5c4-6a1bdbbdee99 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.860761Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.022190Z digest=sha256:c0fb6a5df73ade817c898a4b55454ea35a0c61a6920e4bf5909da51fda12bad6

Observation 01efa139-d2e5-42cb-b09f-6e42f4c5f689 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Proximal Policy Optimization Algorithms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.026626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.026626Z digest=sha256:840abfac1ef1a627d2057c7b0755f9ecc9a912c04626d7efa8665c8613ea9a82

Observation f88fab62-6c2e-46d4-ae45-ded60763dde7 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.031390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.031390Z digest=sha256:535a7fc2d97c83cd3296a81166c9a4ef83890e7678c052bd626f7292ba1780e7

Observation 9c7807fa-509c-4bd1-bfec-804faf362c59 · outbound

This paper cites Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.036222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.036222Z digest=sha256:c15685d6a66ab3ce74a51a3aa486d75604368340a246d31548b0a10f8e0951f3

Observation 6cd3f862-7b50-4f69-941e-1375d2f0cf7c · outbound

This paper cites Sutton, David McAllester, Satinder Singh, and Yishay Mansour.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Sutton, David McAllester, Satinder Singh, and Yishay Mansour

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.845656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.041302Z digest=sha256:0412620e5998aa3107d626046f8aac13605d5cfd885d6db1b88ad7f213cbf480

Observation 2f25b65c-16b8-4d5d-8705-135b06736807 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.045473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.045473Z digest=sha256:c5031e0390854042523aa662a6017cdfa358c47192d030145e3926f38940eed1

Observation c24efdf8-b312-413b-b5a7-f1295e8b7b8b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.050028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.050028Z digest=sha256:8fbc12c5f4228d0f53348437e2a11462ac1fd2df7d2c6045ee9a8258c5513d3b

Observation 01e7a4b5-375c-4141-aff7-57e20d96e081 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.055241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.055241Z digest=sha256:c8c5b2237b3cde26040e309fa9cc8b260725bab76b2c405ff007ef29331b32de

Observation 4f958512-d0ce-4590-af80-d1f24f2a005b · outbound

This paper cites Chain-of-Thought Reasoning Without Prompting.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chain-of-Thought Reasoning Without Prompting

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.059645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.059645Z digest=sha256:b3226593d6daf1afb656b3e011d8f2d5c63956d7b22c045dbbed813fac9fe606

Observation c202611a-70b7-41d9-a323-e45ed797a153 · outbound

This paper cites Le, and Denny Zhou.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Le, and Denny Zhou

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.819137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.064389Z digest=sha256:77075ce6507f75f4302e8e2a10cca7a22b69ce1378bb9a7004922966d5628182

Observation 8a5381e1-c69b-4663-b51e-16398997157b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.804267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.068691Z digest=sha256:3d1630b4db1e25a340ea200cb2a584d6b52e225163c0e7b2347ffdf10d7779fc

Observation 76501c6b-b7e7-4d15-915b-42e6a289f892 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.073482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.073482Z digest=sha256:2cfe83e36163b6ae6effacd274389937e69a0589849499ed15918f219ef2ed6a

Observation 1662f26f-1a90-4a84-9c2c-c688b711e9d9 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.789300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.078344Z digest=sha256:9466143282335e675703f121a927119c9175bd01062407a73fcc353efb70657e

Observation 5eb45b58-9c32-497c-ba3d-b6baeb420f04 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.773581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.082905Z digest=sha256:a6f08816ff51787424fc1b8cef0fbe6e5f0565f5164a14c16b50f3e7f8df90d6

Observation a3b4f10c-1dea-43e8-a5a5-113697227e16 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 58

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.125412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.087304Z digest=sha256:8c5bcb56dc72c4439d87aad6aba923fa85f46cf8aca9724557a818e32387026b

Pith citing papers

Observation 8a3bf153-0a8b-470d-b7ea-f08e298d5ef3 · inbound

Self-Rewarding Vision-Language Model via Reasoning Decomposition cites this paper.

Self-Rewarding Vision-Language Model via Reasoning Decomposition Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T21:06:50.793278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-18T21:03:31.606674Z digest=sha256:130dfe419015e7e2bca89595a18288c71fa47564b0375bb9bdec2a593db54266

Observation 401901ae-2ce4-4b39-bd17-2493aae8662b · inbound

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle cites this paper.

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 162

Resolution
unresolved
no resolver link, observed 2026-08-04T16:07:41.298276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:07:41.298276Z digest=sha256:a3b6f6d141b2761e967f607279386e9fba2670dc530acad4b142179ebcd50e47

Observation a143f6f2-8730-4f1c-980f-16c0a9ca5807 · inbound

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection cites this paper.

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-03T16:33:13.577415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:33:13.577415Z digest=sha256:f9c15c9ecc2699eee6fa65ae436a668680c3f2c1dc2758fb8516ff78d8440ad8

Observation 6b42ea3d-cb52-4bb2-a765-04e608af4a2d · inbound

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning cites this paper.

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T06:52:55.624948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T06:52:55.624948Z digest=sha256:95531ff7d21858323ec4e265924571da38c0e55cf384e637f1b25b9c0fc9edc8

Observation bf2287c3-e21b-4c88-ab6d-558d14d9c0ee · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 39

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.491818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:5bc85caf8dba6db7a24a4f5fed710f43717aaea6bfae6ce0e688fdf9bc820c74

Observation c285e10a-1373-4563-9ecf-c71b9d11a2b8 · inbound

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling cites this paper.

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 38

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T06:06:40.824202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-06-28T07:45:43.320339Z digest=sha256:34c045f0296bdaa4c5d399a1c04f534eecde2921b4bdae44e28dbadc37f6e96e

Observation 84976034-2286-4be4-9490-3c0176afdddb · inbound

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study cites this paper.

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-07-04T04:19:33.985873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-26T17:07:21.486960Z digest=sha256:d99e174cfd80ef6245e17a8170a17fe44b8add3f5a8693a95d0edaf7e544c8b4

Observation a7deee87-0de1-4688-b5db-17d1c6785f06 · inbound

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs cites this paper.

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 102

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:35:42.088576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-01T05:22:38.232552Z digest=sha256:fb531f9e892c13b2ddbc84f2058b377b2cd2b72493b153353f4a138baa256a1c

Observation 4ee668c2-3338-4fac-9708-332017d83d63 · inbound

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs cites this paper.

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-15T14:55:56.722273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T14:55:56.722273Z digest=sha256:a94babc77c2e2db51433a4b30450a3ddb67e0c34464bcbac0287e925fc10455e