Pith. sign in

Paper Citation Record · LEDGER

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 8 inbound Pith citation observations for arXiv:2507.21931.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.21931 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T12:17:54.087304Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T16:07:41.298276Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T04:19:33.983480Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact6
  • verified fuzzy6
  • unresolved45
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd436bbb-8825-4501-b8b7-f5db942d9c04 · outbound

This paper cites online" 'onlinestring :=.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback online" 'onlinestring :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.820835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.820835Z digest=sha256:aa25e363d500a341c3703188c031ad13535d7decdcc80cb233187daab9ce9364

Observation 898f1862-0fd3-4dd8-aa93-459a74075cbe · outbound

This paper cites write newline.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.826146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.826146Z digest=sha256:3f6e899afeb62c8f2e8e90efc9a14b08f0199db344c769ad3e4b01e96a4b890f

Observation 5d1cb278-b2eb-41ec-84eb-347d2bb2759d · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.831713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.831713Z digest=sha256:432d2f099f27b705a1c89f2f2b3a5cb6de9cf7e04797c491863d5b85107f5885

Observation 103e03ea-5066-47f2-a743-bb3e04ec315f · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Constitutional AI: Harmlessness from AI Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.836605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.836605Z digest=sha256:5c52ed630c8a05f38ee48a9611bddfe968bdb22a16f41aa77715a85057eba8f6

Observation b87270d0-8ae5-4356-a111-ecbc97cb7063 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.113630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.842077Z digest=sha256:e86d9a26d84fc4e33bf246bfbc7515b52f46296670a821c3ee22bf41897733be

Observation 3bbc3fcd-2454-42d5-83a3-86301205b4fb · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.847563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.847563Z digest=sha256:5369008bf3d13abc7c34b8813f7739384035ef259a170a10b4d979b6a6aaf387

Observation b9e01c82-0882-4d41-9d5d-7f8d951f6bf4 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.852515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.852515Z digest=sha256:344c8a80a93397bac7db75164cbecd0fd82a4051114168a830713cc563297814

Observation c0dc7cd6-39cc-4876-ab86-db2a37ae961b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 8

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.432406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.857460Z digest=sha256:192611a4088c92d8258852dc2939025c3d1db81f12f0548a3ed9c13ba5e35fed

Observation ed71b569-643b-4543-88cd-57a3c01ac363 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.088245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.862686Z digest=sha256:1be009a477490515723338e3643dcb097cff73648ecf45ba6d866935f31c6e98

Observation 8c077c2b-629d-401b-9c09-fee464e66b55 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.074237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.867059Z digest=sha256:b3fab7356102df9555a6f8da3e31fba4d8f9683b2cd4fdee1e24806118e9cbfd

Observation 184fa3dc-9100-46db-8a09-cf44577f28ff · outbound

This paper cites Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:55.060022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.871556Z digest=sha256:024b62f77439a961d4762127da0169fa3c959e81587fb790fdc654041b43b2e9

Observation ef13e93f-ef6b-4205-a098-6de76c0b9c85 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.876094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.876094Z digest=sha256:e711741bcb359eb1d5495f74489c7b7081ec6b9e990c5bbdf22fa0fd01298ca6

Observation 4a223979-1815-4589-afd9-50d12be8bbe5 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Training Verifiers to Solve Math Word Problems

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.880989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.880989Z digest=sha256:9aad3b406570247d1a77555658f59021adc4ee220460e95e909a48583f9cb107

Observation af25b509-5705-434e-8bfc-5038d932b14f · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.885704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.885704Z digest=sha256:79bb51f6f283ef8012c0c4d9b0cb40416d4dd9cbfa4f98c2185f94c5b624b1bb

Observation ecf33ae4-b3f1-4596-87c7-8277a295c5ae · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.890650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.890650Z digest=sha256:15b167df74e40452d61968d811b265f4cbe8d0aa308c36112e98fe9e8e2069af

Observation 33048014-125a-43ab-99e2-e3c720b8ab88 · outbound

This paper cites Quantile Regression for Distributional Reward Models in RLHF.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Quantile Regression for Distributional Reward Models in RLHF

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.895202Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.895202Z digest=sha256:d9e28896274e7397afa2950a04884bad0797b78714d45804695eea15e242a7e7

Observation 65a6c262-66ef-40d4-a2c1-58753086e028 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.045249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.899825Z digest=sha256:80c25ba2567a216f5ef54c3915008961b36e3651b205047aa2fac8db57fdb561

Observation 1d3cd083-fc4f-4586-bcaf-2e37104afeb7 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 18

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.351568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.904052Z digest=sha256:2079b74baacec9451903ba94e465f17f463fa799684082a970f1e856197cdc64

Observation 2d9f3ea0-e767-4144-82ea-27d427b4b898 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 19

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.334249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.908585Z digest=sha256:29f0a77b1038daa84a2771a0e6b83b913574969c405f0f9a4b05199e33fc1a7a

Observation a2726703-344f-4cee-92b3-d18b74a2efd5 · outbound

This paper cites Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.912913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.912913Z digest=sha256:c7613b6443c1403016a9f2abb8eb1b9caa37a3c3cd987b44bfe65f12794eaaf5

Observation 8e4b5a15-b8c8-4ebb-af48-d535e3ef61c6 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 21

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.301436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.917564Z digest=sha256:8236d89cc69488f785ef91922b457c0e4155d609518230fe2cc2f4f0fdf6bf37

Observation 8b33bcec-5f80-4b65-8a12-45dc2f00570e · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.029029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.922177Z digest=sha256:8321799babdcaa24180c3695fb4eb473bc9d6e88bce78be325d6dbe45404a5ce

Observation 1a70b161-2ca9-48d1-b7b0-524b93f117c3 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.926526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.926526Z digest=sha256:32ca82dd039aa08d8352c3aa2b8bf2a3ff085835e5087fdede265eb66250d0fc

Observation eec53b52-b622-4393-90a2-5a5b8cc340b1 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.012714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.930960Z digest=sha256:c252555e76669289d8a0248190e0a2dffe758b759580e1e74b9723280ed6ec31

Observation 2332ff48-cbd4-4132-a0b9-16d7673924a5 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.996760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.935155Z digest=sha256:7653508ca96f071f3ff2c8d8777b94da8c2ae4e5f077559410dafe3a552c0407

Observation b3f475a8-3e21-4716-a4c6-e37faa252aaf · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.981811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.939221Z digest=sha256:f64db07dd65f3b3b984c226bdb1eee1035868734553f4bc22763c17d9d530690

Observation ddcc5375-fc42-4927-8101-504dfaeeccc0 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.966669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.944321Z digest=sha256:ae463ff6cfa515f04def8198362cbb920ce0569c29187380e81f20f903f80298

Observation aed7f9e3-5650-4f7c-9cce-ec449f2a3c7f · outbound

This paper cites LLM Post-Training: A Deep Dive into Reasoning Large Language Models.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback LLM Post-Training: A Deep Dive into Reasoning Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.948795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.948795Z digest=sha256:efaae60f8b6dd38d741a0b139a48bc8efadcc2629ac98e2cdfa4a2187889e8d4

Observation 65508360-c5de-4996-9683-89ad4182cfa7 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.953322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.953322Z digest=sha256:6084625e2d9e5688ba1e7f3e7e29625def4194cc313c288e9246de46314be6dd

Observation 6305eda4-de57-41e8-8892-6d7d97443ecc · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback RewardBench: Evaluating Reward Models for Language Modeling

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.957953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.957953Z digest=sha256:50c6694e55bde8527e81d69858f8613d7cd908aeffa611d6a1d38cf75ca12e34

Observation 78f6f9e4-e7eb-4c0d-b853-0b34620982c8 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.951308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.962726Z digest=sha256:caf77e889d41658f2bcea16a607109ee65f2c93d640c83177f5be4d77faf2972

Observation 5c1ddf74-63ee-42a0-973b-49555015e06f · outbound

This paper cites Hashimoto.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Hashimoto

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.967178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.967178Z digest=sha256:4f3214d3c9fce9dd672beb614bc57ecb7752ecda7275b0b1b368161dbdd36646

Observation 73bda382-13c6-4c90-8b42-9ab188b7af6c · outbound

This paper cites Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.971631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.971631Z digest=sha256:30b5ac5fca978b3cc60714535eb1afed95d9d568c7889bcb26a47aa865b3dd19

Observation 1fdf2191-ddb2-476a-95fe-3bbacccb8a8f · outbound

This paper cites Machado and Michael Bowling.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Machado and Michael Bowling

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.926167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.976351Z digest=sha256:cf9dedfeab1e9674f1fa6e921794c16447870acdd621822d9c901ae1d85f54a6

Observation 5ae024b5-e315-41e5-a8e8-1f749576accd · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.908405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.980788Z digest=sha256:e4d07963db9cfbef367d0b11fde0fc5204091af155a05d967796303339f3c584

Observation 1607dbc4-e6fb-4267-ae5a-aa5a061a0536 · outbound

This paper cites GPT-4 Technical Report.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback GPT-4 Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.985221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.985221Z digest=sha256:7a2e4812cbec7a30104f0c461ad20af085bb141ed2c2d3532232015fca911ce2

Observation 920a9cf9-af70-4a6e-b69b-31596cf5a4c4 · outbound

This paper cites OpenAI o1 System Card.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback OpenAI o1 System Card

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.989752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.989752Z digest=sha256:970615a13afc61078458cadec5d9fcc9ca2bebd26dee95e8ec48631a7671ebda

Observation 7c5b48e5-f810-4442-8ae8-a20d5599757a · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 38

Resolution
metadata mismatch
raw_fallback, observed 2026-08-06T12:17:54.674179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.994478Z digest=sha256:cd64f65062b29060070d427b057a40d2fbfeacf1ca953819799d2cdcb5cfc52a

Observation 2ccb806d-4f12-4181-81e4-6828331e75dc · outbound

This paper cites Christiano, Jan Leike, and Ryan Lowe.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Christiano, Jan Leike, and Ryan Lowe

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.892689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.999449Z digest=sha256:792c5c066498921b43ba3376a7d11a74eca2f02486ca7cb58fa85181e1496586

Observation 1eb2c9ef-dce7-4f9b-9ba2-0212cadc9381 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 40

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.245322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.003905Z digest=sha256:10625c5823a969530064f8bedfd071d468f1af4d2b9b2e6c21b9ff53a7fe3008

Observation aba441ef-11c8-42b4-8b56-9b462885af30 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Manning, Stefano Ermon, and Chelsea Finn

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.876404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.008412Z digest=sha256:905e2d8dfdb1723a516972d5cadfbda962cac9058fd8801531a0dfb9709aee53

Observation 974b5b5b-e63f-4abf-ab67-11cfec510a20 · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Gemma 2: Improving Open Language Models at a Practical Size

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.012877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.012877Z digest=sha256:cdd8c3f9bfe5db03d0564e1f1e42bfefcfaf6416424bfcad84b2a90ccafc0acd

Observation 18261e3f-3215-4bd2-af58-e902cb91da09 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.017693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.017693Z digest=sha256:a4dbbeb79829a1779e299956024955382b2f241724e6b77b6b2e1e4683982703

Observation f36d5dd8-6196-4ed5-b5c4-6a1bdbbdee99 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.860761Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.022190Z digest=sha256:4b85ee45ec3437182c29f87295b95ce6291b01b9783a16f5eafb401cff32b836

Observation 01efa139-d2e5-42cb-b09f-6e42f4c5f689 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Proximal Policy Optimization Algorithms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.026626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.026626Z digest=sha256:7c310472e61de2ed46b038b09d377fc23bae58574a6a02aa73bc796b4842143f

Observation f88fab62-6c2e-46d4-ae45-ded60763dde7 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.031390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.031390Z digest=sha256:30e742b599d01c6e412fa22927d6b23f8b3ba5283a3dc2288971c73fff358903

Observation 9c7807fa-509c-4bd1-bfec-804faf362c59 · outbound

This paper cites Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.036222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.036222Z digest=sha256:7e6c0338badf4a4aea5749c6dcf7b0c370ead133ae3e554f92dfeb6749d0b9f3

Observation 6cd3f862-7b50-4f69-941e-1375d2f0cf7c · outbound

This paper cites Sutton, David McAllester, Satinder Singh, and Yishay Mansour.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Sutton, David McAllester, Satinder Singh, and Yishay Mansour

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.845656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.041302Z digest=sha256:39ca5fae1c27559bec3799ca5059b2061aa32089d276002c58e13c1d440d4cb5

Observation 2f25b65c-16b8-4d5d-8705-135b06736807 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.045473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.045473Z digest=sha256:5000f727e47ac704d44a52c8ed560bd9ade38a625010b1c827564626e1594f1d

Observation c24efdf8-b312-413b-b5a7-f1295e8b7b8b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.050028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.050028Z digest=sha256:e1fefcf2c2ca90ae461f8ff4c0d7a9dcd17739901d88c89eb0737af34eb0756b

Observation 01e7a4b5-375c-4141-aff7-57e20d96e081 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.055241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.055241Z digest=sha256:310c577ca40d3bc89911506115fdea0427b500726b18cbb9659c97053e956e5b

Observation 4f958512-d0ce-4590-af80-d1f24f2a005b · outbound

This paper cites Chain-of-Thought Reasoning Without Prompting.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chain-of-Thought Reasoning Without Prompting

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.059645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.059645Z digest=sha256:235d2c59bb56aabf7571832a0ee0a0e56c86fa0b94df48bbe24d5371f8d9ce0c

Observation c202611a-70b7-41d9-a323-e45ed797a153 · outbound

This paper cites Le, and Denny Zhou.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Le, and Denny Zhou

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.819137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.064389Z digest=sha256:c0eef8307c8e45dbd4eb5f6adf9fced5176630ba965b21eb873ad51e030b37e8

Observation 8a5381e1-c69b-4663-b51e-16398997157b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.804267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.068691Z digest=sha256:dfb2c73de9a45c924a86958c9969f4a54526a73493bc697c8707f3b3e297b0ad

Observation 76501c6b-b7e7-4d15-915b-42e6a289f892 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.073482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.073482Z digest=sha256:49a13319aaf91fb4554ea68ceda49a326d3cc90a6186bd8deff0d085d2d4ffce

Observation 1662f26f-1a90-4a84-9c2c-c688b711e9d9 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.789300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.078344Z digest=sha256:81e36329a8aae042330caa82e51cda050dde9cde901b8614964ee42312801459

Observation 5eb45b58-9c32-497c-ba3d-b6baeb420f04 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.773581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.082905Z digest=sha256:6c9e756de2020af94a78966add998ef7a6424f45f93ea505a69544aaf3ccea67

Observation a3b4f10c-1dea-43e8-a5a5-113697227e16 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 58

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.125412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.087304Z digest=sha256:8094518cd863a7e7087091a55d65f39da1787e7bf6cb5d1ccfedf1583191f060

Pith citing papers

Observation 8a3bf153-0a8b-470d-b7ea-f08e298d5ef3 · inbound

Self-Rewarding Vision-Language Model via Reasoning Decomposition cites this paper.

Self-Rewarding Vision-Language Model via Reasoning Decomposition Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T21:06:50.793278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-18T21:03:31.606674Z digest=sha256:ede0ceb13fb9b08eef797f73a5d947321ae0bccc08001d640ad41f0dcea0e3cd

Observation 401901ae-2ce4-4b39-bd17-2493aae8662b · inbound

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle cites this paper.

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 162

Resolution
unresolved
no resolver link, observed 2026-08-04T16:07:41.298276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:07:41.298276Z digest=sha256:2b58d244eb8bd8c563075d844015c44ec44e8d574797911d9636db1615093b8c

Observation a143f6f2-8730-4f1c-980f-16c0a9ca5807 · inbound

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection cites this paper.

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-03T16:33:13.577415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:33:13.577415Z digest=sha256:62dc9a92a6168ada0ec3d399467379134b38bc5e611d82948009c92de4f83c20

Observation 6b42ea3d-cb52-4bb2-a765-04e608af4a2d · inbound

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning cites this paper.

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T06:52:55.624948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T06:52:55.624948Z digest=sha256:73944ba221fee8c17222784c8696a05dc330ab109869745b2c81710b80b07fc4

Observation bf2287c3-e21b-4c88-ab6d-558d14d9c0ee · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 39

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.491818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:1c64c813deecfb91f51c210a5198fb355066ac5efaa20bb3786121737c639cf5

Observation c285e10a-1373-4563-9ecf-c71b9d11a2b8 · inbound

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling cites this paper.

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 38

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T06:06:40.824202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-28T07:45:43.320339Z digest=sha256:8c69306b08841f99e603b4c3277f3750e99a57307efdf855c16329f3b72467e1

Observation 84976034-2286-4be4-9490-3c0176afdddb · inbound

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study cites this paper.

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-07-04T04:19:33.985873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-26T17:07:21.486960Z digest=sha256:9ad54fed8f42f2b889d36c7cd8edcd570441a0a957ec3f3821721d37bcbd0e39

Observation a7deee87-0de1-4688-b5db-17d1c6785f06 · inbound

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs cites this paper.

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 102

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:35:42.088576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-07-01T05:22:38.232552Z digest=sha256:6ed439da1c1300c563276023db941d06179bc14e8e10d351d0cabc0e87a7a8e0