Pith. sign in

Paper Citation Record · LEDGER

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

As of 17 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 3 inbound Pith citation observations for arXiv:2507.13158.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.13158 v1

Coverage vector

measured 100 of 117 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T16:34:25.301260Z

measured 103 of 103 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T11:17:36.742733Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T07:59:40.152268Z

Reference resolution

100 of 117 outbound references displayed

  • verified exact5
  • verified fuzzy0
  • unresolved89
  • parse uncertain6
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 77084717-f2be-497f-8d93-392cf620e010 · outbound

This paper cites GPT-4 Technical Report.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.929368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.929368Z digest=sha256:c4013efff96765d12263d13419f00a2219af46833e82d4bcb280e09a5e4777e9

Observation a422fa13-9e47-499a-a907-8db37dd31b07 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 7

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:24.949183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.949183Z digest=sha256:f4aa9c3923b9ff956b0e4c93fb7547a10c111e3ee916f0a66df48b7d984a95f8

Observation e1257466-8376-4141-82e0-9e481af8b394 · outbound

This paper cites Language models are few-shot learners.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Language models are few-shot learners

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.952418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.952418Z digest=sha256:9fa6d6bda8cd9db130efc06357f81629bd0b2f3a5527ff61eb08b7540dd94851

Observation 77be57c1-9825-4171-a4c3-dca895a4b655 · outbound

This paper cites PAD: Personalized Alignment of LLMs at Decoding-Time.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities PAD: Personalized Alignment of LLMs at Decoding-Time

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.962376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.962376Z digest=sha256:6386165b344d08bb2b251a2eed7eb8cfef9cfdb444a25c11902953e3e4f911b0

Observation 12d4acc6-c2fe-47e3-8ed9-3c0a9e4d5f3e · outbound

This paper cites Reward Model Ensembles Help Mitigate Overoptimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reward Model Ensembles Help Mitigate Overoptimization

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.968234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.968234Z digest=sha256:a65b4ef8142f71ac671041be3436b5749b477ab3077f6434bdd60d60018bbac9

Observation 91495224-4271-46dd-b6f0-d9345a56b743 · outbound

This paper cites SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt Optimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt Optimization

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.971232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.971232Z digest=sha256:5bd44773c1b88837caabd0ee926fcfd480c7f5fbfe7f093b56206d9fc7b91b4c

Observation 6761f935-4f6b-4abd-97c8-6a9572c0cc0d · outbound

This paper cites A Survey of Automatic Prompt Optimization with Instruction-focused Heuristic-based Search Algorithm.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Survey of Automatic Prompt Optimization with Instruction-focused Heuristic-based Search Algorithm

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.975337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.975337Z digest=sha256:6ccab022908e5263c4a477f4aa5131a749f77a8a0f2d5d1a3b8fd61729311469

Observation 02831b20-4cac-4fee-97a0-fbe7e43d64c8 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Bert: Pre-training of deep bidirectional transformers for language understanding

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.981480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.981480Z digest=sha256:da2c2896af257f56d68b5503ba00cc6333713ed64329fda8fd0009fc364c22ea

Observation 1e79d17c-964f-441e-b61a-0d03c59a8ba3 · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.985050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.985050Z digest=sha256:7cc6cf9d830229de3349732251f8ecb5e86250f7ebaf762853b147ce987354d4

Observation 234ef8e0-e046-41dc-8a62-bd88d24ab84a · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 19

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:24.988098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.988098Z digest=sha256:15c8c5d29455d7b8dd2b0d2c179148d8f993aceff8785e3c245709f291a9ebc5

Observation c99d0c59-2b0a-4352-94b3-00b75f366909 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities PaLM-E: An Embodied Multimodal Language Model

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.991170Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.991170Z digest=sha256:c083a98650cc25476e5e5ccbcfaee97be893bce2e72fd941670a0334585d1091

Observation 3c01026a-8ea6-45ac-b721-2b1569ef96ae · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.994147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.994147Z digest=sha256:5154f137bac721b0b5c8e57d10a662e1574c3bbf3268f973469a0f287be6e332

Observation 3fa477cb-68ae-4a5e-a4f9-a9649ee2ea25 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities KTO: Model Alignment as Prospect Theoretic Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.997269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.997269Z digest=sha256:a7b31b208695e471618f2ffa7d61a259bb1fc9209f2df42708ad07e9e377731b

Observation e90adc2d-d0b0-4c82-816c-7f3fad3051e9 · outbound

This paper cites Self-Attentional Credit Assignment for Transfer in Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Self-Attentional Credit Assignment for Transfer in Reinforcement Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.003524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.003524Z digest=sha256:e6a75d3d3787dc600affcef95041c85369e0250911c1d6ead8c82ca32de4748a

Observation 6f8a58f3-a49d-42a4-b821-d9b72e930c01 · outbound

This paper cites Learning Robust Rewards with Adversarial Inverse Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Learning Robust Rewards with Adversarial Inverse Reinforcement Learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.007040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.007040Z digest=sha256:f9a6c9ae1de45f347744f8ff0b2cf90b74050ca694d585d1eea2283410421197

Observation 93ddae34-6421-4d2e-a4a4-6e5dfa256901 · outbound

This paper cites BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.013301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.013301Z digest=sha256:3a2692f3130f8da4f01bb12cab9e457f3608b2c2f408c7b658d8b17027c2dbb1

Observation 4cd38935-20b2-47eb-a5ba-8fa46c2c118a · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.016230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.016230Z digest=sha256:5c38fc36b8c8fbce8663a9b7826560b495ab1a5dbae1ca6a39085c52f5c12148

Observation 5b868f90-ea30-4833-9110-e319d1f4a64d · outbound

This paper cites EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.018916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.018916Z digest=sha256:3dfec248c73544426d92d46d0f7c7165c27be85b1306ef0d5a1f62bcf63b5504

Observation 2e45fe2a-0649-4a2e-88a4-cf1875fbf5d2 · outbound

This paper cites Direct Language Model Alignment from Online AI Feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Direct Language Model Alignment from Online AI Feedback

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.021993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.021993Z digest=sha256:36dbcf858267b42213772eccbf33f9ab546be52d3d0e2236b7461e02c86b2fc3

Observation ad89a21f-894c-43aa-beaa-cc1ad8ea8a61 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 31

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.025118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.025118Z digest=sha256:b1881317637dbbefb8fa5130cccca6570091abb88b2672faa25e7bf300ef18e2

Observation f633d741-1147-4b73-8843-2e5ae5178b08 · outbound

This paper cites Soft Actor-Critic Algorithms and Applications.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Soft Actor-Critic Algorithms and Applications

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.028758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.028758Z digest=sha256:3bbb5e3b365c964986d42217fd35827d14e3b42d727b46a575a3e285a71e5637

Observation db3d3eb6-22a5-47aa-a7d5-f9f1b50f5ccd · outbound

This paper cites Prompt-to-Prompt Image Editing with Cross Attention Control.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Prompt-to-Prompt Image Editing with Cross Attention Control

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.034750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.034750Z digest=sha256:c5def8c29ee9502dc46e13b941d9454db1d212792ae4d2b69a102f70abee3b43

Observation 9ab5c693-073c-41f4-b2ef-6d36a1654708 · outbound

This paper cites Explaining Length Bias in LLM-Based Preference Evaluations.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Explaining Length Bias in LLM-Based Preference Evaluations

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.041656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.041656Z digest=sha256:02739bc4ff7051bc5dcbe0005abead49ecb0728116fa8dbd3cd8d0f670f42bab

Observation da8b9743-caaa-4d03-9a5d-143f401474c0 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Large Language Models Cannot Self-Correct Reasoning Yet

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.044668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.044668Z digest=sha256:60d4026fa9eb8159ba922092223751cb11490ac66a87493d8d6847097e859222

Observation 028f2908-3e8d-4bfa-a97f-5e506b9f1667 · outbound

This paper cites Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.048128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.048128Z digest=sha256:aa64465c7f7185a919de6032def2314b27159dbb90d03d2bf4e02486c977c650

Observation f457f343-d5d0-4591-86e8-36c7a6fa49e7 · outbound

This paper cites OpenAI o1 System Card.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities OpenAI o1 System Card

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.051356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.051356Z digest=sha256:4bbdd546159d1bc4aa60244a9a39ec1f6f82a58c383fe00e1f9106ebd976c9ab

Observation 93a3a016-32f8-40a2-a29d-41d011bc36ec · outbound

This paper cites Towards Efficient Exact Optimization of Language Model Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Towards Efficient Exact Optimization of Language Model Alignment

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.054186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.054186Z digest=sha256:2ad2c563ab42b8dfe5e41b1062ca6bd7528cd59d8d12394290bdcb47650dffba

Observation 7045ef3e-baf2-4297-88d2-97e11e689a8d · outbound

This paper cites Scaling Laws for Neural Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Scaling Laws for Neural Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.057213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.057213Z digest=sha256:4c3fff3735595bbaffd3fb86f58d89e04c4134d47cab95e28cd77779752642f8

Observation 50e73708-3b7d-4fc0-90bc-a99fa3c9ceb4 · outbound

This paper cites ARGS: Alignment as Reward-Guided Search.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities ARGS: Alignment as Reward-Guided Search

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.063586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.063586Z digest=sha256:8f04187bf96cfaf0315217e8a99cdacd2734718c81a97b9e8a498466dc5891ec

Observation 3d1a173a-0a9d-4c7c-90be-1b997d674bd9 · outbound

This paper cites Decomposed Prompting: A Modular Approach for Solving Complex Tasks.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Decomposed Prompting: A Modular Approach for Solving Complex Tasks

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.066495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.066495Z digest=sha256:6acd7db2ad96c29850d5627830ea92527435d8da7bbc6a4d92b637f01ec526f2

Observation 4e12ffca-9b85-4c25-ba3e-61cd0bbcb210 · outbound

This paper cites Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:26.167583Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-06T16:34:25.069706Z digest=sha256:67163f130eaf847f8aa37f5622eac84aa4130130e36926203d7c274c15481b2c

Observation 0251ed79-ed5f-4d75-a2e3-93e6133dc99c · outbound

This paper cites DiffWave: A Versatile Diffusion Model for Audio Synthesis.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DiffWave: A Versatile Diffusion Model for Audio Synthesis

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.073347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.073347Z digest=sha256:f5b7f389a073122b330a95ab1771fa44a48380e367e6e3a4516ac5db48b1847c

Observation 87e7605d-5449-4237-87ed-abfbf8fe873e · outbound

This paper cites Privacy in Large Language Models: Attacks, Defenses and Future Directions.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Privacy in Large Language Models: Attacks, Defenses and Future Directions

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.076609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.076609Z digest=sha256:613c0df75a70be50bad570da62fcec5131a429758d9bfe19f2c1eca4b98deafb

Observation 5cd7afb4-fe5b-495e-9338-84609153062c · outbound

This paper cites Personalized Language Modeling from Personalized Human Feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Personalized Language Modeling from Personalized Human Feedback

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.079612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.079612Z digest=sha256:488aa664da845aaab842a7fbddeeb1594bce3a1ccf13946d65774e92ea11ee7f

Observation bbf519a6-9680-4607-8070-a3251649d9d9 · outbound

This paper cites Reward-Guided Speculative Decoding for Efficient LLM Reasoning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reward-Guided Speculative Decoding for Efficient LLM Reasoning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.083207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.083207Z digest=sha256:6ccfa0b10f672e31718436b3e32faef52f09c2b78266f83c0f3bb00f9b3be634

Observation 4a006a67-de87-4587-9da6-2604c988b059 · outbound

This paper cites AI Transparency in the Age of LLMs: A Human-Centered Research Roadmap.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities AI Transparency in the Age of LLMs: A Human-Centered Research Roadmap

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.086302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.086302Z digest=sha256:009c576d31ffcafd041f48872f7ac1df69eeeaee18a5846aca604c9d5d589eaa

Observation ddd944c0-7925-4e6a-9efe-88cafb060228 · outbound

This paper cites 24 (AAAI 2025 and ACL.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities 24 (AAAI 2025 and ACL

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.089378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.089378Z digest=sha256:3e497c998de5c77cc0f263f0b9478b659c676f61babf05a3f7af428a05f9d809

Observation 8345db02-524c-42cc-9e93-99dfba1bf963 · outbound

This paper cites Statistical Rejection Sampling Improves Preference Optimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Statistical Rejection Sampling Improves Preference Optimization

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.092262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.092262Z digest=sha256:8a95372206cb28da9f7afffa478240395b67b821e5146944dc57e1b9934eb565

Observation 9236ba57-eb05-42d2-a5e3-a1d44d921573 · outbound

This paper cites RRM: Robust Reward Model Training Mitigates Reward Hacking.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RRM: Robust Reward Model Training Mitigates Reward Hacking

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.095336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.095336Z digest=sha256:d502b30854589898fdd35accba421c864100ad54f5d845e924abe49feb0de526

Observation e7399c96-4795-48db-842d-c9751bf8efca · outbound

This paper cites RoBERTa: A Robustly Optimized BERT Pretraining Approach.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RoBERTa: A Robustly Optimized BERT Pretraining Approach

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.098649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.098649Z digest=sha256:5719e93b3f390e7bcd3a10b64d723f60f4802a5b1dcc84381b7f807181746d52

Observation 7b49c1be-5347-4cca-825b-e4b3fba7e550 · outbound

This paper cites Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495,.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.101848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.101848Z digest=sha256:8efdb82f6f4bc19bae539bf7e71aaf30e086859b0b1f3a6dfdf765e3770cc297

Observation 28372cfb-437c-4cf6-9e3c-4a6219d7a720 · outbound

This paper cites Rethinking Diverse Human Preference Learning through Principal Component Analysis.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Rethinking Diverse Human Preference Learning through Principal Component Analysis

Reference 56

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:26.018857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-06T16:34:25.104669Z digest=sha256:65b17954b27000b0835d3b709a733eaba688098279c44fc7a10e171ca5898c22

Observation f60977e9-086c-499f-b5b7-6954f51060d3 · outbound

This paper cites Generative Reward Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Generative Reward Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.107700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.107700Z digest=sha256:1a41b08b7645e1f956946dd8f5df8db5757e78fb552f83af0c30d34f82f48296

Observation 4186af3e-c5b1-429b-aa9a-2686c2ec0536 · outbound

This paper cites A Survey of Explainable Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Survey of Explainable Reinforcement Learning

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.111313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.111313Z digest=sha256:26fef62ccca22592083f19a59111a92e78e7ed58f8335cfe7275f56c0780035a

Observation 1710d386-8bfe-4cb3-a838-d648fcb7b511 · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Playing Atari with Deep Reinforcement Learning

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.114353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.114353Z digest=sha256:c289b5c89ab2932d6660fb2668c63591a5ff0bda7abb87347e828c88a57a0bc0

Observation ac4fc5df-b4c9-4000-9c7b-a74f276d7b1e · outbound

This paper cites Active Preference Learning for Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Active Preference Learning for Large Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.117469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.117469Z digest=sha256:8678f8132840ed0510a4854bbce0be1e1658fe9b6048f04c85a46a1d0758da08

Observation 10f4b0a1-0457-4552-9c92-2537507d433a · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 61

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.120526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.120526Z digest=sha256:3c101ae59b80466edcfbec66b8fa271f6e8a2601a44094c3b642c47db5bb061a

Observation c6516752-655b-4a0b-9193-adbdc6190678 · outbound

This paper cites Deep Research is a new agentic AI capability integrated within ChatGPT that autonomously conducts multi-step web research and synthesizes comprehensive reports.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Deep Research is a new agentic AI capability integrated within ChatGPT that autonomously conducts multi-step web research and synthesizes comprehensive reports

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.124084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.124084Z digest=sha256:d00976b09282028781f8b712b60861042401d5c288f221f7d61240a03e2b5ac9

Observation 87571df1-77b6-48be-be6f-6d30f6d46119 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.126927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.126927Z digest=sha256:e75b082c3261a4900d42844f7c469994417956d89d09bbe589509ae8f6abb838

Observation 2993deae-6611-47ef-b968-555e2a0ce527 · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.133720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.133720Z digest=sha256:aca731ef3d6e1d18759f45d204f111271ca3eeb8691b8807bd092ffca1cfc93f

Observation 78ea5e32-c17c-4513-a199-c79c0c6fdb00 · outbound

This paper cites Automatic Prompt Optimization with "Gradient Descent" and Beam Search.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Automatic Prompt Optimization with "Gradient Descent" and Beam Search

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.139637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.139637Z digest=sha256:d51571b7f03a308c40d441a2146343fa82455f23bfaf2106400670fde7b32986

Observation 05ccdabb-33dd-469e-9c2c-2d05c4d0ea58 · outbound

This paper cites A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.143438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.143438Z digest=sha256:a037823a17d36acc717d07626149f31fe01e4e3eb57414475e5a9806f612ef6b

Observation bcec6494-167d-4b74-a35b-9e7ab6db4d5e · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.146449Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.146449Z digest=sha256:acced913fc11f6e744f0bc5994196e27e81905ec20b3f7e64f65bb6bc36a9216

Observation 1ceb9cd7-bbbc-49c6-a586-76b6bd52e915 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 70

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.149674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.149674Z digest=sha256:71401817c66d734accddb644f508365104a8a20d9b74d6c36dc7d1d2b33b3be0

Observation 87501923-c62b-4545-b5ef-5c4fd60de35e · outbound

This paper cites Hierarchical Text-Conditional Image Generation with CLIP Latents.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Hierarchical Text-Conditional Image Generation with CLIP Latents

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.152709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.152709Z digest=sha256:2dde065ea5bd4e9ed1f3b4eafc9def3da6eaa580de97f95fbd8b884b95c37525

Observation cd2fe72f-dacb-4593-a527-847122627c44 · outbound

This paper cites A critical look at tokenwise reward-guided text generation.arXiv preprint arXiv:2406.07780,.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A critical look at tokenwise reward-guided text generation.arXiv preprint arXiv:2406.07780,

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.155797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.155797Z digest=sha256:71013df34fc35045e7da84459d826a93acdfc3e2b2f107f1b78aa959ca5b8830

Observation 8e80c9d6-ee00-4950-b41e-170613f0611b · outbound

This paper cites A Generalist Agent.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Generalist Agent

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.159876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.159876Z digest=sha256:26e7d50cd8eaf4c0ea160a1bb25d093428c5eb4c6d260ec5ec88168eedb40379

Observation a2502d7e-e280-42d3-b361-6ba68091870a · outbound

This paper cites Learning Long-Term Reward Redistribution via Randomized Return Decomposition.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Learning Long-Term Reward Redistribution via Randomized Return Decomposition

Reference 74

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:25.818920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-06T16:34:25.163198Z digest=sha256:913cd3f95f2015560db66c7e3c862b3aae031234b389bedc42095440e0ed546c

Observation 21ae2890-0204-44ba-b4bf-2b3cff27a916 · outbound

This paper cites High-Dimensional Continuous Control Using Generalized Advantage Estimation.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities High-Dimensional Continuous Control Using Generalized Advantage Estimation

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.170316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.170316Z digest=sha256:114352f6e39e2290045dd65cfc59aec524a707f7ee55985f0931d77df063c34f

Observation c615db8a-b98d-4bb0-aa2a-419d1f96996b · outbound

This paper cites Spurious Rewards: Rethinking Training Signals in RLVR.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Spurious Rewards: Rethinking Training Signals in RLVR

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.176219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.176219Z digest=sha256:eb749bc542c6d190523aa8ed99794649dfa146cc772be9e770fb6753afef2b01

Observation 86484ea3-4055-4753-a933-a2e3a05de87c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.179391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.179391Z digest=sha256:c7e2f532069e8438c16e703b210e854ea4a3de49f293a09e8d3d3ca481d5615d

Observation 6f256eb6-64ed-4697-934f-42d9e1153fb3 · outbound

This paper cites Reviving The Classics: Active Reward Modeling in Large Language Model Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reviving The Classics: Active Reward Modeling in Large Language Model Alignment

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:25.767096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-06T16:34:25.182215Z digest=sha256:d28e581f5b2a53d3fafe5f59214442f0dae51601a6f2a21189ff336736405f71

Observation 08498943-cdf1-4c8e-a21a-b4efbf1bb866 · outbound

This paper cites Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.185554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.185554Z digest=sha256:b9168b3a3162fbe8cd52fe6f1ee499cc07129286f40f21f567d250a04c7314f6

Observation b622793b-3d91-4a6e-b0db-24460636a79a · outbound

This paper cites When Life Gives You Lemons, Make Cherryade: Converting Feedback from Bad Responses into Good Labels.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities When Life Gives You Lemons, Make Cherryade: Converting Feedback from Bad Responses into Good Labels

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.188545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.188545Z digest=sha256:6c783cde61325eac3a96cff5eaa7b8d9e80614f700245b605311feb4cfdfadb2

Observation ae7730dd-9eb7-48e4-a4de-b85e157906e8 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 83

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.192087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.192087Z digest=sha256:eb64038a956d517de40cd1aed1943f3e05cf3f92f9e4cf93caa1d52886f64c2d

Observation c36e4d87-d47b-44e8-8317-feb967e0fa88 · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.194886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.194886Z digest=sha256:5132576d2f7cd62efb0a7534e2b37ffea4441651fda567d930c32de625165c2e

Observation 129db947-a33a-4513-93e2-67f981934587 · outbound

This paper cites Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.197977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.197977Z digest=sha256:d5be7295f1a2744e4ff94af36bece526ad814a13311b188c406a2e09e18fb8e2

Observation 6e9d55e6-b139-4cc8-a47c-3cd574ed1282 · outbound

This paper cites Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.201081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.201081Z digest=sha256:bba21ede8061abe268c0a7b529cd491040df8a179702a29af13518e56f30b500

Observation 49f8f937-525f-4198-9dfc-d182860057d2 · outbound

This paper cites A Roadmap to Pluralistic Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Roadmap to Pluralistic Alignment

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.204086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.204086Z digest=sha256:679d4a2238f452279422d524291a8534d20436b1733d44250414caca8ac9727e

Observation 299da6d6-f1b3-43da-9533-97f5226241fe · outbound

This paper cites Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.210425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.210425Z digest=sha256:afc6688fb9cae5166c544d26681468a87ff85bf7d0f202ef237011ecd1157860

Observation 1b8a5cf1-704d-4ee7-9611-ac9b10123401 · outbound

This paper cites Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.213454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.213454Z digest=sha256:9c3842b459cc967a8b21626ea3c0670e321ff3e9bf5055f150c913ee71fa5f01

Observation 36944cbd-6b9a-4553-9207-488a235ed765 · outbound

This paper cites Learning to Repair: Repairing model output errors after deployment using a dynamic memory of feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Learning to Repair: Repairing model output errors after deployment using a dynamic memory of feedback

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.220429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.220429Z digest=sha256:0c44fbc8ed900242266da349481f3ee738dacd0e917d91f2c3b76b3b6e94933b

Observation bbeeeba4-80c0-4693-9d85-79b85eef1422 · outbound

This paper cites DeepMind Control Suite.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DeepMind Control Suite

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.223363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.223363Z digest=sha256:aaa8818ebfc1c371f2ca527fca445f437073d8e66c7d6117e70dfee3b3dedf1c

Observation 5c3029af-049b-429f-a029-722c15b9e226 · outbound

This paper cites Grpo: Generalized reinforcement preference optimization.arXiv preprint arXiv:2405.00000,.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Grpo: Generalized reinforcement preference optimization.arXiv preprint arXiv:2405.00000,

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.226345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.226345Z digest=sha256:82e74de7e36b335ff41eeff661433ef9275dbf906ce9d4a94c4a4f2c6faabb83

Observation 2fef2af8-216f-45a4-9f61-02b0e6243bcd · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.230052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.230052Z digest=sha256:cbb99de1935d4a09bd42bafb8fabf693f32160dd7edb86f15c47b223040a46c0

Observation 83ad950e-a994-42d4-a596-dd77890634e7 · outbound

This paper cites Gram: A generative foundation reward model for reward generalization.arXiv preprint arXiv:2506.14175, 2025a.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Gram: A generative foundation reward model for reward generalization.arXiv preprint arXiv:2506.14175, 2025a

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.233479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.233479Z digest=sha256:034b9536ec7a3f32592194da687792729c86f5c49346f0b4d15718fc5ebf87e5

Observation 02dac0dd-db99-4c97-ae6b-d9eee97d771c · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.236262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.236262Z digest=sha256:f4276a2f1f6a4b0a36f94404fa0eb5425c6143e73d5715b76041cf8bb52ed652

Observation f0519097-48ef-4274-8731-66dc94072c1e · outbound

This paper cites Reinforcement Learning for Reasoning in Large Language Models with One Training Example.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.239464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.239464Z digest=sha256:d87b6ab672cad197104f77414f2eb5ac4231aa74161e96d5cb2c097a0abf156c

Observation b81d8143-0d29-4284-9d02-6ba928991711 · outbound

This paper cites How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective

Reference 100

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:25.472318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-06T16:34:25.246579Z digest=sha256:4d6b80fc2ef9d77ad25b9cc69672765bcc52919bd24e225613ab0be4f61cd8c0

Observation caa7a167-a786-40b8-ad11-8e33e6c466dd · outbound

This paper cites Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint

Reference 101

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.249776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.249776Z digest=sha256:aedc31d0a2efbe624a5f4fb892742a2e2fedc9b6f25c79a32dbc8f026a39ca14

Observation 11c90913-72bb-4836-a257-2e2879251b27 · outbound

This paper cites A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce

Reference 102

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.253465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.253465Z digest=sha256:4badadf24a8e7158ed64c77712a1595352a2a218e11925962e29705b2d34f092

Observation 34aa152a-be09-43ba-852b-232695cee304 · outbound

This paper cites Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models

Reference 103

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.256725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.256725Z digest=sha256:cb4356864288861d52040f59b5eddc94e1f974cb8a7c6353082a1d49e633f236

Observation 5809d262-c85c-43f6-ae1f-2ecea71cf6bc · outbound

This paper cites Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study

Reference 104

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.260209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.260209Z digest=sha256:dbcd56cb17ae3cca60eb8b2010382e330acb48ce671f3dbd97a1dcc569066a4a

Observation 738a22bb-d8db-4848-92be-c26a1f7ba4ff · outbound

This paper cites Large Language Models as Optimizers.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Large Language Models as Optimizers

Reference 105

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.263190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.263190Z digest=sha256:840b4fc2eb7e9d88812fc56560dbe3ed270c6dd7703f163305a16a93ce075354

Observation a357dcd6-bad0-41da-8319-1a491f2a2c77 · outbound

This paper cites Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL

Reference 106

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.266194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.266194Z digest=sha256:8cc117fde216c20bbb3d4e5c663040c5a821326b361f97e2907df92a210ded53

Observation b248e687-6a40-4976-a20b-c4b0a2463933 · outbound

This paper cites Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs

Reference 107

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.269350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.269350Z digest=sha256:1e3dd60820eaec6c0d46b36931d030ba9b981f081198239d7f9e6dc06f48d5ba

Observation ac69e7f0-10ed-4d9b-8ad0-9b06eba55910 · outbound

This paper cites Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts

Reference 108

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.272362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.272362Z digest=sha256:8148d27c964a5864bae0d4c942e9bdf24942c65c34684aa35db1c744a8512a62

Observation 0daaf2f3-714b-4697-b4c1-8ef1564e3f8b · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 109

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.276239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.276239Z digest=sha256:6466edfa9c68f7abd11820184e7c56ea79e5e3077e6d619fca9a34fa235d0bbc

Observation 26a849c7-7e62-4a1a-9237-5698fd209cb9 · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 110

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.279111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.279111Z digest=sha256:b9b358e0019bf13ecb59e770c29bc3404d545e1800b0114ec078920a387b44cf

Observation c79daecb-c563-4a67-b965-4f7e470b53a2 · outbound

This paper cites Diversifying AI: Towards Creative Chess with AlphaZero.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Diversifying AI: Towards Creative Chess with AlphaZero

Reference 111

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.282653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.282653Z digest=sha256:0154a2eba4344b5004dce1afa37be38bf837e4a8e84d2c37afb2013b9de8cc0e

Observation 1b131a45-5c49-4f61-b78d-06947941fe55 · outbound

This paper cites When scaling meets LLM finetuning: The effect of data, model and finetuning method.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities When scaling meets LLM finetuning: The effect of data, model and finetuning method

Reference 112

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.285823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.285823Z digest=sha256:14e3d9a3d73c67d146685c5add00ae32ea216bf43b146c36528e9b0f58f9eab2

Observation 963c5887-8ece-4b8d-8c6c-f0a2e45def27 · outbound

This paper cites Generative Verifiers: Reward Modeling as Next-Token Prediction.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Generative Verifiers: Reward Modeling as Next-Token Prediction

Reference 113

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.288762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.288762Z digest=sha256:2ac9efe0320893d660aa97eb20d4e58a11eac41f33ce6f752a3b54ac8ef9e63b

Observation d3396fdf-285c-4f06-9ab9-8ce1b7348ab2 · outbound

This paper cites Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation

Reference 114

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.291921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.291921Z digest=sha256:0c70e17fcc335f4892f1e8b820c879aa1c7c1818e5ca094d4b5f721f21daed5e

Observation 4730a3b9-3f73-48fe-bbaa-275bc9827592 · outbound

This paper cites Secrets of RLHF in Large Language Models Part I: PPO.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Secrets of RLHF in Large Language Models Part I: PPO

Reference 115

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.294914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.294914Z digest=sha256:3208292c08dd023c66cfe16c691629114897ba95bc19a3a361a2ffc9fb8dc5a7

Observation 99c591d9-b88d-4fbb-b681-f880534ff6fc · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 116

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.297970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.297970Z digest=sha256:f8bda10bd2c0e08346b7e3fd5c38a1cec0f8fbc5f966acdfed2b1a1e7220c54d

Observation ccac6194-08ff-4523-a40f-e40eac577756 · outbound

This paper cites Least-to-Most Prompting Enables Complex Reasoning in Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Reference 117

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.301260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.301260Z digest=sha256:365ec765cd01b03818f82859c14b558bd20fbcd5cc2c80677196c8607626ef46

Observation 90b10786-5de4-4378-88bc-07dde36cb0ba · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Reference 1952

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.945869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.945869Z digest=sha256:509ed0303b76099416da3977de7d8b5923bccb3d8692f278f4d03ace96e39a29

Observation 3f63be04-b7ef-4d04-826a-b31d7e63bd06 · outbound

This paper cites Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models

Reference 1973

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.207451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.207451Z digest=sha256:c6192fb2efc4871f39c56d3364ea4b214c791ff21869928426c9d56d61b30785

Observation 3889c48b-10e2-4ab4-bbfb-46d8a41f0f78 · outbound

This paper cites Retrieval Augmented Thought Process for Private Data Handling in Healthcare.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Retrieval Augmented Thought Process for Private Data Handling in Healthcare

Reference 1991

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.136743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.136743Z digest=sha256:a188bc0e1f14897b291710e5dd6e455b70194d94e1cf3c2eac395c8b2ec22826

Observation f8c77f3b-3746-4371-abd6-e3bb2c761ef8 · outbound

This paper cites Style Over Substance: Evaluation Biases for Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Style Over Substance: Evaluation Biases for Large Language Models

Reference 1992

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.242829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.242829Z digest=sha256:dd7aebae3d490ed51f2800580548a291c939a3bd6618a6fed8825bc974484bad

Pith citing papers

Observation 58ce233a-7689-4a88-977a-8ab27b2358d0 · inbound

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives cites this paper.

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T11:17:36.742733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T11:17:36.742733Z digest=sha256:1ad34d812982f628d2d631cd83fa1a8d5ab62e4a0c5f2e79a881d8d3c24a79dc

Observation 2654dec6-ac02-4a04-9249-fd87fe4db4ce · inbound

The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety cites this paper.

The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-15T19:06:30.621395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-15T19:05:15.708770Z digest=sha256:6a7752c9d13191c48395031a220d7bc13f1fdcbad4e7d06d09e31670f9692f99

Observation 72c87fdd-80a0-4329-9873-91904335d9f2 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Reference 188

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.153902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:2d550908fba851d8ebda219341f5970fc470c75af889f1325c8a972c0fd27945