{"as_of":"2026-08-10T15:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a30e41813a157fe6ee6cad68684ca853e6efe604890fd6877c862e27cae6f5b0","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:34:25.301260Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:17:36.742733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.152268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13158","snapshot_observed_at":"2026-08-04T11:17:36.742733Z","title":"Inverse reinforcement learning meets large language model post-training: Basics, advances, and opportunities.arXiv preprint arXiv:2507.13158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06096","last_updated":"2026-06-26T18:48:41Z","snapshot_observed_at":"2026-08-09T20:20:11.286361Z","submitted_at":"2025-10-07T16:25:14Z","title":"The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T11:17:36.742733Z"},"links":{"cited_paper":"/paper/2507.13158","citing_paper":"/paper/2510.06096"},"observation_digest":"sha256:c1f9f3f8169934439cb4b0ef5e12db2a8466b823c4991acfcfcb4047463f395c","observation_id":"58ce233a-7689-4a88-977a-8ab27b2358d0","resolution":{"observed_at":"2026-08-04T11:17:36.742733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"cited_work":{"arxiv_id":"2507.13158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13158","snapshot_observed_at":"2026-07-04T07:59:40.152268Z","title":"arXiv preprint arXiv:2507.13158 (2025) 50 Elias Malomgré and Pieter Simoens","venue":null,"work_id":"b2807788-5ebb-4c12-b5fe-972f005f57e0","year":2025},"citing_paper":{"arxiv_id":"2603.02259","last_updated":"2026-04-29T14:17:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-28T00:48:06Z","title":"The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T19:05:15.708770Z"},"links":{"cited_paper":"/paper/2507.13158","citing_paper":"/paper/2603.02259"},"observation_digest":"sha256:9a1d6407fee8949c7d7c29ecc9e37b25f4dc8602d24877614eb64e0948a23b04","observation_id":"2654dec6-ac02-4a04-9249-fd87fe4db4ce","resolution":{"observed_at":"2026-05-15T19:06:30.621395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"cited_work":{"arxiv_id":"2507.13158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13158","snapshot_observed_at":"2026-07-04T07:59:40.152268Z","title":"arXiv preprint arXiv:2507.13158 (2025) 50 Elias Malomgré and Pieter Simoens","venue":null,"work_id":"b2807788-5ebb-4c12-b5fe-972f005f57e0","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2507.13158","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:ea779fa310cfac6a83d21a44a100b393c275b484899e7614e36a4b954bc6b90e","observation_id":"72c87fdd-80a0-4329-9873-91904335d9f2","resolution":{"observed_at":"2026-07-04T07:59:40.153902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13158/citation-record","integrity":"/paper/2507.13158/integrity","json":"/paper/2507.13158/citation-record.json","paper":"/paper/2507.13158"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:34:24.929368Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.929368Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:11af9b4ea97ea8b08167c81043a740ac9970c1d2eb53d9a1f7ab6fc6ad2a5608","observation_id":"77084717-f2be-497f-8d93-392cf620e010","resolution":{"observed_at":"2026-08-06T16:34:24.929368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.949183Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.949183Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0a5b899aa75ab5c1c3302c0f41ae76d18e922c0a99ee37584e022ec0c7807cbe","observation_id":"a422fa13-9e47-499a-a907-8db37dd31b07","resolution":{"observed_at":"2026-08-06T16:34:24.949183Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.952418Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.952418Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:1a5e67cf7f49306ce66665786862ae0e8a223a6633f39e23826fa2e6b6d23017","observation_id":"e1257466-8376-4141-82e0-9e481af8b394","resolution":{"observed_at":"2026-08-06T16:34:24.952418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04070","last_updated":"2025-03-13T13:37:57Z","snapshot_observed_at":"2026-08-09T00:40:22.143807Z","submitted_at":"2024-10-05T08:00:55Z","title":"PAD: Personalized Alignment of LLMs at Decoding-Time","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04070","snapshot_observed_at":"2026-08-06T16:34:24.962376Z","title":"Pad: Personalized alignment of llms at decoding-time.arXiv preprint arXiv:2410.04070, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.962376Z"},"links":{"cited_paper":"/paper/2410.04070","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7a504a0455222e44b70258bab060234ed045eb2f3f14ec35747304daded9e927","observation_id":"77be57c1-9825-4171-a4c3-dca895a4b655","resolution":{"observed_at":"2026-08-06T16:34:24.962376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T16:34:24.968234Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.968234Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ce46295ab7960035d043a5883c04ad5c443dbcf8e3ef68db024278d356fe13a4","observation_id":"12d4acc6-c2fe-47e3-8ed9-3c0a9e4d5f3e","resolution":{"observed_at":"2026-08-06T16:34:24.968234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11347","last_updated":"2025-07-12T20:31:55Z","snapshot_observed_at":"2026-08-05T00:49:37.799646Z","submitted_at":"2024-02-17T17:47:10Z","title":"SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11347","snapshot_observed_at":"2026-08-06T16:34:24.971232Z","title":"Phaseevo: Towards unified in-context prompt optimization for large language models.arXiv preprint arXiv:2402.11347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.971232Z"},"links":{"cited_paper":"/paper/2402.11347","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:d5a8d1e175101cdbb8849fd97237fcfd5549eaad8df94147d3fe5f7191256d20","observation_id":"91495224-4271-46dd-b6f0-d9345a56b743","resolution":{"observed_at":"2026-08-06T16:34:24.971232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18746","last_updated":"2025-07-12T20:39:40Z","snapshot_observed_at":"2026-08-07T17:48:29.484541Z","submitted_at":"2025-02-26T01:42:08Z","title":"A Survey of Automatic Prompt Optimization with Instruction-focused Heuristic-based Search Algorithm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18746","snapshot_observed_at":"2026-08-06T16:34:24.975337Z","title":"Automatic prompt optimization via heuristic search: A survey.arXiv preprint arXiv:2502.18746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.975337Z"},"links":{"cited_paper":"/paper/2502.18746","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:26f97681216d4e9973373adfba3c930ac8a683c743bcb95e2fac41cba6c14351","observation_id":"6761f935-4f6b-4abd-97c8-6a9572c0cc0d","resolution":{"observed_at":"2026-08-06T16:34:24.975337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.981480Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.981480Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2f096edfda360f110db65042a98a2bb81f9061d29fe5f26343857b4fc4f011df","observation_id":"02831b20-4cac-4fee-97a0-fbe7e43d64c8","resolution":{"observed_at":"2026-08-06T16:34:24.981480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-06T16:34:24.985050Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.985050Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:457780f753403a0bbe0b3d9393d2b5e1b590bdbf31f533f423d7f98cf49125c0","observation_id":"1e79d17c-964f-441e-b61a-0d03c59a8ba3","resolution":{"observed_at":"2026-08-06T16:34:24.985050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.988098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.988098Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:d735211557665d245300cc344c8bf7e6aa262fa6b3a950500c0246756d9ef58a","observation_id":"234ef8e0-e046-41dc-8a62-bd88d24ab84a","resolution":{"observed_at":"2026-08-06T16:34:24.988098Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T16:34:24.991170Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.991170Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:183e61befce89a865125d81a3416d352c5d49408e76ca83f2e53a353a7c12514","observation_id":"c99d0c59-2b0a-4352-94b3-00b75f366909","resolution":{"observed_at":"2026-08-06T16:34:24.991170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-06T16:34:24.994147Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators.arXiv preprint arXiv:2404.04475,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.994147Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b50a8191627d7670d217ab8bb02957774e5aa1c09c72847872211676381f92de","observation_id":"3c01026a-8ea6-45ac-b721-2b1569ef96ae","resolution":{"observed_at":"2026-08-06T16:34:24.994147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-06T16:34:24.997269Z","title":"Kto: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.997269Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:76b15ba5436c828338a8276492b1da01f1053da3b8d676786c73326eeb5163d4","observation_id":"3fa477cb-68ae-4a5e-a4f9-a9649ee2ea25","resolution":{"observed_at":"2026-08-06T16:34:24.997269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.08027","last_updated":"2019-11-22T14:22:44Z","snapshot_observed_at":"2026-08-03T12:51:18.277147Z","submitted_at":"2019-07-18T13:02:16Z","title":"Self-Attentional Credit Assignment for Transfer in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.08027","snapshot_observed_at":"2026-08-06T16:34:25.003524Z","title":"Self-attentional credit assignment for transfer in reinforcement learning.arXiv preprint arXiv:1907.08027,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.003524Z"},"links":{"cited_paper":"/paper/1907.08027","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:549f484560ce0dcd75e46da2c8a8efad8929fa9037b8f88bb1351b8c8dedf9ac","observation_id":"e90adc2d-d0b0-4c82-816c-7f3fad3051e9","resolution":{"observed_at":"2026-08-06T16:34:25.003524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11248","last_updated":"2018-08-13T18:33:24Z","snapshot_observed_at":"2026-08-10T07:11:22.809789Z","submitted_at":"2017-10-30T21:22:28Z","title":"Learning Robust Rewards with Adversarial Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11248","snapshot_observed_at":"2026-08-06T16:34:25.007040Z","title":"Learning robust rewards with adversarial inverse reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.007040Z"},"links":{"cited_paper":"/paper/1710.11248","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:e0e75d74873f4d19c8135e477cae30a254ca87d34cf7515ace634d3e4b6365aa","observation_id":"6f8a58f3-a49d-42a4-b821-d9b72e930c01","resolution":{"observed_at":"2026-08-06T16:34:25.007040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-04T16:20:42.997639Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-06T16:34:25.013301Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling.arXiv preprint arXiv:2406.00832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.013301Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3abef3d5fa7f3006df09c3728e789a5c1aac57da4309b23e7c4289ed7dc77447","observation_id":"93ddae34-6421-4d2e-a4a4-6e5dfa256901","resolution":{"observed_at":"2026-08-06T16:34:25.013301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:34:25.016230Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.016230Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:d1dc375c8a0afa3d02fd9a175b82b5f7e2afe749c0adeba293c061734e832b8c","observation_id":"4cd38935-20b2-47eb-a5ba-8fa46c2c118a","resolution":{"observed_at":"2026-08-06T16:34:25.016230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08532","last_updated":"2025-05-01T11:56:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-15T16:50:09Z","title":"EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08532","snapshot_observed_at":"2026-08-06T16:34:25.018916Z","title":"Connecting large language models with evolutionary algorithms yields powerful prompt optimizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.018916Z"},"links":{"cited_paper":"/paper/2309.08532","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3068ca8f2128f1210c422805a76eb262ae36d9744a38b3ab26b2ae07da6340e5","observation_id":"5b868f90-ea30-4833-9110-e319d1f4a64d","resolution":{"observed_at":"2026-08-06T16:34:25.018916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T16:34:25.021993Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.021993Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:d84b522bfdbcb1a5b458adff526f4aa3b70fb14eab818f16368740e5d9473309","observation_id":"2e45fe2a-0649-4a2e-88a4-cf1875fbf5d2","resolution":{"observed_at":"2026-08-06T16:34:25.021993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.025118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.025118Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:5b1f323db9baaac972f365a22e400bb14fa827cfa0b9082281fff70eea279485","observation_id":"ad89a21f-894c-43aa-beaa-cc1ad8ea8a61","resolution":{"observed_at":"2026-08-06T16:34:25.025118Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-06T16:34:25.028758Z","title":"Soft actor-critic algorithms and applications.arXiv preprint arXiv:1812.05905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.028758Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:78929fca87cd971a36aba4919ddf2c0cd02a9478a0fddca3967da4d36d1bf28f","observation_id":"f633d741-1147-4b73-8843-2e5ae5178b08","resolution":{"observed_at":"2026-08-06T16:34:25.028758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T16:34:25.034750Z","title":"Prompt-to- prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.034750Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8685ec7119c48d32b8bdd46ae3a834f910e6cffedc2592c25499f5a882a2709b","observation_id":"db3d3eb6-22a5-47aa-a7d5-f9f1b50f5ccd","resolution":{"observed_at":"2026-08-06T16:34:25.034750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01085","last_updated":"2025-09-04T02:14:46Z","snapshot_observed_at":"2026-08-09T10:36:31.462883Z","submitted_at":"2024-07-01T08:37:41Z","title":"Explaining Length Bias in LLM-Based Preference Evaluations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01085","snapshot_observed_at":"2026-08-06T16:34:25.041656Z","title":"Explaining length bias in llm-based preference evaluations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.041656Z"},"links":{"cited_paper":"/paper/2407.01085","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:fe4509ab8b9458e18ef4140f16136350811927ba532f6df00a112a5a9b5b1b97","observation_id":"9ab5c693-073c-41f4-b2ef-6d36a1654708","resolution":{"observed_at":"2026-08-06T16:34:25.041656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-06T16:34:25.044668Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.044668Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:cf23cfab0a7da2977e15052039fa99c4f3e9dd50eee1f3edaa96546f14942c67","observation_id":"da8b9743-caaa-4d03-9a5d-143f401474c0","resolution":{"observed_at":"2026-08-06T16:34:25.044668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09279","last_updated":"2024-10-07T21:24:59Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T16:17:21Z","title":"Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09279","snapshot_observed_at":"2026-08-06T16:34:25.048128Z","title":"Unpacking dpo and ppo: Disentangling best practices for learning from preference feedback.arXiv preprint arXiv:2406.09279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.048128Z"},"links":{"cited_paper":"/paper/2406.09279","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c2c02cbe4d079059682a719e7d393e7c01734bf3d6533bf9e0c3b8f51a925309","observation_id":"028f2908-3e8d-4bfa-a97f-5e506b9f1667","resolution":{"observed_at":"2026-08-06T16:34:25.048128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T16:34:25.051356Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.051356Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:6924bd209a4133acafaffa6777a1f9b422eb15703142ce06def69db06e2d9d4d","observation_id":"f457f343-d5d0-4591-86e8-36c7a6fa49e7","resolution":{"observed_at":"2026-08-06T16:34:25.051356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-08-09T21:25:39.237839Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-06T16:34:25.054186Z","title":"Towards efficient exact optimization of language model alignment.arXiv preprint arXiv:2402.00856,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.054186Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:51cb19ce282271e13a6cf7a67e8d27ed1270ad46d0fbecb1c350477159d22f7b","observation_id":"93a3a016-32f8-40a2-a29d-41d011bc36ec","resolution":{"observed_at":"2026-08-06T16:34:25.054186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T16:34:25.057213Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.057213Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:58bfc825335335f2f511f1e095b046389d460c2e05cfaf07485ce171a4cb27dd","observation_id":"7045ef3e-baf2-4297-88d2-97e11e689a8d","resolution":{"observed_at":"2026-08-06T16:34:25.057213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-06T16:34:25.063586Z","title":"Args: Alignment as reward-guided search.arXiv preprint arXiv:2402.01694,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.063586Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:37c537f1fb62605989a1506e0d3038feb199a5f85d12cbda8e6adcb4df4a61df","observation_id":"50e73708-3b7d-4fc0-90bc-a99fa3c9ceb4","resolution":{"observed_at":"2026-08-06T16:34:25.063586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02406","last_updated":"2023-04-11T19:39:17Z","snapshot_observed_at":"2026-08-10T13:37:57.622090Z","submitted_at":"2022-10-05T17:28:20Z","title":"Decomposed Prompting: A Modular Approach for Solving Complex Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02406","snapshot_observed_at":"2026-08-06T16:34:25.066495Z","title":"Decomposed prompting: A modular approach for solving complex tasks.arXiv preprint arXiv:2210.02406,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.066495Z"},"links":{"cited_paper":"/paper/2210.02406","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:4dc6abe29308c7a55bb8c586c4f5a2928bfc98e6fe2faf06d43352fb6b329403","observation_id":"3d1a173a-0a9d-4c7c-90be-1b997d674bd9","resolution":{"observed_at":"2026-08-06T16:34:25.066495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13998","last_updated":"2024-12-18T16:14:59Z","snapshot_observed_at":"2026-07-06T20:09:24.415233Z","submitted_at":"2024-12-18T16:14:59Z","title":"Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes","version":1},"cited_work":{"arxiv_id":"2412.13998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13998","snapshot_observed_at":"2026-08-06T16:34:26.163405Z","title":"Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes","venue":"cs.LG","work_id":"9727aa20-a241-4c29-a2cb-38c286108ac6","year":2024},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.069706Z"},"links":{"cited_paper":"/paper/2412.13998","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ad125b98c14c69b1788cca1d010e4ddc417eb796b4bf97e662592191c095b132","observation_id":"4e12ffca-9b85-4c25-ba3e-61cd0bbcb210","resolution":{"observed_at":"2026-08-06T16:34:26.167583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-06T16:34:25.073347Z","title":"Diffwave: A versatile diffusion model for audio synthesis.arXiv preprint arXiv:2009.09761,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.073347Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:11f8a5b1100db39dfb07cd042a5dd7d4401d588596fee909760a4577ff65ba72","observation_id":"0251ed79-ed5f-4d75-a2e3-93e6133dc99c","resolution":{"observed_at":"2026-08-06T16:34:25.073347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10383","last_updated":"2024-09-30T11:58:27Z","snapshot_observed_at":"2026-08-10T04:00:38.772655Z","submitted_at":"2023-10-16T13:23:54Z","title":"Privacy in Large Language Models: Attacks, Defenses and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10383","snapshot_observed_at":"2026-08-06T16:34:25.076609Z","title":"Privacy in large language models: Attacks, defenses and future directions.arXiv preprint arXiv:2310.10383, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.076609Z"},"links":{"cited_paper":"/paper/2310.10383","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:74fbe94b049d73d0db0392fa34c4d1c8d0fae54886b2e92e20f2c269f9594eed","observation_id":"87e7605d-5449-4237-87ed-abfbf8fe873e","resolution":{"observed_at":"2026-08-06T16:34:25.076609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05133","last_updated":"2024-12-09T04:21:08Z","snapshot_observed_at":"2026-08-06T13:42:00.057517Z","submitted_at":"2024-02-06T04:18:58Z","title":"Personalized Language Modeling from Personalized Human Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05133","snapshot_observed_at":"2026-08-06T16:34:25.079612Z","title":"Personalized language modeling from personalized human feedback.arXiv preprint arXiv:2402.05133, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.079612Z"},"links":{"cited_paper":"/paper/2402.05133","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:80ee2eb77295ee9e3f40befe3cc6e56557acc6aab0ac8ea660067c1508a77745","observation_id":"5cd7afb4-fe5b-495e-9338-84609153062c","resolution":{"observed_at":"2026-08-06T16:34:25.079612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19324","last_updated":"2025-06-26T03:14:46Z","snapshot_observed_at":"2026-08-10T13:46:16.822794Z","submitted_at":"2025-01-31T17:19:57Z","title":"Reward-Guided Speculative Decoding for Efficient LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19324","snapshot_observed_at":"2026-08-06T16:34:25.083207Z","title":"Reward-guided speculative decoding for efficient llm reasoning.arXiv preprint arXiv:2501.19324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.083207Z"},"links":{"cited_paper":"/paper/2501.19324","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:e241a9bb8f1662ee30b31df270368233a0abf45157c08f1cb1b94d02a22bf2cc","observation_id":"bbf519a6-9680-4607-8070-a3251649d9d9","resolution":{"observed_at":"2026-08-06T16:34:25.083207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01941","last_updated":"2023-08-08T01:41:22Z","snapshot_observed_at":"2026-08-04T23:34:00.991258Z","submitted_at":"2023-06-02T22:51:26Z","title":"AI Transparency in the Age of LLMs: A Human-Centered Research Roadmap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01941","snapshot_observed_at":"2026-08-06T16:34:25.086302Z","title":"Ai transparency in the age of llms: A human-centered research roadmap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.086302Z"},"links":{"cited_paper":"/paper/2306.01941","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:1e375e383185f8ea3f22ed0a1ee9785221045b2161d862b50ecb8f14d7ca7656","observation_id":"4a006a67-de87-4587-9da6-2604c988b059","resolution":{"observed_at":"2026-08-06T16:34:25.086302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.089378Z","title":"24 (AAAI 2025 and ACL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.089378Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a280b365511262edc198d8c981e58f763fdccef31032bce2f3d0dc18f12d4670","observation_id":"ddd944c0-7925-4e6a-9efe-88cafb060228","resolution":{"observed_at":"2026-08-06T16:34:25.089378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-06T16:34:25.092262Z","title":"Statistical rejection sampling improves preference optimization.arXiv preprint arXiv:2309.06657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.092262Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0e36d70666b1d7b892944b9d7e2822901ef7351741047396a2c3c6411228eea1","observation_id":"8345db02-524c-42cc-9e93-99dfba1bf963","resolution":{"observed_at":"2026-08-06T16:34:25.092262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-07-06T19:18:27.644746Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-06T16:34:25.095336Z","title":"Rrm: Robust reward model training mitigates reward hacking.arXiv preprint arXiv:2409.13156,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.095336Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:fe7443cb8def745ab7df1dfeee6e93d3b62d4a3e8df843706e31f33453aab70e","observation_id":"9236ba57-eb05-42d2-a5e3-a1d44d921573","resolution":{"observed_at":"2026-08-06T16:34:25.095336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T16:34:25.098649Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.098649Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:deccb3c9359a6ac2fc5506015749e4bb829fec4fcf010522539475a95ffc9a48","observation_id":"e7399c96-4795-48db-842d-c9751bf8efca","resolution":{"observed_at":"2026-08-06T16:34:25.098649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.101848Z","title":"Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.101848Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c51314c93c9d75021ff14115faae28322d9714ad484b4337ca9369e4ce574506","observation_id":"7b49c1be-5347-4cca-825b-e4b3fba7e550","resolution":{"observed_at":"2026-08-06T16:34:25.101848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13131","last_updated":"2025-06-11T05:43:13Z","snapshot_observed_at":"2026-08-10T09:50:08.783407Z","submitted_at":"2025-02-18T18:55:26Z","title":"Rethinking Diverse Human Preference Learning through Principal Component Analysis","version":2},"cited_work":{"arxiv_id":"2502.13131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13131","snapshot_observed_at":"2026-08-06T16:34:26.014981Z","title":"Rethinking Diverse Human Preference Learning through Principal Component Analysis","venue":"cs.AI","work_id":"175e89d2-e0a7-4323-9212-040ec0bce92d","year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.104669Z"},"links":{"cited_paper":"/paper/2502.13131","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:005efacab9d4b842efc4cd72e188bd9a50fa8d20ef95e976367cb54de69df508","observation_id":"28372cfb-437c-4cf6-9e3c-4a6219d7a720","resolution":{"observed_at":"2026-08-06T16:34:26.018857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-06T16:34:25.107700Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.107700Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8946a8b4af8373eed463098247cbf09003acf51f0cb54208abb05b33da649e9e","observation_id":"f60977e9-086c-499f-b5b7-6954f51060d3","resolution":{"observed_at":"2026-08-06T16:34:25.107700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08434","last_updated":"2022-02-17T03:45:09Z","snapshot_observed_at":"2026-08-09T21:44:48.440973Z","submitted_at":"2022-02-17T03:45:09Z","title":"A Survey of Explainable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08434","snapshot_observed_at":"2026-08-06T16:34:25.111313Z","title":"A survey of explainable reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.111313Z"},"links":{"cited_paper":"/paper/2202.08434","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:f973bbdcf3ca034697e2bf17e1075e3d0d10d7ae8e060189d868e20cb4ab95a5","observation_id":"4186af3e-c5b1-429b-aa9a-2686c2ec0536","resolution":{"observed_at":"2026-08-06T16:34:25.111313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T16:34:25.114353Z","title":"Playing atari with deep reinforcement learning.arXiv preprint arXiv:1312.5602,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.114353Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7361531b2b99d4bce3e078b76f57cf84c2d46c96cd97d44e80db1ed77e879dac","observation_id":"1710d386-8bfe-4cb3-a838-d648fcb7b511","resolution":{"observed_at":"2026-08-06T16:34:25.114353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08114","last_updated":"2024-06-28T08:22:01Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T23:09:00Z","title":"Active Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08114","snapshot_observed_at":"2026-08-06T16:34:25.117469Z","title":"William Muldrew, Peter Hayes, Mingtian Zhang, and David Barber","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.117469Z"},"links":{"cited_paper":"/paper/2402.08114","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:38729d69b0b638d431d18adca3db2e2ebb3ba4551315322acb7ba6bc5d17bf67","observation_id":"ac4fc5df-b4c9-4000-9c7b-a74f276d7b1e","resolution":{"observed_at":"2026-08-06T16:34:25.117469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.120526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.120526Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:fccc9045700b2ce8e86e6b47b5eb2e16dd942956ed566da440ec6f819b9f2865","observation_id":"10f4b0a1-0457-4552-9c92-2537507d433a","resolution":{"observed_at":"2026-08-06T16:34:25.120526Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.124084Z","title":"Deep Research is a new agentic AI capability integrated within ChatGPT that autonomously conducts multi-step web research and synthesizes comprehensive reports","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.124084Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:20893b052a4886a896d4045c878aec3bdfe1ed7d706616eaacd59cb7e2e81626","observation_id":"c6516752-655b-4a0b-9193-adbdc6190678","resolution":{"observed_at":"2026-08-06T16:34:25.124084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-06T16:34:25.126927Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.126927Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:383d0e5cf8ada495fd5c610187a098730df1d3aa3ab7ab5836fda0ca72542016","observation_id":"87571df1-77b6-48be-be6f-6d30f6d46119","resolution":{"observed_at":"2026-08-06T16:34:25.126927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T16:34:25.133720Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.133720Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a5d4901d2901fc1054fea06033cc3dde37a07102cb111f9f5bcfa83ff9d32479","observation_id":"2993deae-6611-47ef-b968-555e2a0ce527","resolution":{"observed_at":"2026-08-06T16:34:25.133720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03495","last_updated":"2023-10-19T04:37:25Z","snapshot_observed_at":"2026-08-06T03:31:54.947656Z","submitted_at":"2023-05-04T15:15:22Z","title":"Automatic Prompt Optimization with \"Gradient Descent\" and Beam Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03495","snapshot_observed_at":"2026-08-06T16:34:25.139637Z","title":"gradient descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.139637Z"},"links":{"cited_paper":"/paper/2305.03495","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c62018fd11e5244eede6de3f5a85425df29ed7a2824655ae96bc6d3994ae4229","observation_id":"78ea5e32-c17c-4513-a199-c79c0c6fdb00","resolution":{"observed_at":"2026-08-06T16:34:25.139637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06665","last_updated":"2025-08-29T04:07:26Z","snapshot_observed_at":"2026-07-06T14:17:30.922581Z","submitted_at":"2022-11-12T13:52:06Z","title":"A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06665","snapshot_observed_at":"2026-08-06T16:34:25.143438Z","title":"A survey on explainable reinforcement learning: Concepts, algorithms, challenges.arXiv preprint arXiv:2211.06665,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.143438Z"},"links":{"cited_paper":"/paper/2211.06665","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:1518c7e43d6db60bec0f723eb1781a343102e7690c1f0e9ef9ea82765c1e6fb2","observation_id":"05ccdabb-33dd-469e-9c2c-2d05c4d0ea58","resolution":{"observed_at":"2026-08-06T16:34:25.143438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T16:34:25.146449Z","title":"Direct preference optimization: Your language model is secretly a reward model.arXiv preprint arXiv:2305.18290,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.146449Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8ecab2df8e6f96926c6280f47e431c075d4f8988cfd5260ffbc831bcdedbc00b","observation_id":"bcec6494-167d-4b74-a35b-9e7ab6db4d5e","resolution":{"observed_at":"2026-08-06T16:34:25.146449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.149674Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.149674Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:61af8f903dacf0ba38ff348c7f5d244b3b2d9a0f55b097376ee4815b00c2043f","observation_id":"1ceb9cd7-bbbc-49c6-a586-76b6bd52e915","resolution":{"observed_at":"2026-08-06T16:34:25.149674Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T16:34:25.152709Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.152709Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2f1eb66a3d688ad88c501148780918094c4ec148b54882b38aaa9e1d2ea49dd1","observation_id":"87501923-c62b-4545-b5ef-5c4fd60de35e","resolution":{"observed_at":"2026-08-06T16:34:25.152709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.155797Z","title":"A critical look at tokenwise reward-guided text generation.arXiv preprint arXiv:2406.07780,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.155797Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:4743b3a29587c2b905d16c083f8133493ec74d63adcda0731a117036e96ec55b","observation_id":"cd2fe72f-dacb-4593-a527-847122627c44","resolution":{"observed_at":"2026-08-06T16:34:25.155797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-06T16:34:25.159876Z","title":"A generalist agent.arXiv preprint arXiv:2205.06175,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.159876Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c84c677589102bef5e8ec17c32dc963e5be498a2a5b61bb23da1dd4fe36f7d14","observation_id":"8e80c9d6-ee00-4950-b41e-170613f0611b","resolution":{"observed_at":"2026-08-06T16:34:25.159876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13485","last_updated":"2022-03-17T07:01:28Z","snapshot_observed_at":"2026-07-06T12:12:25.898094Z","submitted_at":"2021-11-26T13:23:36Z","title":"Learning Long-Term Reward Redistribution via Randomized Return Decomposition","version":2},"cited_work":{"arxiv_id":"2111.13485","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.13485","snapshot_observed_at":"2026-08-06T16:34:25.815039Z","title":"Learning Long-Term Reward Redistribution via Randomized Return Decomposition","venue":"cs.LG","work_id":"00aa9170-bef2-4714-a594-8ff23db955d3","year":2021},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.163198Z"},"links":{"cited_paper":"/paper/2111.13485","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:f1ced37ce53f96791104e1453095375219a292add9b0e3ac5137baa01a03d3f4","observation_id":"a2502d7e-e280-42d3-b361-6ba68091870a","resolution":{"observed_at":"2026-08-06T16:34:25.818920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T16:34:25.170316Z","title":"High-dimensional continuous control using generalized advantage estimation.arXiv preprint arXiv:1506.02438,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.170316Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c2c0fc7b924f9e2dc80278435b761172f4944db10924fa0ab525a88e7efc9393","observation_id":"21ae2890-0204-44ba-b4bf-2b3cff27a916","resolution":{"observed_at":"2026-08-06T16:34:25.170316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-10T11:02:14.031196Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T16:34:25.176219Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.176219Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b228c7116d55ca8eb1bf8d9f904b5bab8820383fd7700eb813edcff86fa82d65","observation_id":"c615db8a-b98d-4bb0-aa2a-419d1f96996b","resolution":{"observed_at":"2026-08-06T16:34:25.176219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T16:34:25.179391Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.179391Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3d9fa8d65b1af81e9323e140d17554c5ab07d5f95073b35f5b196b984495630a","observation_id":"86484ea3-4055-4753-a933-a2e3a05de87c","resolution":{"observed_at":"2026-08-06T16:34:25.179391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-09T19:08:38.829460Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"cited_work":{"arxiv_id":"2502.04354","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04354","snapshot_observed_at":"2026-08-06T16:34:25.763556Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","venue":"cs.CL","work_id":"5cbc144c-8813-42d6-925b-36fb5934db87","year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.182215Z"},"links":{"cited_paper":"/paper/2502.04354","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ff838040467f1adfbde73a9314a24eaeecf5e19709cc3f43f16b83fd53db5753","observation_id":"6f256eb6-64ed-4697-934f-42d9e1153fb3","resolution":{"observed_at":"2026-08-06T16:34:25.767096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19770","last_updated":"2026-05-12T01:02:19Z","snapshot_observed_at":"2026-07-06T21:30:28.303379Z","submitted_at":"2025-05-26T09:54:02Z","title":"Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19770","snapshot_observed_at":"2026-08-06T16:34:25.185554Z","title":"Understanding the performance gap in preference learning: A dichotomy of rlhf and dpo.arXiv preprint arXiv:2505.19770,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.185554Z"},"links":{"cited_paper":"/paper/2505.19770","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:d68840120da48b15b6f625365de6aee1156c26941e4ac2ded7a4cda652a26506","observation_id":"08498943-cdf1-4c8e-a21a-b4efbf1bb866","resolution":{"observed_at":"2026-08-06T16:34:25.185554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15893","last_updated":"2022-10-28T04:57:21Z","snapshot_observed_at":"2026-07-06T14:11:32.120383Z","submitted_at":"2022-10-28T04:57:21Z","title":"When Life Gives You Lemons, Make Cherryade: Converting Feedback from Bad Responses into Good Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15893","snapshot_observed_at":"2026-08-06T16:34:25.188545Z","title":"When life gives you lemons, make cherryade: Converting feedback from bad responses into good labels.arXiv preprint arXiv:2210.15893,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.188545Z"},"links":{"cited_paper":"/paper/2210.15893","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3f4b368f551f97e0aa7bb29b1b71b85b331e697bffd4facc22bf44fb0bb20820","observation_id":"b622793b-3d91-4a6e-b0db-24460636a79a","resolution":{"observed_at":"2026-08-06T16:34:25.188545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.192087Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.192087Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:81abfd08a97a9dbe3013e07adc7fd9a5fbb9b9685ebedd223b7d118eb1489b2e","observation_id":"ae7730dd-9eb7-48e4-a4de-b85e157906e8","resolution":{"observed_at":"2026-08-06T16:34:25.192087Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-06T16:34:25.194886Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm.arXiv preprint arXiv:1712.01815,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.194886Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:6ef8d6b86c81ed25317b19a96f5b1423c7da9b16f70e05f5d45f8379fdd0efa4","observation_id":"c36e4d87-d47b-44e8-8317-feb967e0fa88","resolution":{"observed_at":"2026-08-06T16:34:25.194886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08358","last_updated":"2024-04-17T01:58:09Z","snapshot_observed_at":"2026-08-10T12:41:35.476357Z","submitted_at":"2023-12-13T18:51:34Z","title":"Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08358","snapshot_observed_at":"2026-08-06T16:34:25.197977Z","title":"Distributional preference learning: Understanding and accounting for hidden context in rlhf.arXiv preprint arXiv:2312.08358,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.197977Z"},"links":{"cited_paper":"/paper/2312.08358","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7ffad130b73c3aead44ba67de3217303c2347e326ce4ba777f5d360536c4157f","observation_id":"129db947-a33a-4513-93e2-67f981934587","resolution":{"observed_at":"2026-08-06T16:34:25.197977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17371","last_updated":"2024-07-18T05:18:14Z","snapshot_observed_at":"2026-08-06T15:40:06.757182Z","submitted_at":"2023-11-29T05:54:41Z","title":"Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17371","snapshot_observed_at":"2026-08-06T16:34:25.201081Z","title":"Should we be going mad? a look at multi-agent debate strategies for llms.arXiv preprint arXiv:2311.17371,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.201081Z"},"links":{"cited_paper":"/paper/2311.17371","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3d575c50d48239a63758856c46a3e2e938ae49efe1594ea0f68ae7207cab311a","observation_id":"6e9d55e6-b139-4cc8-a47c-3cd574ed1282","resolution":{"observed_at":"2026-08-06T16:34:25.201081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05070","last_updated":"2024-08-20T19:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-07T18:21:17Z","title":"A Roadmap to Pluralistic Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05070","snapshot_observed_at":"2026-08-06T16:34:25.204086Z","title":"A roadmap to pluralistic alignment.arXiv preprint arXiv:2402.05070,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.204086Z"},"links":{"cited_paper":"/paper/2402.05070","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:aa5a841a528467d6fdd8f27fd01c01ac507b5b405c9d6c5519df9c3d98842d4d","observation_id":"49f8f937-525f-4198-9dfc-d182860057d2","resolution":{"observed_at":"2026-08-06T16:34:25.204086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15624","last_updated":"2025-01-25T11:10:39Z","snapshot_observed_at":"2026-08-02T18:32:46.919947Z","submitted_at":"2024-05-24T15:13:53Z","title":"Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15624","snapshot_observed_at":"2026-08-06T16:34:25.210425Z","title":"Inverse-rlignment: Inverse reinforcement learning from demonstrations for llm alignment.arXiv preprint arXiv:2405.15624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.210425Z"},"links":{"cited_paper":"/paper/2405.15624","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:40c04033e40b4e0923f9a375683b0ecdeba22ce9ab810313e30bd3813d95935f","observation_id":"299da6d6-f1b3-43da-9533-97f5226241fe","resolution":{"observed_at":"2026-08-06T16:34:25.210425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-06T16:34:25.213454Z","title":"Query-dependent prompt evaluation and optimization with offline inverse rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.213454Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:02d1b7589986652834413edc17bd13f6ccfe75a67da84626effd73e8efbadee6","observation_id":"1b8a5cf1-704d-4ee7-9611-ac9b10123401","resolution":{"observed_at":"2026-08-06T16:34:25.213454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09737","last_updated":"2022-05-09T19:02:27Z","snapshot_observed_at":"2026-07-06T12:20:05.607892Z","submitted_at":"2021-12-16T07:01:28Z","title":"Learning to Repair: Repairing model output errors after deployment using a dynamic memory of feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09737","snapshot_observed_at":"2026-08-06T16:34:25.220429Z","title":"Learning to repair: Repairing model output errors after deployment using a dynamic memory of feedback.arXiv preprint arXiv:2112.09737,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.220429Z"},"links":{"cited_paper":"/paper/2112.09737","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a1604dc6b2e4a69dc4b8ac7c219b357e888da41df1ef4cc3ec8b3cf74a7face4","observation_id":"36944cbd-6b9a-4553-9207-488a235ed765","resolution":{"observed_at":"2026-08-06T16:34:25.220429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T16:34:25.223363Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.223363Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2c3b6424414da24037e1497600e4fec515efcfc3b8b23d1590f60e21a73c52f3","observation_id":"bbeeeba4-80c0-4693-9d85-79b85eef1422","resolution":{"observed_at":"2026-08-06T16:34:25.223363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.226345Z","title":"Grpo: Generalized reinforcement preference optimization.arXiv preprint arXiv:2405.00000,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.226345Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b4153481ec05a3523cc8c8e610d8e07be1061123e6b6d598b4a5ca7505c9ee90","observation_id":"5c3029af-049b-429f-a029-722c15b9e226","resolution":{"observed_at":"2026-08-06T16:34:25.226345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T16:34:25.230052Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.230052Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b03ba547d28f1dac3a1fd984c2e487822b84cdafe19a38856acbbdf991bf958a","observation_id":"2fef2af8-216f-45a4-9f61-02b0e6243bcd","resolution":{"observed_at":"2026-08-06T16:34:25.230052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.233479Z","title":"Gram: A generative foundation reward model for reward generalization.arXiv preprint arXiv:2506.14175, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.233479Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:86965ba0c3a2663f7ef14a7a2a55f2e04b7a18d0ebcc6c85d14a87be56e49d7b","observation_id":"83ad950e-a994-42d4-a596-dd77890634e7","resolution":{"observed_at":"2026-08-06T16:34:25.233479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T16:34:25.236262Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.236262Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:68fc5c374d685967d5886cb3d403aa96cc67ed887dc835c0f3c8a11d05e93bd2","observation_id":"02dac0dd-db99-4c97-ae6b-d9eee97d771c","resolution":{"observed_at":"2026-08-06T16:34:25.236262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-06T16:34:25.239464Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.239464Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b2b7ce480d45482f2fb72f2d23115312c2b4d95dbb3e353edb5061e1f5e0bd66","observation_id":"f0519097-48ef-4274-8731-66dc94072c1e","resolution":{"observed_at":"2026-08-06T16:34:25.239464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10093","last_updated":"2024-10-14T02:21:29Z","snapshot_observed_at":"2026-07-06T19:32:46.742766Z","submitted_at":"2024-10-14T02:21:29Z","title":"How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective","version":1},"cited_work":{"arxiv_id":"2410.10093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10093","snapshot_observed_at":"2026-08-06T16:34:25.466718Z","title":"How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective","venue":"cs.CL","work_id":"2c2381d3-00ff-4ebf-91c3-7fedb298aabe","year":2024},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.246579Z"},"links":{"cited_paper":"/paper/2410.10093","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a2fdb2558847c165fdc57e57d821c99e9bb0c8ad32aef4996f09e1eadce2c6ef","observation_id":"b81d8143-0d29-4284-9d02-6ba928991711","resolution":{"observed_at":"2026-08-06T16:34:25.472318Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-06T16:34:25.249776Z","title":"Gibbs sampling from human feedback: A provable kl-constrained framework for rlhf.arXiv preprint arXiv:2312.11456,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.249776Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8895990b1719343d402055863ac22e3ff78e1a35dc5b5834a1f42a403cf43f3e","observation_id":"caa7a167-a786-40b8-ad11-8e33e6c466dd","resolution":{"observed_at":"2026-08-06T16:34:25.249776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-06T16:34:25.253465Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.253465Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:05a5ec8a6ff92ac07f119d6379d8089e12b1aff98a2799fba91856ad71d1a42f","observation_id":"11c90913-72bb-4836-a257-2e2879251b27","resolution":{"observed_at":"2026-08-06T16:34:25.253465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-06T16:34:25.256725Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models.arXiv preprint arXiv:2501.09686,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.256725Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7cc48dcd8773698ca97d69fb4ad77c18b6802f1a5812f299b2cfe4948f7b0362","observation_id":"34aa152a-be09-43ba-852b-232695cee304","resolution":{"observed_at":"2026-08-06T16:34:25.256725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-06T16:34:25.260209Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study.arXiv preprint arXiv:2404.10719,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.260209Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:05ece4859dec1d5879508672c5b357f55dd8d6983ed15c702e11d980c856188a","observation_id":"5809d262-c85c-43f6-ae1f-2ecea71cf6bc","resolution":{"observed_at":"2026-08-06T16:34:25.260209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-06T16:34:25.263190Z","title":"Large language models as optimizers.arXiv preprint arXiv:2309.03409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.263190Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:fbdb6ce98011a514c730ee7312986cf10c325c9bcaa499eaa825ce2e987354dd","observation_id":"738a22bb-d8db-4848-92be-c26a1f7ba4ff","resolution":{"observed_at":"2026-08-06T16:34:25.263190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04478","last_updated":"2022-02-14T04:26:50Z","snapshot_observed_at":"2026-08-08T23:10:28.615456Z","submitted_at":"2022-02-09T14:17:05Z","title":"Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04478","snapshot_observed_at":"2026-08-06T16:34:25.266194Z","title":"Rethinking goal-conditioned supervised learning and its connection to offline rl.arXiv preprint arXiv:2202.04478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.266194Z"},"links":{"cited_paper":"/paper/2202.04478","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:f3ff53f3c42d3f7bd0cf15626708e12f016979a290507d628030bcf569d0bf73","observation_id":"a357dcd6-bad0-41da-8319-1a491f2a2c77","resolution":{"observed_at":"2026-08-06T16:34:25.266194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-10T08:43:37.608281Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-06T16:34:25.269350Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.arXiv preprint arXiv:2406.10216,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.269350Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:817abf046e7917ce6d8d2fc4a6b67e779dfe788e0b5536eaf8651f07f13e6f03","observation_id":"b248e687-6a40-4976-a20b-c4b0a2463933","resolution":{"observed_at":"2026-08-06T16:34:25.269350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10958","last_updated":"2024-05-27T20:05:03Z","snapshot_observed_at":"2026-08-10T11:55:19.195310Z","submitted_at":"2024-02-12T22:47:57Z","title":"Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10958","snapshot_observed_at":"2026-08-06T16:34:25.272362Z","title":"Relative preference optimization: Enhancing llm alignment through contrasting responses across identical and diverse prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.272362Z"},"links":{"cited_paper":"/paper/2402.10958","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0276415b7d071236b218a8be0932a3272371b6a106bf1f2ee6b3ed667ab2e074","observation_id":"ac69e7f0-10ed-4d9b-8ad0-9b06eba55910","resolution":{"observed_at":"2026-08-06T16:34:25.272362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T16:34:25.276239Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.276239Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:4939fbe0e8dfae8fc7a52852bbd2ac9cd2798eb5e603700e2d82e85de0be7ef9","observation_id":"0daaf2f3-714b-4697-b4c1-8ef1564e3f8b","resolution":{"observed_at":"2026-08-06T16:34:25.276239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-09T04:25:12.977504Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-06T16:34:25.279111Z","title":"Rrhf: Rank responses to align language models with human feedback without tears.arXiv preprint arXiv:2304.05302,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.279111Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a88fe5f638aa6142c8591a54de139a3e599ff79fb9498a96d8c010df6b7c858d","observation_id":"26a849c7-7e62-4a1a-9237-5698fd209cb9","resolution":{"observed_at":"2026-08-06T16:34:25.279111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09175","last_updated":"2024-07-31T13:55:49Z","snapshot_observed_at":"2026-07-06T16:07:26.202458Z","submitted_at":"2023-08-17T20:27:33Z","title":"Diversifying AI: Towards Creative Chess with AlphaZero","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09175","snapshot_observed_at":"2026-08-06T16:34:25.282653Z","title":"Diversifying ai: Towards creative chess with alphazero","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.282653Z"},"links":{"cited_paper":"/paper/2308.09175","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ef0534cc9d4d4b52afeee0f518c0b9d8ee09b2e4474f3b71af2f9b84dd0f6cd8","observation_id":"c79daecb-c563-4a67-b965-4f7e470b53a2","resolution":{"observed_at":"2026-08-06T16:34:25.282653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.285823Z","title":"When scaling meets LLM finetuning: The effect of data, model and finetuning method","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.285823Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:badb1d804fa759d0a5c5085164e1b4f769ca7e293371c332a3f83aad1b7d7778","observation_id":"1b131a45-5c49-4f61-b78d-06947941fe55","resolution":{"observed_at":"2026-08-06T16:34:25.285823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-06T16:34:25.288762Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.Advances in Neural Information Processing Systems, 37:64735–64772, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.288762Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:e452697255d9212d601f9bc741c68383db5011a93177c922b9b8817cc188ca06","observation_id":"963c5887-8ece-4b8d-8c6c-f0a2e45def27","resolution":{"observed_at":"2026-08-06T16:34:25.288762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05171","last_updated":"2024-07-09T13:17:36Z","snapshot_observed_at":"2026-08-03T16:32:31.666416Z","submitted_at":"2024-03-08T09:20:12Z","title":"Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05171","snapshot_observed_at":"2026-08-06T16:34:25.291921Z","title":"Xiaoying Zhang, Jean-Francois Ton, Wei Shen, Hongning Wang, and Yang Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.291921Z"},"links":{"cited_paper":"/paper/2403.05171","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:d80f4e78f60f936a5bf0a10247a7e6d2b251dce88d14e41865aad52ec578a40a","observation_id":"d3396fdf-285c-4f06-9ab9-8ce1b7348ab2","resolution":{"observed_at":"2026-08-06T16:34:25.291921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-06T16:34:25.294914Z","title":"Secrets of rlhf in large language models part i: Ppo.arXiv preprint arXiv:2307.04964,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.294914Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:f28106c38a44b8fb79191080df2066dcbed9d97d939dce5898955849fff01246","observation_id":"4730a3b9-3f73-48fe-bbaa-275bc9827592","resolution":{"observed_at":"2026-08-06T16:34:25.294914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-06T16:34:25.297970Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.297970Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0a27bc07ceaae85504a4af5d63d013c75a9a19943018ebb9e86f9f502ff49b7b","observation_id":"99c591d9-b88d-4fbb-b681-f880534ff6fc","resolution":{"observed_at":"2026-08-06T16:34:25.297970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-06T16:34:25.301260Z","title":"Lima: Less is more for alignment.Advances in Neural Information Processing Systems, 36:55006–55021, 2023a","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.301260Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:72a5ae07334cb531b3fcf5937796bbcb97da0471b45195fdab5b11d71caeff74","observation_id":"ccac6194-08ff-4523-a40f-e40eac577756","resolution":{"observed_at":"2026-08-06T16:34:25.301260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T16:34:24.945869Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.945869Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2b55cbe694bd87be4d6d953b3fb608ac8b1747f8851e22f0782ea3190e2c7f2f","observation_id":"90b10786-5de4-4378-88bc-07dde36cb0ba","resolution":{"observed_at":"2026-08-06T16:34:24.945869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T16:34:25.207451Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.arXiv preprint arXiv:2206.04615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1973,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.207451Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a7801ab588fe11aef35666f1f7a88d5c3a972b83ff03c351e29e71b8d032be7c","observation_id":"3f63be04-b7ef-4d04-826a-b31d7e63bd06","resolution":{"observed_at":"2026-08-06T16:34:25.207451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07812","last_updated":"2024-08-07T18:27:59Z","snapshot_observed_at":"2026-07-06T17:29:00.943463Z","submitted_at":"2024-02-12T17:17:50Z","title":"Retrieval Augmented Thought Process for Private Data Handling in Healthcare","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07812","snapshot_observed_at":"2026-08-06T16:34:25.136743Z","title":"Retrieval-augmented thought process as sequential decision making.arXiv preprint arXiv:2402.07812,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.136743Z"},"links":{"cited_paper":"/paper/2402.07812","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:299fe499bc3cece9e2703deb354a171344641dee2d7b92eba7981c1bd0b51130","observation_id":"3889c48b-10e2-4ab4-bbfb-46d8a41f0f78","resolution":{"observed_at":"2026-08-06T16:34:25.136743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03025","last_updated":"2023-11-12T06:25:32Z","snapshot_observed_at":"2026-08-09T22:31:08.379987Z","submitted_at":"2023-07-06T14:42:01Z","title":"Style Over Substance: Evaluation Biases for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03025","snapshot_observed_at":"2026-08-06T16:34:25.242829Z","title":"Style over substance: Evaluation biases for large language models.arXiv preprint arXiv:2307.03025,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.242829Z"},"links":{"cited_paper":"/paper/2307.03025","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:f5ecc99504f673989d36f8259d0fe37f196c5f8be21261b606f4e17c426577b7","observation_id":"f8c77f3b-3746-4371-abd6-e3bb2c761ef8","resolution":{"observed_at":"2026-08-06T16:34:25.242829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":6,"unresolved":89,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 3 inbound Pith citation observations for arXiv:2507.13158."}