{"as_of":"2026-08-12T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e979c449f5d30c4189348e0edeea43f50330ea6b5daa19e98299734efa63231d","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:17:54.087304Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:41.298276Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:19:33.983480Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-08-10T21:29:25.180272Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:ca0eba221ef052508c3dd677047de51ba1efad3a60ffd552e988d4ed7e1894ea","observation_id":"8a3bf153-0a8b-470d-b7ea-f08e298d5ef3","resolution":{"observed_at":"2026-05-18T21:06:50.793278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-08-04T16:07:41.298276Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:41.298276Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:936e1b6e126fd159113557cb0aa57a65ed7f68523e6cfe87fdbd5fd902bfd4f0","observation_id":"401901ae-2ce4-4b39-bd17-2493aae8662b","resolution":{"observed_at":"2026-08-04T16:07:41.298276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-08-03T16:33:13.577415Z","title":"Science 193(4253):592–595 https://doi.org/10.1126/science.959820","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2512.15783","last_updated":"2026-07-20T11:40:43Z","snapshot_observed_at":"2026-08-09T09:18:59.224249Z","submitted_at":"2025-12-15T11:29:05Z","title":"Towards AI epidemiology: a measurement standardisation framework for prospective risk detection","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T16:33:13.577415Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2512.15783"},"observation_digest":"sha256:c78718002659f89a4d1696b257570db4e9bb5857c94d2448789c415ba13e663c","observation_id":"a143f6f2-8730-4f1c-980f-16c0a9ca5807","resolution":{"observed_at":"2026-08-03T16:33:13.577415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-08-03T06:52:55.624948Z","title":"M., Lin, H.-c., and Ga s i \\'c , M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-09T11:15:25.818401Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.624948Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:191e8ea9484d84aaca35d0a8459df01abb276bc6c9d2b0c5b3bbceff48f45b79","observation_id":"6b42ea3d-cb52-4bb2-a765-04e608af4a2d","resolution":{"observed_at":"2026-08-03T06:52:55.624948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:7400f1c77e610598bff7d7b96b81319f7c25e39174c1a8e0aef40a5e92015990","observation_id":"bf2287c3-e21b-4c88-ab6d-558d14d9c0ee","resolution":{"observed_at":"2026-07-01T20:56:13.491818Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:a124579510f13ebe2fe5e21613ee8ebeb1fbdc0932f47ac9c1fe2ff9481e23b8","observation_id":"c285e10a-1373-4563-9ecf-c71b9d11a2b8","resolution":{"observed_at":"2026-07-02T06:06:40.824202Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.20881","last_updated":"2026-06-18T19:15:50Z","snapshot_observed_at":"2026-08-07T07:30:08.874288Z","submitted_at":"2026-06-18T19:15:50Z","title":"When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:07:21.486960Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.20881"},"observation_digest":"sha256:853a7a2ac449630a4e89c4f7a27e32d969dcf719d3c99394fde0cafee1b4fe8b","observation_id":"84976034-2286-4be4-9490-3c0176afdddb","resolution":{"observed_at":"2026-07-04T04:19:33.985873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.32032","last_updated":"2026-06-30T17:56:01Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T17:56:01Z","title":"Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-07-01T05:22:38.232552Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.32032"},"observation_digest":"sha256:56cb3083421ab484cae69a77a0b47d2ccfd4eba14893ed46bc58116b22b29d7e","observation_id":"a7deee87-0de1-4688-b5db-17d1c6785f06","resolution":{"observed_at":"2026-07-01T10:35:42.088576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21931/citation-record","integrity":"/paper/2507.21931/integrity","json":"/paper/2507.21931/citation-record.json","paper":"/paper/2507.21931"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.820835Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.820835Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:597214dc36aab4bc57c99c2d72b9587973284727b3c9557c922a4a03127b55a2","observation_id":"cd436bbb-8825-4501-b8b7-f5db942d9c04","resolution":{"observed_at":"2026-08-06T12:17:53.820835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.826146Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.826146Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7621193ea7d5ef8d49c0b82bf4fadf718e762774cbf23bb7cba809b8f6712ef5","observation_id":"898f1862-0fd3-4dd8-aa93-459a74075cbe","resolution":{"observed_at":"2026-08-06T12:17:53.826146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.831713Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.831713Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:0cdc04353c36d793cbca9040a010769880fcc3e62587630636a456e0e8d7b5ea","observation_id":"5d1cb278-b2eb-41ec-84eb-347d2bb2759d","resolution":{"observed_at":"2026-08-06T12:17:53.831713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T12:17:53.836605Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.836605Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:740ceffbe7bd6c2a4639c2d56ac1719f8730d473ec63a46c04e9f6a68a453bd0","observation_id":"103e03ea-5066-47f2-a743-bb3e04ec315f","resolution":{"observed_at":"2026-08-06T12:17:53.836605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.108517Z","title":null,"venue":null,"work_id":"737795e6-9091-4791-b210-c37dcc75d87c","year":2013},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.842077Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:57b0d416277404d08fa4294ce6feb96c4559c231adbb77d329991bde7d8c6643","observation_id":"b87270d0-8ae5-4356-a111-ecbc97cb7063","resolution":{"observed_at":"2026-08-06T12:17:55.113630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.847563Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.847563Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:0008886a29ae0ff940d4b07fb94e12b2764758a5a1f61893bd601963bce6266d","observation_id":"3bbc3fcd-2454-42d5-83a3-86301205b4fb","resolution":{"observed_at":"2026-08-06T12:17:53.847563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.852515Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.852515Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:d9b86e15db8a1a6220b42321a4b561cd8a78e39e350f3521dd1febfae98c9ed5","observation_id":"b9e01c82-0882-4d41-9d5d-7f8d951f6bf4","resolution":{"observed_at":"2026-08-06T12:17:53.852515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-1355","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"122602b1-3697-4c7e-903a-1987c206418c","year":2019},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.857460Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:d9ee51be0584d734b9904ad208dcb69d16e22c105538c578d64617bf50943d35","observation_id":"c0dc7cd6-39cc-4876-ab86-db2a37ae961b","resolution":{"observed_at":"2026-08-06T12:17:54.432406Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.083980Z","title":null,"venue":null,"work_id":"f9db3169-9627-463c-ac6a-32df01ace885","year":2004},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.862686Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:2af28c3328042c0c1901ee1f56d07137ac1530b6243816440adc0033b5ad1768","observation_id":"ed71b569-643b-4543-88cd-57a3c01ac363","resolution":{"observed_at":"2026-08-06T12:17:55.088245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.069799Z","title":null,"venue":null,"work_id":"083ca879-e2e0-4492-98e8-bd3a132b2007","year":2017},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.867059Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7db65455fe40219fc4c3835e9471abd1bbd7452ecf119582ed5796e9263592e5","observation_id":"8c077c2b-629d-401b-9c09-fee464e66b55","resolution":{"observed_at":"2026-08-06T12:17:55.074237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.055274Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":"600151d3-57bc-492c-a5eb-61cea781fb7c","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.871556Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:f3e7277f7bc22cd72da0ff5e1f31fde6eb7a9e4184b0c25745cafed5243f97f9","observation_id":"184fa3dc-9100-46db-8a09-cf44577f28ff","resolution":{"observed_at":"2026-08-06T12:17:55.060022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T12:17:53.876094Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.876094Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:406d72c72a51f6303105fedb0b4a59883dd9f3427f11a4025ac66189bdd5a833","observation_id":"ef13e93f-ef6b-4205-a098-6de76c0b9c85","resolution":{"observed_at":"2026-08-06T12:17:53.876094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T12:17:53.880989Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.880989Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:2f5c4c0d4ab7ed330ca4c1293e8f1f9df221eac519daf98f16e392e837c8c807","observation_id":"4a223979-1815-4589-afd9-50d12be8bbe5","resolution":{"observed_at":"2026-08-06T12:17:53.880989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T12:17:53.885704Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.885704Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:ddc1037226fe66a4e2cfe2c7968856515932784efa3a1b1d46a91e23e740625b","observation_id":"af25b509-5705-434e-8bfc-5038d932b14f","resolution":{"observed_at":"2026-08-06T12:17:53.885704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T12:17:53.890650Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.890650Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:69c69e08c6396a18d3dc142cfda0eb5c6aa90b815da67252a55944bd63d79b01","observation_id":"ecf33ae4-b3f1-4596-87c7-8277a295c5ae","resolution":{"observed_at":"2026-08-06T12:17:53.890650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10164","last_updated":"2024-09-16T10:54:04Z","snapshot_observed_at":"2026-07-06T19:15:56.947205Z","submitted_at":"2024-09-16T10:54:04Z","title":"Quantile Regression for Distributional Reward Models in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10164","snapshot_observed_at":"2026-08-06T12:17:53.895202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.895202Z"},"links":{"cited_paper":"/paper/2409.10164","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:65716b900b4568193f13be82beccaf4c61dc7b820cdafa20c05828acdd957624","observation_id":"33048014-125a-43ab-99e2-e3c720b8ab88","resolution":{"observed_at":"2026-08-06T12:17:53.895202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.040326Z","title":null,"venue":null,"work_id":"36f5a5e6-3425-4f68-a2a2-a482f0ce0b2d","year":2019},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.899825Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:b831e0f74360ce0d66773aceea8dbc0707011015d1240ebafe910781cd4b2aaf","observation_id":"65a6c262-66ef-40d4-a2c1-58753086e028","resolution":{"observed_at":"2026-08-06T12:17:55.045249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.558","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"f3610f58-c86f-4030-8682-090284f0152b","year":2021},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.904052Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:199f3f4b04adf02670fc54ae4f82c30307758a9f0fc9c2ab669133241b5b9054","observation_id":"1d3cd083-fc4f-4586-bcaf-2e37104afeb7","resolution":{"observed_at":"2026-08-06T12:17:54.351568Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.sigdial-1.4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"52de4a12-1630-4b90-b091-1c229f270163","year":2020},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.908585Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:29e49289cb0207e77d1f6e09220028710496f87ff5f65aabcfa088dda067bae7","observation_id":"2d9f3ea0-e767-4144-82ea-27d427b4b898","resolution":{"observed_at":"2026-08-06T12:17:54.334249Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02902","last_updated":"2025-04-03T04:39:54Z","snapshot_observed_at":"2026-08-07T16:12:37.144625Z","submitted_at":"2025-04-03T04:39:54Z","title":"Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02902","snapshot_observed_at":"2026-08-06T12:17:53.912913Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.912913Z"},"links":{"cited_paper":"/paper/2504.02902","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:917e79405f70c81fb8dbfb9d503bfe7b7f2213db7361a78bb994932dc7631255","observation_id":"a2726703-344f-4cee-92b3-d18b74a2efd5","resolution":{"observed_at":"2026-08-06T12:17:53.912913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.570","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"6bfe1022-35c6-4123-a582-1f1a186640af","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.917564Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:58959bbcf7cd7e6283e59a974900a4d293d9e132c7637ce710b35a03eda52547","observation_id":"8e4b5a15-b8c8-4ebb-af48-d535e3ef61c6","resolution":{"observed_at":"2026-08-06T12:17:54.301436Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.023956Z","title":null,"venue":null,"work_id":"a14571ea-6970-409a-a8b6-24af62212c37","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.922177Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:5d4dd87373bf1fd6c274198dd159bf9c2030ccaa39df550bd3024227ad488963","observation_id":"8b33bcec-5f80-4b65-8a12-45dc2f00570e","resolution":{"observed_at":"2026-08-06T12:17:55.029029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.926526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.926526Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:1d6efa64b227514ae45f45af4278a0530b72bf88a95379a72c8aea17c58b320d","observation_id":"1a70b161-2ca9-48d1-b7b0-524b93f117c3","resolution":{"observed_at":"2026-08-06T12:17:53.926526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.007511Z","title":null,"venue":null,"work_id":"cecd1997-c9c3-4c0d-b3ff-889f24c2a3df","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.930960Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:0ee6980edfe49416410f0f1fc89364033454ea45e6eef68ae6d44508c85c00d3","observation_id":"eec53b52-b622-4393-90a2-5a5b8cc340b1","resolution":{"observed_at":"2026-08-06T12:17:55.012714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.992037Z","title":null,"venue":null,"work_id":"f6bf51cd-7068-4416-a830-6bb2a1335eed","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.935155Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:8029f350dade39ab0269abb710ec4bd5685bca998fa020cbd9176d9a3738a2de","observation_id":"2332ff48-cbd4-4132-a0b9-16d7673924a5","resolution":{"observed_at":"2026-08-06T12:17:54.996760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.977260Z","title":null,"venue":null,"work_id":"64f3adb1-9703-4818-84ee-565eb92c4083","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.939221Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:bd8e70a9fa0b88c2649088555c11e642ad8a14192382de7aa1953f4149514f7d","observation_id":"b3f475a8-3e21-4716-a4c6-e37faa252aaf","resolution":{"observed_at":"2026-08-06T12:17:54.981811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.962040Z","title":null,"venue":null,"work_id":"3ec56bdc-638f-4581-9884-c7991cb9cb87","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.944321Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:10154c7e2ebcd99e323022f580baed6433533a40cd9a71be9ba02653f3fa36d1","observation_id":"ddcc5375-fc42-4927-8101-504dfaeeccc0","resolution":{"observed_at":"2026-08-06T12:17:54.966669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-09T09:18:08.427943Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-06T12:17:53.948795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.948795Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:6c8be88d615d430d87796662a6508e734184805511a306e01e31a37b92db571c","observation_id":"aed7f9e3-5650-4f7c-9cce-ec449f2a3c7f","resolution":{"observed_at":"2026-08-06T12:17:53.948795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T12:17:53.953322Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.953322Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:b6c53531be95eb6e4a5ba9b7216877c2bb63ce618edae357928220d41ec3c82d","observation_id":"65508360-c5de-4996-9683-89ad4182cfa7","resolution":{"observed_at":"2026-08-06T12:17:53.953322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T12:17:53.957953Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.957953Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:bd07160483c69c5e12e3148dd46ed1d020725652ecde2ba40b9fb77cb829db85","observation_id":"6305eda4-de57-41e8-8892-6d7d97443ecc","resolution":{"observed_at":"2026-08-06T12:17:53.957953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.946780Z","title":null,"venue":null,"work_id":"b0d29bd4-5a68-4dcc-83ca-7b655468bc18","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.962726Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:bc9818ed792d2b27a67deba084168404b0971954e9138b95628ef2269357a00a","observation_id":"78f6f9e4-e7eb-4c0d-b853-0b34620982c8","resolution":{"observed_at":"2026-08-06T12:17:54.951308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.967178Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.967178Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:6913c29aac3ba268d29b310aae16c2756806849b5893e2fd65270ac8f06d97e7","observation_id":"5c1ddf74-63ee-42a0-973b-49555015e06f","resolution":{"observed_at":"2026-08-06T12:17:53.967178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-07-06T19:25:23.988463Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-06T12:17:53.971631Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.971631Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:4953c6d240fd1a1cb08ba027bef9426a2a3211fe9458cb5a3fea5dce677c15fb","observation_id":"73bda382-13c6-4c90-8b42-9ab188b7af6c","resolution":{"observed_at":"2026-08-06T12:17:53.971631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.920523Z","title":"Machado and Michael Bowling","venue":null,"work_id":"eb755e59-20cb-46fb-a68c-b5f6470d57d5","year":2016},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.976351Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:1d16739e631c461a744d19c58560dfd6ae32f184496621508f1ec70eed4c5692","observation_id":"1fdf2191-ddb2-476a-95fe-3bbacccb8a8f","resolution":{"observed_at":"2026-08-06T12:17:54.926167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.903565Z","title":null,"venue":null,"work_id":"c729eb59-1997-45cd-88b1-385596d6f0cb","year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.980788Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:cb027ea2a204d062aa04b5391480d8b59a1c18f35666e5889b496345c37b1d50","observation_id":"5ae024b5-e315-41e5-a8e8-1f749576accd","resolution":{"observed_at":"2026-08-06T12:17:54.908405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T12:17:53.985221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.985221Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:0e805aab30280644a9985fe4f00cf39560030235c8fc31d585e4e19562609cba","observation_id":"1607dbc4-e6fb-4267-ae5a-aa5a061a0536","resolution":{"observed_at":"2026-08-06T12:17:53.985221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T12:17:53.989752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.989752Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:1db3fcca99cc574afcdc5e3daeba569d246bd9f396467833d7ea2323050eeed7","observation_id":"920a9cf9-af70-4a6e-b69b-31596cf5a4c4","resolution":{"observed_at":"2026-08-06T12:17:53.989752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2006.89027","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.666996Z","title":null,"venue":null,"work_id":"3324007f-df42-44bc-8bf9-279e887e7b2d","year":2007},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.994478Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:5f6b5815f2ba36b9b8f82893c1d1bbf8ea48b7b8e1eacfcffbaa18bc43c840cf","observation_id":"7c5b48e5-f810-4442-8ae8-a20d5599757a","resolution":{"observed_at":"2026-08-06T12:17:54.674179Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.887389Z","title":"Christiano, Jan Leike, and Ryan Lowe","venue":null,"work_id":"8fdf0349-511e-4e56-9f42-5137ab534abe","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.999449Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:b0a24c9582188d82600ff8e1aba2efb357730bcde94f7015f4028eff0b59c4a0","observation_id":"2ccb806d-4f12-4181-81e4-6828331e75dc","resolution":{"observed_at":"2026-08-06T12:17:54.892689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1010580","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"PLoS Computational Biology","work_id":"62d48f8d-0da8-4efe-82ab-28fa30da43cb","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.003905Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7a2f17ad39eb6c18a79b865f76ac4cf25c83c2c5eb2891aa4afc676c7f1ed0c7","observation_id":"1eb2c9ef-dce7-4f9b-9ba2-0212cadc9381","resolution":{"observed_at":"2026-08-06T12:17:54.245322Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.871419Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"c3a34e7d-c173-4ca0-bfe0-d327a18fca82","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.008412Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:4a138180a1f2a43fd7ad5974638633371777596df49b44e9113cd98793bfbd63","observation_id":"aba441ef-11c8-42b4-8b56-9b462885af30","resolution":{"observed_at":"2026-08-06T12:17:54.876404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T12:17:54.012877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.012877Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:6e0146974e84cc53a5d5deb160e417211d8383edc86d2938cf440b8f6ea2b6a7","observation_id":"974b5b5b-e63f-4abf-ab67-11cfec510a20","resolution":{"observed_at":"2026-08-06T12:17:54.012877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.017693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.017693Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:c4ea14fa7fb0b34ed534cbac65e4febd66c5b358891eca47793f1c87848f1b37","observation_id":"18261e3f-3215-4bd2-af58-e902cb91da09","resolution":{"observed_at":"2026-08-06T12:17:54.017693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.856016Z","title":null,"venue":null,"work_id":"7f978bcb-bffb-4388-bb87-5625bc6bbd47","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.022190Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:5b17b0231534f1ebe704b9bf835fc1fd0950c235494edab0cc9ef8618709209b","observation_id":"f36d5dd8-6196-4ed5-b5c4-6a1bdbbdee99","resolution":{"observed_at":"2026-08-06T12:17:54.860761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T12:17:54.026626Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.026626Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:265f9e6f956103339a11796f9e569500d796a99149ee110997408132b718715d","observation_id":"01efa139-d2e5-42cb-b09f-6e42f4c5f689","resolution":{"observed_at":"2026-08-06T12:17:54.026626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.031390Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.031390Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:496f086fe5200d9fa454c08bad343aa993421ddde43c8e0c40e5a7ab7959e339","observation_id":"f88fab62-6c2e-46d4-ae45-ded60763dde7","resolution":{"observed_at":"2026-08-06T12:17:54.031390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15624","last_updated":"2025-01-25T11:10:39Z","snapshot_observed_at":"2026-08-02T18:32:46.919947Z","submitted_at":"2024-05-24T15:13:53Z","title":"Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15624","snapshot_observed_at":"2026-08-06T12:17:54.036222Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.036222Z"},"links":{"cited_paper":"/paper/2405.15624","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:68949878271ff3d3933206df690ddeae1c79d4594c466a2791466bb78d1add15","observation_id":"9c7807fa-509c-4bd1-bfec-804faf362c59","resolution":{"observed_at":"2026-08-06T12:17:54.036222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.840422Z","title":"Sutton, David McAllester, Satinder Singh, and Yishay Mansour","venue":null,"work_id":"214b4f66-d576-4c10-af34-bf86b5799bc8","year":1999},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.041302Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:f1f9ac0a7ee1462270e0d8b92906be37bb66d26e71871391ec5cd8b5789c40b4","observation_id":"6cd3f862-7b50-4f69-941e-1375d2f0cf7c","resolution":{"observed_at":"2026-08-06T12:17:54.845656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.045473Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.045473Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:49a005b22f9bf04593671b842e7ba325e943fbb63712170ac74b80ee8f479727","observation_id":"2f25b65c-16b8-4d5d-8705-135b06736807","resolution":{"observed_at":"2026-08-06T12:17:54.045473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.050028Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.050028Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:13b70aec3567b5d204ad23f503019a773bbb82875b792a6d2902e49d78d2f7ca","observation_id":"c24efdf8-b312-413b-b5a7-f1295e8b7b8b","resolution":{"observed_at":"2026-08-06T12:17:54.050028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.055241Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.055241Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:54de1fcf6cec28cfa02790c68c5a84d21fc891122dac9def9c448dc98bf6d88d","observation_id":"01e7a4b5-375c-4141-aff7-57e20d96e081","resolution":{"observed_at":"2026-08-06T12:17:54.055241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-06T12:17:54.059645Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.059645Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:5ff1f9c2e044f636773af7ecd55c2a2b560a04e09ef7571ec78c058c94b449a0","observation_id":"4f958512-d0ce-4590-af80-d1f24f2a005b","resolution":{"observed_at":"2026-08-06T12:17:54.059645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.814567Z","title":"Le, and Denny Zhou","venue":null,"work_id":"1bf9c81b-1f3f-429b-b7d2-26fdc6c4adcc","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.064389Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7f4498449d04c5403474058f5d19e5251c31bd771c70c93ee36ab35c2280f908","observation_id":"c202611a-70b7-41d9-a323-e45ed797a153","resolution":{"observed_at":"2026-08-06T12:17:54.819137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.799511Z","title":null,"venue":null,"work_id":"8c89fafd-80f8-4154-a7b6-eac3af4abec2","year":2018},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.068691Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:d1cd302905b5fe4fb07d91bcec45e4b208c81ac894d4c96fc5eee752cae76794","observation_id":"8a5381e1-c69b-4663-b51e-16398997157b","resolution":{"observed_at":"2026-08-06T12:17:54.804267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.073482Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.073482Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:36d7ccc181139dd6b44c427e0cf7f1ce0edc3d4f61e57966ab68715b51b8d550","observation_id":"76501c6b-b7e7-4d15-915b-42e6a289f892","resolution":{"observed_at":"2026-08-06T12:17:54.073482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.783871Z","title":null,"venue":null,"work_id":"8778199f-7b16-4bae-a1ea-9dbcc0c214a9","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.078344Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7af5308fa67ca97f07c3abf248878bd5079332c647871ffcbdaa61b0b3f35dbb","observation_id":"1662f26f-1a90-4a84-9c2c-c688b711e9d9","resolution":{"observed_at":"2026-08-06T12:17:54.789300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.768521Z","title":null,"venue":null,"work_id":"0f658ce6-2436-442c-93b0-821f60ecac4f","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.082905Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:c52e753a563bd76da7d05d1ece91cf7c66994e177ae0834212b25aa82ffbd734","observation_id":"5eb45b58-9c32-497c-ba3d-b6baeb420f04","resolution":{"observed_at":"2026-08-06T12:17:54.773581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.672","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"1274be7d-ec17-4fb5-a460-f6e2e13dff12","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.087304Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:96f67cf263e465b51012e309b904abb39f6de8d50c4f760cb62f771d2dbd4f57","observation_id":"a3b4f10c-1dea-43e8-a5a5-113697227e16","resolution":{"observed_at":"2026-08-06T12:17:54.125412Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T21:05:13.812027Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":6,"verified_fuzzy":6},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 8 inbound Pith citation observations for arXiv:2507.21931."}