{"as_of":"2026-08-19T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cc54a067cb5597dd0ca0fb8138d6aead8bdeb9112cf8130a1adb4053abc2563","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:52:15.453661Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:38:50.313305Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:46:14.329572Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"cited_work":{"arxiv_id":"2507.20252","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20252","snapshot_observed_at":"2026-07-01T20:46:14.329572Z","title":"Post-completion learning for language models","venue":null,"work_id":"aabfffb2-905c-4625-804d-dc1a091c9040","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2507.20252","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:11f176cb0cb4b22d8161b2583b390ea87af56e111f6ee23bd6e265f6d2fd0eec","observation_id":"c4aa8bd9-13f5-41c5-96ff-011f2213e0f9","resolution":{"observed_at":"2026-05-18T00:02:25.374454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"cited_work":{"arxiv_id":"2507.20252","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20252","snapshot_observed_at":"2026-07-01T20:46:14.329572Z","title":"Post-completion learning for language models","venue":null,"work_id":"aabfffb2-905c-4625-804d-dc1a091c9040","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.20252","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:bba805964fa16e1a1b8887095002d1f35d3c829179497f858293fe03fa6b246b","observation_id":"defad7af-08e9-4111-aa98-1adb07a52c81","resolution":{"observed_at":"2026-07-01T20:46:14.330974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20252/citation-record","integrity":"/paper/2507.20252/integrity","json":"/paper/2507.20252/citation-record.json","paper":"/paper/2507.20252"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-16T02:16:32.508169Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-15T17:52:15.252186Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.252186Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:eb59ff02d2f180b53a560b46a6bec4cb91939830ed1d18e19e037e642f8736a7","observation_id":"3b5fd937-374c-483b-b351-5a8f81171507","resolution":{"observed_at":"2026-08-15T17:52:15.252186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T17:52:15.258371Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.258371Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:54f14d62f7f47f37287579782d6011bc8d139e831bcbd6862183f0c973fd4b3e","observation_id":"0208342f-e35e-46fd-9902-b63ac0cc5b41","resolution":{"observed_at":"2026-08-15T17:52:15.258371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.264139Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.264139Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:9d51d8b6d64e4c6e049a30e114249e1d648b73f5a4d79c3dd8cee1003123b8aa","observation_id":"0147ddf8-6793-4af8-a2ce-9eb5729a426d","resolution":{"observed_at":"2026-08-15T17:52:15.264139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.269964Z","title":"F.; Leike, J.; Brown, T.; Martic, M.; Legg, S.; and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.269964Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:db7c9ad1e5427f9b1a8785a875c649e534183ebe15494a169ab754b6dff9f04b","observation_id":"1f33c2bd-6391-427b-84de-b17e9348fa69","resolution":{"observed_at":"2026-08-15T17:52:15.269964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.275470Z","title":"W.; Hou, L.; Longpre, S.; Zoph, B.; Tay, Y.; Fedus, W.; Li, Y.; Wang, X.; Dehghani, M.; Brahma, S.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.275470Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:c7622618e913b831755d4f640800c0818d38c9770e23051c89be290541365c58","observation_id":"9de409c5-19cf-4568-90b1-d5e6e6bbccf3","resolution":{"observed_at":"2026-08-15T17:52:15.275470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T17:52:15.280955Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.280955Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:ea4dcee94d075f839ebe1d90a61da697014a71a18e47390d770a2f1cf2cd6b0e","observation_id":"215636c2-f45d-48f6-af60-5e1201e03c47","resolution":{"observed_at":"2026-08-15T17:52:15.280955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.287338Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.287338Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:e010b148ea59ed093c868976aa16517d9d643191c81237e567be8494aad3980c","observation_id":"e988729f-6df9-48ec-a669-032553362dbd","resolution":{"observed_at":"2026-08-15T17:52:15.287338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.292338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.292338Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:2bba3efeaf6b9d5b0a4b34844791e18ff6cf70ec0406e1db9c33b7adadea6f10","observation_id":"45eda838-e090-4692-b042-5b04ea444918","resolution":{"observed_at":"2026-08-15T17:52:15.292338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.297765Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.297765Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:b27a20d5f9ddc2be71b33e1da2c1904d5d8dbedb5d852248541c57d73731a805","observation_id":"371e742e-01f8-41ba-ab29-a111d6c91404","resolution":{"observed_at":"2026-08-15T17:52:15.297765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-17T17:58:03.429114Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-15T17:52:15.303331Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.303331Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:d538973b90089108afea7eb5af513cc826f5f2234a32c9406d903de644c923d9","observation_id":"6c3f19e7-c0d6-459f-924c-eb6dc8dd69a3","resolution":{"observed_at":"2026-08-15T17:52:15.303331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.308376Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.308376Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:ae74508f0791fc40a4a6c6c1ee5991ca9e543a33f6b516838a6ab96f3a5d1a02","observation_id":"e48c4a41-e81e-42dd-aaa0-55e0d8d7c683","resolution":{"observed_at":"2026-08-15T17:52:15.308376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02917","last_updated":"2024-05-05T12:51:38Z","snapshot_observed_at":"2026-08-16T13:55:18.261813Z","submitted_at":"2024-05-05T12:51:38Z","title":"Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02917","snapshot_observed_at":"2026-08-15T17:52:15.315509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.315509Z"},"links":{"cited_paper":"/paper/2405.02917","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:3b9920abd823edccbca1d3cb1e298e55541c1bfa94d4a863a5b6d56cfea502f0","observation_id":"324a01e3-eebf-4f9b-9774-fdcefc434fc9","resolution":{"observed_at":"2026-08-15T17:52:15.315509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05193","last_updated":"2024-11-27T00:05:44Z","snapshot_observed_at":"2026-08-16T13:01:55.976106Z","submitted_at":"2024-11-07T21:36:52Z","title":"Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05193","snapshot_observed_at":"2026-08-15T17:52:15.321068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.321068Z"},"links":{"cited_paper":"/paper/2411.05193","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:4dda33a32793ada5fb3dd00c84c0d6a43b92be27e37e546b32cc630c03d0ee76","observation_id":"46d4ac9f-b08a-458d-abdd-506c69e3831d","resolution":{"observed_at":"2026-08-15T17:52:15.321068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-18T01:49:25.380130Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-15T17:52:15.326811Z","title":"J.; Rohatgi, D.; Zhang, C.; Simchowitz, M.; Ash, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.326811Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:5b87398c29d0a763f6517fd76dd9e0d2969c8ac3b4ce15e25d5d260d54be8e8b","observation_id":"46c8a55c-b236-4164-bb68-6b9cd86bfda9","resolution":{"observed_at":"2026-08-15T17:52:15.326811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-15T17:52:15.332477Z","title":"S.; Yu, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.332477Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:42a223631852204a7db2b381388eafc080f76a88c05f9df2ba03a91728c34b73","observation_id":"7c9fbded-0f78-411d-8e40-e79501cf3503","resolution":{"observed_at":"2026-08-15T17:52:15.332477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.954756Z","title":null,"venue":null,"work_id":"9cb60d10-a9c8-4917-aa6a-b8b6cf2c25cd","year":2025},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.338079Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:f1595a1323131c6c4bfb15ddc9bed836ebee75f0ef1d94c49c76f7723baa1214","observation_id":"5fee84e3-aa6c-4440-ae5d-9e73d6bcef45","resolution":{"observed_at":"2026-08-15T17:52:15.960108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.936218Z","title":null,"venue":null,"work_id":"e3f70372-4879-49e0-8bba-01181eba66c8","year":2024},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.343614Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:047bd73c9e837241d78d4c962301a95b131d3fb0e0534ba97223d9563230290f","observation_id":"c4c3bc83-19a8-420e-84aa-d5dc78f6c4dd","resolution":{"observed_at":"2026-08-15T17:52:15.942228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.348769Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.348769Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:1abf7d6d272e830c9a8ea8798fd0f35e70e9f5d990c75f2b385547900cba90c6","observation_id":"fec0a622-f3a4-4c85-91fe-a6bb432ea8ef","resolution":{"observed_at":"2026-08-15T17:52:15.348769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.354177Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.354177Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:7fc84959dae6b66922b5b47587ff39212a6f9aac6af3da09d96d8033f18330ed","observation_id":"0d0f9d1b-04ff-4539-af49-93ef744272fd","resolution":{"observed_at":"2026-08-15T17:52:15.354177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.359618Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.359618Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:e4a06ccc4deb4d0e83d94d7cfe304d9457a45a2a5de85e0b0a4f6e485183479d","observation_id":"7cf8be28-91e3-409a-aa48-a882d66f24cd","resolution":{"observed_at":"2026-08-15T17:52:15.359618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.366178Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.366178Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:97f1b9401e224c109e061f0b91189358b09f1c9dafdb7c90206840e33c832724","observation_id":"71f57d5a-e271-4375-bc3c-24c089647787","resolution":{"observed_at":"2026-08-15T17:52:15.366178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.871136Z","title":"A.; and DeSanctis, V","venue":null,"work_id":"7ccfcd1a-0c41-4de5-970c-77e28a0119ed","year":1986},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.371553Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:d68f6ca63d5318f5ff8ae39742cd1c174ad73283eaf064d895dbb6b8ce0f07a4","observation_id":"510f3b3d-64de-41e3-a5af-ec4d21cf2c47","resolution":{"observed_at":"2026-08-15T17:52:15.877252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:52:15.376429Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.376429Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:57a953edd48fad06b080db4b297068adfaadd07c4e8b5d9b7772e6941c7233de","observation_id":"058de3f7-e17f-4f24-9611-2afb39334dff","resolution":{"observed_at":"2026-08-15T17:52:15.376429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-15T17:52:15.381183Z","title":"S.; Xin, R.; Geng, S.; Wang, Y.; Oh, S.; Du, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.381183Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:935a4350229bbcbb0f728b82de91037431aca76d3d7c80a832a79d241fe1e44d","observation_id":"ae3c49ea-7b7a-47b2-9344-b4211a087cd4","resolution":{"observed_at":"2026-08-15T17:52:15.381183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T17:52:15.387914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.387914Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:3ca2304659197dc87d4d0add5e077342f12c9ff21f7e1c586a37cd0656927076","observation_id":"20879c3c-5579-4477-9360-a9136a7d9fe1","resolution":{"observed_at":"2026-08-15T17:52:15.387914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.850276Z","title":null,"venue":null,"work_id":"8c175d5a-7271-48fd-b004-21a89e44c4ba","year":2023},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.393309Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:2d4cc1c5889907a2f704ff49ca8217b31e9d3e7200382d203a1b3e57b38bfb70","observation_id":"26d7f755-92a5-4b47-ad1d-1b5ab8c08e07","resolution":{"observed_at":"2026-08-15T17:52:15.857037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.398536Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.398536Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:042576f7c5e35b375e131a26a639255efffe4d907d911526b3c7be9bd7d9694b","observation_id":"d2276e5b-0fe5-44ef-b55a-57fabd4cdc6c","resolution":{"observed_at":"2026-08-15T17:52:15.398536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-15T17:52:15.403813Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.403813Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:f7043832b997acf525a166965d2f1530c3d52fff26e15472f219f6aa23b65784","observation_id":"61a167cc-fe00-4799-ae1a-cc18f5d0e03a","resolution":{"observed_at":"2026-08-15T17:52:15.403813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.409219Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.409219Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:f2cb76064ea2d776e8fe259c33fac394976c31d72e1fa3e031314e8b9351003a","observation_id":"7fe828d0-beaa-41f4-911b-7142aa578d0c","resolution":{"observed_at":"2026-08-15T17:52:15.409219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-15T17:52:15.413955Z","title":"Y.; Guu, K.; Yu, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.413955Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:0deb154e868c4c84dc8913ed860e5f3f201c2e6521742d803d4f11b6eeb5dc0f","observation_id":"263560d0-8a50-4cef-a03c-a6ba055203b2","resolution":{"observed_at":"2026-08-15T17:52:15.413955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.419295Z","title":"V.; Zhou, D.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.419295Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:1f197f4e2c5c6439d039888e9673ca55395fbb4059f4ac338fa3f5bb6c77ba34","observation_id":"3d0fc0a1-cd0f-43ff-a4c5-d56285da7868","resolution":{"observed_at":"2026-08-15T17:52:15.419295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T17:52:15.424571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.424571Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:912e60fe7573211e5cf3fcbbc7b90e966ed1b230775207235653542caaf07c9d","observation_id":"616009bf-27a6-4545-ba36-85ac62988051","resolution":{"observed_at":"2026-08-15T17:52:15.424571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.430545Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.430545Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:18f6e9435bd0db68b3f5ffc2ee4ddeaface3fc9060cc5b399c8750d50d7d54d4","observation_id":"d416f233-55f1-43fe-af93-9424d98570d4","resolution":{"observed_at":"2026-08-15T17:52:15.430545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-15T17:52:15.435918Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.435918Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:816ca996d1d66d71c132c245873cacba778098e57e87890c12a7641bf25a2d6c","observation_id":"45ec7328-fc69-45fc-8d4f-0f4560e5f40a","resolution":{"observed_at":"2026-08-15T17:52:15.435918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-17T12:00:23.281116Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-15T17:52:15.441713Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.441713Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:f848434007fa05a6ed5a7255d5cfbb931b58d25de564c29e74f4516a9a11590c","observation_id":"e1a9f662-467a-4bdd-b086-da9dff9d2de9","resolution":{"observed_at":"2026-08-15T17:52:15.441713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.448034Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.448034Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:c64773d16e518ff129f94d494e501e699e3e45d0f0963209c06901036d930d80","observation_id":"ca0b1020-5cbd-4d90-82b8-d333e83f2ff9","resolution":{"observed_at":"2026-08-15T17:52:15.448034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:15.453661Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.453661Z"},"links":{"citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:49c3dca7e6c95f164c9cf756b912ec90fc5877e970876457565f70c4870afe11","observation_id":"081db2f0-62ba-4c9e-9053-fc252e6d9951","resolution":{"observed_at":"2026-08-15T17:52:15.453661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2507.20252."}