{"as_of":"2026-08-14T20:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f6866510ee0b009627f8f737ad5da01eee0bfa39379ccabbee7e8b3f1d4ab84","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:51:30.802158Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:12:24.953400Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"cited_work":{"arxiv_id":"2506.06923","doi":"10.48550/arxiv.2506.06923","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boosting llm reasoning via spontaneous self-correction.arXiv preprint arXiv:2506.06923","venue":"ArXiv.org","work_id":"0e6049ce-9fed-4b37-b5eb-b4d3db4199bc","year":2025},"citing_paper":{"arxiv_id":"2509.18847","last_updated":"2026-04-15T06:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-23T09:35:49Z","title":"Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T15:00:51.162221Z"},"links":{"cited_paper":"/paper/2506.06923","citing_paper":"/paper/2509.18847"},"observation_digest":"sha256:f88d4615c133595af425c3a0e7b6782dc541f7f16947f48ff8e405b319307616","observation_id":"1b132b7c-82ef-4045-8111-aef36f124d68","resolution":{"observed_at":"2026-05-18T15:01:31.324902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"cited_work":{"arxiv_id":"2506.06923","doi":"10.48550/arxiv.2506.06923","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boosting llm reasoning via spontaneous self-correction.arXiv preprint arXiv:2506.06923","venue":"ArXiv.org","work_id":"0e6049ce-9fed-4b37-b5eb-b4d3db4199bc","year":2025},"citing_paper":{"arxiv_id":"2601.05106","last_updated":"2026-05-21T03:21:52Z","snapshot_observed_at":"2026-08-13T12:55:23.271484Z","submitted_at":"2026-01-08T16:53:16Z","title":"Token-Level LLM Collaboration via FusionRoute","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T12:25:59.747665Z"},"links":{"cited_paper":"/paper/2506.06923","citing_paper":"/paper/2601.05106"},"observation_digest":"sha256:595cff52f1de73b8da85982c0c5302c08c29f7390f53d32fb24aa3bae023811e","observation_id":"86faf3ca-6145-4caf-afeb-ba9ece208066","resolution":{"observed_at":"2026-05-22T12:26:31.592686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"cited_work":{"arxiv_id":"2506.06923","doi":"10.48550/arxiv.2506.06923","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boosting llm reasoning via spontaneous self-correction.arXiv preprint arXiv:2506.06923","venue":"ArXiv.org","work_id":"0e6049ce-9fed-4b37-b5eb-b4d3db4199bc","year":2025},"citing_paper":{"arxiv_id":"2606.05976","last_updated":"2026-07-31T08:26:14Z","snapshot_observed_at":"2026-08-13T05:42:05.031665Z","submitted_at":"2026-06-04T10:17:00Z","title":"The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T01:25:07.890796Z"},"links":{"cited_paper":"/paper/2506.06923","citing_paper":"/paper/2606.05976"},"observation_digest":"sha256:2be948826b669fdb42fbfc692605eff2ce84fb16f00081282f9339ed034f2d5f","observation_id":"ba8d26e6-7c0c-4fbe-8735-0607b64bd0e5","resolution":{"observed_at":"2026-06-28T01:31:29.317466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"cited_work":{"arxiv_id":"2506.06923","doi":"10.48550/arxiv.2506.06923","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boosting llm reasoning via spontaneous self-correction.arXiv preprint arXiv:2506.06923","venue":"ArXiv.org","work_id":"0e6049ce-9fed-4b37-b5eb-b4d3db4199bc","year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-13T10:34:20.953214Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T06:39:34.199607Z"},"links":{"cited_paper":"/paper/2506.06923","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:80937ffbf7f0e966723e2786cae8c6f7aa7dd64cba1dde0ac2178b7955f76d3a","observation_id":"d859d439-49c4-4f68-94c9-544189e6e1dc","resolution":{"observed_at":"2026-07-03T15:08:33.339023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06923","snapshot_observed_at":"2026-08-03T02:12:24.953400Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-13T10:34:20.953214Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:24.953400Z"},"links":{"cited_paper":"/paper/2506.06923","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:c2fbbb91c3bebb44f9643d5e26eaf8ca7f8a793272433af62c38a030b60709bf","observation_id":"8c53babe-d41d-4111-b267-a2debe949841","resolution":{"observed_at":"2026-08-03T02:12:24.953400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"cited_work":{"arxiv_id":"2506.06923","doi":"10.48550/arxiv.2506.06923","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boosting llm reasoning via spontaneous self-correction.arXiv preprint arXiv:2506.06923","venue":"ArXiv.org","work_id":"0e6049ce-9fed-4b37-b5eb-b4d3db4199bc","year":2025},"citing_paper":{"arxiv_id":"2606.29425","last_updated":"2026-06-28T14:40:01Z","snapshot_observed_at":"2026-08-05T16:29:32.428034Z","submitted_at":"2026-06-28T14:40:01Z","title":"Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T07:11:02.464556Z"},"links":{"cited_paper":"/paper/2506.06923","citing_paper":"/paper/2606.29425"},"observation_digest":"sha256:42324adb854b6cbfb3872fe74778c28563e2c1751a56640fa7de41dd23d07aa5","observation_id":"8c74e4ae-a7d8-4650-a512-401250934550","resolution":{"observed_at":"2026-06-30T07:14:20.884384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06923","snapshot_observed_at":"2026-07-14T07:59:56.441098Z","title":"arXiv preprint arXiv:2506.06923 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10966","last_updated":"2026-07-13T00:21:30Z","snapshot_observed_at":"2026-08-13T17:25:50.326845Z","submitted_at":"2026-07-13T00:21:30Z","title":"SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-14T07:59:56.441098Z"},"links":{"cited_paper":"/paper/2506.06923","citing_paper":"/paper/2607.10966"},"observation_digest":"sha256:6b829b471c5b6ce47a7177e0a750bca7ab30a15a9cad8338fb2d3919ee7bbca2","observation_id":"44d7a380-53a1-459e-874b-f727b8fb1aba","resolution":{"observed_at":"2026-07-14T07:59:56.441098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06923/citation-record","integrity":"/paper/2506.06923/integrity","json":"/paper/2506.06923/citation-record.json","paper":"/paper/2506.06923"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:51:30.646607Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.646607Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:ccec1c74d71b153909b8a87609ac4f7d61918c0b71e8c9ddcd8866e11accb79f","observation_id":"72f5906c-14e6-4017-99f2-6a8016d04b9f","resolution":{"observed_at":"2026-08-07T05:51:30.646607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11452","last_updated":"2024-02-18T04:28:16Z","snapshot_observed_at":"2026-08-13T04:16:51.412786Z","submitted_at":"2024-02-18T04:28:16Z","title":"AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11452","snapshot_observed_at":"2026-08-07T05:51:30.655211Z","title":"Autoprm: Automating procedural supervision for multi-step reasoning via controllable question decomposition.arXiv preprint arXiv:2402.11452,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.655211Z"},"links":{"cited_paper":"/paper/2402.11452","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:ab940e6fd85b4b8fc0034ce1a6df67e4ab3c9e2c995619a63210ea8e834bf117","observation_id":"1ffdbfdd-1f2c-4183-a0a0-8869dca2b8a3","resolution":{"observed_at":"2026-08-07T05:51:30.655211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T05:51:30.658951Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment.arXiv preprint arXiv:2304.06767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.658951Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:fcb34bd575f1b08da4009f0fa77ee3cf816e7443118b65ee5e926d8bd27331e0","observation_id":"821ba7ec-47d2-4c1a-9730-cdf55bfb9a5f","resolution":{"observed_at":"2026-08-07T05:51:30.658951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:51:30.666323Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.666323Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:b5ec9b414f094672b2ced7cd5495893a1f393464b05484b0ffba4579f2ca369e","observation_id":"21619a22-cada-4584-ad50-89d5977f8072","resolution":{"observed_at":"2026-08-07T05:51:30.666323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T05:51:30.673543Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.673543Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:6dc8fc73a74282cce4a9bbdb71a68bda9362abba0c2f0c71d0bba561c50da101","observation_id":"5fcfeb08-6ff6-4638-acff-9a8ffcd9f872","resolution":{"observed_at":"2026-08-07T05:51:30.673543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-14T09:52:03.795785Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T05:51:30.680647Z","title":"Training language models to self-correct via reinforcement learning.arXiv preprint arXiv:2409.12917,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.680647Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:60b247a1a6e7101a573b1509f8fe69eada6d82701b0fda6b9d4ad24ebcd8d676","observation_id":"064fd908-3486-44a2-9119-af0b37e847b5","resolution":{"observed_at":"2026-08-07T05:51:30.680647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-01T16:20:31.337598Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-07T05:51:30.684280Z","title":"Encouraging divergent thinking in large language models through multi-agent debate.arXiv preprint arXiv:2305.19118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.684280Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:67f8393ae662740398f399107322b72a5da9b8f428512343de0913f1ff57a23d","observation_id":"6480e74e-4923-47ad-a159-a15f1759e899","resolution":{"observed_at":"2026-08-07T05:51:30.684280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T05:51:30.687632Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.687632Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:a659afc4e411f498291c02333bdd358dda8837eb0ef6cbaf3a05267c2c210bc6","observation_id":"c3faa4b9-3db5-410e-b94e-bd522d5d2203","resolution":{"observed_at":"2026-08-07T05:51:30.687632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-08-14T18:13:01.234745Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-07T05:51:30.691200Z","title":"S2 r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.691200Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:d4f64fd42fefaabf9f4584ef4022b89172426ade0d5a892be852ad7b67b1f0ed","observation_id":"2d5e7b6f-4e1c-4faf-9f00-b351615363dd","resolution":{"observed_at":"2026-08-07T05:51:30.691200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:30.694647Z","title":"Deepseek-r1 thoughtology: Let’s think about llm reasoning.arXiv preprint arXiv:2504.07128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.694647Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:da80ecc95ce0bbd020b6a0d4c8c312340ccd4665e27597395b1cd34b9cc79fa3","observation_id":"639f6b94-bffe-4676-8378-ca4216a1b2b4","resolution":{"observed_at":"2026-08-07T05:51:30.694647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-13T23:44:54.604004Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-08-07T05:51:30.697849Z","title":"Orca-math: Unlocking the potential of slms in grade school math.arXiv preprint arXiv:2402.14830,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.697849Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:445027a30c9212ddad451c9b5050edd051793528c3d75e4d4b82ad93cd8e829e","observation_id":"e255617b-dfeb-4c4b-87f2-5a314ab0dbf4","resolution":{"observed_at":"2026-08-07T05:51:30.697849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:30.701201Z","title":"Malt: Improving reasoning with multi-agent llm training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.701201Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:e9a9181a5536d69bb88c2837ee21b12a8789adf2ad3af353e902f20a9f8c9963","observation_id":"e0864680-2e7a-469e-8c9a-8d99867be80d","resolution":{"observed_at":"2026-08-07T05:51:30.701201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-14T08:20:34.829087Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-07T05:51:30.708193Z","title":"Recursive introspection: Teaching language model agents how to self-improve.arXiv preprint arXiv:2407.18219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.708193Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:9a5e599a4b82cecaa9e10d231d624cb9f86cdd87407b9e7668d609668c4af845","observation_id":"22a7ff88-7d46-4db5-ab0c-6d65423d6042","resolution":{"observed_at":"2026-08-07T05:51:30.708193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-08-13T17:24:30.719766Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-07T05:51:30.711791Z","title":"Self-critiquing models for assisting human evaluators.arXiv preprint arXiv:2206.05802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.711791Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:1060b1ec57a19f980b8c0b28ac7af2c2563090f62413d0d2ba011ce8ae14c874","observation_id":"a87dd523-30df-455b-8f44-7739100a0701","resolution":{"observed_at":"2026-08-07T05:51:30.711791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00053","last_updated":"2022-10-31T18:09:51Z","snapshot_observed_at":"2026-08-13T13:52:42.978034Z","submitted_at":"2022-10-31T18:09:51Z","title":"Generating Sequences by Learning to Self-Correct","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00053","snapshot_observed_at":"2026-08-07T05:51:30.726142Z","title":"Generating sequences by learning to self-correct.arXiv preprint arXiv:2211.00053,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.726142Z"},"links":{"cited_paper":"/paper/2211.00053","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:5f383409f97b0f2cc8fb29f3082db7f7ca867acc8b67e8f0994fda36c229451e","observation_id":"2d8a13ba-1438-4563-baba-31d72530b596","resolution":{"observed_at":"2026-08-07T05:51:30.726142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-07T05:51:30.729872Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation.arXiv preprint arXiv:2308.08155,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.729872Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:53fbb00ddd44740571e5528137d74d17a6e973cccb21135bb9e969c715db7bd8","observation_id":"bf952e5b-92b0-464d-b2bf-5bc6059a3ee0","resolution":{"observed_at":"2026-08-07T05:51:30.729872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04682","last_updated":"2025-01-08T18:42:48Z","snapshot_observed_at":"2026-08-10T21:24:31.639820Z","submitted_at":"2025-01-08T18:42:48Z","title":"Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04682","snapshot_observed_at":"2026-08-07T05:51:30.733420Z","title":"Towards system 2 reasoning in llms: Learning how to think with meta chain-of-though.arXiv preprint arXiv:2501.04682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.733420Z"},"links":{"cited_paper":"/paper/2501.04682","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:04fbaed5d2de494396a95ea14d7719259178687350631a84b68af5cafb2e2e32","observation_id":"45d72fcc-112d-4e52-9821-6762d0f869d5","resolution":{"observed_at":"2026-08-07T05:51:30.733420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-13T04:59:12.838781Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-07T05:51:30.736946Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint.arXiv preprint arXiv:2312.11456,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.736946Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:6887c813c98d44f8fd77d14d151f7c5ea0ac85edc77882b02baef2cbb794ad57","observation_id":"2cbcdcb0-37db-4fba-b52b-61e85f8acf78","resolution":{"observed_at":"2026-08-07T05:51:30.736946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19613","last_updated":"2025-02-26T23:01:16Z","snapshot_observed_at":"2026-08-12T10:11:45.514589Z","submitted_at":"2025-02-26T23:01:16Z","title":"Self-rewarding correction for mathematical reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19613","snapshot_observed_at":"2026-08-07T05:51:30.740802Z","title":"Self-rewarding correction for mathematical reasoning.arXiv preprint arXiv:2502.19613,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.740802Z"},"links":{"cited_paper":"/paper/2502.19613","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:7af3af3e799b8c70dd0cf8092c7385e8da15e4b77c07eaa44ecbc584d1fdd7f9","observation_id":"a00c80d3-824f-4ab2-922a-582cb76fbd30","resolution":{"observed_at":"2026-08-07T05:51:30.740802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20370","last_updated":"2024-09-30T15:06:53Z","snapshot_observed_at":"2026-08-12T22:34:31.514001Z","submitted_at":"2024-09-30T15:06:53Z","title":"The Perfect Blend: Redefining RLHF with Mixture of Judges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20370","snapshot_observed_at":"2026-08-07T05:51:30.744527Z","title":"The perfect blend: Redefining rlhf with mixture of judges.arXiv preprint arXiv:2409.20370,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.744527Z"},"links":{"cited_paper":"/paper/2409.20370","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:777a90f2adbec3de67cdb4c2f2cfdb4cf1b7af0d9024791458dedb3b6ba872ab","observation_id":"d9d12446-f629-4000-8a3e-681432b58a87","resolution":{"observed_at":"2026-08-07T05:51:30.744527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T05:51:30.748032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.748032Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:e487b948b810f29e4dac921a4d61c6cc08b79e3ee56b5251a83b5210525520bf","observation_id":"481e8170-2563-43b9-ac69-ffd75e58a9eb","resolution":{"observed_at":"2026-08-07T05:51:30.748032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16293","last_updated":"2024-08-29T06:49:20Z","snapshot_observed_at":"2026-08-12T22:55:26.274100Z","submitted_at":"2024-08-29T06:49:20Z","title":"Physics of Language Models: Part 2.2, How to Learn From Mistakes on Grade-School Math Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16293","snapshot_observed_at":"2026-08-07T05:51:30.751555Z","title":"Physics of language models: Part 2.2, how to learn from mistakes on grade-school math problems.arXiv preprint arXiv:2408.16293,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.751555Z"},"links":{"cited_paper":"/paper/2408.16293","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:2de79f3a5410459d21e6bd1d33a0398acd00c1441f256d413c1ce1f9cb87f933","observation_id":"a6724760-13bd-44c8-bab3-1b31fdef9bd7","resolution":{"observed_at":"2026-08-07T05:51:30.751555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-12T22:56:24.326978Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T05:51:30.754913Z","title":"Generative verifiers: Reward modeling as next-token prediction.arXiv preprint arXiv:2408.15240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.754913Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:32b5431f5ff0734b64cc68aa28bf37c2ddbf4d373db128f863a3905aede14ffa","observation_id":"10ff8058-bac5-4f70-b4b2-50d5cd7b6289","resolution":{"observed_at":"2026-08-07T05:51:30.754913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16326","last_updated":"2025-06-11T02:01:02Z","snapshot_observed_at":"2026-08-13T21:43:23.440832Z","submitted_at":"2024-08-29T08:02:09Z","title":"Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16326","snapshot_observed_at":"2026-08-07T05:51:30.758539Z","title":"Critic-cot: Boosting the reasoning abilities of large language model via chain-of-thoughts critic.arXiv preprint arXiv:2408.16326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.758539Z"},"links":{"cited_paper":"/paper/2408.16326","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:80a05cae24e60d07e10cf3bcb79766f478db21d1597617f758e4061b5002b9c7","observation_id":"2a0cdfcf-6cc6-42af-b74c-338472202853","resolution":{"observed_at":"2026-08-07T05:51:30.758539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.672757Z","title":null,"venue":null,"work_id":"207ce429-dddc-49c3-9357-9edd2319a14f","year":2023},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.762004Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:e8e4e4f978abac52f3957de681b867dfb09b6d905e732e75ccdb5a74a273aaf8","observation_id":"521ee6e4-ca2e-4d74-be1b-ff9f04abe176","resolution":{"observed_at":"2026-08-07T05:51:31.675414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.663842Z","title":"This test set spans five difficulty levels and seven subjects, which promotes a comprehensive evaluation of reasoning capabilities","venue":null,"work_id":"ebbaece3-f693-447c-b00a-d3ceef0b28a0","year":2023},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.765912Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:70393a9509311453c36b9c0cc1fc58023e4efd4f977191a518ca6ea8308a5b31","observation_id":"a46726ca-a597-4e2a-8506-f48cb7332d72","resolution":{"observed_at":"2026-08-07T05:51:31.666950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.655096Z","title":"I think the solution is correct","venue":null,"work_id":"45f53a16-e3a9-49eb-a9e1-cca37f48d8d6","year":2024},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.769600Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:0ae206cb5e8fb1cb6ebc17db4db976efa8f44eaf8a7a37cb2b7a704eeb040ffd","observation_id":"206d89b9-7f9a-4304-a511-5fe7b7a0cbe1","resolution":{"observed_at":"2026-08-07T05:51:31.657876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.636823Z","title":null,"venue":null,"work_id":"a553e9b0-b7f1-47ab-8284-8ef134dbdf9e","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.776696Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:83dd091f4e5efbe7da9dac2783a3417d2389b161a3263ffcbd05b89c3c725dff","observation_id":"b056555e-06dd-419d-9c78-59a1b9ef497d","resolution":{"observed_at":"2026-08-07T05:51:31.639788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.627650Z","title":"## Step 4: Verify if \\( a = 1 \\) satisfies the conditions of the problem","venue":null,"work_id":"a2668b22-cfef-4d9a-9e9f-b1a8e97b00e0","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.780310Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:9943c60637029cde7c5c4c4e95e0c4450d4f96680b84c7b04d72d61427fca881","observation_id":"27a73b57-0698-48bc-83af-f9b116da876a","resolution":{"observed_at":"2026-08-07T05:51:31.630855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.616443Z","title":"This means \\( r^2 = 2009 \\) is not possible for any integer \\( r \\) since 2009 is not a perfect square","venue":null,"work_id":"beec90b8-91f8-4190-99c2-e227ac689be5","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.784166Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:6459d105ffb5583e54b1e53ad72c45b6eec04523d064fe7be2eae450bcedaa39","observation_id":"c5523e90-8edf-4613-b87e-db957766b547","resolution":{"observed_at":"2026-08-07T05:51:31.620687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.605125Z","title":"Thus, \\( b = 1 \\) is not possible since \\( a < b \\), implying \\( a \\) would have to be less than 1, which is not possible for positive integers","venue":null,"work_id":"73086a02-3ec9-435f-9f2f-c64d465b298a","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.787612Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:38b9db157d90e766c2dba65bb885e3fb9a6514f495ff835eeb5d2d6844260331","observation_id":"9da34c37-d85e-4443-b0ac-74daaee1a0ce","resolution":{"observed_at":"2026-08-07T05:51:31.608898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.407039Z","title":null,"venue":null,"work_id":"34c8aa13-3aae-48da-8054-85c093075aa4","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.791507Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:40cc9a41afb51cfc203ed6f9d3b8b1f6bc86621bb079900e360943c7acc880f1","observation_id":"316997fc-3f4d-49ad-bfa6-4147c8b15705","resolution":{"observed_at":"2026-08-07T05:51:31.506712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.340860Z","title":null,"venue":null,"work_id":"93b6948b-31fa-42db-b70b-c3d488de21f5","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.794861Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:3a29ee8023093b48ed2fd89b4f5865617559b5cd168ac5a4301ffccacd4cb971","observation_id":"4e7bab44-6516-491d-bac4-cf78265fcb73","resolution":{"observed_at":"2026-08-07T05:51:31.358409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.310637Z","title":"Thus, \\( r^2 = 1 \\), giving \\( r = 1 \\) or \\( r = -1 \\)","venue":null,"work_id":"33aa0da2-3e9a-4adc-b68e-c012d73d2d95","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.798481Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:a7632b3daafd70c3e0a059cafab3d2e650ce76dd409b8ca9e2a8fc02037c2ac9","observation_id":"3a97133e-bba6-480b-856a-a065388f58cb","resolution":{"observed_at":"2026-08-07T05:51:31.321319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.280517Z","title":null,"venue":null,"work_id":"b2c4622b-5a82-46a4-b56e-b74362b91b15","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.802158Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:d19f39f703b4063ec2383b390527d1df6b81dacd1ba31aba28a90e473724bc29","observation_id":"97e67abb-7f35-4632-a4f8-1d62ac7e2da8","resolution":{"observed_at":"2026-08-07T05:51:31.291891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01904","last_updated":"2024-02-04T12:15:18Z","snapshot_observed_at":"2026-08-14T09:21:04.743043Z","submitted_at":"2023-04-04T15:57:28Z","title":"REFINER: Reasoning Feedback on Intermediate Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01904","snapshot_observed_at":"2026-08-07T05:51:30.704566Z","title":"Refiner: Reasoning feedback on intermediate representations.arXiv preprint arXiv:2304.01904,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.704566Z"},"links":{"cited_paper":"/paper/2304.01904","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:0e2f4693b6fa49d1a850b1fa013b070d994b397569213c1917f533cbec63e523","observation_id":"f155d4f3-4747-4e7c-872a-8db3d2a0e2ea","resolution":{"observed_at":"2026-08-07T05:51:30.704566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-14T20:06:37.819179Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-07T05:51:30.719001Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm.arXiv preprint arXiv:1712.01815,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.719001Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:9ca9b0b8fb6494789abdcbaaa4bea114286448a2542638e3104f13a1f67293d4","observation_id":"1c712f5b-949f-4280-a6ee-3b068b91deb3","resolution":{"observed_at":"2026-08-07T05:51:30.719001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:31.645826Z","title":"To find the factors of 2009, we can start by checking for its prime factorization","venue":null,"work_id":"459b06ca-62dd-49f5-8765-716635078524","year":2009},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.773303Z"},"links":{"citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:bfb2fb4851bca11150d48c3fd186ba9577f67de5c3441e475f5f682baec8a0ef","observation_id":"c5819207-0b3a-4ae6-aabe-69630fdf17be","resolution":{"observed_at":"2026-08-07T05:51:31.649171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:51:30.722541Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.722541Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:ee7cdf59534303dcce67ac5eadc17df23a03242cb461760412efce038bef76eb","observation_id":"7290b59d-4f0d-4708-af25-53e0c5171f20","resolution":{"observed_at":"2026-08-07T05:51:30.722541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-07T05:51:30.677062Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.677062Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:9e88a33df0e7347a26369b5385ffaaaafac238e08b7d772302a886b11f9a952e","observation_id":"57ab5821-d2de-4f18-a0c1-e2d79764e2e1","resolution":{"observed_at":"2026-08-07T05:51:30.677062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:51:30.715663Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.715663Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:8e818f18d4b021f4bd4d55dd974d947c54dbd3df24ba9b144f3c8e03970537d5","observation_id":"1377f845-2e76-4d66-a6cc-ee47c3cde664","resolution":{"observed_at":"2026-08-07T05:51:30.715663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:51:30.662886Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.662886Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:35e7fcc171eb97ef98a500be04d1b0f36e15c98ac7c4467d08f1c9ad74977a67","observation_id":"f1949295-9ccd-4115-96c8-d4df2ae36cc4","resolution":{"observed_at":"2026-08-07T05:51:30.662886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08844","last_updated":"2023-07-11T18:29:12Z","snapshot_observed_at":"2026-08-14T13:43:32.177991Z","submitted_at":"2023-05-15T17:57:16Z","title":"RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model Outputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08844","snapshot_observed_at":"2026-08-07T05:51:30.651067Z","title":"Rl4f: Generating natural language feedback with reinforcement learning for repairing model outputs.arXiv preprint arXiv:2305.08844,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.651067Z"},"links":{"cited_paper":"/paper/2305.08844","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:75b375281c6cc9f08d86c69e5c394b6bc6b22746808cb0711e94edd34cbd3c90","observation_id":"d5a81be3-6384-4657-9ab5-a0f67f876325","resolution":{"observed_at":"2026-08-07T05:51:30.651067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10963","last_updated":"2024-06-25T03:14:10Z","snapshot_observed_at":"2026-08-13T04:19:31.642737Z","submitted_at":"2024-02-13T20:16:29Z","title":"GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10963","snapshot_observed_at":"2026-08-07T05:51:30.670012Z","title":"Glore: When, where, and how to improve llm reasoning via global and local refinements","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.670012Z"},"links":{"cited_paper":"/paper/2402.10963","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:f08d89ef22f63d32749959838761950dc56e65b46da70026f72a617d63c9052f","observation_id":"b210253c-344a-4e54-93cf-2142dcf91728","resolution":{"observed_at":"2026-08-07T05:51:30.670012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T17:25:11.492849Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 7 inbound Pith citation observations for arXiv:2506.06923."}