{"as_of":"2026-08-18T07:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbdbe3134c0b13bf6a8774151edc7a78cb75cb0048d3682b895502ae9abe1a9a","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:42:06.520147Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06024/citation-record","integrity":"/paper/2509.06024/integrity","json":"/paper/2509.06024/citation-record.json","paper":"/paper/2509.06024"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.155669Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.155669Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:d84f660a87bd6435bcb6da22b6dd3ac1743840a361c7ada87b97ab2ba79a604e","observation_id":"22cd9d77-5bc3-43bf-9b6e-012dd366a55d","resolution":{"observed_at":"2026-08-05T04:42:05.155669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.213407Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.213407Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:dfdb8e295bd10344aac0fd02979097133e7744779e6a775962728df3790facd3","observation_id":"2c9f5930-0553-42f5-9e99-0b969903eda9","resolution":{"observed_at":"2026-08-05T04:42:05.213407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T04:42:05.231836Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.231836Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:faebc802a9ca89e4ae11c7a432562427f7c113a87a8693e497744495f33b78d1","observation_id":"c27a294e-71ce-4d0c-af54-188db47e8299","resolution":{"observed_at":"2026-08-05T04:42:05.231836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14851","last_updated":"2025-05-09T05:26:43Z","snapshot_observed_at":"2026-08-16T20:15:33.207365Z","submitted_at":"2025-01-24T15:49:10Z","title":"JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14851","snapshot_observed_at":"2026-08-05T04:42:05.339231Z","title":"Justlogic: A comprehensive benchmark for evaluating deductive reasoning in large language models.arXiv preprint arXiv:2501.14851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.339231Z"},"links":{"cited_paper":"/paper/2501.14851","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:42d97cf34819519c89c57574f945e395952b4fee7f2c5d3c736cc0d777d960f1","observation_id":"69fdc157-bbdc-465c-b495-18e1571d5675","resolution":{"observed_at":"2026-08-05T04:42:05.339231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15652","last_updated":"2025-07-21T01:15:52Z","snapshot_observed_at":"2026-08-18T03:39:00.284015Z","submitted_at":"2025-02-21T18:20:35Z","title":"Empowering LLMs with Logical Reasoning: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15652","snapshot_observed_at":"2026-08-05T04:42:05.386445Z","title":"Empower- ing llms with logical reasoning: A comprehensive survey.arXiv preprint arXiv:2502.15652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.386445Z"},"links":{"cited_paper":"/paper/2502.15652","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2f740ad1b4f368203a26d3f93c9b41d11256799b052fe3fc0111838a4470121f","observation_id":"7e793c40-6723-4edc-a07b-443d5e24281c","resolution":{"observed_at":"2026-08-05T04:42:05.386445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.790620Z","title":"Self- playing adversarial language game enhances llm reasoning.Advances in Neural Information Processing Systems, 37:126515–126543, 2024","venue":null,"work_id":"ac303a56-4213-4517-9eba-57ea9a5e9fd4","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.458658Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:c1909ddb47958e0efb692e5c60fecbbe8c1edf7e391de5573cbad9f533f46ea7","observation_id":"212bd76f-6364-41ed-ac58-8ef82c2f2f98","resolution":{"observed_at":"2026-08-05T04:42:07.796428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05867","last_updated":"2020-05-05T17:33:38Z","snapshot_observed_at":"2026-08-15T00:04:44.899968Z","submitted_at":"2020-02-14T04:23:28Z","title":"Transformers as Soft Reasoners over Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05867","snapshot_observed_at":"2026-08-05T04:42:05.511121Z","title":"Transformers as soft reasoners over language.arXiv preprint arXiv:2002.05867, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.511121Z"},"links":{"cited_paper":"/paper/2002.05867","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:74863ec75943bf56e5637610412c20af8d607cdaa80a582bb00d1385591e9748","observation_id":"0e1d43cc-a800-41fa-9bd3-ba158b18055a","resolution":{"observed_at":"2026-08-05T04:42:05.511121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T04:42:05.571433Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.571433Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:4ed69cac059085e19043057717ed97dbb928a7d34002a703efa1bdd16665abc1","observation_id":"0a96dd2b-7f59-414c-b992-b6f92d214188","resolution":{"observed_at":"2026-08-05T04:42:05.571433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.669140Z","title":"Gemini 2.0 flash thinking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.669140Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:495ca01f8e186e976117a64b749206384f814239cdc8c1e45d003abae9a909db","observation_id":"09d5c820-15d6-4f1a-9671-70f7e1198aab","resolution":{"observed_at":"2026-08-05T04:42:05.669140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T04:42:05.728700Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.728700Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:ba793b6c03c1475c5e58787bc69d91b995d8e1fdb4ebffa65b581eda4178a4b1","observation_id":"5269d331-add4-4aea-a46d-b61819dccfba","resolution":{"observed_at":"2026-08-05T04:42:05.728700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.798953Z","title":"Did aristotle use a laptop? a question answering benchmark with implicit reasoning strategies.Transactions of the Association for Computational Linguistics, 9:346–361, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.798953Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:ab23e64345e868c33e741e0402195c6f7346817671de432c5097a08ac83fc7bd","observation_id":"9a8ec324-7c9d-4337-b5a0-2ec0abbe9e96","resolution":{"observed_at":"2026-08-05T04:42:05.798953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15778","last_updated":"2024-10-12T11:00:25Z","snapshot_observed_at":"2026-08-16T13:23:12.527841Z","submitted_at":"2024-08-28T13:16:41Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15778","snapshot_observed_at":"2026-08-05T04:42:05.864107Z","title":"Logicgame: Benchmarking rule-based reasoning abilities of large language models.arXiv preprint arXiv:2408.15778, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.864107Z"},"links":{"cited_paper":"/paper/2408.15778","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:1ba7c586348d561a1a7f45a959823d0db7f28a1b3f0537fc49046e45df0a744b","observation_id":"e546555a-3bc0-4ed5-b677-ec87a70695d5","resolution":{"observed_at":"2026-08-05T04:42:05.864107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T04:42:05.932027Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.932027Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:0126dd49f1af10256c5b77e9c07a0e50185d1e8681f1e60d8193aa93966b2b91","observation_id":"bcd6ed91-71c9-4de7-b825-c40330044a9d","resolution":{"observed_at":"2026-08-05T04:42:05.932027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00840","last_updated":"2024-10-11T20:08:54Z","snapshot_observed_at":"2026-08-16T16:35:12.787222Z","submitted_at":"2022-09-02T06:50:11Z","title":"FOLIO: Natural Language Reasoning with First-Order Logic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00840","snapshot_observed_at":"2026-08-05T04:42:06.003231Z","title":"Folio: Natural language reasoning with first-order logic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.003231Z"},"links":{"cited_paper":"/paper/2209.00840","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:4cdf14b13139ea6598b7c272a9f6fbff5d6555a84be572a7e3713d175dbc4eb8","observation_id":"c1d3bab2-ec8e-4b06-b5ea-c4ff44d58900","resolution":{"observed_at":"2026-08-05T04:42:06.003231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.068109Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.068109Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:53ba34824194dcab528980ef74e20a8f01f8f9bed8bef6bc5c3480fe4824cb6b","observation_id":"a19a564f-598b-4599-a236-031e91b38bdf","resolution":{"observed_at":"2026-08-05T04:42:06.068109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T04:42:06.155144Z","title":"Reinforce++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.155144Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:ac36797b390e7f637df1a3cff3b5f303a0654502b3fcc8f7aacffe25f8d0f721","observation_id":"355d0c2c-b29a-472a-a57c-407d9fa9959e","resolution":{"observed_at":"2026-08-05T04:42:06.155144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04585","last_updated":"2025-04-20T05:49:38Z","snapshot_observed_at":"2026-08-16T13:12:08.047937Z","submitted_at":"2024-10-06T18:46:28Z","title":"Reasoning-Enhanced Healthcare Predictions with Knowledge Graph Community Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04585","snapshot_observed_at":"2026-08-05T04:42:06.221502Z","title":"Reasoning-enhanced healthcare predictions with knowledge graph community retrieval.arXiv preprint arXiv:2410.04585, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.221502Z"},"links":{"cited_paper":"/paper/2410.04585","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:6d21f7b0d665ce0b1c7d9d2675d7eda3c85a0c9803386f5c603f446d7d267af7","observation_id":"18da2e70-102c-4c7f-8c81-4fd3f7fa4496","resolution":{"observed_at":"2026-08-05T04:42:06.221502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.718521Z","title":"Boardgameqa: A dataset for natural language reasoning with contradictory information","venue":null,"work_id":"39365a33-e88b-4680-a3a5-ae3df30dd675","year":2023},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.241979Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8fd2f195c63cfa4654110d1b444834ee11a9be86c5b6ef7afbd0e7b0c3f1ff4d","observation_id":"6442c8e8-9681-4416-9224-33767f2bbff7","resolution":{"observed_at":"2026-08-05T04:42:07.734162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.697619Z","title":"Buy 4 REINFORCE samples, get a baseline for free! In Deep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6, 2019","venue":null,"work_id":"d58a4469-1f5f-4d2d-9797-639d108e579b","year":2019},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.247220Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:02228ea4bf2c950a53c51043aabed61b8c07806200276c8959d6f65b6240a085","observation_id":"2922c9ec-3339-4875-bddc-725e62d6c14e","resolution":{"observed_at":"2026-08-05T04:42:07.704465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.670878Z","title":"Chain of code: Reasoning with a language model-augmented code emulator","venue":null,"work_id":"17bbc1e1-5bf5-4c16-8fb5-71e75ac70b47","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.254413Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:d61a8632a37b00b69f830ee26982a02c273ca1fd595efc4cfbee8dbf87d3ac5b","observation_id":"ee6cc1d8-bbdd-4b9b-9e66-7843aa934929","resolution":{"observed_at":"2026-08-05T04:42:07.678037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07316","last_updated":"2025-05-21T13:38:27Z","snapshot_observed_at":"2026-08-16T15:36:15.556886Z","submitted_at":"2025-02-11T07:26:50Z","title":"CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07316","snapshot_observed_at":"2026-08-05T04:42:06.261278Z","title":"Codei/o: Condensing reasoning patterns via code input-output prediction.arXiv preprint arXiv:2502.07316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.261278Z"},"links":{"cited_paper":"/paper/2502.07316","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9654a2e84d1525cceed44d4691e35ae7fe6c9387a6194dab560824a761f201b6","observation_id":"03c8f9e5-1a42-40d5-b2da-16e5218e12b3","resolution":{"observed_at":"2026-08-05T04:42:06.261278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.266810Z","title":"Limr: Less is more for rl scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.266810Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:bcf4528e1d03f4cd91359cd3d1b894cbe527f88a3ca0b2feaf1958d29c5497ac","observation_id":"0a7f6c22-c1a8-4074-a35e-e00a8c6b8587","resolution":{"observed_at":"2026-08-05T04:42:06.266810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.639824Z","title":"From system 1 to system 2: A survey of reasoning large language models, 2025","venue":null,"work_id":"ab8f18ac-7b22-4e74-a242-fea44d14886d","year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.271252Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8f93b60cb0e2727d8da716a83418b3a9f91691e42e1e8261598ff64a7be45633","observation_id":"c4c61012-3a83-4b03-9eea-bf583e5e64ee","resolution":{"observed_at":"2026-08-05T04:42:07.644307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-15T18:38:02.815401Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-05T04:42:06.276239Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning.arXiv preprint arXiv:2502.01100, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.276239Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:56841b7353295eedd3fed8998599c79edcd5096664d72cae06dcfe7bbfdb3035","observation_id":"29969c6a-139c-4e09-a049-55ed9bb828c8","resolution":{"observed_at":"2026-08-05T04:42:06.276239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.622105Z","title":"Natural language inference in context-investigating contextual reasoning over long texts","venue":null,"work_id":"5aa94114-9df0-4b04-9de3-f75d24518e5b","year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.280844Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:802da174ee35ab3a70acbe46b2cc3e2683fe19c355ed79f6611b70dd212e4bbb","observation_id":"8423668f-70ee-447b-833a-9dee553df8a4","resolution":{"observed_at":"2026-08-05T04:42:07.628502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.605718Z","title":"Logiqa 2.0—an improved dataset for logical reasoning in natural language understanding.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 31:2947–2962, 2023","venue":null,"work_id":"906621f6-65c9-40bb-8e83-75acdf167aa5","year":2023},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.285793Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9bcea5e894a7cc7a15e67d63c040721e86bbb42f7d4c447bc9b503f8346d7342","observation_id":"3e1a4b64-531c-4654-89b3-9a8337c56d83","resolution":{"observed_at":"2026-08-05T04:42:07.610533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.587785Z","title":"大模型逻辑推理研究综述 (survey on logical reasoning of large pre- trained language models)","venue":null,"work_id":"2133bec2-ed05-41df-b5d4-3c1faa6caa39","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.291168Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:719acc6bfd35ebc641a5337d576534e1274c98132e0e801540fb731d95d8cd8b","observation_id":"95a44259-4307-4cc3-8ac1-b9ac02df23cf","resolution":{"observed_at":"2026-08-05T04:42:07.593555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-05T04:42:06.296264Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning.arXiv preprint arXiv:2007.08124, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.296264Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:39962e14f5a36a54161a6bdb9291a572c55a6b8a2f3fea2c7147d7ee2f0455c0","observation_id":"273438f4-5775-49f5-885a-3fef33514fc5","resolution":{"observed_at":"2026-08-05T04:42:06.296264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.302217Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.302217Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:5ec49f7103ffaf38c424339df0f54378106b067a910a431b339a5e2c5c417751","observation_id":"6b5f3609-3501-456a-943d-3574cbc9e3f6","resolution":{"observed_at":"2026-08-05T04:42:06.302217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.555036Z","title":"Reasoning with large language models for medical question answering.Journal of the American Medical Informatics Association, 31(9):1964–1975, 2024","venue":null,"work_id":"9ebccaeb-741a-466d-8fea-c068dc9729a9","year":1964},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.310288Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:771cb6cbc71afb8c4dae27b4973170e72108e5e73d373877f5b3abec223da4f0","observation_id":"8e4789af-807a-449b-9d8d-a0c69a8ccd72","resolution":{"observed_at":"2026-08-05T04:42:07.560070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.537257Z","title":"Improve mathematical reasoning in language models by automated process supervision, 2024","venue":null,"work_id":"50fb517a-80d4-4a38-acdc-f2d809a362e5","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.316399Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:c780e848d58c728ca4981063dfeab43ff5f38efb2af49bb2fede54415062d816","observation_id":"1e5db605-f610-426a-a1aa-ccd084413474","resolution":{"observed_at":"2026-08-05T04:42:07.543417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.320941Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.320941Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:5f19e345d83e628ec0e294ab1e2d21f6d2dec0b39f0af920a1a27218a2ab5c8a","observation_id":"8ca36034-17c8-4859-8c4b-7a18a21a1959","resolution":{"observed_at":"2026-08-05T04:42:06.320941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.325245Z","title":"Real: Efficient rlhf training of large language models with parameter reallocation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.325245Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:0553739d7bcbade53d352fd17e4fae4ce8881b71750402ba92ab388abc34ea4e","observation_id":"a64b2246-ff11-42ec-b052-3c2b371c4d6d","resolution":{"observed_at":"2026-08-05T04:42:06.325245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.481332Z","title":"Enhancing reasoning capabilities of llms via principled synthetic logic corpus.Advances in Neural Information Processing Systems, 37:73572–73604, 2024","venue":null,"work_id":"95a344c9-21e2-47e0-9a45-ebeb3253fdb8","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.329775Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:3b8c25d534392ee84b15b1a8b0caa9130d1714637d15837b2a6ec42ab9d92598","observation_id":"89658dd5-f79b-4562-8d19-88c8603d5be1","resolution":{"observed_at":"2026-08-05T04:42:07.489665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.460211Z","title":"Advanced semantics for commonsense knowledge extraction","venue":null,"work_id":"e0fbb3d0-22be-4560-ac0b-fc5418f36e47","year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.334589Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8f640b4d2df16dab19ea432fbb905f9acafecc811010a144aa10601f1de40a13","observation_id":"9965ee69-3d72-4e05-9625-12449474ce55","resolution":{"observed_at":"2026-08-05T04:42:07.465259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.340441Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.340441Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:e3391a8ec4ff4fd8d4366192df0de0740a00d73f00b563d6c1e02d86d4cf01f6","observation_id":"a2abe552-b684-461c-8ee6-e02b32a85bb3","resolution":{"observed_at":"2026-08-05T04:42:06.340441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.345622Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.345622Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:578f0ce3d864ffcfd6858588a1ae5a321d4ee3512e90459023c97b47248a34ed","observation_id":"a124621e-0d8f-45cd-878f-6db8f00f9a15","resolution":{"observed_at":"2026-08-05T04:42:06.345622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.416190Z","title":"Making reasoning matter: Measuring and improving faithfulness of chain-of-thought reasoning","venue":null,"work_id":"1bd53f35-6b66-48b6-8483-2c80e6bc5c5e","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.350765Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8a538b429c3c0c594aa47e7c09dbc2a4a5e282fe927606567fd21435ba5206cf","observation_id":"36668151-2c8f-4385-8f61-4c85f13e2149","resolution":{"observed_at":"2026-08-05T04:42:07.421265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.355048Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.355048Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:774e2fae78dcb220e06b787f11adff0698d97f1ba947b54e01b04d6f3f813aa1","observation_id":"c84e8efc-0eb1-408a-b7e6-609ab6f1ef72","resolution":{"observed_at":"2026-08-05T04:42:06.355048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.361130Z","title":"Qwq-32b: Embracing the power of reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.361130Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:6ecb9d6ab01faf29289025f9783b136c9711f1c783466a9837475a9362ef384a","observation_id":"bfc4097e-25ec-4b96-a47e-faf186ca7e4d","resolution":{"observed_at":"2026-08-05T04:42:06.361130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-08-16T16:27:11.895195Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-08-05T04:42:06.366029Z","title":"Language models are greedy reasoners: A systematic formal analysis of chain-of-thought.arXiv preprint arXiv:2210.01240, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.366029Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:b29957f44051845320953cdaf8dc95caa632e3b6eb4c09204c10ece313b942ed","observation_id":"e8703507-c9af-4c01-8e63-1957d0e91145","resolution":{"observed_at":"2026-08-05T04:42:06.366029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.375987Z","title":"Testing the general deductive reasoning capacity of large language models using ood examples.Advances in Neural Information Processing Systems, 36:3083–3105, 2023","venue":null,"work_id":"fdf633af-3448-4112-b33f-94537da06be0","year":2023},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.371099Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9b6003006fabebf7acc303a8d1f7acd58c476467a49bce073cf84af8fa45950f","observation_id":"b0f0895b-9acb-461c-9d78-6c8844fc20b8","resolution":{"observed_at":"2026-08-05T04:42:07.381247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.375876Z","title":"High-dimensional continuous control using generalized advantage estimation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.375876Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2d9b17313399a8b632df98fa1d95eeae171fe1e4602cb27341636d4bdf76275f","observation_id":"53e22eda-0e18-4252-9fd6-6c8b7321b991","resolution":{"observed_at":"2026-08-05T04:42:06.375876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.380438Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.380438Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:ad29ab6fc9f5f8d4f7168bbf06895d3dd356a061a30cf6784075e8d1e0be1b83","observation_id":"4665d72d-0ab1-45b7-9720-a7522d293317","resolution":{"observed_at":"2026-08-05T04:42:06.380438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.327263Z","title":"Automatic solutions of logic puzzles","venue":null,"work_id":"1f1ab41d-8f3d-4057-90dd-ade30e1626f4","year":2009},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.384947Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9bc9c64e2e9e3736ce513eb73ec31966ea270d7aad6177579cfee7a6c3147ee5","observation_id":"76bf7573-9660-4de6-b51b-193c6c08f8cc","resolution":{"observed_at":"2026-08-05T04:42:07.332435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T04:42:06.390455Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.390455Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:682dc7fd162b00f88f9922c290ab2ea16d955766736262b0f7791b37dbf1bafe","observation_id":"e2a07ee8-ad48-43d5-bdb8-7c983b3c3e7d","resolution":{"observed_at":"2026-08-05T04:42:06.390455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-17T14:30:20.233099Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-05T04:42:06.395257Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.395257Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:96ac226ff89bc2eb8ab3daf052d2a82043962ebfacae2878b3682d6eed797d86","observation_id":"d3877bd5-b1fc-4b05-8349-1711b53a8446","resolution":{"observed_at":"2026-08-05T04:42:06.395257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-16T13:17:24.872479Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-05T04:42:06.402593Z","title":"To cot or not to cot? chain-of-thought helps mainly on math and symbolic reasoning.arXiv preprint arXiv:2409.12183, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.402593Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:233215b940f6f6a1f24355460e091d51e69eb91488025f620f45195e1d8d97e8","observation_id":"8531279f-7ae6-4beb-933a-c0eb75e3c785","resolution":{"observed_at":"2026-08-05T04:42:06.402593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.408266Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.408266Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9cce6934be2f8575734d9be499573bc2f64e7ea05e7db0513486325359800d60","observation_id":"f8b7f272-204d-465c-a1aa-7444d57cf1f9","resolution":{"observed_at":"2026-08-05T04:42:06.408266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T04:42:06.413231Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.413231Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:1abac07feb2ba3bc7ebbc59e14978b2adabd89cbf111d16e7a9b7ffb5856c8df","observation_id":"c3f4937f-ea0b-4334-a053-bd4aaf3d7510","resolution":{"observed_at":"2026-08-05T04:42:06.413231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14790","last_updated":"2024-10-04T04:58:12Z","snapshot_observed_at":"2026-08-18T00:54:55.207032Z","submitted_at":"2024-07-20T07:43:07Z","title":"Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?","version":2},"cited_work":{"arxiv_id":"2407.14790","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14790","snapshot_observed_at":"2026-08-05T04:42:06.618084Z","title":"Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?","venue":"cs.CL","work_id":"0a1d010d-e125-4202-af0d-3370fa6d816b","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.419474Z"},"links":{"cited_paper":"/paper/2407.14790","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2cb9ced770160b5d6bbee9dd5b377b724cfb1d84e86c35f78c8160dbc6998830","observation_id":"dad3b24a-8875-480f-9a86-f853f97c303b","resolution":{"observed_at":"2026-08-05T04:42:06.625878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.297134Z","title":null,"venue":null,"work_id":"9f095218-93f8-4215-9349-19af41c670b0","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.424640Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:35a74f01ef65b6068c66a6137de49110c0620cdfcf7163565c5ffa8512e991ab","observation_id":"c0cf8e43-d49e-4adf-a9be-78609e07433b","resolution":{"observed_at":"2026-08-05T04:42:07.302087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.429383Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.429383Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:a27254abcce105949523d50ce2d4217522d357ad769521a02d85471b890d70f2","observation_id":"d9c6894b-eabb-43b7-9ca1-1543ab1a513c","resolution":{"observed_at":"2026-08-05T04:42:06.429383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.257484Z","title":null,"venue":null,"work_id":"ea6829f2-0a05-4b18-88dc-5840bea03a47","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.435873Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:443a934c2bb56accee1a523f2fcf98edeeb0f1d3680af4c9386a28fef9d052e7","observation_id":"543ede4a-f228-40e4-8e54-4343af2b16e0","resolution":{"observed_at":"2026-08-05T04:42:07.263273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.239471Z","title":"Legalreasoner: A multi-stage framework for legal judgment prediction via large language models and knowledge integration","venue":null,"work_id":"3699f55f-682b-4f38-b79b-5c0db25baf25","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.440662Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:a584ba7e2816346d52a4fa52474b8118e2585f2a318633baebfc1f6b148da073","observation_id":"71bd38f1-573f-4554-bff1-6b107809ad40","resolution":{"observed_at":"2026-08-05T04:42:07.244773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.445735Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.445735Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8551d50057ef9b4621e38c27e363b20cc2ff7b8bcf0c52fc9cc3647dcbe53bb0","observation_id":"8ce955bc-2e1d-48be-a995-f1f6c09e22ea","resolution":{"observed_at":"2026-08-05T04:42:06.445735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.210874Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":"af7ad4f3-4b4f-41eb-a232-f8a95b3f0274","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.450159Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:e66ab363d28addce57feaf16d100d13c5fdf8744fdf48c846abf38b631ddfc7e","observation_id":"2c2e16b8-680b-44d5-8e29-414d7bb94455","resolution":{"observed_at":"2026-08-05T04:42:07.216188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.455832Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.455832Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:637821a63e54845f0876a1f15891654cfd7e7986d01cd8609b5dfcf362931fb1","observation_id":"36449521-a3f2-453d-a8b9-af3ee859ceb8","resolution":{"observed_at":"2026-08-05T04:42:06.455832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-17T01:54:11.006899Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T04:42:06.460031Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering.arXiv preprint arXiv:1809.09600, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.460031Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:0e1c534120efc2477e03f3d0ba1a3a919f7d9dcc85b99a64d30d3e9e0eec6a4a","observation_id":"94806828-92e3-4d58-bd00-648bf406b4d7","resolution":{"observed_at":"2026-08-05T04:42:06.460031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.464464Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.464464Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:82865c2b7b98bd8ca53567f7d8409dbda54473d39ad62991138bf4dabb4bde8f","observation_id":"95b6e9fb-a1bd-4f56-8651-e9a10cae643d","resolution":{"observed_at":"2026-08-05T04:42:06.464464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.168725Z","title":"Lawllm: Intelligent legal system with legal reasoning and verifiable retrieval","venue":null,"work_id":"30927bc6-8f69-4fd5-b4c5-e515d1d6912c","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.469293Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2ba32817843a728fdebfb4511e87edc6baee63a97036d6fa7894f4ea60e439d9","observation_id":"652cb997-1e1d-4751-bc58-5e4b95ddbf04","resolution":{"observed_at":"2026-08-05T04:42:07.174320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.474025Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.474025Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:89c85556290f212cdcf514e334747d5bbc62a4f678dfb5919fb9e63e7569f53b","observation_id":"a2e9bfbd-2315-4212-ae65-7a9fcd6943c1","resolution":{"observed_at":"2026-08-05T04:42:06.474025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-16T18:17:36.314960Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-05T04:42:06.478842Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.arXiv preprint arXiv:2406.03816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.478842Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:061d259af10822d61617311715f20614af0f18ba2402f3a2f78b4c58a2795e22","observation_id":"4404c5fd-2fa1-423a-a3b1-419b3d1c9fc1","resolution":{"observed_at":"2026-08-05T04:42:06.478842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.130156Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning, 2025","venue":null,"work_id":"ac909891-a20c-459f-9d68-e0182a9f4658","year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.485081Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:10fb3bbd69d423ae9684f70e611379a8fe33fd19c2460cf754e458a3ed53dce9","observation_id":"cb0d3350-691f-4d83-82e6-406ba2ede228","resolution":{"observed_at":"2026-08-05T04:42:07.136777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16906","last_updated":"2025-02-24T07:02:31Z","snapshot_observed_at":"2026-08-17T07:58:10.151898Z","submitted_at":"2025-02-24T07:02:31Z","title":"AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16906","snapshot_observed_at":"2026-08-05T04:42:06.489294Z","title":"Autologi: Automated generation of logic puzzles for evaluating reasoning abilities of large language models.arXiv preprint arXiv:2502.16906, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.489294Z"},"links":{"cited_paper":"/paper/2502.16906","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8bdf60bfcc7b2c26e22ed6c0855df9fd1cc02e894265235b2bf9145009581de0","observation_id":"921924ed-5215-4ebe-ba12-99a806a60fa3","resolution":{"observed_at":"2026-08-05T04:42:06.489294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.110190Z","title":null,"venue":null,"work_id":"a2eae4fa-ce1d-4e36-ae63-8dc41c71d061","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.495133Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:74ed8910a5d252a691197f9211d73300bea689c9062b2f819fe348b11968c2a0","observation_id":"d8179a4a-a3d1-4047-9b5b-e87933e7816b","resolution":{"observed_at":"2026-08-05T04:42:07.115497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.083463Z","title":null,"venue":null,"work_id":"ccdfd23b-2897-4d02-8fc4-00dd60a1ce4d","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.500166Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:57442a01ee8fd96f40821ff19ce7e9b137216ca5d28ae0f6f0447238b973e9b5","observation_id":"031ed804-4040-4d9e-b669-bb1e4e812f50","resolution":{"observed_at":"2026-08-05T04:42:07.090966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.064458Z","title":null,"venue":null,"work_id":"07e523fc-7960-4ecd-a656-be8e6ee8546e","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.504954Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:68039d314270f01fb039082cf8863c79f5221c856c3b252cca133baa07d2cd1c","observation_id":"0c848a07-871c-470a-92bc-4a2048ff9b50","resolution":{"observed_at":"2026-08-05T04:42:07.069307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.044749Z","title":null,"venue":null,"work_id":"4367c484-386e-402a-b6f7-5e62f2818776","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.510163Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9b6695319f3e5736a5b736ace281b4d13afa6304f210140ec068563f184cb33c","observation_id":"63fdc848-2390-47ce-b156-8f6f6ed1cfdf","resolution":{"observed_at":"2026-08-05T04:42:07.050266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.025586Z","title":null,"venue":null,"work_id":"ba3cf461-7f32-4532-8fc3-c4c544a44329","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.515259Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:14ea735930292ab691c8e005b337d72c10e1883bd16eb7ed6e9eefda0a3fbb5b","observation_id":"e0dcc09d-4cc0-470b-9de8-7480d9989c85","resolution":{"observed_at":"2026-08-05T04:42:07.031013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.006819Z","title":"Alice studies","venue":null,"work_id":"64cdae06-55ba-4934-9e7c-2928263b18d3","year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.520147Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:4695a248e5dac4ab9e53f60cb2b297131c4d75765f9301a2ed412c77d85200c1","observation_id":"5ceff70f-fa52-4110-b4aa-9ba3b33e5eb8","resolution":{"observed_at":"2026-08-05T04:42:07.011688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T00:59:52.537349Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2509.06024."}