{"as_of":"2026-08-20T01:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60763cd3a14051dc0955f478287d4ecc06f61722cbf1ca61264357fdecb36746","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:40:50.239122Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.09278/citation-record","integrity":"/paper/2510.09278/integrity","json":"/paper/2510.09278/citation-record.json","paper":"/paper/2510.09278"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:42.323020Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:42.323020Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:d73cf7f7c4691feb8518aa1bcc141e3f66f3bf98e26e66223ba816a63f9991c3","observation_id":"361a8eb8-0174-4642-b389-c59f74f9f910","resolution":{"observed_at":"2026-08-04T10:40:42.323020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-16T12:51:00.810519Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-04T10:40:42.437398Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:42.437398Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:a3d416ec17779a5f5ed44cbb84dd34b2a35ca24c9642ba502cdd04cbb75ed2b8","observation_id":"77f1045f-9409-4096-9730-639a51ae7717","resolution":{"observed_at":"2026-08-04T10:40:42.437398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-04T10:40:42.596699Z","title":"Guan, Aleksander Madry, Wojciech Zaremba, Jakub Pachocki, and David Farhi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:42.596699Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:2c705fb2e2b696a25b0a37ca19a17fa8d04582dcad31a5e9174f7522fa4ecbca","observation_id":"afba2411-c0db-4330-bd1c-911667d6a48b","resolution":{"observed_at":"2026-08-04T10:40:42.596699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-04T10:40:42.851428Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:42.851428Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:6243c0400d99d7c7386cfea33aeaf2417eaaa8472cd2e0b323e61fa6ce8f0a43","observation_id":"82004794-885e-4aa5-a803-aaf580e011e2","resolution":{"observed_at":"2026-08-04T10:40:42.851428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-15T05:29:13.739206Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-04T10:40:42.937652Z","title":"Bowman, Jan Leike, Jared Kaplan, and Ethan Perez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:42.937652Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:d12aa9a0c0df15e6472ee7d50defcb65ac51c07852756e2ce34a8ceb7cfbe1fe","observation_id":"399715de-4411-4b6e-a0b8-7346bfde06b6","resolution":{"observed_at":"2026-08-04T10:40:42.937652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13986","last_updated":"2024-01-25T07:04:30Z","snapshot_observed_at":"2026-08-16T14:24:39.580436Z","submitted_at":"2024-01-25T07:04:30Z","title":"Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13986","snapshot_observed_at":"2026-08-04T10:40:43.075961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:43.075961Z"},"links":{"cited_paper":"/paper/2401.13986","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:4a8c3e98c4e5b214f6f193353a14bafd519cf0a7dd7ad7cddc447843cc4414f5","observation_id":"2ff1e785-3ad6-44f2-a00f-3418d956fcfa","resolution":{"observed_at":"2026-08-04T10:40:43.075961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05518","last_updated":"2025-06-26T19:29:49Z","snapshot_observed_at":"2026-08-16T14:11:31.512550Z","submitted_at":"2024-03-08T18:41:42Z","title":"Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05518","snapshot_observed_at":"2026-08-04T10:40:43.208031Z","title":"Bowman, Julian Michael, Ethan Perez, and Miles Turpin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:43.208031Z"},"links":{"cited_paper":"/paper/2403.05518","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:6a085cf9f9f4287d9ad643855ad2f441644b7bf6eb03e80202f24811a877af67","observation_id":"7bba21fd-6a2b-42b2-9553-09838920feee","resolution":{"observed_at":"2026-08-04T10:40:43.208031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T10:40:43.382825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:43.382825Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:f0705a0661d0d4ec70d5990ece7f0f6721ebe6f91db6a58aa4db1e62c6865298","observation_id":"083f581b-80e7-4a24-93a0-99e2548948f7","resolution":{"observed_at":"2026-08-04T10:40:43.382825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T10:40:43.561051Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:43.561051Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:4d0678f733ddf8701b41e08e3f497565234e6adeff9dd16fcf81730fdfe9cc5f","observation_id":"19582271-b0b6-431f-8b71-61e74e59e90f","resolution":{"observed_at":"2026-08-04T10:40:43.561051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05170","last_updated":"2026-05-05T15:31:45Z","snapshot_observed_at":"2026-08-16T09:12:27.037321Z","submitted_at":"2025-08-07T09:04:10Z","title":"ReCode: Reinforcing Code Generation with Reasoning-Process Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05170","snapshot_observed_at":"2026-08-04T10:40:43.728971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:43.728971Z"},"links":{"cited_paper":"/paper/2508.05170","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:5ee8c256fd202913473486375fc2becc24a883826b0437cc4cd8dba42a956d04","observation_id":"62ef4912-82a5-48f2-89a5-b2c5682cfa19","resolution":{"observed_at":"2026-08-04T10:40:43.728971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-04T10:40:43.915453Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:43.915453Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:5ed66e769d0a5933322472cf9a74815ab971aad8e515175233436d0d85d27a37","observation_id":"d1dc259b-d0ea-4212-8337-94bb634b95ba","resolution":{"observed_at":"2026-08-04T10:40:43.915453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05294","last_updated":"2026-07-07T13:41:32Z","snapshot_observed_at":"2026-08-16T12:43:16.404604Z","submitted_at":"2025-04-07T17:49:23Z","title":"Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05294","snapshot_observed_at":"2026-08-04T10:40:44.071135Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:44.071135Z"},"links":{"cited_paper":"/paper/2504.05294","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:ee241994e917beaa767946c4726b6dd1361b873cc9f66b522935259089ff39fc","observation_id":"16b77f73-248e-4669-95fe-35d2d5d1f121","resolution":{"observed_at":"2026-08-04T10:40:44.071135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-08-11T03:34:09.767397Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-04T10:40:44.210807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:44.210807Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:f6abb0dc876909dffeba4ecd93401da7492b06add323eee1c28336bc4d246754","observation_id":"f66c8e89-2702-4cfc-9bc1-c620cbc15149","resolution":{"observed_at":"2026-08-04T10:40:44.210807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-04T10:40:44.385582Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:44.385582Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:2947d9f128c97bd58427b39d4bc0aff7067dc3cd59a379b0816455783bb16ed1","observation_id":"99c30de1-b493-4faf-b77e-26080463a2a8","resolution":{"observed_at":"2026-08-04T10:40:44.385582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T10:40:44.588687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:44.588687Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:7c122ddb024745fec47cad6d9f9cf2784db9a88fd9e0b67fc88d536cc4ff8410","observation_id":"6b543e0d-9588-4705-b2ba-d72e6409fbe9","resolution":{"observed_at":"2026-08-04T10:40:44.588687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.717777Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:44.717777Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:496b444133f410930422d1ffcdaed6d9bc90b1cddda7a95e25a91d837d38286a","observation_id":"f742fe26-bddd-4058-9644-5250871c6264","resolution":{"observed_at":"2026-08-04T10:40:44.717777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:44.860700Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:44.860700Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:ccc801f5464d15e71af420e1b371df4f879d3acec390e9aedc022f63fee6c05d","observation_id":"f1610e9e-0199-4a63-8962-402cc25e0f91","resolution":{"observed_at":"2026-08-04T10:40:44.860700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12759","last_updated":"2025-05-23T21:59:14Z","snapshot_observed_at":"2026-08-15T07:58:01.172171Z","submitted_at":"2025-03-17T02:53:42Z","title":"RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12759","snapshot_observed_at":"2026-08-04T10:40:45.013735Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.013735Z"},"links":{"cited_paper":"/paper/2503.12759","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:91935ea6035aede262c18691011ed6385bd2f9baf5a8d270325108619050391f","observation_id":"2f131002-14e0-4128-b7f8-fbd9143e9613","resolution":{"observed_at":"2026-08-04T10:40:45.013735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:45.142857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.142857Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:ad004c57645b6d26d9d8072c76357bfd172e9f75925ad563da9fa9d318912628","observation_id":"cc19292c-a333-448f-a6d9-6b92b54af040","resolution":{"observed_at":"2026-08-04T10:40:45.142857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T10:40:45.271923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.271923Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:e4f8e2bd736a9d848b50868b8caf18d9dbcd511516fa82e7ed7abff411400e63","observation_id":"633c5962-5bbe-4d59-af80-61a5e622d631","resolution":{"observed_at":"2026-08-04T10:40:45.271923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-19T11:12:45.951488Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-04T10:40:45.421707Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.421707Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:d356251ec906e475356f899638c3fa37d907702cf3f56553efc205ee47beec7e","observation_id":"65080f60-5aa7-457e-b13f-db4814363f61","resolution":{"observed_at":"2026-08-04T10:40:45.421707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-08-17T06:10:48.003173Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-04T10:40:45.563609Z","title":"Cohen, and Xinghua Lu","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.563609Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:8fd4030cc7d736cc32a63ea0e94628598386e990a0e4b215e3c882bd2b7df0d1","observation_id":"22b37d82-c8b9-4cda-9e10-2b91e8a3397e","resolution":{"observed_at":"2026-08-04T10:40:45.563609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-04T10:40:45.717755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.717755Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:26392435b8c920513ded2e449e2305700e920621f4998c316cb461462ec4808c","observation_id":"c63b186b-05fb-47b6-a7b8-365e099d1d7e","resolution":{"observed_at":"2026-08-04T10:40:45.717755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13692","last_updated":"2024-08-01T17:18:54Z","snapshot_observed_at":"2026-08-18T23:52:17.487601Z","submitted_at":"2024-07-18T16:58:18Z","title":"Prover-Verifier Games improve legibility of LLM outputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13692","snapshot_observed_at":"2026-08-04T10:40:45.855435Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.855435Z"},"links":{"cited_paper":"/paper/2407.13692","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:a55e845b791f7f1ade10374908bdc971128a00581392d6cae955b7ff9f0f2514","observation_id":"dd420bf7-a3e9-4cb5-bfca-956a24b62bcf","resolution":{"observed_at":"2026-08-04T10:40:45.855435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:45.997496Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:45.997496Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:2b6437c4a1946cc46411c08ea64cb0036a6efa58c5189b26abf56028c09601e2","observation_id":"84786868-3129-4d84-9da9-749e7413b8ec","resolution":{"observed_at":"2026-08-04T10:40:45.997496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01710","last_updated":"2025-06-02T14:18:09Z","snapshot_observed_at":"2026-08-19T14:46:08.756756Z","submitted_at":"2025-06-02T14:18:09Z","title":"Reasoning-Table: Exploring Reinforcement Learning for Table Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01710","snapshot_observed_at":"2026-08-04T10:40:46.135824Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.135824Z"},"links":{"cited_paper":"/paper/2506.01710","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:795c1bc70ff4899fb4dbb6b16ea179c6f074e2c9298a89d5c18b1128d14b9283","observation_id":"c6a6d043-c3c8-4645-8703-761607e6d954","resolution":{"observed_at":"2026-08-04T10:40:46.135824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:46.264642Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.264642Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:fc4be89c4ab6c2aa19acc3939d9a1cac40a90bd0b55cdd7c09beee4bd1c414a6","observation_id":"7948169f-0219-41a3-b275-fb64d3c67ad5","resolution":{"observed_at":"2026-08-04T10:40:46.264642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-17T13:27:14.855105Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-04T10:40:46.397811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.397811Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:d6c295f9095297ede6478f5e628cc6455b5f0c1ca27af31fc59a69165541e75e","observation_id":"3560fc99-bac1-426f-a0dc-af3069e0e8f4","resolution":{"observed_at":"2026-08-04T10:40:46.397811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-04T10:40:46.491019Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.491019Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:28aa427fddf02e94905fe01e8d761da3727230004f9fb974295ea95e1f66a7a9","observation_id":"3ef278a6-c580-4aa6-8739-30e00e1c6b21","resolution":{"observed_at":"2026-08-04T10:40:46.491019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-08-15T04:02:05.429942Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-04T10:40:46.608654Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.608654Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:29c514135d776192814b132a1c8bd24eceb4aaf5ade3bcac06ee6da0e60a460a","observation_id":"bbffb5cc-a76d-4be1-ab53-2bab677d2646","resolution":{"observed_at":"2026-08-04T10:40:46.608654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T10:40:46.751263Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.751263Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:e7f0e3ea76dea2d5a9db56b548ffacef3b52bf308372f9b5938be15e0d645cdc","observation_id":"bc1b9482-67ca-459a-a80c-163e8712ba4f","resolution":{"observed_at":"2026-08-04T10:40:46.751263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T10:40:46.948269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.948269Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:36757f69a31eecf421a6baea7118566de15b161de783bb0b5fe5d12c66e5005d","observation_id":"9b628e38-ffc3-41ed-882a-cb25f9cd7aed","resolution":{"observed_at":"2026-08-04T10:40:46.948269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:47.107142Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:47.107142Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:a74f34de26205752deb6545113d46333d4b2a0e14dcf9c945db301f86ab4ebfc","observation_id":"26cea3b5-6e5c-4162-9666-895705db7df8","resolution":{"observed_at":"2026-08-04T10:40:47.107142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:47.234256Z","title":null,"venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:47.234256Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:20f858fb44f57f815efef2782b7513df1e075b9eaa6a968e2ab95d158ccb82fc","observation_id":"51da2358-127a-4fff-a8c1-6b007bace80c","resolution":{"observed_at":"2026-08-04T10:40:47.234256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13950","last_updated":"2024-10-06T17:54:06Z","snapshot_observed_at":"2026-08-16T14:16:31.474049Z","submitted_at":"2024-02-21T17:23:59Z","title":"Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13950","snapshot_observed_at":"2026-08-04T10:40:47.386849Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:47.386849Z"},"links":{"cited_paper":"/paper/2402.13950","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:f16ae2f6b5722be9e0170714a97ab9a70a4da33e0b5071d96f4c3b4f2ed64f98","observation_id":"a003e3a2-a1a3-4431-917c-c05e411e3e94","resolution":{"observed_at":"2026-08-04T10:40:47.386849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:47.471242Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:47.471242Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:9436f06a81955b6b246380cce92115ce2c33b87b54ab26cdf2d51588e410a29d","observation_id":"a26a8150-b357-4ef7-9f27-7a9b98c5a117","resolution":{"observed_at":"2026-08-04T10:40:47.471242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T10:40:47.632256Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:47.632256Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:4f66e2a4ecef787596fa6e78ed0cb54b9328d5cc2b654fba1758aa34ce5fc0cf","observation_id":"e32dbfc1-15da-42af-b8bf-71eda8124d6c","resolution":{"observed_at":"2026-08-04T10:40:47.632256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T10:40:47.812288Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:47.812288Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:37e2fc9f64191851dbf667b6fd8d74d794db5df9caa04c164a3dda92e02b19f1","observation_id":"436f5eb2-4f65-4e35-ba16-5a7cf8f6c83b","resolution":{"observed_at":"2026-08-04T10:40:47.812288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T10:40:47.950018Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:47.950018Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:ca41ec0f94bda233f4bd7366479730f5021fbe2ab61b1b73341d6b3bf974b072","observation_id":"6bb43ed4-80ab-46b8-97aa-4f70436b58aa","resolution":{"observed_at":"2026-08-04T10:40:47.950018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:48.131252Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:48.131252Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:e4263dd06ae391426a54aef9d48464c5ed6cff246c4e36607fd09989909d9109","observation_id":"299ae545-5864-445e-9222-3709189eb5a1","resolution":{"observed_at":"2026-08-04T10:40:48.131252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-04T10:40:48.311730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:48.311730Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:533e07dcc0aa09ff560696260e98395f2c8dc390ecbddf420b556f5e7599f0d8","observation_id":"54e137fd-72b3-4241-95c9-53f001ea1304","resolution":{"observed_at":"2026-08-04T10:40:48.311730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-18T08:44:38.466468Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-04T10:40:48.485814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:48.485814Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:a42980aee2cb05b4c79c88ca2582004b20ce9c0d499b577a8bd8756f15ee5d5d","observation_id":"5678ad83-14b1-4b82-b552-9a4d16097830","resolution":{"observed_at":"2026-08-04T10:40:48.485814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05242","last_updated":"2025-08-07T10:31:24Z","snapshot_observed_at":"2026-08-16T08:51:58.692022Z","submitted_at":"2025-08-07T10:31:24Z","title":"CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05242","snapshot_observed_at":"2026-08-04T10:40:48.632259Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:48.632259Z"},"links":{"cited_paper":"/paper/2508.05242","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:f839cca7333d180c0ba328cdc61ec22fb475f0c65897f40141d3dc3e734a9e08","observation_id":"580f43ad-e190-4243-a5c5-cc26060f8c41","resolution":{"observed_at":"2026-08-04T10:40:48.632259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16144","last_updated":"2025-03-17T06:04:48Z","snapshot_observed_at":"2026-08-18T04:52:04.297937Z","submitted_at":"2024-06-23T15:50:22Z","title":"Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16144","snapshot_observed_at":"2026-08-04T10:40:48.792795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:48.792795Z"},"links":{"cited_paper":"/paper/2406.16144","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:6032acb0d46e9b7a2fe73a5b63cb026f9f26d97212d258cc2432141e71299b38","observation_id":"36edb7ea-7158-4493-82aa-accde33d1d79","resolution":{"observed_at":"2026-08-04T10:40:48.792795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:48.992415Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:48.992415Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:ff4a7a28e8ba27caa9c76933a048b7562ed818813047cca9f0963d2bc74b96d9","observation_id":"9b6e4891-99c2-4707-8f6c-8c110fcd1ba1","resolution":{"observed_at":"2026-08-04T10:40:48.992415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-04T10:40:49.178218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:49.178218Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:a4b9069333735c4e87714558ea6b7aebea55943bb5ac520d68965976369f7b09","observation_id":"91b278bf-e186-4ec8-855e-1a2b944eafe5","resolution":{"observed_at":"2026-08-04T10:40:49.178218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06772","last_updated":"2025-03-11T02:46:19Z","snapshot_observed_at":"2026-08-17T07:19:35.020898Z","submitted_at":"2025-02-10T18:51:47Z","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06772","snapshot_observed_at":"2026-08-04T10:40:49.340924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:49.340924Z"},"links":{"cited_paper":"/paper/2502.06772","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:5e1f0f267fc730e98b7dd3a60747f33b2a2cd977c0da06a03f8f22c176bfabbe","observation_id":"c6a232ff-50c6-4fae-bf07-a1a1895c37c8","resolution":{"observed_at":"2026-08-04T10:40:49.340924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09213","last_updated":"2025-07-30T08:05:40Z","snapshot_observed_at":"2026-08-10T20:07:53.240207Z","submitted_at":"2025-01-16T00:19:19Z","title":"FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09213","snapshot_observed_at":"2026-08-04T10:40:49.493709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:49.493709Z"},"links":{"cited_paper":"/paper/2501.09213","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:81a2e862d344437094f2f91572c8f92d6673ba009bb04808f8a21bc1c1ed2122","observation_id":"43b5f8b9-8e61-4b7c-8c6c-198a7f4189aa","resolution":{"observed_at":"2026-08-04T10:40:49.493709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01815","last_updated":"2026-05-30T14:12:57Z","snapshot_observed_at":"2026-08-15T10:05:35.359075Z","submitted_at":"2025-08-03T15:58:54Z","title":"From Graph Retrieval to Schema Realization: Counterfactual Validation for Text-to-SPARQL over Heterogeneous Knowledge Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01815","snapshot_observed_at":"2026-08-04T10:40:49.666102Z","title":"Low, Eugene Ho Hong Zhuang, and Daren Zong Loong Tan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:49.666102Z"},"links":{"cited_paper":"/paper/2508.01815","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:2a7374965f1989ac61f3b277b37412d1e5584ed495a2d07bbfec6be6aa2323ca","observation_id":"a78efc93-19c0-4077-8f49-858bcd059b8e","resolution":{"observed_at":"2026-08-04T10:40:49.666102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:49.793271Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:49.793271Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:8c617e5ad9f327f933f2ce4c6ee81f8c174a5d0a6ee474287d30f7fc3903a58d","observation_id":"297cb829-c30f-433d-a7ca-7164f4b980ad","resolution":{"observed_at":"2026-08-04T10:40:49.793271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04391","last_updated":"2025-07-06T13:47:55Z","snapshot_observed_at":"2026-08-09T21:54:21.234990Z","submitted_at":"2025-07-06T13:47:55Z","title":"Does Learning Mathematical Problem-Solving Generalize to Broader Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04391","snapshot_observed_at":"2026-08-04T10:40:49.924763Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:49.924763Z"},"links":{"cited_paper":"/paper/2507.04391","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:1792f6dda28687d1ba5e6bc6993f048ed886d9cbc8e4808d18a380d1b7e818cb","observation_id":"7ce2f5b1-d381-4916-9404-e26dce96ef3f","resolution":{"observed_at":"2026-08-04T10:40:49.924763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:50.098262Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:50.098262Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:cc003cf486ffb9958743ce3486db0602c30afd22271160d1ff14dce1f2cddb09","observation_id":"248c655b-998c-4f70-b69e-13c16eb45eb3","resolution":{"observed_at":"2026-08-04T10:40:50.098262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:40:50.239122Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:50.239122Z"},"links":{"citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:82ac70b5e30dd30b645d537fbc4f69170492af14516ca5d36b4ed7e810e3ac7a","observation_id":"dd20c3ad-e6b4-43f5-acf4-8e89e68fccb7","resolution":{"observed_at":"2026-08-04T10:40:50.239122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2510.09278."}