{"as_of":"2026-08-09T04:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba7753130c6ea07c9744ef4e869865fba502f335024a374192c991191ec6eb41","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:25:13.011848Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T12:36:50.060335Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2412.18925"},"observation_digest":"sha256:8ce0c72ceb66c14497366b8afd1d549666af3c14c3a9d72b669c2804c412bd79","observation_id":"2b60958c-1ddf-4199-a784-b73d877bbe4e","resolution":{"observed_at":"2026-05-15T12:36:50.152506Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-08T10:25:13.011848Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08127","last_updated":"2025-06-14T03:19:54Z","snapshot_observed_at":"2026-08-08T10:18:14.855636Z","submitted_at":"2025-02-12T05:13:04Z","title":"Fino1: On the Transferability of Reasoning-Enhanced LLMs and Reinforcement Learning to Finance","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:25:13.011848Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2502.08127"},"observation_digest":"sha256:b2d323f80f23325d27630889179310618caca839943e005f0aa27139e53f7e03","observation_id":"1c805dae-c164-4439-9298-0f08e61d317c","resolution":{"observed_at":"2026-08-08T10:25:13.011848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:2b00501032ccea83dab69dd48d676d723b874d6fab52b55fc331c842169ed65f","observation_id":"d3565846-792b-4bbf-8a49-6bc802995dec","resolution":{"observed_at":"2026-05-16T15:04:22.859163Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2504.02181","last_updated":"2026-04-22T01:49:17Z","snapshot_observed_at":"2026-07-30T09:24:14.725185Z","submitted_at":"2025-04-02T23:51:27Z","title":"A Survey of Scaling in Large Language Model Reasoning","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-22T21:20:07.238992Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2504.02181"},"observation_digest":"sha256:836f5cad4a7b366c75e3f305993926a1fdff22955e14734c66cceefe00e381e3","observation_id":"b43b2d88-3886-4512-aada-45ba6ff87023","resolution":{"observed_at":"2026-05-22T21:22:09.255716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T18:42:39.023650Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2504.11536"},"observation_digest":"sha256:81a96d932f857c223230458cab1df4f80d4e548d85e29e111711ed5dda65b591","observation_id":"8c0a4906-8f08-492a-a834-58cccecf0722","resolution":{"observed_at":"2026-05-13T18:42:39.072862Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:6b2516dea7e1d594cbcc030ce9efa84301a7c54565656164ca3ade250ea15f9d","observation_id":"f422ba67-dcdb-42d1-abdb-77fbde5d2ca9","resolution":{"observed_at":"2026-05-18T15:58:33.423958Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T14:38:07.369948Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.369948Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:e53398dc461ea55330795a0ff982869ca3a452d0e4a6adab70c01c12f9481c1a","observation_id":"b77e8eb1-cffd-4a6e-8c4c-dc90b07f2190","resolution":{"observed_at":"2026-08-07T14:38:07.369948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T13:53:59.379335Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-07T22:45:15.753079Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.379335Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:e88243bf7d66025ccd961a7a541c8a259544777c0bc7e10f81cf551bf9230d93","observation_id":"d478c978-2271-4eef-acb5-47450fea440c","resolution":{"observed_at":"2026-08-07T13:53:59.379335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T12:40:09.774303Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24105","last_updated":"2025-05-30T01:13:22Z","snapshot_observed_at":"2026-08-07T20:32:59.705021Z","submitted_at":"2025-05-30T01:13:22Z","title":"Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:09.774303Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2505.24105"},"observation_digest":"sha256:b19064213cae4757260ad6aba930df1a624bfe3f0ecc16f8bdd524fce0a110fc","observation_id":"77f82f1d-90bb-424d-ad69-2b7662b4c4cf","resolution":{"observed_at":"2026-08-07T12:40:09.774303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T12:13:21.337851Z","title":"https://arxiv.org/abs/2401.08967","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00242","last_updated":"2025-05-30T21:16:25Z","snapshot_observed_at":"2026-08-07T22:44:35.925402Z","submitted_at":"2025-05-30T21:16:25Z","title":"Whispers of Many Shores: Cultural Alignment through Collaborative Cultural Expertise","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:13:21.337851Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2506.00242"},"observation_digest":"sha256:dc4846d6b69834ae76df2ebf4a005f58f67cc607a2e787168caf1e4d6b723110","observation_id":"59a5836c-04db-4516-af7a-2d9bb671b982","resolution":{"observed_at":"2026-08-07T12:13:21.337851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T10:54:07.790412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04065","last_updated":"2025-06-04T15:31:46Z","snapshot_observed_at":"2026-08-07T22:46:03.142129Z","submitted_at":"2025-06-04T15:31:46Z","title":"Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:07.790412Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2506.04065"},"observation_digest":"sha256:66cc015b09298899e3e16a79fbe6667547f31e852114378e689974d15521fa3e","observation_id":"b2cb4f65-b5b7-41c3-ab44-f1004e6de99a","resolution":{"observed_at":"2026-08-07T10:54:07.790412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T11:00:53.750838Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06366","last_updated":"2025-06-12T10:22:01Z","snapshot_observed_at":"2026-08-08T03:51:35.989314Z","submitted_at":"2025-06-04T08:12:32Z","title":"AI Agent Behavioral Science","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:00:53.750838Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2506.06366"},"observation_digest":"sha256:e32fee7f2bd6d9be66c8892786e6bdcc348a052b26597fa1cdca0619a402cecd","observation_id":"3f1138a9-c49d-4495-b9d6-6c8355ea4e03","resolution":{"observed_at":"2026-08-07T11:00:53.750838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T10:24:24.701431Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-07T22:39:15.110117Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.701431Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:fe73870add65f6a3847fc51dd2b6aa7bd2601923a535056d47ea6fbe43853444","observation_id":"bc871d76-c04e-4477-881b-39ea09382062","resolution":{"observed_at":"2026-08-07T10:24:24.701431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T05:01:24.171772Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.171772Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:b1f7c905733b34e1299ea36c479998d0c7236432adcff5f75e62d6542f82c735","observation_id":"b1ee18de-6c4a-4f6f-8ec9-ad19fbc7fa63","resolution":{"observed_at":"2026-08-07T05:01:24.171772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-06T20:15:52.887684Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.887684Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:22738306323cf1ce9692f725a4208224a391185b6d950f40ed939c5626a6349c","observation_id":"28faa975-416c-4b4a-abf9-c8e60afd8a80","resolution":{"observed_at":"2026-08-06T20:15:52.887684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-06T19:31:27.373655Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05386","last_updated":"2026-06-29T17:47:49Z","snapshot_observed_at":"2026-08-06T19:25:14.929252Z","submitted_at":"2025-07-07T18:17:06Z","title":"Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training","version":6},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:31:27.373655Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2507.05386"},"observation_digest":"sha256:aa86ef3abbdf8e81a86b1f02b9a8d36b2356a55f486507ad707bc9a501ea85da","observation_id":"216caaee-f178-4204-b854-b162cec63e98","resolution":{"observed_at":"2026-08-06T19:31:27.373655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-06T18:15:37.905420Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-08-06T18:06:40.369641Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:15:37.905420Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2507.08794"},"observation_digest":"sha256:0cfd29e36667546c17f07769a9279d7b67c89fac5ce94618a39e322f70bc0d4e","observation_id":"f67dfa6e-fe8d-43cf-80b9-d1ddee10220c","resolution":{"observed_at":"2026-08-06T18:15:37.905420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-06T15:50:51.182259Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14849","last_updated":"2025-07-20T07:43:16Z","snapshot_observed_at":"2026-08-08T12:19:05.625389Z","submitted_at":"2025-07-20T07:43:16Z","title":"Beyond Isolated Capabilities: Bridging Long CoT Reasoning and Long-Context Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:50:51.182259Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2507.14849"},"observation_digest":"sha256:9b3576cd95e1cac61c7a54646318beb037dea8eb317667ae7805d1803608bcb7","observation_id":"60eaf0db-3db8-40e8-92d3-e5fe0f7f32dc","resolution":{"observed_at":"2026-08-06T15:50:51.182259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-06T14:52:43.034343Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17527","last_updated":"2025-07-27T05:17:25Z","snapshot_observed_at":"2026-08-08T10:18:26.773169Z","submitted_at":"2025-07-23T14:07:41Z","title":"Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:52:43.034343Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2507.17527"},"observation_digest":"sha256:93e4ff407ec7637a6a26e7cf6ba322f69f29e3a1367900679a3d31780b01006c","observation_id":"85fb2d14-dd27-47b3-8cea-2c384eabee1f","resolution":{"observed_at":"2026-08-06T14:52:43.034343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-04T20:20:36.819153Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-06T13:15:27.312512Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.819153Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:221dbe66a95c008afa84bbcbe0d320e112c8247680877591dc429c940ed9e855","observation_id":"03bae2fa-c3cb-4423-8c12-78049f450a13","resolution":{"observed_at":"2026-08-04T20:20:36.819153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-04T14:57:15.491600Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T14:24:48.666197Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:80c78bd2e9e27c8b66281b7841b7d8ef7b90dd30c53b34c3a243bc8c520533f5","observation_id":"8318f854-3f94-46a9-8799-50700ba725a1","resolution":{"observed_at":"2026-05-18T14:26:28.273192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-07-31T14:35:45.739240Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:883394a2334dbe970b9b0cb8877dea67851cd0a8916001e2ae722830f636ee5e","observation_id":"011d2cef-7b5a-473a-aeec-aab241eaa0a9","resolution":{"observed_at":"2026-05-17T22:25:22.566198Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2601.13262","last_updated":"2026-04-26T01:38:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-19T17:51:00Z","title":"CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T13:20:49.919833Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2601.13262"},"observation_digest":"sha256:816accec2db29a5f4747aeac84905b4fd2e3236ed45a04bc86ae2a2e75ce280d","observation_id":"393c61a2-8e87-45aa-b99a-acdb263710d5","resolution":{"observed_at":"2026-05-16T13:20:57.551310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:13.293921Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:4cbdc91e23cb7652e98fff1fe9d4abe346296967088fcc39f4588f8d9e1e9c70","observation_id":"134200e4-b179-45bb-83fb-61d63dfb2635","resolution":{"observed_at":"2026-05-21T13:14:11.036161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-03T03:33:43.836467Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:43.836467Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:185ca8745f902aef2a42e6b8bfeb495f0abaf4f40e9a7cee6eaef90828e22b0a","observation_id":"60924a86-6c78-4322-9b77-3f5f1ec98ea8","resolution":{"observed_at":"2026-08-03T03:33:43.836467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-02T23:33:12.426070Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.13602","last_updated":"2026-05-30T00:19:02Z","snapshot_observed_at":"2026-08-02T23:33:07.026705Z","submitted_at":"2026-02-14T04:52:11Z","title":"Towards Sparse Video Understanding and Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T23:33:12.426070Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2602.13602"},"observation_digest":"sha256:fe836e92cf8a97b5699da63932740f7c316334ccdcc0dbaf2f8fc7d8b858162d","observation_id":"3931b483-e967-4b6c-b3d4-ad9276220cd8","resolution":{"observed_at":"2026-08-02T23:33:12.426070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2604.18327","last_updated":"2026-04-20T14:29:08Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:29:08Z","title":"PARM: Pipeline-Adapted Reward Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:26.015817Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2604.18327"},"observation_digest":"sha256:d4716ede02b5309f157381976e37d0bb3cce3a4082f7170896e2957d375f46ea","observation_id":"b20dc4d0-0773-412b-891f-83cb66077905","resolution":{"observed_at":"2026-05-10T09:28:39.504938Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2604.21138","last_updated":"2026-04-22T22:58:47Z","snapshot_observed_at":"2026-07-06T23:07:47.244208Z","submitted_at":"2026-04-22T22:58:47Z","title":"Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-09T23:27:54.704794Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2604.21138"},"observation_digest":"sha256:e10184890ecd5d46f45f37fd6208b3f9f730eb6f358dec00b12aad7af1895b07","observation_id":"e6d25f51-1e15-4dbf-b6f7-2d39a11ab1ef","resolution":{"observed_at":"2026-05-11T14:06:05.471421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-08T09:35:47.501360Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:9dd6452c73b4d303a18302a34ad9d3b65bc663264b3ef685767f17f826b9704a","observation_id":"604eab8c-9026-409f-8c93-f7b546795d20","resolution":{"observed_at":"2026-05-11T20:21:08.248562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-12T03:16:59.195706Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:d0849a993a5096fe62dcc39ac30ddcc605c242b6c1c4063225a8e1c05612baee","observation_id":"39b51824-bed8-48e7-b49f-e7b227ea4e8d","resolution":{"observed_at":"2026-05-12T03:21:19.207104Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-20T22:36:13.781114Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:f7fe64d3354ab037e1d987d277daee170743cbcfb5f957bfc4f326181a454e84","observation_id":"97a3e1c7-6394-4eab-bafe-90c433301b34","resolution":{"observed_at":"2026-05-20T22:39:10.435844Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2605.08516","last_updated":"2026-05-08T21:55:41Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:55:41Z","title":"OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T00:52:42.845447Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2605.08516"},"observation_digest":"sha256:208d373138b67c33c17c7b2ce576a37b01d1ef82677dc4668a48e7994c00755c","observation_id":"a5398c4e-c9e3-44eb-9592-713551c87f45","resolution":{"observed_at":"2026-05-12T08:36:26.957307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2605.09262","last_updated":"2026-05-10T02:17:14Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:17:14Z","title":"Reinforcing Multimodal Reasoning Against Visual Degradation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:37:21.451146Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2605.09262"},"observation_digest":"sha256:2cd9058850e268274354cd9b9ab90bdcfb3f2ca281b67980f15fb36cad71ef9a","observation_id":"9b569002-79a6-411e-82d6-f71c6a131152","resolution":{"observed_at":"2026-05-12T06:06:25.307181Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2605.17187","last_updated":"2026-05-16T22:52:11Z","snapshot_observed_at":"2026-07-06T23:28:12.114488Z","submitted_at":"2026-05-16T22:52:11Z","title":"PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-20T14:05:14.737146Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2605.17187"},"observation_digest":"sha256:1abababe61161a996a08e41d71bcc43531541f8a670b72e03217035eb678011d","observation_id":"12f10086-267a-46f8-b0c7-659981a5e0d8","resolution":{"observed_at":"2026-05-20T14:08:20.469682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2605.25198","last_updated":"2026-05-24T17:59:06Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:59:06Z","title":"Hide to Guide: Learning via Semantic Masking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T12:16:12.108715Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2605.25198"},"observation_digest":"sha256:eba9a712900135abbc08ec842739dffd1558985e1d8f655bdb88d683c545af9c","observation_id":"225262dd-f8f8-4b10-9332-b4e643357c8a","resolution":{"observed_at":"2026-06-30T12:34:39.110322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2606.21228","last_updated":"2026-06-23T04:40:39Z","snapshot_observed_at":"2026-08-02T19:24:45.644999Z","submitted_at":"2026-06-19T08:47:40Z","title":"Sakana Fugu Technical Report","version":2},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-06-26T14:22:37.596720Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2606.21228"},"observation_digest":"sha256:728e1724333c1da647758cc71a8ccc660c56ac816a68ef00b870b81f7dc1d5d0","observation_id":"52332038-93eb-4e0f-ad74-121870f0626d","resolution":{"observed_at":"2026-07-04T06:29:38.287103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2606.22158","last_updated":"2026-06-29T19:38:11Z","snapshot_observed_at":"2026-08-05T04:12:27.304755Z","submitted_at":"2026-06-20T17:33:07Z","title":"Improving Reasoning in Vision-Language Models via Perception Verified Self-Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T12:14:35.109298Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2606.22158"},"observation_digest":"sha256:74020e835fca3a7b870609e328aec8099d6d9fc8a6785740bb37b7768346d6ca","observation_id":"fe614fb8-4ffc-4679-b762-05bf33793149","resolution":{"observed_at":"2026-07-04T08:09:40.781225Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2401.08967","doi":"10.48550/arxiv.2401.08967","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Zhang, X., Jie, Z., Sun, P., Jin, X., and Li, H","venue":"arXiv (Cornell University)","work_id":"0838dc74-5a0c-44b6-99b0-a2258f7665fb","year":2024},"citing_paper":{"arxiv_id":"2606.22158","last_updated":"2026-06-29T19:38:11Z","snapshot_observed_at":"2026-08-05T04:12:27.304755Z","submitted_at":"2026-06-20T17:33:07Z","title":"Improving Reasoning in Vision-Language Models via Perception Verified Self-Training","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:51.635039Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2606.22158"},"observation_digest":"sha256:eecb7f86b264c856609e54d3e8109b1fec1f4635fc3ebf23e7cc657d8ec57fc9","observation_id":"195b7c74-96db-4177-97df-00a66ee514ca","resolution":{"observed_at":"2026-07-01T09:35:39.633672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:21.6939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-02T13:36:56.480861Z","title":"doi:10.48550/arXiv.2401.08967 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21610","last_updated":"2026-05-20T04:43:02Z","snapshot_observed_at":"2026-08-06T13:09:35.487490Z","submitted_at":"2026-05-20T04:43:02Z","title":"SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T13:36:56.480861Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2607.21610"},"observation_digest":"sha256:a736715d26cb98ba2255d4ce9a03c988ae9ea80ab388195b66bb56effa53ed81","observation_id":"a521c81a-e063-4479-9afa-ae5901e356de","resolution":{"observed_at":"2026-08-02T13:36:56.480861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-01T06:32:20.959706Z","title":"ReFT: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21856","last_updated":"2026-07-23T22:50:23Z","snapshot_observed_at":"2026-08-07T15:15:19.846490Z","submitted_at":"2026-07-23T22:50:23Z","title":"LeAct: Learning to Reason from Expert Actions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T06:32:20.959706Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2607.21856"},"observation_digest":"sha256:1f63a1df88ac4d60e89897f29607584f406b39e6900cd720df3629d90233b332","observation_id":"44030fd9-7c7c-4891-a80e-b818b9ea07ef","resolution":{"observed_at":"2026-08-01T06:32:20.959706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-03T09:20:19.366216Z","title":"Q.; Zhang, X.; Jie, Z.; Sun, P.; Jin, X.; and Li, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29320","last_updated":"2026-07-31T11:51:04Z","snapshot_observed_at":"2026-08-06T01:21:57.429804Z","submitted_at":"2026-07-31T11:51:04Z","title":"MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T09:20:19.366216Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2607.29320"},"observation_digest":"sha256:21beecf80afa9936fd410a6b8257dc4081c7999149af6529aad57fdc37bceec6","observation_id":"dfcfd0d3-334c-4196-9e74-1351f190d653","resolution":{"observed_at":"2026-08-03T09:20:19.366216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-04T13:51:11.941692Z","title":"arXiv:2401.08967","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:11.941692Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:25145f9d56680a9ef990dc0e98ab0a64ad4e7b9803411e027acb30fd10782361","observation_id":"9f2b05e2-0da4-4382-99b5-a5ede3c9c0dd","resolution":{"observed_at":"2026-08-04T13:51:11.941692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T00:14:52.493528Z","title":"arXiv:2401.08967","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.493528Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:92d7ef9d29c3c16733bf7e0d8418eecf82f9c5d70bee5984f612d1e768a531b4","observation_id":"fd8b029b-c614-420d-963a-c6901beb1782","resolution":{"observed_at":"2026-08-07T00:14:52.493528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.08967/citation-record","integrity":"/paper/2401.08967/integrity","json":"/paper/2401.08967/citation-record.json","paper":"/paper/2401.08967"},"outbound":[],"paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2401.08967."}