{"as_of":"2026-08-09T19:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61f95ab578f1fc3f489a81380766ed4a811f877bf77e872fb5ae5bc23cf226f7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:02:23.397708Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:36.567324Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-08T13:02:23.397708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07365","last_updated":"2025-05-28T08:04:23Z","snapshot_observed_at":"2026-08-09T03:30:26.149584Z","submitted_at":"2025-02-11T08:37:16Z","title":"LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T13:02:23.397708Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2502.07365"},"observation_digest":"sha256:a9c81eaeb4149689f01649bdda96db6631871c1978ec246d36728373759cfa69","observation_id":"58656352-dd46-4280-83b0-75243c5d2710","resolution":{"observed_at":"2026-08-08T13:02:23.397708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:f477c58a074a07b0a0655d5f491dc0c01e09fdd70655ed94e2869e10a363d70e","observation_id":"f33de9cf-eec2-4453-83db-1f09bebf594e","resolution":{"observed_at":"2026-05-22T23:35:13.444477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:2d31f897c0852d26fc61b15903a749c5129dbeea2eeeee9f63188278e1636a59","observation_id":"06469bab-0143-4fcb-82dd-0f9ab749777c","resolution":{"observed_at":"2026-05-19T06:59:03.369257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T18:42:39.023650Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2504.11536"},"observation_digest":"sha256:2a1d942152895f11bf00d62550c722d96ae580acd52b7a55386fbd8b8537f7b9","observation_id":"76b6808a-bca6-4a3f-96b9-3f5d8dfea00a","resolution":{"observed_at":"2026-05-13T18:42:39.082992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T18:46:11.571831Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2504.13818"},"observation_digest":"sha256:b483276204f59c476d425d3ad017b5d318016565fe9a6c72281be43126dc5174","observation_id":"4381c426-e715-40cb-b99e-6afc554e7039","resolution":{"observed_at":"2026-05-22T18:46:56.774430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T19:14:25.283645Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2504.21776"},"observation_digest":"sha256:7913c9658681b70aefa18e84acefa04243cec8b9534f543848f03bcdbc63bb01","observation_id":"29297c44-ea38-4cf0-8954-a3cb1074da32","resolution":{"observed_at":"2026-05-16T19:14:25.443648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T15:42:20.985769Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:20.985769Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:fb065cc3287bdbc8178c26df3728a007b9c7fa9065c01778b4a432af7ea83b7a","observation_id":"1026facc-1e92-45cb-be99-89ba8001c0c8","resolution":{"observed_at":"2026-08-07T15:42:20.985769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T15:43:00.380468Z","title":"Wenhu Chen, Xueguang Ma, Xinyi Wang, and William W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14157","last_updated":"2025-09-10T04:33:47Z","snapshot_observed_at":"2026-08-07T15:36:59.913411Z","submitted_at":"2025-05-20T10:05:11Z","title":"Prior Prompt Engineering for Reinforcement Fine-Tuning","version":2},"reference_index":1901,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:00.380468Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.14157"},"observation_digest":"sha256:c4f593eba4f2b350176ac6a6862b0d3e65dcef611e98f1d585a94eefba367fb5","observation_id":"1b8875ab-b37b-43d1-add0-a48501d7948a","resolution":{"observed_at":"2026-08-07T15:43:00.380468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T15:16:01.048333Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15810","last_updated":"2025-05-22T11:15:23Z","snapshot_observed_at":"2026-08-09T07:15:17.774887Z","submitted_at":"2025-05-21T17:59:09Z","title":"GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:01.048333Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.15810"},"observation_digest":"sha256:b6286843a847cb17cc348e01a2343694c86694f6521001b039c98066bd3f71ec","observation_id":"a6f741f9-565d-4385-8f11-ea6c15b61ef1","resolution":{"observed_at":"2026-08-07T15:16:01.048333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T15:06:03.057637Z","title":"An empirical study on eliciting and improving r1-like reasoning models.CoRR, abs/2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.057637Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:a7520ee907182378e323a6ced5ab7ac4d85c30fae149f78eaaa3094c74a948c3","observation_id":"c5f52244-f3d1-4478-92df-621630b3f6d6","resolution":{"observed_at":"2026-08-07T15:06:03.057637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T14:58:12.795266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16810","last_updated":"2025-05-26T08:51:17Z","snapshot_observed_at":"2026-08-07T20:42:39.359884Z","submitted_at":"2025-05-22T15:49:38Z","title":"DeepRec: Towards a Deep Dive Into the Item Space with Large Language Model Based Recommendation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:12.795266Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.16810"},"observation_digest":"sha256:b064168152e809edc2da93dc21d399d094963e686b89405b89c8f55d74e0c9e9","observation_id":"fe80a669-587b-42f0-83c4-ecb28f4aebd1","resolution":{"observed_at":"2026-08-07T14:58:12.795266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T14:59:15.857633Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16865","last_updated":"2025-06-04T11:31:59Z","snapshot_observed_at":"2026-08-09T17:57:03.404620Z","submitted_at":"2025-05-22T16:22:54Z","title":"LARES: Latent Reasoning for Sequential Recommendation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:15.857633Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.16865"},"observation_digest":"sha256:ec877142429a8b8c389ea236fa02c8045b18dfd24dcaae688c4885c1d8e91a4d","observation_id":"198ecfa4-6606-4742-af44-4607ce100a41","resolution":{"observed_at":"2026-08-07T14:59:15.857633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T14:45:16.258476Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17829","last_updated":"2025-05-23T12:42:50Z","snapshot_observed_at":"2026-08-09T13:11:47.293938Z","submitted_at":"2025-05-23T12:42:50Z","title":"Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:45:16.258476Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.17829"},"observation_digest":"sha256:670135b9a700457c173f76cbc30de3ece25f45b2fd35408c7f0ade20acaa53ed","observation_id":"622a08fe-2874-4516-9be6-0009b06f3410","resolution":{"observed_at":"2026-08-07T14:45:16.258476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T12:32:21.206536Z","title":"An empirical study on eliciting and improving r1-like reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24273","last_updated":"2025-05-30T06:49:00Z","snapshot_observed_at":"2026-08-07T18:34:20.398845Z","submitted_at":"2025-05-30T06:49:00Z","title":"How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:21.206536Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.24273"},"observation_digest":"sha256:7f30a1a694fc8cbe95cd1678b6418e48e68754f047550a59d9dfe0c2d4a0ab1b","observation_id":"4b20eca8-405a-43c7-b82f-25ee47b0b245","resolution":{"observed_at":"2026-08-07T12:32:21.206536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T12:25:26.696704Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24480","last_updated":"2025-05-30T11:30:18Z","snapshot_observed_at":"2026-08-09T17:09:03.936400Z","submitted_at":"2025-05-30T11:30:18Z","title":"Towards Effective Code-Integrated Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:26.696704Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.24480"},"observation_digest":"sha256:ea007ff2a74f2d96d17a827030bb50022527dea5fe5ddbf29267e287017c18e8","observation_id":"c1dd7f1c-5a02-496d-920e-2483e7447a1f","resolution":{"observed_at":"2026-08-07T12:25:26.696704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T10:35:02.142063Z","title":"An empirical study on eliciting and improving r1-like reasoning models.arXiv preprint arXiv:2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04894","last_updated":"2025-06-05T11:20:37Z","snapshot_observed_at":"2026-08-09T04:58:40.515829Z","submitted_at":"2025-06-05T11:20:37Z","title":"ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:02.142063Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2506.04894"},"observation_digest":"sha256:aac34e674c0bb3ae95dd5f0342a746ebde94f3709058c0c98cc151bc78610393","observation_id":"91706d69-cc3c-4652-96bf-4e1f55e08da2","resolution":{"observed_at":"2026-08-07T10:35:02.142063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T05:19:15.802751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08343","last_updated":"2025-06-18T14:43:36Z","snapshot_observed_at":"2026-08-07T08:58:45.702180Z","submitted_at":"2025-06-10T01:54:04Z","title":"Wait, We Don't Need to \"Wait\"! Removing Thinking Tokens Improves Reasoning Efficiency","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:15.802751Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2506.08343"},"observation_digest":"sha256:b53ed0d067f1c855a88d406b51c97cb9dbfd4a1765ccf24e755d5baa02e82160","observation_id":"a14cc001-f48a-4c0f-801b-fff9e23f21f7","resolution":{"observed_at":"2026-08-07T05:19:15.802751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T05:09:42.527494Z","title":"An empirical study on eliciting and improving r1-like reasoning models.arXiv preprint arXiv:2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-08T00:32:04.126170Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.527494Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:36ac1e44eeb79dd8c4ae181715f81d2319887f0fff769f68711362c8362ee6e2","observation_id":"f7a66c95-c231-4ac5-800a-9fb4f645469d","resolution":{"observed_at":"2026-08-07T05:09:42.527494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T04:46:20.731461Z","title":"An empirical study on eliciting and improving r1-like reasoning models.arXiv preprint arXiv:2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09820","last_updated":"2025-06-12T12:50:37Z","snapshot_observed_at":"2026-08-09T14:38:23.977723Z","submitted_at":"2025-06-11T14:59:02Z","title":"CoRT: Code-integrated Reasoning within Thinking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:20.731461Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2506.09820"},"observation_digest":"sha256:da820fe066a4dcad2d1de031cf50ad634850a9e5e77203f81372080e465ebf1f","observation_id":"66a3de8d-8fc8-4511-9668-9911376d2011","resolution":{"observed_at":"2026-08-07T04:46:20.731461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-06T21:40:48.214783Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23643","last_updated":"2025-06-30T09:13:54Z","snapshot_observed_at":"2026-08-09T17:39:24.850011Z","submitted_at":"2025-06-30T09:13:54Z","title":"Act-With-Think: Chunk Auto-Regressive Modeling for Generative Recommendation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:40:48.214783Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2506.23643"},"observation_digest":"sha256:283926efdad9088d51630604050b4f84081f82f905b2fd1c221b0de5498532ad","observation_id":"c297cfb4-f2b0-4ecc-91df-2dc7fee1cf47","resolution":{"observed_at":"2026-08-06T21:40:48.214783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-06T14:55:03.899694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17448","last_updated":"2025-07-23T12:13:06Z","snapshot_observed_at":"2026-08-09T02:39:49.820114Z","submitted_at":"2025-07-23T12:13:06Z","title":"Reasoning-Driven Retrosynthesis Prediction with Large Language Models via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:55:03.899694Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2507.17448"},"observation_digest":"sha256:7e0072c7da8d4102af703a28575acd69c38e44047fc82a8780e9a8c3585f61c8","observation_id":"6d6b4f97-6902-456c-ba54-d30bb5150131","resolution":{"observed_at":"2026-08-06T14:55:03.899694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-05T20:21:05.350521Z","title":"An empirical study on eliciting and improving r1-like reasoning models.CoRR, abs/2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.350521Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f6c88ce36cebc1896ea31d54fdbb594b3135cc7b5f84faac4c2367e54a7cacd3","observation_id":"9a097a0b-09ff-4ebf-8733-eafab4a5893d","resolution":{"observed_at":"2026-08-05T20:21:05.350521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-05T10:31:37.763822Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04027","last_updated":"2026-06-09T07:28:31Z","snapshot_observed_at":"2026-08-09T08:53:17.340894Z","submitted_at":"2025-09-04T09:02:16Z","title":"Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T10:31:37.763822Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2509.04027"},"observation_digest":"sha256:3e71763bb414a3240569de8d6f4887158dac89bea23589a335139fc7c8d90d34","observation_id":"0f1e3433-c858-49cf-852f-f44ed4fbd56d","resolution":{"observed_at":"2026-08-05T10:31:37.763822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-05T05:45:02.361736Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05007","last_updated":"2025-09-08T03:26:03Z","snapshot_observed_at":"2026-08-05T05:45:00.604843Z","submitted_at":"2025-09-05T11:14:11Z","title":"Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T05:45:02.361736Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2509.05007"},"observation_digest":"sha256:a753372e4b67286a66bb02997be32fd9bbd33bb1996fb09ad55a337d053f354a","observation_id":"b17cbcda-a229-4ac6-a328-5428da7d0df3","resolution":{"observed_at":"2026-08-05T05:45:02.361736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:d39b859c6714048ca6cb5ca5e2b0a628107930ff0a8b9298fc882cc7008052eb","observation_id":"5c756cda-6e36-440b-b588-c5ad41ddeee5","resolution":{"observed_at":"2026-05-18T00:02:25.155358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-04T14:57:15.491600Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T14:24:48.666197Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:928f583d6c2bfaa86d5adb0b3de578ecfcae08377486701a510712ad70909375","observation_id":"628b4a99-10af-4df0-843a-96075de8680e","resolution":{"observed_at":"2026-05-18T14:26:28.245340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2510.05837","last_updated":"2026-04-13T12:17:34Z","snapshot_observed_at":"2026-07-06T22:31:53.944103Z","submitted_at":"2025-10-07T12:02:03Z","title":"EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T08:53:31.803096Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2510.05837"},"observation_digest":"sha256:c9684ed813ece71b2de782a3089a8d60b237d43c60de87be0aa8f9fae3622161","observation_id":"f6ece2d3-1975-4510-b898-b35c9b2453fa","resolution":{"observed_at":"2026-05-18T08:56:08.702299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2605.08817","last_updated":"2026-05-09T09:10:03Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:10:03Z","title":"How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:04.955816Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2605.08817"},"observation_digest":"sha256:0b3d3675572aa9f95e0e35aa682bb4626b415ce9c751f55480862832ad66dec6","observation_id":"a9173ba0-c924-44b1-b186-7d8790d0b7f9","resolution":{"observed_at":"2026-05-12T03:26:19.275213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2605.09931","last_updated":"2026-05-11T03:28:43Z","snapshot_observed_at":"2026-08-03T02:44:35.388736Z","submitted_at":"2026-05-11T03:28:43Z","title":"PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:49.165066Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2605.09931"},"observation_digest":"sha256:ee75f0f6f17df3ff6f37152c1e802df116c36e1f2d7696f1264a848e90095d5d","observation_id":"6e29e227-7d4b-4b70-bf5f-5f7909f88ea4","resolution":{"observed_at":"2026-05-12T06:01:23.360130Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2605.12518","last_updated":"2026-04-03T12:30:15Z","snapshot_observed_at":"2026-08-09T14:23:22.777149Z","submitted_at":"2026-04-03T12:30:15Z","title":"TimelineReasoner: Advancing Timeline Summarization with Large Reasoning Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T21:33:48.376967Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2605.12518"},"observation_digest":"sha256:0d1e32b572d43aa0e209166ec202512a642a29f46fa397e9fcc54b07b2a8873f","observation_id":"6e0ee3e9-a6f6-4d9c-8ee7-5edacf66493d","resolution":{"observed_at":"2026-05-14T21:38:01.053722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2605.18864","last_updated":"2026-05-15T07:42:21Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-15T07:42:21Z","title":"SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-20T20:09:42.841695Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2605.18864"},"observation_digest":"sha256:f37a2e3c114b9947ad0a8ff652eb477c9683f7e19315e5a05aca7b6181714427","observation_id":"28301dbc-933c-438e-98be-bb5d6bead1b3","resolution":{"observed_at":"2026-05-20T20:13:44.094363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2605.26971","last_updated":"2026-05-26T12:57:12Z","snapshot_observed_at":"2026-08-07T18:23:52.993798Z","submitted_at":"2026-05-26T12:57:12Z","title":"RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T19:34:12.081362Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2605.26971"},"observation_digest":"sha256:6fb1af2b2f1f6eb44440fdb731a44d67c453851d81fe1a7a6eefd178db045009","observation_id":"9a52c77f-62d9-4e31-bdcd-bf21981882e7","resolution":{"observed_at":"2026-06-29T19:43:55.066083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":289,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:9893acee6f2fcc05eae1b49f993e98e9fa0f1a19307148d633134810c347aaac","observation_id":"02371df3-e049-457f-a350-f324403fbc61","resolution":{"observed_at":"2026-07-01T20:56:13.161760Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2606.10522","last_updated":"2026-07-06T06:23:24Z","snapshot_observed_at":"2026-08-06T02:01:24.162802Z","submitted_at":"2026-06-09T07:52:10Z","title":"GUI-AC: Enhancing Continual Learning in GUI Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T13:56:09.049753Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2606.10522"},"observation_digest":"sha256:2ddb05e912abfaab376b419404006eeb88c5b344fca9e148e211b3a66e4a528e","observation_id":"6f19636a-2dcb-4fd8-9d09-89c43a4236a4","resolution":{"observed_at":"2026-07-03T04:27:36.568792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-12T14:27:05.589465Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models.arXiv preprint arXiv:2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10522","last_updated":"2026-07-06T06:23:24Z","snapshot_observed_at":"2026-08-06T02:01:24.162802Z","submitted_at":"2026-06-09T07:52:10Z","title":"GUI-AC: Enhancing Continual Learning in GUI Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T14:27:05.589465Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2606.10522"},"observation_digest":"sha256:8e1e419a1ebb800caf3092fe1817f5bd141388ad3a98aff525d24774dcd00c34","observation_id":"9ea71d90-980c-4f64-9ae2-54906282b8b8","resolution":{"observed_at":"2026-07-12T14:27:05.589465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.04548/citation-record","integrity":"/paper/2503.04548/integrity","json":"/paper/2503.04548/citation-record.json","paper":"/paper/2503.04548"},"outbound":[],"paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2503.04548."}