{"as_of":"2026-08-15T00:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a03573bb6277ad3ad063d73628cf3865ead0e860ff930dad2dd23b90b9384905","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:06:35.501572Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:04:14.050518Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-13T10:15:00.293616Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T18:45:16.641012Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2505.05470"},"observation_digest":"sha256:2ae9a030108e5e149c4545e51ac1fcb73d11f890742b292ba3f865bae0a8e989","observation_id":"fe7e1c32-886c-47e8-8499-7d151890b587","resolution":{"observed_at":"2026-05-11T18:45:16.862524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T11:04:14.050518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-14T07:46:43.583789Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.050518Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:48f29e649991293d37b77499b50d064b38f2c1f33758b0e116f2baf408667f17","observation_id":"106c8006-b943-42f6-89be-79b3fc2895ba","resolution":{"observed_at":"2026-08-07T11:04:14.050518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T00:41:33.940080Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-13T16:04:27.350434Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:33.940080Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.13284"},"observation_digest":"sha256:14ce7ad214521ebd3ff617e146af53f349cb4be355b4ab97aa3ddbce8c538173","observation_id":"c2edf7f1-ed2c-4a8f-80a6-07974803d571","resolution":{"observed_at":"2026-08-07T00:41:33.940080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T00:14:22.519933Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-14T02:21:25.523082Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.519933Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:f8a924bacb18ec0480fd1b07199287bbdb7ca950622ba4b978bc494ee2742106","observation_id":"2a0e87ad-35f9-427c-8aae-3ec1f1dfbbb9","resolution":{"observed_at":"2026-08-07T00:14:22.519933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T18:57:38.595495Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-14T02:21:20.549140Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.595495Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:ec9b730c1e0e8985a8e82865662dc88040709730f614b858fce8b3fe7ddf4015","observation_id":"162c4416-8a67-4ce8-9d07-a7313e31f590","resolution":{"observed_at":"2026-08-06T18:57:38.595495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T17:32:30.634578Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-12T14:27:20.873974Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:32:30.634578Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.10535"},"observation_digest":"sha256:744de88f0ccc09e218a6b3ae54b0e17931d4da43c757d4b1d8e435cea7412c5e","observation_id":"6712258d-8282-40f6-ad1f-31d0bc269b16","resolution":{"observed_at":"2026-08-06T17:32:30.634578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-08-14T07:39:12.121905Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-21T23:20:45.685446Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.15778"},"observation_digest":"sha256:771a7a292387424706050fcab5a782c60640e281361b15d4eb7cbaa29d008423","observation_id":"7ea75ee1-7bc6-480f-8cec-9b1aa1fdea48","resolution":{"observed_at":"2026-05-21T23:24:26.284917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T14:11:51.663587Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19748","last_updated":"2025-07-26T02:45:10Z","snapshot_observed_at":"2026-08-14T11:23:14.235627Z","submitted_at":"2025-07-26T02:45:10Z","title":"JT-Math: A Multi-Stage Framework for Advanced Mathematical Reasoning in Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T14:11:51.663587Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.19748"},"observation_digest":"sha256:16722937f2a9ec02abab06b464ee42d25c05fb8fd9eb381b42efe59a5dab185f","observation_id":"9a6aba26-2b8e-416f-827a-99da7e9707bb","resolution":{"observed_at":"2026-08-06T14:11:51.663587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-04T22:48:32.672774Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07159","last_updated":"2025-09-08T19:15:38Z","snapshot_observed_at":"2026-08-12T14:18:34.854452Z","submitted_at":"2025-09-08T19:15:38Z","title":"PaVeRL-SQL: Text-to-SQL via Partial-Match Rewards and Verbal Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:48:32.672774Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2509.07159"},"observation_digest":"sha256:54b739fa23366389689cf0d96c7137024172e7af2c7f072fe79b50bbfe3f7036","observation_id":"77c19d91-9dd0-49e4-bf54-bcd3b4dcf963","resolution":{"observed_at":"2026-08-04T22:48:32.672774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:1107eaaff06821f9eab2e51cff2f5d10f8611c0158b1b4572c00e00cb48c0ed9","observation_id":"2500b2d5-6c02-4916-99b1-335cb24575aa","resolution":{"observed_at":"2026-05-18T00:02:25.126142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2509.20712","last_updated":"2026-04-23T12:06:05Z","snapshot_observed_at":"2026-08-12T17:09:25.484926Z","submitted_at":"2025-09-25T03:22:04Z","title":"CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-18T15:06:33.991929Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2509.20712"},"observation_digest":"sha256:993a526a997eef33216c6974ea2a8a6966773605cfb390ffbdfea43019323b5b","observation_id":"cdc9989a-6d34-43aa-8d34-8c94d1d57ac4","resolution":{"observed_at":"2026-05-18T15:11:32.270447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-04T08:55:58.550417Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-13T23:07:53.470526Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.550417Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:e9cf4b296e700fd1eb5ff69ab119b6e5698f35584341f8f67cb075dabda2dc0b","observation_id":"3a280a8b-e968-43f2-8ec5-90bbbe690e94","resolution":{"observed_at":"2026-08-04T08:55:58.550417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-03T23:27:36.778635Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning.arXiv preprint arXiv:2505.16400, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05722","last_updated":"2026-06-03T04:35:07Z","snapshot_observed_at":"2026-08-13T06:02:06.374996Z","submitted_at":"2025-11-07T21:29:41Z","title":"OckBench: Measuring the Efficiency of LLM Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T23:27:36.778635Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2511.05722"},"observation_digest":"sha256:06ae74abc4a5769a15aa3be4897ed2fe41ff0585b02babafd4a008b3fbe72e02","observation_id":"8b08caa5-d6d7-401f-be09-9adfd1e9b9a5","resolution":{"observed_at":"2026-08-03T23:27:36.778635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2512.05591","last_updated":"2026-04-23T12:00:34Z","snapshot_observed_at":"2026-08-11T12:57:45.671372Z","submitted_at":"2025-12-05T10:26:32Z","title":"Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T00:53:51.251900Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2512.05591"},"observation_digest":"sha256:eebe8d9fb006dbf8af98bf74439c683a370af2ed18cfec1e42e51e29a2355bff","observation_id":"051254d6-6815-46c0-8514-79096d9ba67c","resolution":{"observed_at":"2026-05-17T00:58:46.311837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-07-13T23:28:12.790404Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16867","last_updated":"2026-06-03T09:37:20Z","snapshot_observed_at":"2026-08-14T22:25:11.633208Z","submitted_at":"2026-03-17T17:59:51Z","title":"Efficient Reasoning on the Edge","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T23:28:12.790404Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2603.16867"},"observation_digest":"sha256:5116d520cf9ad4453df8f4bd5ccf9d778a86d0f504aa034e5a07c0336a13b5be","observation_id":"604cc654-1611-494a-a9f5-b122ba7c947b","resolution":{"observed_at":"2026-07-13T23:28:12.790404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.08477","last_updated":"2026-06-04T07:25:57Z","snapshot_observed_at":"2026-08-13T13:23:18.310832Z","submitted_at":"2026-04-09T17:16:07Z","title":"SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:29.695213Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.08477"},"observation_digest":"sha256:43b3bba61375591c4c75646a11e691f698b4e58e294f45e37ee9d3dc7d0794f4","observation_id":"30ceaf37-843f-45f8-8949-c6f54325ab76","resolution":{"observed_at":"2026-05-11T07:11:01.629864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-14T08:41:23.060090Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:ec9d971d22a13a971ce20764da2acc9102d6a8ac1ac8b55d0bc98a91abfb6b49","observation_id":"1eac8f59-c2c5-4a84-aa95-f9e582fcd24c","resolution":{"observed_at":"2026-05-10T06:06:19.468811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-08-14T20:51:20.111244Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:c5c7720701650c61b94efa2b991ec2b43b93c3f5618dca26a8140418a2df5789","observation_id":"963255fd-4918-4ab8-a1be-4b5e861860c7","resolution":{"observed_at":"2026-05-10T05:56:11.305553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.21327","last_updated":"2026-04-23T06:32:08Z","snapshot_observed_at":"2026-07-06T23:07:56.487654Z","submitted_at":"2026-04-23T06:32:08Z","title":"Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T22:55:19.471307Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.21327"},"observation_digest":"sha256:c54788a27a59b2fce5cf52d07f8ec8df124f0950723dc8fadcaf456dbedcb9a6","observation_id":"993bcdb0-e451-4784-979e-d0e3b9e60613","resolution":{"observed_at":"2026-05-11T14:16:07.278352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.02909","last_updated":"2026-04-06T15:02:52Z","snapshot_observed_at":"2026-08-11T05:02:35.231150Z","submitted_at":"2026-04-06T15:02:52Z","title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:52.969408Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.02909"},"observation_digest":"sha256:c653dcbd5d6a80eb5c15e4438c14fcd61f4b33a693b03157b5c8c4975a3d97c4","observation_id":"edc3109a-db52-4c8f-b539-c362704567e8","resolution":{"observed_at":"2026-05-10T23:45:53.101099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-08-11T17:59:38.011831Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:49cdb5349deb6766292ca4114a9777821448d01c7dc3e5764ef5ec2e7e7d58d3","observation_id":"8cc6f019-6d8f-482f-924f-841fba0a9cdf","resolution":{"observed_at":"2026-05-13T07:37:29.841604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.12384","last_updated":"2026-05-12T16:47:40Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:47:40Z","title":"Scalable Token-Level Hallucination Detection in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:49:23.534294Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.12384"},"observation_digest":"sha256:9ab7ac98c3b1426cbc278a359839accd2a2bddc5b4b702ea03abe530ec55b325","observation_id":"2c103f40-2966-4ba2-9c42-93d845d2059d","resolution":{"observed_at":"2026-05-13T05:52:22.421954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-08-14T19:39:25.088761Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:51:17.595707Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.13255"},"observation_digest":"sha256:daf356dde9095a0eb581f206c3b5778c5ee402559985ffc3b2e7fd4c8334d528","observation_id":"4e0abeda-e4b8-4968-8653-cb0b3fd38774","resolution":{"observed_at":"2026-05-14T19:52:52.411736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.25864","last_updated":"2026-05-25T13:55:12Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T13:55:12Z","title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:46.313028Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.25864"},"observation_digest":"sha256:02ea8ab52b5c196531899a8465a8188c489142bbe6e2d4653f5b425c3b4eabcb","observation_id":"4d9f336e-c8ca-4339-b799-afc4c8a24a24","resolution":{"observed_at":"2026-06-29T23:04:01.322678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.26971","last_updated":"2026-05-26T12:57:12Z","snapshot_observed_at":"2026-08-07T18:23:52.993798Z","submitted_at":"2026-05-26T12:57:12Z","title":"RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T19:34:12.081362Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.26971"},"observation_digest":"sha256:c1b408b370ff76d40250d6f685b774276f7d43cd82a45506ee51934d12181ce9","observation_id":"49c626dd-add2-429b-a250-05b5da73c1f4","resolution":{"observed_at":"2026-06-29T19:43:55.053657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:da833c09841c0b796afb5d64ab80826271733d1c3f868f19b8305abdbca196e4","observation_id":"cae54978-a304-4bb7-9065-517d124851da","resolution":{"observed_at":"2026-07-03T20:38:55.942362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2606.19771","last_updated":"2026-06-18T04:11:56Z","snapshot_observed_at":"2026-08-13T14:44:13.617317Z","submitted_at":"2026-06-18T04:11:56Z","title":"Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T17:37:43.856000Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2606.19771"},"observation_digest":"sha256:5fc033a8daf54fcb3f0ffeb1b1fa065ae5b7023aceb862ccd7817fcda0e8fd17","observation_id":"f080444e-7265-48f3-befc-cf754f9647fc","resolution":{"observed_at":"2026-07-04T03:49:30.159779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:4212875d290c0fc38509487ff517dc48cbf2264d442c71f37926abfa2ae037bc","observation_id":"4afb7a0a-b48a-4c0a-ab97-a7d8e16d28ed","resolution":{"observed_at":"2026-07-04T09:09:43.581253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-02T06:37:36.445162Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-14T05:11:38.171950Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.445162Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:6ed6265366eee63b4b8055b72f0425fa45c63749e4763ce1add0dbe50e11c1b2","observation_id":"70ba9640-73f3-4a19-bd19-009a3d40a001","resolution":{"observed_at":"2026-08-02T06:37:36.445162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16400/citation-record","integrity":"/paper/2505.16400/integrity","json":"/paper/2505.16400/citation-record.json","paper":"/paper/2505.16400"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-08-14T07:26:32.101930Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-08-07T15:06:35.285362Z","title":"Opencodereasoning: Advancing data distillation for competitive coding.arXiv preprint arXiv:2504.01943, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.285362Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:06afff51149a674d037a3bd6a852e0f8aba61ecf05f613efae92b6eeb51555cf","observation_id":"bc0f1d88-e512-4685-a69c-d708aada8cb3","resolution":{"observed_at":"2026-08-07T15:06:35.285362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-07T15:06:35.291514Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.291514Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:c2c0adaf9824afce7291de36a5a2ad13c92cad4ddc7ecfcc5da58b17c9c572cd","observation_id":"cf4fbbea-9329-4e47-9ac9-32d3b8e00df8","resolution":{"observed_at":"2026-08-07T15:06:35.291514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.273404Z","title":"Matharena: Evaluatingllmsonuncontaminatedmathcompetitions,February2025","venue":null,"work_id":"f1d5b1ec-e289-410f-860b-8e6178d0dc0f","year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.296648Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:758c0a02b4989384f615a4c5d2615558f4f0878b1590e6a7ffcbf41f379ec97a","observation_id":"63df6452-c98d-437d-9275-daf942bf2c46","resolution":{"observed_at":"2026-08-07T15:06:36.278571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:35.302290Z","title":"Llama-Nemotron: Efficient Reasoning Models.arXiv preprint arXiv:2505.00949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.302290Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:7cfa03586313f39a1c2f4ec9ff6ce7b65156ba1115f7603711974f5462fd4e12","observation_id":"8d71d6b6-2bdf-41c3-9e4b-c08397732127","resolution":{"observed_at":"2026-08-07T15:06:35.302290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.257698Z","title":"Bridging supervised learning and reinforcement learning in math reasoning.arXiv preprint, 2025","venue":null,"work_id":"e64bcdc7-c633-4dd3-bd1e-111ed13334df","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.307091Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:d77808e90b27e39d8f84de4b6520d0ea629129d946bba48ed1fe5f21cc3f09c9","observation_id":"020157d3-fd39-4ff5-b0a8-5098219e32dc","resolution":{"observed_at":"2026-08-07T15:06:36.262756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T15:06:35.311936Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.311936Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:825a091fef8475067edf1535fcb805055f7edb499da21fd4215b522767a5b848","observation_id":"5190ac7e-046f-47b0-a9a9-66545e9cb3d2","resolution":{"observed_at":"2026-08-07T15:06:35.311936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:06:35.317188Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.317188Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:e6a865af327d4cf619e4133931e5b0fd0af181ddfc122f866c557fcc3c4a4a5f","observation_id":"ffe16904-0259-44f0-ad08-81046c0cb338","resolution":{"observed_at":"2026-08-07T15:06:35.317188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-14T05:04:00.503119Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:06:35.322184Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.322184Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:3821f997139a0338653cb26b580c1d7182795f583a9d3a29a398333050e64b1f","observation_id":"887e1314-3873-42ed-9526-052b06796094","resolution":{"observed_at":"2026-08-07T15:06:35.322184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:06:35.327654Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.327654Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:60364338cdbe8c3419f142b393dd5471dcb6a17781fb6846146a7e07407e5d19","observation_id":"652fbdd3-cbb5-4d55-a749-836820c87e0d","resolution":{"observed_at":"2026-08-07T15:06:35.327654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T15:06:35.333225Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence.arXiv preprint arXiv:2401.14196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.333225Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:c9fde2dda544c12e2355d0a3d73045a32ace4ad97fcbfd851fa3e75967876a7c","observation_id":"81e55ba2-3080-4c5c-a19c-19e60495eb29","resolution":{"observed_at":"2026-08-07T15:06:35.333225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:06:35.338695Z","title":"Deepseek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.338695Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:a471d58c892011752ed7a9e0e832ab3cfd75f62201d036f64b51ee3762ba243f","observation_id":"34d09bcb-f26b-439d-bf7f-56042ab63c9f","resolution":{"observed_at":"2026-08-07T15:06:35.338695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.241766Z","title":"Skywork open reasoner series, 2025","venue":null,"work_id":"e1b8b316-9eaf-4fad-954e-310d3e4c561d","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.346308Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:4cdc6669f909a6772b9a98885de5c0b7eacd87884c52ac41fa15aa2165260c1c","observation_id":"245b7b6e-9de9-4fa0-81e2-ab6f86cd1c27","resolution":{"observed_at":"2026-08-07T15:06:36.246484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.226488Z","title":"Measuring mathematical problem solving with the math dataset.NeurIPS, 2021","venue":null,"work_id":"0e7860a0-9a49-440e-8610-9a2c7c77802d","year":2021},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.351544Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:5af294b647ff2833f535c17b8a74bb432024f5bd63ef4826949f2f7fa7d31dea","observation_id":"0a914012-d692-4cc1-bae7-f1ee13803624","resolution":{"observed_at":"2026-08-07T15:06:36.231267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.211374Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":"fb2b1ca0-fdca-4867-bbaa-a94333bd6298","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.356186Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:cfc4381e92658c80e6b8901879aec87a060563678d0fb0f59acac6e8efca25c7","observation_id":"5c83f9db-dfb0-41f0-bbef-712e9d7a46e3","resolution":{"observed_at":"2026-08-07T15:06:36.216361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T15:06:35.360560Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.360560Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:d4515f5aaae69b500b3e62d84743614c12d2188d774155abacd146c5ec7524fc","observation_id":"90ee0e6b-52ff-40bd-ad18-0ff352523cd9","resolution":{"observed_at":"2026-08-07T15:06:35.360560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T15:06:35.364966Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.364966Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:367d7fe41f73aa8a3f03fdc9a8fdca5947574f0e2c344fe865fe5168f2fc9e90","observation_id":"0553564d-8612-4b45-8336-a6a2a33ca38f","resolution":{"observed_at":"2026-08-07T15:06:35.364966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:35.369809Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.369809Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:cdbe1befb5cf36ec5a005537731e88e3f08de724b46d282545f8b0d4563a4f5c","observation_id":"52356d23-5f99-4217-b9d9-d08978ed2ce8","resolution":{"observed_at":"2026-08-07T15:06:35.369809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.182330Z","title":"Numinamath","venue":null,"work_id":"2d18e057-5759-40a8-92a7-b611989cd5ac","year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.374725Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:ac551be58e29c241ef3a67c69b106472951583bf4c93299ab64bd2fdfaeb222c","observation_id":"77e21b3b-f8f9-48b9-8a42-71f26ff1a087","resolution":{"observed_at":"2026-08-07T15:06:36.188890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.166594Z","title":"Let’s verify step by step","venue":null,"work_id":"72c41abf-3a90-4994-8f44-173d52e19227","year":2023},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.379388Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:dfbc8978ec80a11f708dbdad73f521da93dc5cd1770ac5950090374c5de9b29d","observation_id":"d6ef4e8f-f597-4ef6-b2de-afb965259a57","resolution":{"observed_at":"2026-08-07T15:06:36.171672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:06:35.384699Z","title":"Deepseek-V3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.384699Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:0d5ee88900020e494dd59fe9afa86a8fda058bea10deda517556cd0b30a03910","observation_id":"77f105be-63c4-4387-b8b9-392d2da950e6","resolution":{"observed_at":"2026-08-07T15:06:35.384699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T15:06:35.391101Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms.arXiv preprint arXiv:2410.18451,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.391101Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:dfb32d9b89113af474f1a57ce0102c9e0c04f09ef93f7f06325ed26bd76b1dad","observation_id":"62ea21e6-726c-4955-80ee-87ba1fac670b","resolution":{"observed_at":"2026-08-07T15:06:35.391101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.151236Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"bb41eb1a-e0cd-40e6-a024-706d8cf29041","year":2023},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.396473Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:a83568958b69f2bcadf71f95e7d400ca43f27e289c0e5ebdd68c7a1c00377e06","observation_id":"bca7eb50-4e78-44c8-b247-6e032ef6b77c","resolution":{"observed_at":"2026-08-07T15:06:36.156142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.136153Z","title":"Evaluating language models for efficient code generation","venue":null,"work_id":"4ca48f5d-1cd8-4588-bfdc-9390e623c8ea","year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.401772Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:0f54091f41440ce5f11ee87a62e2cf31c8dd3052ab76ac1eefc4835c248ee286","observation_id":"18a06f92-5396-49aa-895d-690b15053bc0","resolution":{"observed_at":"2026-08-07T15:06:36.141039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15084","last_updated":"2025-01-17T07:12:55Z","snapshot_observed_at":"2026-08-11T11:36:59.692420Z","submitted_at":"2024-12-19T17:29:44Z","title":"AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15084","snapshot_observed_at":"2026-08-07T15:06:35.406551Z","title":"AceMath: Advancing frontier math reasoning with post-training and reward modeling.arXiv preprint arXiv:2412.15084, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.406551Z"},"links":{"cited_paper":"/paper/2412.15084","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:b09959495e1327ddaf79eaf46793e2fddd4c0e42f15d51b3568e2874d84d8c7c","observation_id":"943f7d5d-3417-4c90-a906-f22ca245594a","resolution":{"observed_at":"2026-08-07T15:06:35.406551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.120406Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level, 2025","venue":null,"work_id":"73d17662-6c01-4e51-b9de-4c64fe49b8ae","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.412153Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:c5b4357263c799828302242ae32bd53c16a0323ee5df9bad9327bff62a625205","observation_id":"f62916a8-3707-488a-871f-4ba17fc61ac8","resolution":{"observed_at":"2026-08-07T15:06:36.125432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.104382Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"3caa649b-3a2d-4ca4-a9c5-e0098e59c75e","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.417224Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:27308defebc81e35e8286c77f8396206fcd64a5d7519b2967cf84ac3854de0ea","observation_id":"64bde935-b262-40a0-9b46-8333690e42c4","resolution":{"observed_at":"2026-08-07T15:06:36.109543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-08-14T19:09:59.262526Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T15:06:35.422347Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems.arXiv preprint arXiv:2412.09413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.422347Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:8114a7b6a73c770d70cae6bf108c2218c60d396c2cef80698608426a60289fc3","observation_id":"801014ec-d30e-4b72-a28d-a34a81e0fd50","resolution":{"observed_at":"2026-08-07T15:06:35.422347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-08-14T01:44:06.317131Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-08-07T15:06:35.426645Z","title":"Aimo-2 winning solution: Building state-of-the-art mathematical reasoning models with openmathreasoning dataset.arXiv preprint arXiv:2504.16891, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.426645Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:51f7315a1c1122b9a26a9d56c4070a2179780c515ddaf66614f672b982bf4685","observation_id":"b3932edf-1f19-4485-917b-1965519b2f19","resolution":{"observed_at":"2026-08-07T15:06:35.426645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.088887Z","title":"Learning to reason with LLMs, 2024","venue":null,"work_id":"2c216a38-4bb3-4ccb-a9e5-a65a68f89e6e","year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.432368Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:0d295e0f7d4b61121d54de82f4fdfc467abff119b853fbddbef347d1ed0af5db","observation_id":"f594eac6-4b05-4fe9-83b7-3d3ecbd2a1b2","resolution":{"observed_at":"2026-08-07T15:06:36.093590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.071344Z","title":"Qwen3, April 2025","venue":null,"work_id":"52cbf93c-dfe5-4bf9-9e70-e921e6ed5714","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.437045Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:48b81a65c2b554631a2931998b125592adecc5d8fd58a7b52cbf6fc53260298a","observation_id":"5cfdd2fb-dfd5-430c-a1a6-72f17cf6f8a4","resolution":{"observed_at":"2026-08-07T15:06:36.077528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.054173Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"4d8a86ea-8f31-4561-80a5-b30a915ac86f","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.441505Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:4eb933aaad2b05080c753282dcb890cfb5f430abd11e60cac82e7bb457cc5536","observation_id":"c908a22d-9724-4234-acba-4d09f27f2be7","resolution":{"observed_at":"2026-08-07T15:06:36.059219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.037945Z","title":"Areal: Ant reasoning rl.https://github.com/inclusionAI/AReaL, 2025","venue":null,"work_id":"818adcaa-0fc9-4226-804d-3aeb07514fea","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.446011Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:fd3eb38fe96ca11d512650a887c09d90af8d096afa19d7814d8d4bb2f689f56d","observation_id":"6dc5eecb-f298-4121-abf4-4b3f9ed98fcd","resolution":{"observed_at":"2026-08-07T15:06:36.043379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:06:35.450509Z","title":"Proximal policy opti- mization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.450509Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:5d81cfcf7a8f4f65833f468463f2cd456367153304b700eb7974b695934644a4","observation_id":"ffa884c3-6476-46db-97a6-685fd284f4db","resolution":{"observed_at":"2026-08-07T15:06:35.450509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:06:35.455071Z","title":"DeepseekMath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.455071Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:dcf439324e3d03af154cacccbbd14f6d5b1355bc92561c2ddda30345123da40c","observation_id":"16f4defc-df20-453b-8f91-72d0605aa93a","resolution":{"observed_at":"2026-08-07T15:06:35.455071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:06:35.459500Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.459500Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:03567c72badb7d8582b06c3654914f92034a312cddc888b03b3b5ed43810138e","observation_id":"570359b4-1457-4bfd-a6db-e7e87a6ef781","resolution":{"observed_at":"2026-08-07T15:06:35.459500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.021098Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":"842ee798-d3bb-4054-9cdb-9d3842d167a7","year":2022},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.464091Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:a29e8b98f03f9f688aa85654e58f030a193aeff3fe3e9c4d51edfd4f3c3ca245","observation_id":"e9c27ef8-6b48-43f1-904d-7af7db4955f0","resolution":{"observed_at":"2026-08-07T15:06:36.026419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-10T16:59:28.676649Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T15:06:35.469350Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond.arXiv preprint arXiv:2503.10460, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.469350Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:234fd10fdc7907ec45189c3a1c4942897812c6ce616adb2176aaa1e6102e6857","observation_id":"51031af8-96fb-4a71-ae2a-093c23cca5ee","resolution":{"observed_at":"2026-08-07T15:06:35.469350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.004035Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning.Machine learning, 8:229–256, 1992","venue":null,"work_id":"bd7f45bb-44ec-4cd0-9225-9aaa1ac3d3ee","year":1992},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.474413Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:72e7517712cc896fb11cf13ce99d59d6fda8250aa38d50d2df9b40a2de7dbaaa","observation_id":"0986e787-4d8d-4456-8c8c-e0b2d8b4c211","resolution":{"observed_at":"2026-08-07T15:06:36.009629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:06:35.478748Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.478748Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:ff70e058da79927e3f6a508c7942186f1c69290d61cf3b987fa07815be76c070","observation_id":"48f6a565-6fa7-4c1f-b5f9-30faffd8f681","resolution":{"observed_at":"2026-08-07T15:06:35.478748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:06:35.483074Z","title":"Qwen2.5-Math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.483074Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:80802ba6a82a1c026f40d7e4400eaed37958cbd0b274118fe2fea356b86edecd","observation_id":"88905fb7-ae1a-483f-a07f-345628fd43d2","resolution":{"observed_at":"2026-08-07T15:06:35.483074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:06:35.487503Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.487503Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:797f734ad481bfc61f37e804817d2cfca6bddec8c5b6adea3e90e84504ca6c06","observation_id":"510d0643-00d6-4fef-aef8-1ab9ad7221ec","resolution":{"observed_at":"2026-08-07T15:06:35.487503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T15:06:35.492037Z","title":"Does rein- forcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.492037Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:6758317e5e43133fce7b1714c1ccc00b4424ba1e5d44bc224b4dd02152f13b89","observation_id":"611726fe-6b2d-409d-8c1d-77e4328403d1","resolution":{"observed_at":"2026-08-07T15:06:35.492037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01718","last_updated":"2025-05-24T04:36:48Z","snapshot_observed_at":"2026-08-14T06:10:00.978457Z","submitted_at":"2025-02-03T18:46:04Z","title":"ACECODER: Acing Coder RL via Automated Test-Case Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01718","snapshot_observed_at":"2026-08-07T15:06:35.496885Z","title":"Acecoder: Acing coder rl via automated test-case synthesis.arXiv preprint arXiv:2502.01718, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.496885Z"},"links":{"cited_paper":"/paper/2502.01718","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:235568f6b13a1f1e8fa2356d2a655bbd21632cb3e7990c84a0254dc6f9f1b207","observation_id":"ca8ca9ec-51a5-4129-a6ec-795d41618fb8","resolution":{"observed_at":"2026-08-07T15:06:35.496885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:35.985121Z","title":"r’s **, let’s break it down step by step. ### Step 1: Understand the Context - It seems you’re referring to the letter **","venue":null,"work_id":"80177c5e-4733-4458-81e8-2f6d80b15bbc","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.501572Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:264c7115b1ce0972bb488725a74bcf8b846ff79498d99b2b9e6a356b8e6dc7a8","observation_id":"2b6e39db-4943-4156-866b-1525df2d61e7","resolution":{"observed_at":"2026-08-07T15:06:35.992091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T02:20:26.934129Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 29 inbound Pith citation observations for arXiv:2505.16400."}