{"as_of":"2026-08-19T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d57351d2ede20b86bf5953269a36dfb85a16d03f93c3e30893e692309eb76976","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:51:43.099838Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:21:08.555405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.554863Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-08-15T18:21:08.555405Z","title":"a d v a n t a g e s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18391","last_updated":"2025-07-24T13:14:25Z","snapshot_observed_at":"2026-08-17T14:04:48.290694Z","submitted_at":"2025-07-24T13:14:25Z","title":"Revisiting LLM Reasoning via Information Bottleneck","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:21:08.555405Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2507.18391"},"observation_digest":"sha256:397d48f5e58a16ed24ffa79cd9d3cc51cb2c7b11efe02fd52b05aa043fabb635","observation_id":"fa18ef4b-7416-40ea-a7b3-0d7e23549957","resolution":{"observed_at":"2026-08-15T18:21:08.555405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-08-06T04:39:04.024925Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.024925Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:48b4a90f9acd16f31a2c91e36ee2c3ca590dca7688444bee6cff50965bb121b1","observation_id":"74b92fd2-80fe-457e-8dfc-f7d363cc0b3b","resolution":{"observed_at":"2026-08-06T04:39:04.024925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-08-04T07:59:53.046706Z","title":"Scaling up rl: Unlocking di- verse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.23486","last_updated":"2026-07-03T18:03:08Z","snapshot_observed_at":"2026-08-19T09:10:57.779829Z","submitted_at":"2025-10-27T16:17:45Z","title":"Learning to Reason Efficiently with Discounted Reinforcement Learning","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T07:59:53.046706Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2510.23486"},"observation_digest":"sha256:79919928d8dfccfc4c9ee90b95f92b88fc7574e43cdd8cdd36894099cf3928c9","observation_id":"da2f79da-b1fe-4b5c-bc8a-065e3102426e","resolution":{"observed_at":"2026-08-04T07:59:53.046706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-15T14:36:44.426681Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:15.222571Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:e928ea330528a48553b4079b8d83c9fd8ab639dbb8ec960394eabff0ad9cbe4a","observation_id":"3310297e-1a88-4046-94cf-424c1b424a51","resolution":{"observed_at":"2026-05-11T09:25:59.026410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-12T22:48:45.647588Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-15T14:36:44.426681Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T22:48:45.647588Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:756fbd4e118802d62210d05d490ac380a59d09d99b3207515d09b03a6a89b78c","observation_id":"ddab7b49-4cd9-47a9-8686-07871448f7bd","resolution":{"observed_at":"2026-07-12T22:48:45.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2604.15306","last_updated":"2026-04-16T17:59:43Z","snapshot_observed_at":"2026-08-16T04:12:19.606812Z","submitted_at":"2026-04-16T17:59:43Z","title":"Generalization in LLM Problem Solving: The Case of the Shortest Path","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T10:37:45.355872Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2604.15306"},"observation_digest":"sha256:fb56f52c8d8b58ca5221475362493cc265ff3fbf4345a540cda5abfd23622fd3","observation_id":"19e525d1-700f-4d79-b634-ea8bad51050a","resolution":{"observed_at":"2026-05-10T10:39:38.040670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2605.17295","last_updated":"2026-05-17T07:14:44Z","snapshot_observed_at":"2026-08-12T12:03:12.716366Z","submitted_at":"2026-05-17T07:14:44Z","title":"DISA: Offline Importance Sampling for Distribution-Matching LLM-RL","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T15:11:43.235574Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2605.17295"},"observation_digest":"sha256:fd5bf6629c2936b35864c18f07d282a34ea41df8b3c5de7837caff644650726a","observation_id":"e5e3e00a-54c4-4420-88fc-74d3b10c6268","resolution":{"observed_at":"2026-05-20T15:13:24.864105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2605.23454","last_updated":"2026-05-25T06:33:52Z","snapshot_observed_at":"2026-08-13T14:21:56.290782Z","submitted_at":"2026-05-22T10:09:28Z","title":"ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T04:31:37.641598Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2605.23454"},"observation_digest":"sha256:2b0728e546bb5cb9721ec13dbc9b568ec14bd40dd214dd9710e330bf90b7870a","observation_id":"087dd9df-be03-46a5-a491-625313e27927","resolution":{"observed_at":"2026-05-25T04:35:21.594882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2605.23454","last_updated":"2026-05-25T06:33:52Z","snapshot_observed_at":"2026-08-13T14:21:56.290782Z","submitted_at":"2026-05-22T10:09:28Z","title":"ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T16:21:40.582248Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2605.23454"},"observation_digest":"sha256:3e1ed6479ce948aeda6c70fc4758f67cc323b84fe2344d9a146db35b630e27c6","observation_id":"85b190e6-9899-4bb1-95db-2d694c32d13a","resolution":{"observed_at":"2026-06-30T16:24:55.362639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":226,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:e744d000c125c86cec9a491c80b6a9d06bf7455a539d785a11f85c15a6d799fd","observation_id":"373a9187-b9f6-4da7-8a24-f1581a8da92d","resolution":{"observed_at":"2026-07-01T20:56:13.556324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12507/citation-record","integrity":"/paper/2507.12507/integrity","json":"/paper/2507.12507/citation-record.json","paper":"/paper/2507.12507"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T16:51:41.308878Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.308878Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:22fe9685be4a774a5a65f120527832bd6b72480beaa63fcc40cec022aec1ec5a","observation_id":"01702ac7-f90e-41df-ad01-e3366eed0b87","resolution":{"observed_at":"2026-08-06T16:51:41.308878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:51:41.379398Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.379398Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:4ef27d8f55d8d67d94528669a4a440cf668cdee8adf6171f282bf520eb1e6e25","observation_id":"b91c1ff4-f3e1-4e84-836e-c7ef764722fb","resolution":{"observed_at":"2026-08-06T16:51:41.379398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.505347Z","title":"Tang, Manan Roongta, Colin Cai, Jef- frey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"8ea19dd7-3abc-4a03-9b2b-2674f920f70e","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.478402Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:380850abdc3de56288a2e756e331141d6c96beb377870a10e6920d84b8cb96c1","observation_id":"9cd6446e-a56c-4d76-832e-a6d630ed29b0","resolution":{"observed_at":"2026-08-06T16:51:44.536753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:41.605352Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.605352Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:544e43be123bca9c4137f6f5b583cc68b02951dcf19ba3678dbf7294e315ac2d","observation_id":"ae443173-a672-4bb6-87ec-464a477d3bef","resolution":{"observed_at":"2026-08-06T16:51:41.605352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-17T04:59:59.434643Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-06T16:51:41.675432Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.675432Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:f03736c14b9809084d681ac25fb6e0cf9c753413ca3279578cff32a3928cc5ea","observation_id":"d72de7c8-7f04-4e43-b906-ee8f2bc20d39","resolution":{"observed_at":"2026-08-06T16:51:41.675432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:41.754532Z","title":"Scp-116k: A high-quality problem-solution dataset and a generalized pipeline for automated extraction in the higher education science domain, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.754532Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:0d5ff4b3cd9193994042280fb780d368af182e6f1672e1d7102fd4449b9911a4","observation_id":"e3eded81-4d23-4ab7-abbf-2568a743311f","resolution":{"observed_at":"2026-08-06T16:51:41.754532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.405240Z","title":"Reasoning gym: Reasoning environments for reinforcement learning with verifiable rewards, 2025","venue":null,"work_id":"507cb78e-1d45-4062-91e1-c6616f59fd0a","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.839172Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:7aaa500bb63dfebe5d87b1b83930173b4c37eaf730cac867d9252f5b0b52395d","observation_id":"b7202fe5-07b3-4c21-8477-6aec33c4b1fc","resolution":{"observed_at":"2026-08-06T16:51:44.440037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.330455Z","title":null,"venue":null,"work_id":"864119cd-92b9-4d57-97ef-8409a036de2c","year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.927847Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:f2a857601e16d99c91444f71c80c8924780035c6b5104fdee4a25c43d748e91e","observation_id":"e2d45004-e28f-4f90-b895-4a4bf75b0781","resolution":{"observed_at":"2026-08-06T16:51:44.361140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:41.986503Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.986503Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:ef0c9dee7c869b74b854883ec0efdbbd8c9a5d3a6b9a27301c1d194c882b885d","observation_id":"6c2e0656-9b38-4af2-8d61-d9e6fb88c713","resolution":{"observed_at":"2026-08-06T16:51:41.986503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T16:51:42.072510Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.072510Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:c8882f96d7cd1c5b711c74faf9419a630b30d8a260aaa37369f08de52b50945c","observation_id":"73910816-2529-43d4-ba57-7b29a62e8611","resolution":{"observed_at":"2026-08-06T16:51:42.072510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.132236Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.132236Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:16dfe2120f5707a0666f76ad5d43430e14de25fd35dc91e47814765c3a5cfd55","observation_id":"38a9ed1a-7369-4098-9a0b-75cbc62aa494","resolution":{"observed_at":"2026-08-06T16:51:42.132236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.235851Z","title":"Approximating KL Divergence","venue":null,"work_id":"d6717539-530f-47ca-ba7a-66e3425b3064","year":null},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.192659Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:6acc2bcda732c27297c6b6253a7f1e0544983669c382f0c6dc2e8bf0ff0cc6e5","observation_id":"44a62020-97b4-44bf-b019-693d73a66d65","resolution":{"observed_at":"2026-08-06T16:51:44.270150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.156787Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level","venue":null,"work_id":"54dac1a2-2ca8-4161-8f38-5fa6eceb4d89","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.236452Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:f87ef10fbb5101d769f7476609a312af9029f8f4214ae30d9e701adf2797070b","observation_id":"e9f94756-acd8-4fa3-9f76-d3a664121d0b","resolution":{"observed_at":"2026-08-06T16:51:44.190811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.092250Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":"6470f07a-6e09-4ef8-bb48-6f6d02bbe6ef","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.281094Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:941dc55e6fadde3aca2378e0e90b18612899a5a7bc9b72e5b46810538f1a4303","observation_id":"5036a461-add3-44f6-971b-82c784a0fff8","resolution":{"observed_at":"2026-08-06T16:51:44.120691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.047770Z","title":"Skywork open reasoner series.https://capricious-hydrogen-41c .notion.site/Skywork-Open-Reaonser- Series-1d0bc9ae823a80459b46c149e4f51680, 2025","venue":null,"work_id":"763358ba-b5ea-45c9-87bd-1dacb5dc180e","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.312913Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:861c0aab5d76f73576c9d1c3aac8d2d053f22298f4f0f81d067b02aacaf12dc4","observation_id":"06296c41-5472-4ca1-a519-acb330813ae0","resolution":{"observed_at":"2026-08-06T16:51:44.066802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.859497Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"2fb8fe48-783a-4a21-927d-e6732f1585d0","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.366724Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:a5cd2e27b59b3ba2986f17e61f6b7ec18ec64d175f27491a75f3181f3ead9a77","observation_id":"9fb672b9-d13d-4e17-97ff-e2bb93fea91c","resolution":{"observed_at":"2026-08-06T16:51:43.928142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.428615Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.428615Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:3e821b6dd5260d66e18a263b0f078618dec81a163958bb7ddcab25454379315a","observation_id":"1f6e9583-fd27-417e-ae19-f98d530e3e09","resolution":{"observed_at":"2026-08-06T16:51:42.428615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.767319Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient.https://hkust-nlp.notion.site/ simplerl-reason, 2025","venue":null,"work_id":"2b623820-b689-4686-b351-33e18751632d","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.481817Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:1c32c1ab55736fba44677caf3d4af3dc112e818f05ff6ad7812151c0def940b1","observation_id":"4371198a-3b07-42c5-a489-2af2baca32d0","resolution":{"observed_at":"2026-08-06T16:51:43.806690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.668165Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"5a0d50c6-bd55-4e94-bd7e-1b7a198655c7","year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.511720Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:e837541aebbcd81041646c4a2ba4186480a82b51e4a5434ca8a37e5f83feefda","observation_id":"9ec5ac18-d477-4187-bdce-9003b7eb8312","resolution":{"observed_at":"2026-08-06T16:51:43.711163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.583377Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"594969fd-eda6-4179-b477-bd9ebf86b324","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.546714Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:f7c922f8aacf9df92cedf75be4891dd6b67ae7068af74eb3c43ac042c6ff658a","observation_id":"62f2ad05-1b60-44e6-b401-05a5ffa833e7","resolution":{"observed_at":"2026-08-06T16:51:43.608952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.504066Z","title":"American mathematics competition - amc","venue":null,"work_id":"c16261c5-5779-481c-ab4e-ce3d86b66e59","year":null},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.576951Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:b862e15fdb1e17c262ac1c03ec28be97f71c68b685072a29290d5e38d4f9746c","observation_id":"ea63ccc2-ada3-4e43-b86d-47132b004ac6","resolution":{"observed_at":"2026-08-06T16:51:43.543312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.599645Z","title":"Measuring mathematical problem solving with the math dataset, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.599645Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:08df93d84a4900c82b0285faa42cf09e7a25d1aa8f45c959023366366d9020f6","observation_id":"c7028bb1-2669-48a3-b27d-c54cbecb0cb6","resolution":{"observed_at":"2026-08-06T16:51:42.599645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.633994Z","title":"Solving quantitative reasoning problems with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.633994Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:e35af49f99b2aa3a8512bf3a0465a3e96023b1d6192053a115c027cf533976a6","observation_id":"bde776d0-36a9-4c99-a458-dfee812f1963","resolution":{"observed_at":"2026-08-06T16:51:42.633994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.657244Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.657244Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:aa3619097a0d4f92b7a173d7664573cf30a72e3b6dfef3fd931353cf918967ae","observation_id":"58383f93-4bd2-4994-9394-11a5d15a3604","resolution":{"observed_at":"2026-08-06T16:51:42.657244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.719030Z","title":"Measuring coding challenge competence with apps, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.719030Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:2f299fd5d65748ffa49d641e6736bfcee97f21b2fb553c5f58da39661abd1e76","observation_id":"43299953-156f-4e44-91f1-fd7833a838ea","resolution":{"observed_at":"2026-08-06T16:51:42.719030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.778292Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.778292Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:bb89b8cb63b025002ba8e21df9ac988bb543f12d652522f405d167643a99e290","observation_id":"31cdb266-0bbe-4b21-ba0e-157ff5892789","resolution":{"observed_at":"2026-08-06T16:51:42.778292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.831655Z","title":"Taco: Topics in algorithmic code generation dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.831655Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:ad73661fcc633dca69e413ee0e0623bf45cc43e29057350879c3c747a88cb9a2","observation_id":"12403a07-828b-4577-9316-ef7bc464d2d8","resolution":{"observed_at":"2026-08-06T16:51:42.831655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.383851Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"76494209-bdc1-487b-8a1c-3d1793a11011","year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.871217Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:6cee687d2e177a852eb7821b5216027831bec0106d9bcf5e751b461cef58bef8","observation_id":"98a14543-e3ae-4cb7-bccf-8b9d918c770c","resolution":{"observed_at":"2026-08-06T16:51:43.418470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.887053Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.887053Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:e6c0fdec7c3d61fe4edaf09d206f4bc6ca7cbdafd321f96bc864fbb547116e0e","observation_id":"ae44f13a-84c5-4e58-82bc-276933a6febe","resolution":{"observed_at":"2026-08-06T16:51:42.887053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.908581Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.908581Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:5353c8e6878f95d4a095b24a8b6939ae7f80ac9d7e649f610bc0edba093452c6","observation_id":"202e4379-5d88-4739-af38-9804f644e500","resolution":{"observed_at":"2026-08-06T16:51:42.908581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.984504Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.984504Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:31629e9142ee1191d62964f78fa2ec80f25e7482d7de10a8d6a12a5046f18b05","observation_id":"e0df78d3-4be0-4360-8fef-94fdf4fc1630","resolution":{"observed_at":"2026-08-06T16:51:42.984504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.316254Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"414f5bf0-a0d9-4ff7-966a-973fe72993a1","year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:43.036697Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:fca42a2c2b877816cefa9ae4cc7c486320c34f49500252842419a6250df0bb43","observation_id":"bba4a0ec-2391-4fa3-a991-b13230e25b7a","resolution":{"observed_at":"2026-08-06T16:51:43.341473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.252671Z","title":"The curious case of neural text degeneration, 2020","venue":null,"work_id":"56a531a0-a04b-4c14-b969-bfe374da73d5","year":2020},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:43.099838Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:d2ca637e459af188efcc302b5173c0f869ddf2eb4359b1570b1a4a5c46f6b0d2","observation_id":"3573b1db-f3f2-4d53-8cdc-f1b92d7d675d","resolution":{"observed_at":"2026-08-06T16:51:43.283087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 10 inbound Pith citation observations for arXiv:2507.12507."}