{"as_of":"2026-08-09T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5352ffb31a6caecfd737475c6e4eaef660060b9e0119eef30a7c50f69004bbae","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:53:15.153126Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:53:52.768850Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.539228Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-05T14:23:54.061991Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.061991Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3cebfb94a5b8929809553c5e24b280342dfc84c291f9dbf64415b2fb9d4f7f12","observation_id":"7d8e9ecb-8f18-4653-b893-fc7ccde05aad","resolution":{"observed_at":"2026-08-05T14:23:54.061991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-04T22:59:14.604039Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.604039Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:3278be0c1336f514ffb564af3c57fe4a958f0c8de5c7cb38fc9a01db203257fc","observation_id":"14b2af2a-9784-420d-848f-0382d14a4838","resolution":{"observed_at":"2026-08-04T22:59:14.604039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-04T12:41:43.277273Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02919","last_updated":"2026-05-29T16:16:27Z","snapshot_observed_at":"2026-08-07T08:42:12.238625Z","submitted_at":"2025-10-03T11:46:04Z","title":"Self-Reflective Generation at Test Time","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T12:41:43.277273Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2510.02919"},"observation_digest":"sha256:18a141e22d772ef789e14c804804980452901f8fbd8d0dae9f11cb4e8f248cdd","observation_id":"31883257-a409-49e5-8385-e1ea6eae40f8","resolution":{"observed_at":"2026-08-04T12:41:43.277273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-04T10:39:29.867992Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09388","last_updated":"2026-06-22T08:02:17Z","snapshot_observed_at":"2026-08-07T16:09:47.648297Z","submitted_at":"2025-10-10T13:42:03Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T10:39:29.867992Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2510.09388"},"observation_digest":"sha256:b2d375594e48a06c5fcdcf95eae7549f9f90fd90d4c481cf160c1394bd83ff64","observation_id":"3e0d01b1-8879-442b-b095-39dc436c58a7","resolution":{"observed_at":"2026-08-04T10:39:29.867992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2605.08666","last_updated":"2026-05-09T04:07:20Z","snapshot_observed_at":"2026-08-02T05:46:41.345933Z","submitted_at":"2026-05-09T04:07:20Z","title":"The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:24:03.186413Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2605.08666"},"observation_digest":"sha256:27fc8b8f50d7193ccdbb40a3e768a73dd1d1a5d889bd575eeb2e93abf2789bfd","observation_id":"eaa1a40d-e8fb-4d0d-a1a4-f25b78d4160c","resolution":{"observed_at":"2026-05-12T08:01:29.024124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2605.08817","last_updated":"2026-05-09T09:10:03Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:10:03Z","title":"How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:04.955816Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2605.08817"},"observation_digest":"sha256:4f45992896d7c55f8faa410daf90efea0de6492bee251246b2a7101fde75ac7a","observation_id":"f373a8cc-ce6f-4c16-8b6d-3b79152a151b","resolution":{"observed_at":"2026-05-12T03:26:19.362669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-09T19:21:36.282967Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:28:18.615371Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:4f4c6fe6e8a7e81ae0416334c5b200a66a2f28d92eb75cf4089d6cf4bae5e35b","observation_id":"5f689fb8-57bb-4870-a57f-205763537f54","resolution":{"observed_at":"2026-05-13T01:47:05.208530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-09T19:21:36.282967Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T21:20:24.066520Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:48c1191b384bacf005bf5c1d8f9372862985fad324bf058391e1ccfc1a584f00","observation_id":"6617a73d-f319-48fa-873a-3f4d3d1feda7","resolution":{"observed_at":"2026-05-14T21:22:59.327594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2605.16874","last_updated":"2026-05-16T08:33:31Z","snapshot_observed_at":"2026-08-01T16:12:13.947960Z","submitted_at":"2026-05-16T08:33:31Z","title":"Reasoning Can Be Restored by Correcting a Few Decision Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T20:56:48.771058Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2605.16874"},"observation_digest":"sha256:e0ceb78d2d04eb09d045160c7281896f22e04947f43af085e0f301eb8c03dc24","observation_id":"6962d0cf-3be1-46a4-9016-cd6295a98b42","resolution":{"observed_at":"2026-05-19T20:57:46.813786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:ab794bf5f4466c457ea30f6aa490256b355228a6c1678f0d2e9631b351dc21a7","observation_id":"d9099c6b-26ae-4bd5-b61a-9248ff6573f5","resolution":{"observed_at":"2026-07-01T20:56:13.650396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c6a4e791b2bfac4377cfccb4e0acd164f94e9ec7a9a5198a614d36067c5bedf9","observation_id":"024e228f-8c3a-40b3-93a7-ae7df8bbde22","resolution":{"observed_at":"2026-07-02T12:06:56.398549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d69a96820c9bdc3675b2e4d91ae035352091be884e036e96455333f08971e611","observation_id":"5523e626-d46b-4a60-8e80-73862cbeafab","resolution":{"observed_at":"2026-07-02T12:16:56.967524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:aec159e00d608a660403644ecbeb39ea3871ceebaa23d8dbb9199a73619fb036","observation_id":"1254643d-d89f-4eb6-9f53-d3e6c4f518c3","resolution":{"observed_at":"2026-07-03T20:38:55.848699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.20662","last_updated":"2026-06-09T23:13:53Z","snapshot_observed_at":"2026-07-06T23:55:48.334376Z","submitted_at":"2026-06-09T23:13:53Z","title":"Confidence Laundering in Agent Systems: Why Uncertainty Needs a Latent Carrier","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T12:53:05.153500Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.20662"},"observation_digest":"sha256:6a1fa3ea49932f09a00d46c5d9e7da7909bf117501fc23cdf63e8b873db63451","observation_id":"3c977e00-2de3-42ac-b623-1fe22de75659","resolution":{"observed_at":"2026-07-03T06:07:41.573469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":276,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:d31cf57409e1a2d060d531c88e980dc07bec0fc0183ef0c38ea4e8c85431f132","observation_id":"b505331e-ed58-46a2-ba6d-ce078e8d855a","resolution":{"observed_at":"2026-07-04T08:09:40.649189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:8409f4763346feb9f836ae0534f7809c5eea4d938ac57c299a4861926244d3b7","observation_id":"855d224b-6a44-4a97-ae37-fd7df83fc914","resolution":{"observed_at":"2026-07-04T09:09:43.540812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-02T01:39:10.853118Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:10.853118Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:0344e3bcf949682eebba5caaca651c4e417e254d5949a2b593f1221de1930393","observation_id":"8331d4b8-dc11-4eda-b24c-c560ab2b1b34","resolution":{"observed_at":"2026-08-02T01:39:10.853118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-06T05:53:52.768850Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-08T23:13:56.397386Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.768850Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:afbcd101deea7c441375830e62c3d7b99291a765b09ca0f30dc148d101d37933","observation_id":"8114cd00-53cd-4efb-baa9-9557b6121c75","resolution":{"observed_at":"2026-08-06T05:53:52.768850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07017/citation-record","integrity":"/paper/2507.07017/integrity","json":"/paper/2507.07017/citation-record.json","paper":"/paper/2507.07017"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-06T18:53:11.406993Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:11.406993Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:25bfd335ff341a1ccc821c25044687f734054a6c4ec2785d10f5ae735ea76e21","observation_id":"9467682a-6022-4bbf-91ce-59a20c95f063","resolution":{"observed_at":"2026-08-06T18:53:11.406993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:17.256238Z","title":"Using confidence bounds for exploitation-exploration trade-offs.JournalofMachineLearningResearch, 3(Nov):397–422, 2002","venue":null,"work_id":"f33956dd-ed3b-48ce-afb9-0506ec55fa61","year":2002},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:11.509061Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:1bce120caf10c7ade571297ff6d71c9d125245e6656c394249d6c6b8d7ce6d11","observation_id":"1f96a7a7-cda7-4f5d-b81e-71a4897833e8","resolution":{"observed_at":"2026-08-06T18:53:17.295629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:11.640190Z","title":"Finite-time analysis of the multiarmed bandit problem","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:11.640190Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:61162796fdd4eed58425c2e1d6d3a73d97e9c6442b3da67e82dc00e428eb1332","observation_id":"da3b65e4-0336-4c60-adc0-081ee30abc4b","resolution":{"observed_at":"2026-08-06T18:53:11.640190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:11.762655Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:11.762655Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:4cebd62d469b125caf0197036316aa025f62465918cbbcf640da20e9492a80d9","observation_id":"f1a73968-6880-4e1f-955d-dbbf5321f161","resolution":{"observed_at":"2026-08-06T18:53:11.762655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T18:53:11.886340Z","title":"Do not think that much for 2+3=? on the overthinking of o1-like llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:11.886340Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:e35cbca5b73d447cfd869b1c8e297b7109fe828c95558be127e81dbcf651d31c","observation_id":"d58235a4-d96e-4d0e-888e-9f2403f8ca6c","resolution":{"observed_at":"2026-08-06T18:53:11.886340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-06T18:53:11.982084Z","title":"Process reinforcement through implicit rewards, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:11.982084Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:88a291a9ffcd19d683477a499f427624ecc2aff9cacbe4751ad5e23f7a2f3e64","observation_id":"90fa350c-2be6-4f5b-9662-3d9b8c654482","resolution":{"observed_at":"2026-08-06T18:53:11.982084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00052","last_updated":"2025-03-31T04:08:01Z","snapshot_observed_at":"2026-08-07T16:26:15.036245Z","submitted_at":"2025-03-31T04:08:01Z","title":"Assessing Validity of ICD-10 Administrative Data in Coding Comorbidities","version":1},"cited_work":{"arxiv_id":"2504.00052","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.00052","snapshot_observed_at":"2026-08-06T18:53:15.665401Z","title":"Assessing Validity of ICD-10 Administrative Data in Coding Comorbidities","venue":"q-bio.QM","work_id":"c2ebc64c-eb14-4fcc-917c-324f775a9025","year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.073302Z"},"links":{"cited_paper":"/paper/2504.00052","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:b32e3fc6af6c4fe0c3d42d5927437144754596d6eeaee3539b78acf6a56038a7","observation_id":"8df3f110-f943-4012-b73c-4441fdc1fff3","resolution":{"observed_at":"2026-08-06T18:53:15.752569Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07686","last_updated":"2025-05-17T04:01:57Z","snapshot_observed_at":"2026-08-08T14:14:41.258693Z","submitted_at":"2025-05-12T15:50:44Z","title":"S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07686","snapshot_observed_at":"2026-08-06T18:53:12.135771Z","title":"S-grpo: Early exit via reinforcement learning in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.135771Z"},"links":{"cited_paper":"/paper/2505.07686","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:e4a95a58859dc3f6d323ec5916e5e239183cbb78ded356014fb34874511d2411","observation_id":"0bfd072f-e7fb-4c9a-b297-695dacd32624","resolution":{"observed_at":"2026-08-06T18:53:12.135771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-07-06T07:30:05.397042Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-06T18:53:12.229578Z","title":"Go-explore: a new approach for hard-exploration problems.arXiv preprint arXiv:1901.10995, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.229578Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:e3fa2fd457200ab30496130ace6ddfb7a63d7ef1a6abf28384d999820ff13c22","observation_id":"b2a8d39d-42a5-4abe-bf7d-575a39e8159f","resolution":{"observed_at":"2026-08-06T18:53:12.229578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:12.302180Z","title":"Stanley, and Jeff Clune","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.302180Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:7882e6dc790776e68df319e6d15303a8dd837ed0d1ea19806d7e1628b5bf49a8","observation_id":"dd151a39-067f-4f20-bc7f-7a61b8292e5d","resolution":{"observed_at":"2026-08-06T18:53:12.302180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17726","last_updated":"2025-03-22T10:49:32Z","snapshot_observed_at":"2026-08-07T16:44:17.525384Z","submitted_at":"2025-03-22T10:49:32Z","title":"A Survey on Mathematical Reasoning and Optimization with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17726","snapshot_observed_at":"2026-08-06T18:53:12.361332Z","title":"A survey on mathematical reasoning and optimization with large language models.arXiv preprint arXiv:2503.17726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.361332Z"},"links":{"cited_paper":"/paper/2503.17726","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:77595e0dfbabf8c1ed40a9f3f2cf74d90bbe8d3137bcb558e95c710dbe5bfb21","observation_id":"b2697bc8-ad10-49f3-ac3c-cd673bc6c02c","resolution":{"observed_at":"2026-08-06T18:53:12.361332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:53:12.465006Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.465006Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:f6d385dd7e91df18b5aaa8396ff2eef95e7141e859343baa773ceafa3a65ed71","observation_id":"2b4d0b61-8c05-4d5c-b784-da600d060f2b","resolution":{"observed_at":"2026-08-06T18:53:12.465006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-08-09T08:43:45.790818Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00432","snapshot_observed_at":"2026-08-06T18:53:12.561980Z","title":"Does math reasoning improve general llm capabilities? understanding transferability of llm reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.561980Z"},"links":{"cited_paper":"/paper/2507.00432","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:cfe9e47d02fefd1902e2ba0fe8a9f2c88453bbb94abca8dd1e99108f53f53b3d","observation_id":"031a95bc-c452-4015-86f6-bdf98fce8502","resolution":{"observed_at":"2026-08-06T18:53:12.561980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-06T18:53:12.630333Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.630333Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:0d7b8187caf7e6ef5818feef578f33fd76c19c4eeba6e08c466a5e756681d8ef","observation_id":"4fcc9aa5-d6d3-420c-90c1-532a17c17fe1","resolution":{"observed_at":"2026-08-06T18:53:12.630333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20196","last_updated":"2025-05-26T16:39:52Z","snapshot_observed_at":"2026-08-07T13:55:18.345337Z","submitted_at":"2025-05-26T16:39:52Z","title":"Temporal Sampling for Forgotten Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20196","snapshot_observed_at":"2026-08-06T18:53:12.730408Z","title":"Temporal sampling for forgotten reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.730408Z"},"links":{"cited_paper":"/paper/2505.20196","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:36dd0282ee3bc4b4407195ca3375ae8f01e869a9ca8f86a84d2502b782201a1a","observation_id":"89d42913-2226-4634-b56e-05c1653ec6c8","resolution":{"observed_at":"2026-08-06T18:53:12.730408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:12.795404Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.795404Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:7f9056451cf115e465b75916d10fc32c789b9e4362d7839147deb3c838297a31","observation_id":"12059643-acbf-418a-8c11-f1bc77026d36","resolution":{"observed_at":"2026-08-06T18:53:12.795404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15143","last_updated":"2025-02-07T11:10:39Z","snapshot_observed_at":"2026-07-06T18:19:04.614208Z","submitted_at":"2024-05-24T01:45:27Z","title":"Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15143","snapshot_observed_at":"2026-08-06T18:53:12.860423Z","title":"Intelligent go-explore: Standing on the shoulders of giant foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.860423Z"},"links":{"cited_paper":"/paper/2405.15143","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:a6118df38a0ded8ef32515dc000bda3d31093fe8365a231f149c44ccf9370c63","observation_id":"41c2f940-5cb4-4352-8f6d-a1c4c6f0d3b6","resolution":{"observed_at":"2026-08-06T18:53:12.860423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T18:53:12.924944Z","title":"Improve mathematical reasoning in language models by automated process supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.924944Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:9c288411208770c784119f6508946bd8ef130b9ba5a0344b07fe00cc3eb66e7a","observation_id":"cf567e20-b6ab-4828-be67-e36d925e32ff","resolution":{"observed_at":"2026-08-06T18:53:12.924944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:13.035225Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.035225Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:e571f43c147b247e775a230bbfd055b22aba684d6c4e5dbf240b6b5c4a02c36a","observation_id":"32634212-fcd9-4925-92e5-2cda5e921854","resolution":{"observed_at":"2026-08-06T18:53:13.035225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-06T18:53:13.146511Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.146511Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:a27df62583775d36993b9e4f6181fde2825542e18f9464e0fa403e68ff4c3924","observation_id":"58b41610-eaed-4414-b7d1-3c3323f7478a","resolution":{"observed_at":"2026-08-06T18:53:13.146511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:17.090336Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"fe4fff40-8556-4d19-b6f1-c411e58e8847","year":2022},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.202720Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:647c0577d86161b29b282bdbced8b91c2e72c577e29f9d9e69c4d6208460e2fa","observation_id":"70828079-b558-4591-b755-4a9b04af1bef","resolution":{"observed_at":"2026-08-06T18:53:17.162881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-06T05:10:41.210993Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-06T18:53:13.287355Z","title":"A survey of temporal credit assignment in deep reinforcement learning.arXiv preprint arXiv:2312.01072, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.287355Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:ec156ff25f2a1560ea00f296bc6415806b33c0d520a4b187d30dd27d1f61359c","observation_id":"3d113656-ccc7-4533-8eef-555599ea29de","resolution":{"observed_at":"2026-08-06T18:53:13.287355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T18:53:13.385918Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.385918Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:4835a5410c0b32696b33aa77c0fd23f7ac406e9b4a6db68ae75dd4c9c8f03bb6","observation_id":"472d729b-e22a-4390-ae03-d9cb47d9f45b","resolution":{"observed_at":"2026-08-06T18:53:13.385918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:16.934683Z","title":"Sequence level training with recurrent neural networks, 2016","venue":null,"work_id":"a95c261c-8335-4d34-a232-a54dc88bedb3","year":2016},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.466582Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:d87dd25830dc7312ee8808e8d8527dc5d238abf7b66dc2a1850ab7c34324467b","observation_id":"d8d0e84f-522b-42c4-a44d-5483af15b854","resolution":{"observed_at":"2026-08-06T18:53:17.005806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T18:53:13.508181Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.508181Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:d7bab74d3cbdd28a23691570ee3d57f8a1227ab446bb673dbc90a63126045f89","observation_id":"04ff86ca-7e0c-4c22-8e62-472b22cd7c6a","resolution":{"observed_at":"2026-08-06T18:53:13.508181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T18:53:13.561109Z","title":"High-dimensional continuous control using generalized advantage estimation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.561109Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:6369b6e65b37fafc49f48bc8fa7d6d3332bc29210b03a2d176c94d657f40949b","observation_id":"8be6ceca-94e6-444c-b349-47ec76ac118e","resolution":{"observed_at":"2026-08-06T18:53:13.561109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:16.762726Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning,","venue":null,"work_id":"a5e1defd-cb8e-4726-9c42-2f3001bae0e5","year":null},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.648906Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:80aa213a54c05b0e0cee23059cc4414240b890d4a9dca653a7b58920e8cba807","observation_id":"32a9bdeb-ac58-431b-a770-16c45ba907d3","resolution":{"observed_at":"2026-08-06T18:53:16.854979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:16.626293Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":"f10456bd-4603-4093-8621-3c4c198b8faa","year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.818787Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:b329c9b32b42da9b694e8b3597bca5ee62d4812ef8b8369f686ecbc76f4301e8","observation_id":"12d153fa-9aaa-46a8-8017-aa1bf075aa24","resolution":{"observed_at":"2026-08-06T18:53:16.702794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:53:13.908046Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.908046Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:ae4bac7f171a300fb39ac010d5fb250526a6fd9235137ff2e6792d13c3dcbc6e","observation_id":"b407463e-99a5-4f64-b345-a798cb0a5cf1","resolution":{"observed_at":"2026-08-06T18:53:13.908046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:13.998381Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.998381Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:cb9c5c6e496b672df0ae361043f2736edfc482b9b4e90bf108bd3321122d33b9","observation_id":"1628ed8d-f1db-4d53-8bdc-f2b7e54f2dc4","resolution":{"observed_at":"2026-08-06T18:53:13.998381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:14.057085Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.057085Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:2df69f26b5378fb7917f511d9948a8986771dc8945f7d2654bb2201fd6b1bfb9","observation_id":"20959a98-1f1f-48db-88a7-50c6fca993bd","resolution":{"observed_at":"2026-08-06T18:53:14.057085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:16.223927Z","title":"Between mdps and semi-mdps: A framework for temporal abstraction in reinforcement learning.Artificial intelligence, 112(1–2):181–211, 1999","venue":null,"work_id":"c9097913-41d4-42d2-a324-e640e59c31b9","year":1999},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.077103Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:49e46f8ce3cce2005d58d0b16717981ca4094710fee8fc447312a001d37d8808","observation_id":"f561fe24-6207-4082-83ee-b7881fc157b1","resolution":{"observed_at":"2026-08-06T18:53:16.366032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:15.968894Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning,","venue":null,"work_id":"ce330388-9dca-4c37-8a02-785d6dd86e41","year":null},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.168794Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:7d60691aafc417f66abd1b5336344b7f61672eae061f939578db7a60f05f84fb","observation_id":"adba242a-f3f7-4a2a-86bf-1beaef2e5d1e","resolution":{"observed_at":"2026-08-06T18:53:16.046672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:53:14.380943Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advancesin neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.380943Z"},"links":{"citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:c725688cab52906835a460511a0a6d31d37ba617e720aac80348cf28148d827e","observation_id":"8d1700c0-2ca1-4f5b-9e34-db0a7d90a11c","resolution":{"observed_at":"2026-08-06T18:53:14.380943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13639","last_updated":"2024-10-22T22:05:16Z","snapshot_observed_at":"2026-08-07T03:12:05.820669Z","submitted_at":"2024-10-17T15:09:03Z","title":"A Comparative Study on Reasoning Patterns of OpenAI's o1 Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13639","snapshot_observed_at":"2026-08-06T18:53:14.480574Z","title":"A comparative study on reasoning patterns of openai’s o1 model.arXiv preprint arXiv:2410.13639, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.480574Z"},"links":{"cited_paper":"/paper/2410.13639","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:25f307011e9114ce36e14ccf82f78860e73d69c968fabb06eed8f65d8b436760","observation_id":"e43dfba1-b086-4b45-ab7b-4d162700aceb","resolution":{"observed_at":"2026-08-06T18:53:14.480574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T18:53:14.618359Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.618359Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:0cff91056f8de6faa9ae41b73c2d028b4374a32b13cecaa5c61a4d35f2268f4a","observation_id":"1537cf48-c20c-4d91-8a72-da3bbe84d475","resolution":{"observed_at":"2026-08-06T18:53:14.618359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T18:53:14.726477Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.726477Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:d8a13b101534d9a3bc0e5374342a69e968bb0e445b6598d37c8203e06de0203c","observation_id":"2bcd14f6-b579-4a79-ae0e-9ebfb33ca07c","resolution":{"observed_at":"2026-08-06T18:53:14.726477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T18:53:14.864096Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.864096Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:44874790c61ad460ce5600e75eaf27256a5bbce0ac7827c08090703ea8e61cfa","observation_id":"b8755a62-5c3b-40d9-a1db-1e0eec0da0c5","resolution":{"observed_at":"2026-08-06T18:53:14.864096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-06T18:53:15.010459Z","title":"Srpo: A cross-domain implementation of large-scale reinforcement learning on llm, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:15.010459Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:321e8eef63d87c889c2fd6abda118fd1bb6af406b7d09c5d4adf2a66dacfb316","observation_id":"588b069e-cf15-4971-b6ae-7fdd8a2ffc51","resolution":{"observed_at":"2026-08-06T18:53:15.010459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-06T18:53:15.153126Z","title":"Least-to-most prompting enables complex reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:15.153126Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:84796e9c3f4fb5433f9edcaabc3bfe4a86ef0c805a7168989a91e94466eae430","observation_id":"4534fe21-53e4-4202-91e8-dbccaba797ea","resolution":{"observed_at":"2026-08-06T18:53:15.153126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-06T18:53:13.735965Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.735965Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:9b0fe883f50467f0bc96022d0145f1e6353cd83118ed446a78b20462ef670059","observation_id":"d8a66a00-6f23-4a3f-ad4f-454fd58ab2dd","resolution":{"observed_at":"2026-08-06T18:53:13.735965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-06T18:53:14.276825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.276825Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:1741cd102d470d36735b84d2fa41eaaefccca9ca1f02ed91a720e91d0f2480e4","observation_id":"41b217b6-13f5-40da-9b5e-1d3ab295520a","resolution":{"observed_at":"2026-08-06T18:53:14.276825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 18 inbound Pith citation observations for arXiv:2507.07017."}