{"as_of":"2026-08-13T14:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a66660e575dda06e1b9e3f4790efb69991da5fe1a020ec6add1a241c645ba27a","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:18:04.508009Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:45:08.292468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:19:43.881659Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:d91f5a28124940e8ba8a8913e8f09f2379471a17b49960a95a02e595fb9e93dc","observation_id":"8215d2d0-315b-4add-9aa8-a54da7b0598d","resolution":{"observed_at":"2026-05-14T01:29:57.440468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-08-06T21:45:08.292468Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23864","last_updated":"2025-06-30T13:57:28Z","snapshot_observed_at":"2026-08-11T05:35:29.875085Z","submitted_at":"2025-06-30T13:57:28Z","title":"Garbage In, Reasoning Out? Why Benchmark Scores are Unreliable and What to Do About It","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:08.292468Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2506.23864"},"observation_digest":"sha256:26cc08f22b00232a19be98772f846802d1f8596616f21970af4a7a827d48f9f1","observation_id":"e2806cf4-e1a3-4291-8d88-34263ede61be","resolution":{"observed_at":"2026-08-06T21:45:08.292468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-08-06T05:14:37.167029Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02178","last_updated":"2026-06-29T02:19:28Z","snapshot_observed_at":"2026-08-07T20:42:16.632978Z","submitted_at":"2025-08-04T08:22:14Z","title":"Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:14:37.167029Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2508.02178"},"observation_digest":"sha256:4c06fd02ea388521da63f0107f9da52ef547823981fe38c058bd40645f547091","observation_id":"1cb0dbfa-7cc7-4266-9804-628e6c489f8c","resolution":{"observed_at":"2026-08-06T05:14:37.167029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:70ff255d3691f691539ab33fb128dda2f495c33dcae3c2a55930e82001be39e9","observation_id":"6db48e9a-15f4-4c36-8b2f-f582bbe38f7d","resolution":{"observed_at":"2026-05-15T05:31:55.906712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-13T14:28:35.916911Z","title":"Learn to reason efficiently with adaptive length-based reward shaping.arXiv preprint arXiv:2505.15612, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01301","last_updated":"2026-06-09T22:21:28Z","snapshot_observed_at":"2026-08-13T11:08:33.154775Z","submitted_at":"2026-04-01T18:05:32Z","title":"Numerically Optimizing Shortcuts to Adiabaticity: A Hybrid Control Strategy","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T14:28:35.916911Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2604.01301"},"observation_digest":"sha256:f43696178befa56ba5a16b7dab68d89eaee9ed3adb314bf7b3fb27b3b58a9245","observation_id":"57e59cd1-dfe9-492f-b79f-d81a8bceeacb","resolution":{"observed_at":"2026-07-13T14:28:35.916911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.02178","last_updated":"2026-05-04T03:15:56Z","snapshot_observed_at":"2026-08-12T12:40:32.507029Z","submitted_at":"2026-05-04T03:15:56Z","title":"T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T19:36:00.359351Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.02178"},"observation_digest":"sha256:4c292fdb4297ab3d154ac98860a3053280d65f7737284acd7db7ddd357eea4e9","observation_id":"d1d3c71b-ce7b-40f6-9879-0ea2168f9d51","resolution":{"observed_at":"2026-05-09T05:45:22.135373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":244,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:ec2b9caf2335c30b3e6a101085ca70fb033e7aaba374366249547028c2900a37","observation_id":"decffc5e-5dc7-49d2-9828-01f11c1e8ba2","resolution":{"observed_at":"2026-05-11T20:06:09.969293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.07316","last_updated":"2026-05-08T06:25:08Z","snapshot_observed_at":"2026-08-11T15:38:48.653973Z","submitted_at":"2026-05-08T06:25:08Z","title":"Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:20.864362Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.07316"},"observation_digest":"sha256:e9267089bf94daf03a148eaf70c74562eb9ddb25f6646378e25e9c62357502bb","observation_id":"621aa321-98df-4cf1-8d43-93fc91d81e1d","resolution":{"observed_at":"2026-05-11T04:36:00.027949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:ac703e33e6b1a9e2eb7b077d03f9ae1d74bc5819c515ef59ad804e3c63fb90a8","observation_id":"1bd3322e-6d0f-47ed-aae6-2d7d2b22e475","resolution":{"observed_at":"2026-05-12T08:06:31.370255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:8ff4f33d2f567da2e5225aa3be89dd53a085dc86bc872ce6648ac9e8d468a30d","observation_id":"0b3bda08-724c-48d2-8257-5898f42dd122","resolution":{"observed_at":"2026-05-19T18:07:42.254204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.09806","last_updated":"2026-05-10T23:05:02Z","snapshot_observed_at":"2026-08-11T14:51:56.510873Z","submitted_at":"2026-05-10T23:05:02Z","title":"LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:42.407934Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.09806"},"observation_digest":"sha256:49f153848dd1f86167e083423f0d6c2f4cc707e6db2a1154ba4dbf9663f54311","observation_id":"0f8f4104-ab31-4fd6-a7e2-35d3b24f9e7b","resolution":{"observed_at":"2026-05-12T02:31:16.776375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.22211","last_updated":"2026-05-21T09:16:27Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:16:27Z","title":"CLORE: Content-Level Optimization for Reasoning Efficiency","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:23.111591Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.22211"},"observation_digest":"sha256:902508e209071ca68ab6ddb962b4295796a1967425f7071eab124f433b5e8f43","observation_id":"9473f81e-b1c1-4bbf-b0f4-d52050b385e9","resolution":{"observed_at":"2026-05-22T05:51:08.161581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.25604","last_updated":"2026-05-25T08:55:16Z","snapshot_observed_at":"2026-08-13T02:57:08.151274Z","submitted_at":"2026-05-25T08:55:16Z","title":"DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T21:29:31.723326Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.25604"},"observation_digest":"sha256:bb92ce36c65af2aa43e864251dc9f8edc3b20849978d0817a39fea55a5f1d833","observation_id":"5f010621-c287-4485-9c86-3830856bcd32","resolution":{"observed_at":"2026-06-29T21:33:59.250975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2605.30832","last_updated":"2026-05-29T04:37:49Z","snapshot_observed_at":"2026-07-06T23:40:03.151978Z","submitted_at":"2026-05-29T04:37:49Z","title":"SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T22:27:30.783923Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2605.30832"},"observation_digest":"sha256:d0f9cdae0e6060361b535ed5753d3138bd9878458e8de7a714569fa81ec66901","observation_id":"c6993438-c84d-4363-b3cd-d682e4cf7a33","resolution":{"observed_at":"2026-06-28T22:32:44.426841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2606.19927","last_updated":"2026-06-18T08:28:26Z","snapshot_observed_at":"2026-08-10T23:58:59.566249Z","submitted_at":"2026-06-18T08:28:26Z","title":"CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T17:56:34.203135Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2606.19927"},"observation_digest":"sha256:f0f16fd6653a9c075994940fc07046a600405aceff65d922e975c4571c0d06a6","observation_id":"d4422fa3-a96f-48cf-aaa0-9b986e39183d","resolution":{"observed_at":"2026-07-04T03:29:31.421204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-02T15:57:58.597260Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:6a74fc5ac554aed8c946a09751b30389c62e4eaaf27007d16debd8440f060b3e","observation_id":"5c542a3d-e8a9-416e-a70b-6da1d6e9e7af","resolution":{"observed_at":"2026-07-04T09:19:43.883814Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15612/citation-record","integrity":"/paper/2505.15612/integrity","json":"/paper/2505.15612/citation-record.json","paper":"/paper/2505.15612"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T15:17:59.467282Z","title":"Aggarwal and S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:59.467282Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:715530acce8795c7966f50587d2f831a63151a3b96957f5980a1ac5f86b5e2f7","observation_id":"28e84fc4-fc33-4282-ba75-0814213730e5","resolution":{"observed_at":"2026-08-07T15:17:59.467282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:59.568317Z","title":"Arora and A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:59.568317Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:5a211f9c4b7152ff1dd5e62fddc11f25b85c8f5d034761ecc0782ee5853fcd44","observation_id":"1cdb23a8-2f9d-4a88-b874-010ff7f73628","resolution":{"observed_at":"2026-08-07T15:17:59.568317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T15:17:59.667035Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:59.667035Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:3d6cdf7788145bf2714ee80b303d8ddcef35e5a51df7a984f801e73bf85a7abd","observation_id":"eee27329-6959-4997-b431-f94e55efbdc8","resolution":{"observed_at":"2026-08-07T15:17:59.667035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:17:59.798415Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:59.798415Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:2104a906297699671642cda9a64cd7c861f6b857ffc4e08bd55fc44d24ee58bc","observation_id":"ad411e10-4157-4f26-81fe-82d48ecf5652","resolution":{"observed_at":"2026-08-07T15:17:59.798415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:07.560219Z","title":"Gandhi, A","venue":null,"work_id":"35ead561-ff7f-46df-88fa-59d7fc6634a2","year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:59.894964Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:8a479536dde7adaad90a2e8a4ae8fb8344792f3cde90cc117cdc2379f06657ae","observation_id":"95b32e92-0252-450b-8771-e9bd405a767c","resolution":{"observed_at":"2026-08-07T15:18:07.683827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-07T15:18:00.003763Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.003763Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:e558c35f6babf66c29939626e68ecc5302a666261e54ebe5294670c2cf1eb530","observation_id":"3d3cf30e-68a5-4ad6-8741-267b5a3249cb","resolution":{"observed_at":"2026-08-07T15:18:00.003763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:00.102621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.102621Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:615cdaa509770651012aedebc606d7d58521bdad8d76e5225e149f52b3ff84aa","observation_id":"7b40c05d-5a62-4179-9807-fb0ab96c2062","resolution":{"observed_at":"2026-08-07T15:18:00.102621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:18:00.199909Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.199909Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:7c3171b7b9f414b2073d28185d5d685ba651c4a12a33ef67d77cbf5dd36a10b5","observation_id":"af46f05c-9118-4372-a39c-0345ca05e32a","resolution":{"observed_at":"2026-08-07T15:18:00.199909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:07.197948Z","title":"Hendrycks, C","venue":null,"work_id":"5b44f108-5ebf-4ed9-b229-16fad2098b22","year":2021},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.275045Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:e5862420b63be74a693875b9326f61fad11dd89b0d4511dd56a1e04745d0aa01","observation_id":"b241c72e-f219-4882-a4c3-24328accca6a","resolution":{"observed_at":"2026-08-07T15:18:07.412863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-08-12T17:13:46.909910Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T15:18:00.357524Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.357524Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:ec9c6a69d2de999dcf9873f7900e3caf91005c7ba627366c8e98b16631d4ee84","observation_id":"b913ec90-d3c6-4440-b6c0-178707ad69a4","resolution":{"observed_at":"2026-08-07T15:18:00.357524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T15:18:00.496831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.496831Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:d2af668a20eece2613430372aee8a62637260af42fec7c7f83c7cd9cd9fc32da","observation_id":"fd11b564-bd11-4335-97e6-3cf7d9d1af9d","resolution":{"observed_at":"2026-08-07T15:18:00.496831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:06.784865Z","title":null,"venue":null,"work_id":"8c36938d-7559-493b-a4ad-e5615c2cebc2","year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.595825Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:dfb4d2e8ab0c4c71591b833140f1f4b838dcd3f0c30e29b8d2f4774f3dc22be2","observation_id":"954cf2c1-8e1d-48fd-b239-df1e25e27ff8","resolution":{"observed_at":"2026-08-07T15:18:06.995684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T15:18:00.725959Z","title":"Muennighoff, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.725959Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:5245f4767a65b9b220bd6484778db793ad897c3af74d829de3304d05cf12c953","observation_id":"1d8b928e-392b-4957-aeb1-1c5fee32c0aa","resolution":{"observed_at":"2026-08-07T15:18:00.725959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-08T01:06:04.764010Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-07T15:18:00.832579Z","title":"Munkhbat, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.832579Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:1eaf9f3db019b890129f699a8712a5726b593000e2ec544f1869db67d940714c","observation_id":"288839eb-69ee-4030-a74f-913083a2f4e8","resolution":{"observed_at":"2026-08-07T15:18:00.832579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T15:18:00.974743Z","title":"Jaech, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:00.974743Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:351aa53e523ab81c4f6ef6e42a4367921382ca6d10ca84d0d8c1928ffad92f53","observation_id":"d730ab99-18ba-4bbf-b24a-fe68527707d4","resolution":{"observed_at":"2026-08-07T15:18:00.974743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:01.079263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.079263Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:feb056854414624c5fe67b6c22373a3e4a626fb3cbd28e89b123a94da3fe2f10","observation_id":"4c36ddf6-0e6d-4bf7-b3dd-4867468d26a6","resolution":{"observed_at":"2026-08-07T15:18:01.079263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T15:18:01.206010Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.206010Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:82d710f9b4cc3ffe03d3224722de72414c5dca2d246406b4488ecb3f983cb1b2","observation_id":"5d08d321-e896-4279-95d7-dd0755e96a78","resolution":{"observed_at":"2026-08-07T15:18:01.206010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:01.330227Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.330227Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:4429a963fd7ad9c33810942f70502664bd69bc143fa4bea21de875620ba8ac79","observation_id":"b27b57e0-8994-4bc7-874c-23c3118b2407","resolution":{"observed_at":"2026-08-07T15:18:01.330227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:18:01.437191Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.437191Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:caa8d643949d9ee9e8630af4df1144a1ad3ce770d6e9de61aaf0706e20bf1fa0","observation_id":"fcb88eb2-64be-4b8b-a1f7-82935f1ad521","resolution":{"observed_at":"2026-08-07T15:18:01.437191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:18:01.525978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.525978Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:383e6bc3e3cabef8cff45c713e3d2cfa98696374aab6c2c6e36ce588ea488024","observation_id":"35381598-08c1-420a-bc5c-2d6a5cc66f97","resolution":{"observed_at":"2026-08-07T15:18:01.525978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:18:01.639730Z","title":"Sheng, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.639730Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:58a0c239c7ca8b2ba944a6bf13291f4b73b82b0ed8414e534e9a19ab3d486768","observation_id":"fc3775df-960a-4b0a-baaf-26fe0d688ef5","resolution":{"observed_at":"2026-08-07T15:18:01.639730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24377","last_updated":"2025-03-31T17:58:07Z","snapshot_observed_at":"2026-08-12T17:17:28.011053Z","submitted_at":"2025-03-31T17:58:07Z","title":"Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24377","snapshot_observed_at":"2026-08-07T15:18:01.733588Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.733588Z"},"links":{"cited_paper":"/paper/2503.24377","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:eef82fcdd9de3c83a584aa6bb18455694273c84acae5a2a54293d57851e23c3f","observation_id":"474c8158-6c00-4b95-a7e6-e9f2fa52867b","resolution":{"observed_at":"2026-08-07T15:18:01.733588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:06.412011Z","title":null,"venue":null,"work_id":"03c60744-361b-434b-8e1e-1a0c8c917dc3","year":2022},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.847962Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:0e75538a63368d3136b65a6e8a21969acdf2350abf9a742ac471119077c0b0dc","observation_id":"2a519d24-8e85-4981-8899-c72fa7b103f2","resolution":{"observed_at":"2026-08-07T15:18:06.594553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:01.984634Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:01.984634Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:7befa55a23d1bf715c1888e94644a16946dc845f1164c68d8ca92fb0c27028e5","observation_id":"bcae8ac7-cbd8-45d8-8249-037a2be47198","resolution":{"observed_at":"2026-08-07T15:18:01.984634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:06.024108Z","title":null,"venue":null,"work_id":"eb70d898-fce3-49ad-a7da-7d60d9805abc","year":null},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:02.101816Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:7cae02966b8ba4b76073f2a3c440188b98947103f7afd0599643fb532a091299","observation_id":"515b6d5c-4d55-4420-a9a5-dfc1e798df75","resolution":{"observed_at":"2026-08-07T15:18:06.205324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:05.760284Z","title":null,"venue":null,"work_id":"c2448260-dcfe-4c5c-8655-d59dc0e11d73","year":null},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:02.267130Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:e0f251c332363e03fd1da125b64d398f46d8e89b82f202b5131dfae804624e8a","observation_id":"20148de8-f039-471e-bae1-d6fbfbd23660","resolution":{"observed_at":"2026-08-07T15:18:05.874359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:18:02.954245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:02.954245Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:bd6b6721e2be9a0280ba19273a3caef05a7d8b8aa7c82929bc6adadf6f1dd3f5","observation_id":"41384598-14da-41dc-ae07-b941ab3cd98d","resolution":{"observed_at":"2026-08-07T15:18:02.954245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T15:18:03.643174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:03.643174Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:e40771885f328dbb317de2fcaae42492521d00f1a821d56e7f16c945aedaf3eb","observation_id":"5dfbb9aa-1fd5-4817-b7d3-6c317d6bb337","resolution":{"observed_at":"2026-08-07T15:18:03.643174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:05.601106Z","title":"<think>...</think>","venue":null,"work_id":"48251aa5-092f-4768-81a9-87b0338f5a21","year":2021},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:04.240695Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:5d4a2408498f93afb394a2a634b822903b39865588b482c4bdf66ded64e8ad93","observation_id":"a01d5355-f674-45c6-923f-75fd472e93ab","resolution":{"observed_at":"2026-08-07T15:18:05.676753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:05.254692Z","title":"Wait, subtracting a negative is like adding the positive, so that would be 3 + 6, which is 9","venue":null,"work_id":"d446ac51-65f8-49f0-b084-058194dfbbbf","year":null},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:04.346749Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:0cbb2247a4c6b5d76cfd705e5ece7774902ac85138194908cba39afda8af8aad","observation_id":"577e7356-dde9-457a-becc-c5fcc438a479","resolution":{"observed_at":"2026-08-07T15:18:05.438832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:05.066190Z","title":"Calculate \\( f(-1) \\):\\[f(-1) = \\frac{3(-1) - 2}{-1 - 2} = \\frac{-3 - 2}{-3} = \\frac{-5}{-3} = \\frac{5}{3}\\]3","venue":null,"work_id":"f9b090d1-a71f-42a2-87af-1b7397dfd110","year":null},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:04.508009Z"},"links":{"citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:dac81614be5b4d604a6eb589d6be6afad34e20efddcc89ffe56fbb425be6f65c","observation_id":"01a5be31-685e-4785-a785-45382d5c0368","resolution":{"observed_at":"2026-08-07T15:18:05.150909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:18:02.183957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:02.183957Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:4fff5d69575b1e3981677befd94adbd5dc35780fab75a6a66c83c212d4c2c779","observation_id":"e37737d0-0717-4936-91d9-e1195dd1ca07","resolution":{"observed_at":"2026-08-07T15:18:02.183957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T15:18:02.380737Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:02.380737Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:17c6bdaaec36cdbb090b28aa827dadfd1a9174d9209d1c9424aa27ddd955a54b","observation_id":"a80ecce7-12be-4b1d-ab64-ae428b6d2493","resolution":{"observed_at":"2026-08-07T15:18:02.380737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 16 inbound Pith citation observations for arXiv:2505.15612."}