{"as_of":"2026-08-11T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16b0da11ab01e5df872e5e8e721b5b4e7201756b9c22e547df7d3b1bc7cd18e8","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:31.536924Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:54:17.890896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:03.297902Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-06T17:54:17.890896Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-10T21:22:23.649310Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.890896Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:c96bb3027bd79e3a0a7e0d4b823822f5a74687bc1812b4cfccfddba6e89f771a","observation_id":"c090e580-0bf6-4349-920f-77f28307ce44","resolution":{"observed_at":"2026-08-06T17:54:17.890896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-04T07:59:54.120284Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning.arXiv preprint arXiv:2506.05256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.23486","last_updated":"2026-07-03T18:03:08Z","snapshot_observed_at":"2026-08-09T00:53:49.879051Z","submitted_at":"2025-10-27T16:17:45Z","title":"Learning to Reason Efficiently with Discounted Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T07:59:54.120284Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2510.23486"},"observation_digest":"sha256:9028bb7a3e7df63f248c19ae3ef3d03e49640ef2c347609e533ccd5793962a8f","observation_id":"16630b78-1342-41b9-9ed6-dc4aacfcc365","resolution":{"observed_at":"2026-08-04T07:59:54.120284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2512.19995","last_updated":"2026-05-11T11:26:21Z","snapshot_observed_at":"2026-07-06T22:39:52.837578Z","submitted_at":"2025-12-23T02:44:25Z","title":"Schoenfeld's Anatomy of Mathematical Reasoning by Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T20:39:34.858032Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2512.19995"},"observation_digest":"sha256:9b4fa4a80356e0fea818c3a76d98ebe3e3620242a0847704c704dd155f82b24e","observation_id":"4e8c6e8f-b5e7-42ac-8320-38c74b5bfdf1","resolution":{"observed_at":"2026-05-16T20:41:15.359772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-03T11:02:10.268276Z","title":"question_id","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.08010","last_updated":"2026-07-13T20:15:15Z","snapshot_observed_at":"2026-08-10T23:50:15.602253Z","submitted_at":"2026-01-12T21:24:45Z","title":"CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:02:10.268276Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2601.08010"},"observation_digest":"sha256:bdad28cfea00eb32d9e34a4905f03275b6933651e19ba6a1a5631bd5c2c50479","observation_id":"4200b067-bc3b-474c-96d4-a8b2e435ba8a","resolution":{"observed_at":"2026-08-03T11:02:10.268276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2601.11340","last_updated":"2026-04-15T07:21:40Z","snapshot_observed_at":"2026-08-02T05:43:35.759183Z","submitted_at":"2026-01-16T14:38:18Z","title":"Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:21:36.606855Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2601.11340"},"observation_digest":"sha256:20c2e63b6864ab1c69fd40993e2bc753361550a00b6b6f539d153afa9a710f69","observation_id":"39b95d97-b81b-4681-bedc-cdd7eba02034","resolution":{"observed_at":"2026-05-16T13:22:55.264368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-03T02:53:07.791956Z","title":"Feng Yao, Liyuan Liu, Dinghuai Zhang, Chengyu Dong, Jingbo Shang, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09591","last_updated":"2026-06-10T09:27:06Z","snapshot_observed_at":"2026-08-10T23:50:08.136145Z","submitted_at":"2026-02-10T09:45:42Z","title":"On the Optimal Reasoning Length for RL-Trained Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:07.791956Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2602.09591"},"observation_digest":"sha256:8ba58c386228c59ad5a5d6f215b6ad0c7d844ea290e38c97587833ac9ff99b8b","observation_id":"713381ab-65ec-40bf-a8ce-7c0fa3ade253","resolution":{"observed_at":"2026-08-03T02:53:07.791956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2602.09953","last_updated":"2026-04-17T15:42:08Z","snapshot_observed_at":"2026-08-03T00:49:45.538658Z","submitted_at":"2026-02-10T16:40:22Z","title":"ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T02:44:18.723713Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2602.09953"},"observation_digest":"sha256:b3ac4a5b7d5e4835285e13a9831f1af831bbf481669ae533bfbc12460f7405d9","observation_id":"a4a96d6c-7bae-4897-91f2-4885d260985a","resolution":{"observed_at":"2026-05-16T02:47:10.890611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2603.08659","last_updated":"2026-04-06T09:23:11Z","snapshot_observed_at":"2026-08-03T00:34:34.031576Z","submitted_at":"2026-03-09T17:37:15Z","title":"CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T14:23:00.793443Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2603.08659"},"observation_digest":"sha256:a28edf4278aa39e6430916e17e7386693ee9253f7d5cc7d59938c0da4fef9c62","observation_id":"886e77fa-05e3-4eae-8cca-de6899a4bc07","resolution":{"observed_at":"2026-05-15T14:25:55.461203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-07T10:42:27.644514Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:9a49d84fe78258ffef51577816413338e185c58277fa4c745eda14437a178725","observation_id":"84601f54-4850-4575-a90c-73210dcff0f1","resolution":{"observed_at":"2026-05-12T09:31:26.152468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-02T15:28:13.138448Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T15:28:13.138448Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:1fb9ebf46815374959c787c83b4d89dc095859147b9e87ea6e462a0d52c92030","observation_id":"344b53f1-e67c-445a-b1a3-61e04d7501c6","resolution":{"observed_at":"2026-08-02T15:28:13.138448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-09T11:43:52.076241Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":227,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:c23e944886e3fce25ffd5d4ce685b303e6c35048436733838ec32840bb4885a6","observation_id":"724ea3d7-2db4-4f6c-b903-a7e256621619","resolution":{"observed_at":"2026-05-11T17:26:04.968571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.08441","last_updated":"2026-05-08T20:03:19Z","snapshot_observed_at":"2026-08-02T05:33:25.541249Z","submitted_at":"2026-05-08T20:03:19Z","title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:11.065744Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.08441"},"observation_digest":"sha256:1faa5ddd87507bf1ecb86cb22c7ed1165fa38f9f19253ad71f91852c149124b3","observation_id":"0933af8a-9e79-4afc-921b-197b5fea19cc","resolution":{"observed_at":"2026-05-12T07:46:28.454063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.09806","last_updated":"2026-05-10T23:05:02Z","snapshot_observed_at":"2026-07-06T23:21:49.499951Z","submitted_at":"2026-05-10T23:05:02Z","title":"LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:42.407934Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.09806"},"observation_digest":"sha256:7adcce71f419635cbc2cc1371e941b925b3ea8f273d32283ce831f3c43f0278a","observation_id":"df06833a-2720-4f97-a639-0fa242ebb1a6","resolution":{"observed_at":"2026-05-12T02:31:16.760115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.19358","last_updated":"2026-05-19T04:41:51Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T04:41:51Z","title":"Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-20T06:40:06.103206Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.19358"},"observation_digest":"sha256:21f34dcbad5fbf0ed3809cf1b31bf6ebc9cc2313b7559b13dcf7b5c03ceb93cf","observation_id":"deecccc9-3022-4352-bddd-5df8ab3f24d5","resolution":{"observed_at":"2026-05-20T06:43:05.955153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.22211","last_updated":"2026-05-21T09:16:27Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:16:27Z","title":"CLORE: Content-Level Optimization for Reasoning Efficiency","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:23.111591Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.22211"},"observation_digest":"sha256:833f52302d1b887ef16a2df98706800d58e8851c22e8bafa06a34a400d3ccc38","observation_id":"07878212-db95-4bed-acb5-058a6488d63c","resolution":{"observed_at":"2026-05-22T05:51:08.348019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":243,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:b0357d693a38d9e3aaec2bc1016b932a32f82394fe1c226b573e176f6419c583","observation_id":"b7ff19b3-3818-4609-aad2-73facda3bc15","resolution":{"observed_at":"2026-07-01T20:56:13.590565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.03077","last_updated":"2026-06-10T06:28:18Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:09:13Z","title":"Libra: Efficient Resource Management for Agentic RL Post-Training","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:00.385932Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.03077"},"observation_digest":"sha256:ac82604b13553cc19304b3ce010c174a7313c9af7e3d59f6962687438654402c","observation_id":"bae9feb9-53fe-44eb-96f0-cc4d667df1c3","resolution":{"observed_at":"2026-07-02T02:16:27.163309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:c12dcdd794c6c012ed0eb671c265f9dff2583fb35855b18bcc8e2bdfc18e5db5","observation_id":"57c65ba3-1f45-48aa-acd3-0038a3bd3b17","resolution":{"observed_at":"2026-07-03T20:38:56.069868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-26T16:15:22.543601Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:ae372c7aabe116b7c04cf966364497961bc63b0b0b7e1daf4cd0bd22019fbad2","observation_id":"14dfd15c-1b8c-4bd1-bbbb-bea699947083","resolution":{"observed_at":"2026-07-04T05:09:36.866760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-02T10:49:07.680058Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.680058Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:5c66b8a753ab3affe0d501cd4d9e8f130c86c4a2560d893b9318073ccf092810","observation_id":"3e778285-b681-44bd-9652-4e0890b5ae65","resolution":{"observed_at":"2026-08-02T10:49:07.680058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:1dc82798333baf883dbb19aea806538941df07dbc12fe2f996789599bcd96af3","observation_id":"a8dac336-9aea-4217-932d-7a2c3366b668","resolution":{"observed_at":"2026-07-04T07:59:40.698593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-02T15:57:58.597260Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:8402a3ffd3ab399890aa25888b4f16eead9cacbf2e2be2cf62992b5a1d193f8a","observation_id":"124265fb-a462-4763-ba7b-0bd2a6e40fdf","resolution":{"observed_at":"2026-07-04T09:19:43.879965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:9d0730173cc05dc77aec4fc35db3521a5a26169920d9fdb7517fe98841afa21f","observation_id":"3742ff11-eeed-4114-8244-565d834dc2c9","resolution":{"observed_at":"2026-07-04T18:40:03.299162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:7f8ca0ac723ff0da690bd29a242f75ff333b639d3f3eb0a234e2c6713f3122fe","observation_id":"59b6edb1-7561-488e-8233-1e658a261cf1","resolution":{"observed_at":"2026-07-01T18:15:59.049118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-14T15:45:54.532529Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-14T15:45:54.532529Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:f7ad020b35f34b3e0c555570b2226e466be34975cd46bd9308fbad9cbdce4350","observation_id":"25ff8107-92f1-4eb6-a063-61c8481c02df","resolution":{"observed_at":"2026-07-14T15:45:54.532529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-02T08:06:10.856964Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T08:06:10.856964Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:9cdedce12dd1cf5b213ac79b54efd4decf7dbc54e07864ca8dbe174e4437b734","observation_id":"72a9e867-bdbe-411f-8fa7-12cecb22928b","resolution":{"observed_at":"2026-08-02T08:06:10.856964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-04T04:30:30.198277Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.198277Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:98a33beb070f239fbe9adf2379fa567c71a76555ad4373ef372b695b8520067d","observation_id":"1c6f5859-2199-4f0b-a129-13d2f68e69a2","resolution":{"observed_at":"2026-08-04T04:30:30.198277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-01T09:52:11.853588Z","title":"arXiv preprint arXiv:2506.05256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:11.853588Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:49ac2fcafd4f3f5ced830568493797500a32a6376d5b6e3c97811df1987cfca9","observation_id":"22d43118-764f-4480-89c7-77bb223199be","resolution":{"observed_at":"2026-08-01T09:52:11.853588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05256/citation-record","integrity":"/paper/2506.05256/integrity","json":"/paper/2506.05256/citation-record.json","paper":"/paper/2506.05256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:30.048003Z","title":"Xingyu Chen, Jiahao Xu, Tian Liang, Zhiwei He, Jianhui Pang, Dian Yu, Linfeng Song, Qiuzhi Liu, Mengfei Zhou, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, and Dong Yu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.048003Z"},"links":{"citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:9ab3757f3ce1ac452fb7931ded7b9620865d0ce161ac062eefa68aa9e1ab0d46","observation_id":"1c2e65a2-a26b-454f-a04d-17ba24728abd","resolution":{"observed_at":"2026-08-07T10:28:30.048003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T10:28:30.149754Z","title":"DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.149754Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:878fcd33464148b06fc0c18148618a06b418bd52d2641c0a3260773af6b2c96f","observation_id":"21756724-5271-4197-82a1-57ed4f1d5c21","resolution":{"observed_at":"2026-08-07T10:28:30.149754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:28:30.270494Z","title":"Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai, Yibo Miao, Qingxiu Dong, Lei Li, Chenghao Ma, Liang Chen, Runxin Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.270494Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:321598fbd2bb77a1e249377fe9da97f02a4c7f44c2c6d408e1c6dc2ddcc11e69","observation_id":"d7fd6e85-6f0c-4ed1-88e5-0df5bdedf482","resolution":{"observed_at":"2026-08-07T10:28:30.270494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T10:28:30.467637Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.467637Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:c2ec7e56161d5f75f860fe2d1e0bb04bac0693d253a461b3275e30a4efe3b780","observation_id":"c17b38e5-69a3-4707-bee7-f1d9912d501c","resolution":{"observed_at":"2026-08-07T10:28:30.467637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T10:28:30.568819Z","title":"Aaron Jaech, Adam Kalai, Adam Lerer, Adam Richardson, Ahmed El-Kishky, Aiden Low, Alec Helyar, Aleksander Madry, Alex Beutel, Alex Carney, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.568819Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:c4fd08d6bfda042cecb8edbf98c333cb43535db524ee351e2d02fe1333f583c7","observation_id":"506a3c43-7cb5-4e58-9910-0f3a7236edaf","resolution":{"observed_at":"2026-08-07T10:28:30.568819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T10:28:30.642928Z","title":"Yingqian Min, Zhipeng Chen, Jinhao Jiang, Jie Chen, Jia Deng, Yiwen Hu, Yiru Tang, Jiapeng Wang, Xiaoxue Cheng, Huatong Song, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.642928Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:8a6b60b9b49cc7fb2073031a1c7ae464cf0d4a3564d4da27a341a3aa5536d10d","observation_id":"6266d389-f09d-486d-90b0-605c95de981e","resolution":{"observed_at":"2026-08-07T10:28:30.642928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T10:28:30.721513Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.721513Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:16fa64ad8ad5af32b32ebbbf71728dfe031bfa850b039c2eb8008fe21cb1df2d","observation_id":"3b9d6cb8-82a1-4aef-85bd-e8ee20e8affa","resolution":{"observed_at":"2026-08-07T10:28:30.721513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:28:30.799790Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.799790Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:11009a26c7c6f3ad7f5bdbac06d1a7c3b1c8b5320d66e057c6d27b2355962c59","observation_id":"fc219677-9c0c-4254-ba77-9456d1e1314d","resolution":{"observed_at":"2026-08-07T10:28:30.799790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T10:28:30.901007Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.901007Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:105dbc58f206d6fb4e8172775517ee759c6a180c87bbf9a9019a371e1623e267","observation_id":"aa4c12c2-f0d5-4d45-a420-c80e7d78f85f","resolution":{"observed_at":"2026-08-07T10:28:30.901007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T10:28:30.991793Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.991793Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:c7a95b67872f5414a2a1c170c6311b9c1c1c22181e212c38bb8b0aedc053c101","observation_id":"90f3d839-d2ed-47a8-b0f0-16b8717c79e3","resolution":{"observed_at":"2026-08-07T10:28:30.991793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-10T17:28:59.378726Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T10:28:31.092526Z","title":"Yue Wang, Qiuzhi Liu, Jiahao Xu, Tian Liang, Xingyu Chen, Zhiwei He, Linfeng Song, Dian Yu, Juntao Li, Zhuosheng Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.092526Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:200d4c4b20c7d44299e51c9595bbfe0c3af1bc7b525743f9f47a9f108f967183","observation_id":"73b43e58-27e3-456e-afad-2512004f8b5c","resolution":{"observed_at":"2026-08-07T10:28:31.092526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-07T10:28:31.175370Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models.arXiv preprint arXiv:2408.00724,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.175370Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:46373da74147620bf431703642ff13c3208046bf7c11f0604d7b3a5574d4896e","observation_id":"49c3822b-ec35-401e-a7dc-565487c5fc36","resolution":{"observed_at":"2026-08-07T10:28:31.175370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04682","last_updated":"2025-01-08T18:42:48Z","snapshot_observed_at":"2026-08-10T21:24:31.639820Z","submitted_at":"2025-01-08T18:42:48Z","title":"Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04682","snapshot_observed_at":"2026-08-07T10:28:31.296126Z","title":"Towards system 2 reasoning in llms: Learning how to think with meta chain-of-though.arXiv preprint arXiv:2501.04682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.296126Z"},"links":{"cited_paper":"/paper/2501.04682","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:ac847adfe93db3bf91c3449d7ef65fa28ba696d9b7efa2c53f5bdb60c2a65220","observation_id":"79876e20-bc1d-4a1e-be92-fa16de0f8d84","resolution":{"observed_at":"2026-08-07T10:28:31.296126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-10T23:49:19.260833Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T10:28:31.403312Z","title":"Monte carlo tree search boosts reasoning via iterative preference learning.arXiv preprint arXiv:2405.00451,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.403312Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:8c92a85aa0bc116f497be3313b3b62df59d8febcd482f2a5874dfc66ed083ec5","observation_id":"f65d5de8-86c7-4087-8689-c8d1d2d00d61","resolution":{"observed_at":"2026-08-07T10:28:31.403312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:32.053321Z","title":"Backtracking","venue":null,"work_id":"03089200-d49e-492a-b4c0-64838ffe19b9","year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.536924Z"},"links":{"citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:85ce60f1ac30f1ab880bd6979a880189919f248d2d075a4626ed62273b7ac11a","observation_id":"58daa4dc-cb8d-4f60-915a-c311ae2b4f9c","resolution":{"observed_at":"2026-08-07T10:28:32.170425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T10:28:30.367732Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.367732Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:8a566fcbd4dce18f07968c2de3721d01947ba0fef0a0e43c773d1e34e78d737f","observation_id":"419cdef7-efd5-4303-9654-5891a7af65a2","resolution":{"observed_at":"2026-08-07T10:28:30.367732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T10:28:29.980350Z","title":"10 Arash Ahmadian, Chris Cremer, Matthias Gallé, Marzieh Fadaee, Julia Kreutzer, Olivier Pietquin, Ahmet Üstün, and Sara Hooker","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:29.980350Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:32755257048ade3779d060587832223b6237a0419705500da005caa837a777be","observation_id":"99687c21-cddc-4122-ad45-a82abd54e362","resolution":{"observed_at":"2026-08-07T10:28:29.980350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T18:31:44.300424Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 28 inbound Pith citation observations for arXiv:2506.05256."}