{"as_of":"2026-08-17T02:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f29b7e8ce3dbc9ab2d15d52c1c35600d1448735762862b157458bbe5b2e3fd9e","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:19:49.843075Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:54:17.825564Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T06:41:18.351616Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13326","snapshot_observed_at":"2026-08-06T17:54:17.825564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-15T08:55:38.744613Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":196,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.825564Z"},"links":{"cited_paper":"/paper/2505.13326","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:b1eb7b0ccd30fe62c662907f8d4531d6de601b0a2540812f81305ae2691dc1a3","observation_id":"2471e376-0d03-4be6-a93c-acc70559f058","resolution":{"observed_at":"2026-08-06T17:54:17.825564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"cited_work":{"arxiv_id":"2505.13326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13326","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking short and right over thinking long: Serving llm reasoning efficiently and accurately","venue":null,"work_id":"6272e2c8-cbe8-424b-9269-133c83454d37","year":2025},"citing_paper":{"arxiv_id":"2604.07144","last_updated":"2026-04-08T14:37:17Z","snapshot_observed_at":"2026-08-12T18:21:44.403037Z","submitted_at":"2026-04-08T14:37:17Z","title":"Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:40.021376Z"},"links":{"cited_paper":"/paper/2505.13326","citing_paper":"/paper/2604.07144"},"observation_digest":"sha256:5a09aac28809613eb4e0d6e2e9149eae9f96f10466391fa63cb07b8a9f5655c4","observation_id":"ad90210c-9f4f-420b-82a8-9e6539f914d7","resolution":{"observed_at":"2026-05-11T06:41:18.397177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13326/citation-record","integrity":"/paper/2505.13326/integrity","json":"/paper/2505.13326/citation-record.json","paper":"/paper/2505.13326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.280268Z","title":"Let’s sample step by step: Adaptive- consistency for efficient reasoning and coding with llms","venue":null,"work_id":"1f2b90a7-8412-48cb-bae2-f7c31ad2f851","year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.715046Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:c9f82ebb2eda5143c577046fcbd617677f448056d976f914918909d5b03c9bb6","observation_id":"0f6036f1-4340-4781-82e9-7874a0f87172","resolution":{"observed_at":"2026-08-15T20:19:50.284118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.719410Z","title":"A survey of monte carlo tree search methods","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.719410Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:ca348aa41512239e9777396a1dbe8c4a3039edf0c74a713c5fe4a3a1b007b88b","observation_id":"27e9bdc7-184f-4fa3-b24f-2d395805cbe5","resolution":{"observed_at":"2026-08-15T20:19:49.719410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.724393Z","title":"Are more llm calls all you need? towards the scaling properties of compound ai systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.724393Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:77083a7e3579f247347c1455ce8b79534edadf0b906fef4478dcc7a5d9f73a1d","observation_id":"5e5f27db-06f3-4c3e-b6e2-610b0c0377b2","resolution":{"observed_at":"2026-08-15T20:19:49.724393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-15T20:19:49.728028Z","title":"Towards reasoning era: A survey of long chain- of-thought for reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.728028Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:9fdd28946e139b0b7d400b71ecd6e36d2ce53caeaf7f5733ae32c648cf1d1f96","observation_id":"c1ab0503-88a9-4aba-960e-dbe7fb248f4a","resolution":{"observed_at":"2026-08-15T20:19:49.728028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.256913Z","title":"Order statistics","venue":null,"work_id":"58ada1b0-6f85-4cb7-bfa3-6ead51a64b90","year":2004},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.732109Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:ef85d5c3eda43bd12b5410dd3160bc8d1739861e159827732c4d62a6ddb7a959","observation_id":"22e78168-8a22-4f8b-ac31-6d6ef42314be","resolution":{"observed_at":"2026-08-15T20:19:50.260779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.245160Z","title":"Reasoning without self-doubt: More efficient chain-of-thought through certainty probing","venue":null,"work_id":"26191f63-1d4d-475f-bff9-4d9ec56ba778","year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.735719Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:41652fcfaf2fdf45baed08aca01b89565bd72c5b57d57a3a3f400c8ab5dd4109","observation_id":"743b175f-5c96-498b-99ba-d0b031a888e2","resolution":{"observed_at":"2026-08-15T20:19:50.249564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:19:49.739586Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.739586Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:19a31eb8b77a7a6798e41d145fe4e87952eac725f855b3a28ca6a001e3a8bf1a","observation_id":"c6ba63cb-0177-496d-b99e-b107aa9d5c09","resolution":{"observed_at":"2026-08-15T20:19:49.739586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06135","last_updated":"2023-03-30T18:28:05Z","snapshot_observed_at":"2026-08-16T15:49:08.862387Z","submitted_at":"2023-03-10T18:53:52Z","title":"Rewarding Chatbots for Real-World Engagement with Millions of Users","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06135","snapshot_observed_at":"2026-08-15T20:19:49.742844Z","title":"Rewarding chatbots for real-world engagement with millions of users","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.742844Z"},"links":{"cited_paper":"/paper/2303.06135","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:17cddcd5964a298782066aa188cfb7ee325b2dae8521e174d72a2eae413a9950","observation_id":"64fe63e3-ef57-4246-9c11-daef4aa030c6","resolution":{"observed_at":"2026-08-15T20:19:49.742844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11668","last_updated":"2023-10-21T16:02:07Z","snapshot_observed_at":"2026-08-16T14:58:58.202069Z","submitted_at":"2023-09-20T22:22:52Z","title":"Towards Effective Disambiguation for Machine Translation with Large Language Models","version":2},"cited_work":{"arxiv_id":"2309.11668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11668","snapshot_observed_at":"2026-08-15T20:19:50.123333Z","title":"Towards Effective Disambiguation for Machine Translation with Large Language Models","venue":"cs.CL","work_id":"f7530136-8c3b-4380-a577-1db1555cf5c2","year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.746323Z"},"links":{"cited_paper":"/paper/2309.11668","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:7fa36e2923b0fc57106b00d1ca002b7fcd8bee176dcb0c433ecac5a71efe0d67","observation_id":"72ba4f1f-901d-4d82-b090-e72d15a30ef1","resolution":{"observed_at":"2026-08-15T20:19:50.129149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:19:49.749869Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.749869Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:565c92a034e43996bbee4212a44cdc87282ac90b8ed0fb697d6a63100996913d","observation_id":"07e5bab0-22bb-4a10-bf40-49db42f0cf40","resolution":{"observed_at":"2026-08-15T20:19:49.749869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14520","last_updated":"2023-05-31T19:51:51Z","snapshot_observed_at":"2026-08-16T15:52:06.791166Z","submitted_at":"2023-02-28T12:23:48Z","title":"Large Language Models Are State-of-the-Art Evaluators of Translation Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14520","snapshot_observed_at":"2026-08-15T20:19:49.753339Z","title":"Large language models are state-of-the-art evaluators of translation quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.753339Z"},"links":{"cited_paper":"/paper/2302.14520","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:d825496a996b319fe1fd85609c95071b67c8c688f621b9ae90aa10f3ba629c8e","observation_id":"d57cfab4-9917-42a9-9f7b-b81f3aa88943","resolution":{"observed_at":"2026-08-15T20:19:49.753339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.756857Z","title":"Efficient memory management for large lan- guage model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.756857Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:b3f059d5293dcfa2403b66a6125b4c849a94a3425ebd14c77eb51b6c5ff87c9a","observation_id":"3aaefee5-3d37-488c-8086-5fbb63b38c07","resolution":{"observed_at":"2026-08-15T20:19:49.756857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11169","last_updated":"2025-06-16T11:37:38Z","snapshot_observed_at":"2026-08-16T12:57:59.578456Z","submitted_at":"2025-02-16T15:39:57Z","title":"CMCTS: A Constrained Monte Carlo Tree Search Framework for Mathematical Reasoning in Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11169","snapshot_observed_at":"2026-08-15T20:19:49.760152Z","title":"Leveraging constrained monte carlo tree search to generate reliable long chain-of-thought for mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.760152Z"},"links":{"cited_paper":"/paper/2502.11169","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:8b037832b076ef6b90b90635e386ab9d3bef4d96817d0a47d93265ce1fbadd09","observation_id":"2b275cb6-c4f1-4e07-8110-e4fe6640aee8","resolution":{"observed_at":"2026-08-15T20:19:49.760152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-14T11:38:51.383664Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T20:19:49.763621Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.763621Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:f6f4d7afecbda49767ef2807ec15778f203e8b62f6c6c0f375bb03b1e7218d0a","observation_id":"28770b78-1343-424f-a5b6-8e000d6717cf","resolution":{"observed_at":"2026-08-15T20:19:49.763621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.229595Z","title":"ChatGPT: Optimizing Language Models for Dialogue, 2022","venue":null,"work_id":"4ffde23d-144c-452d-9078-52fb25fd9235","year":2022},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.767277Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:44810b0d9943b72dcefe7fee7ca85e892b3d59e96a4eaa8e04e8cef852b24690","observation_id":"e289fe20-6ce0-48dc-90ba-42d96f2caf3a","resolution":{"observed_at":"2026-08-15T20:19:50.233101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:19:49.770198Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.770198Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:7038cc7a448de353ad34330ffefc7e18ae8ce9a00293debae26313d140e198ec","observation_id":"3c171614-7d3e-4df4-9954-3d61dde7723f","resolution":{"observed_at":"2026-08-15T20:19:49.770198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.217866Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":"b4adbf62-d361-4ea6-8e57-323658fbb2de","year":2024},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.773233Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:e9b457550b60e2ebd340bbbf60e61860565a24f50b7ce8ef8dd0c6afaa7a4687","observation_id":"6c3710e3-a5c2-4b97-92d8-b570591b65ed","resolution":{"observed_at":"2026-08-15T20:19:50.222952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.776309Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.776309Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:d1eacf5b86d0edad428ed2555a814df47d4b66166f478c2b86e7da6f7e7ef8e2","observation_id":"9765b6c9-19a1-4b21-b6bf-138dab5e772f","resolution":{"observed_at":"2026-08-15T20:19:49.776309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:19:49.779922Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.779922Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:c466397098abc2eb30f96ff8f18f532e4d3ae43ddfdf20840b681b1eaa49d9c3","observation_id":"79acdd19-0796-48e8-bb73-0fd281df2842","resolution":{"observed_at":"2026-08-15T20:19:49.779922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:19:49.783194Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.783194Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:251b97801489199948186641a9347d00f464a35055a07ae10d5a107e9ad4cedb","observation_id":"5c0b104c-f988-4a68-b3a8-3e59278e17e1","resolution":{"observed_at":"2026-08-15T20:19:49.783194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T20:19:49.786453Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.786453Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:2a232e7eaf73264f394d729c4440005331801eb739c807ac4350a3f2d5c711a3","observation_id":"f01d0a4e-c2bb-42c6-a93f-61c32a80e8f2","resolution":{"observed_at":"2026-08-15T20:19:49.786453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00127","last_updated":"2025-04-30T18:48:06Z","snapshot_observed_at":"2026-08-16T04:48:18.978901Z","submitted_at":"2025-04-30T18:48:06Z","title":"Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00127","snapshot_observed_at":"2026-08-15T20:19:49.790220Z","title":"Between underthinking and overthinking: An empirical study of reasoning length and correctness in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.790220Z"},"links":{"cited_paper":"/paper/2505.00127","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:ff330b098ea027d063e1c77e410b328e76aed316cb80c59085c6ba6a682e7538","observation_id":"bd8e7d10-e2bb-4b29-9f06-a3aecdca760f","resolution":{"observed_at":"2026-08-15T20:19:49.790220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-15T20:19:49.794758Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.794758Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:8830746bdfeb8cd37e55bb07aa04adaed72eca1022b172d7286495d03becf7c5","observation_id":"d63f1acf-7c0b-4a83-8d42-c24130139e5a","resolution":{"observed_at":"2026-08-15T20:19:49.794758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T20:19:49.798466Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.798466Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:42b530c10c867a7cdfe39b7fecfcc566120453ecca6f4b50255a73f8a8d08561","observation_id":"e398009c-6372-4323-94bf-a802dcf32ab6","resolution":{"observed_at":"2026-08-15T20:19:49.798466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.202241Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"47adebf7-3450-4ad4-8404-2c2f3e22af2b","year":2017},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.802383Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:3664f8cec671a49e6771ea66a0827c3702a0ff289868df3c21279bb1ad894af7","observation_id":"4138d3c1-0c7b-44f5-ab2c-902c4e0d0f8e","resolution":{"observed_at":"2026-08-15T20:19:50.205638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.191761Z","title":"Self-consistency improves chain of thought reasoning in lan- guage models","venue":null,"work_id":"ef15cfc8-2ef7-4335-ae91-80a94f8db95e","year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.806306Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:21bb36b51d156e4bd2827f564b382a6e7f93839b1b8b88aea03cb1dbcd062fc2","observation_id":"094ce05d-3394-4c98-b2bf-a5a86f21caba","resolution":{"observed_at":"2026-08-15T20:19:50.195328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.810395Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.810395Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:7e148577ac853ea84ca07963252b848f5cf84b82cf70299b0750cc0f34aa4852","observation_id":"6726a320-963a-4d0f-afd7-2f9cfec08a8c","resolution":{"observed_at":"2026-08-15T20:19:49.810395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-15T20:19:49.814230Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.814230Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:67a2aec22364d87cb1f9b53c9398fcfe69a5da7af8b0476636b09c0e1ba00244","observation_id":"8110e710-0286-4eef-8a5e-aaa6dda28426","resolution":{"observed_at":"2026-08-15T20:19:49.814230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.818103Z","title":"Dynamic early exit in reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.818103Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:894b7e15eff5e70af00a46168c5c9478c4183c027742399a4da541c7bec35557","observation_id":"aa462b4e-4f8c-4f90-81ca-9ab9841bcb02","resolution":{"observed_at":"2026-08-15T20:19:49.818103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.175462Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"c13bf38d-0276-4a9b-90de-fe7a4b0510af","year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.821610Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:55df7f2da96b26dbd815fe68829e15536963d02a2a7f4dca254971ffdce4eded","observation_id":"0e0d31ca-a2b2-4139-9fdb-7ddeaa231493","resolution":{"observed_at":"2026-08-15T20:19:50.179374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.825112Z","title":"Shorterbetter: Guiding reasoning models to find optimal inference length for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.825112Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:c457857e3c16194fd6baa3feaa2057d0aa86dff88db45c22757fedc2c3fb26c2","observation_id":"5ced0b51-21c3-4966-a83b-640d0646ac34","resolution":{"observed_at":"2026-08-15T20:19:49.825112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:50.164877Z","title":"Orca: A distributed serving system for transformer-based generative models","venue":null,"work_id":"55550f0f-b396-415b-965d-3c18c5e94c51","year":2022},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.828879Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:380c12c7dae44c354410bf6ad557444dc77a430cdb09874e394fc878b70ecce0","observation_id":"8824d208-b8ed-4e1f-a65b-3de16ae5874d","resolution":{"observed_at":"2026-08-15T20:19:50.168929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-16T01:22:08.293337Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-15T20:19:49.832498Z","title":"What, how, where, and how well? a survey on test-time scaling in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.832498Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:c7cff45ad28ba7461971371bbcafd4290dbcfbeb28435305b2c220a595cafa4e","observation_id":"05e0ec26-53b1-4ac8-a221-e5b677d4bf22","resolution":{"observed_at":"2026-08-15T20:19:49.832498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:49.835979Z","title":"Evaluating the performance of large language models on gaokao benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.835979Z"},"links":{"citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:da79f446ffbee2409ce717eb66c55e6df61f9da29bba349f11f6c876525e3bee","observation_id":"a6620c24-5ef2-4ea2-a7aa-6df91f131628","resolution":{"observed_at":"2026-08-15T20:19:49.835979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-15T20:19:49.839499Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.839499Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:e83d52a532ee23016aea27efb351e6f95166534ad5abcddcc639bfe98f43bbc5","observation_id":"b12fd042-80c6-4487-b0ac-3afb99a33325","resolution":{"observed_at":"2026-08-15T20:19:49.839499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04675","last_updated":"2024-06-14T11:40:52Z","snapshot_observed_at":"2026-08-16T15:41:32.780007Z","submitted_at":"2023-04-10T15:51:30Z","title":"Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04675","snapshot_observed_at":"2026-08-15T20:19:49.843075Z","title":"Multilingual machine translation with large language models: Empirical results and analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:49.843075Z"},"links":{"cited_paper":"/paper/2304.04675","citing_paper":"/paper/2505.13326"},"observation_digest":"sha256:7629be5f177d35b3c23d788d9cadfb0cb58f42d76893d0ebfb02758486bf28e0","observation_id":"212c5640-bad2-4790-a215-1922bfd3e1be","resolution":{"observed_at":"2026-08-15T20:19:49.843075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13326","last_updated":"2025-05-19T16:34:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:13:23.521679Z","submitted_at":"2025-05-19T16:34:56Z","title":"Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2505.13326."}