{"as_of":"2026-08-10T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2eb3f9388ae732f6f51226bf2972c11c9298a4d795c87ca73af7ae730d21b80e","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:40:42.903751Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:53:40.869843Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:17:15.138349Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18149","snapshot_observed_at":"2026-08-06T17:53:40.869843Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-07T01:15:50.475193Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:53:40.869843Z"},"links":{"cited_paper":"/paper/2505.18149","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:97001dac09041c56d1f25f24a360804111e0fb51343967ce2b4cc5b325cd0a4e","observation_id":"fe208371-4307-450f-ae9a-f534c222f62b","resolution":{"observed_at":"2026-08-06T17:53:40.869843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18149","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18149","snapshot_observed_at":"2026-07-02T17:17:15.138349Z","title":"arXiv preprint arXiv:2505.18149 , year=","venue":null,"work_id":"a89f6715-4468-4f3b-8c89-20bd7a70195c","year":null},"citing_paper":{"arxiv_id":"2606.06906","last_updated":"2026-06-05T04:49:37Z","snapshot_observed_at":"2026-08-02T10:42:01.638389Z","submitted_at":"2026-06-05T04:49:37Z","title":"EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T22:05:00.537690Z"},"links":{"cited_paper":"/paper/2505.18149","citing_paper":"/paper/2606.06906"},"observation_digest":"sha256:659a60946b99d002c1f03b0160cd4dd0e8fa7a9a3b8fad8ec798390665b551dd","observation_id":"7b075402-bc0c-4bf8-9700-afa59a9af154","resolution":{"observed_at":"2026-07-02T17:17:15.139638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18149/citation-record","integrity":"/paper/2505.18149/integrity","json":"/paper/2505.18149/citation-record.json","paper":"/paper/2505.18149"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-08T08:43:53.657438Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-07T14:40:39.958576Z","title":"Abdin, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:39.958576Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:f3a6152b1dd455ec872bfe8d0039dabe7a268f871d1dd6ce92a9d601217c6e98","observation_id":"ce71aa4e-0dad-4bbc-9b6d-c514e9926bbf","resolution":{"observed_at":"2026-08-07T14:40:39.958576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T14:40:39.995140Z","title":"Aggarwal and S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:39.995140Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:fc0d4095e83620fd2e8f80e2a495fbd2a477ded761d939d9b8df469f6ac691e9","observation_id":"f61a9703-8231-42c3-8f5b-40a9bcd5dedf","resolution":{"observed_at":"2026-08-07T14:40:39.995140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10814","last_updated":"2025-03-13T19:03:41Z","snapshot_observed_at":"2026-08-08T22:59:01.475072Z","submitted_at":"2025-03-13T19:03:41Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10814","snapshot_observed_at":"2026-08-07T14:40:40.111091Z","title":"Bandyopadhyay, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.111091Z"},"links":{"cited_paper":"/paper/2503.10814","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:98d68a8f012dab184edb10045635a29758ddecaeb6be3f66707d32749de6c529","observation_id":"e96f47e2-f43f-4f40-8102-ccc4f2222df1","resolution":{"observed_at":"2026-08-07T14:40:40.111091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T14:40:40.208024Z","title":"Brown, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.208024Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:eb3b523e857bf37257a63d5a1f669ea88c46b105e6ab920063669cfd38667d41","observation_id":"9f62ca1a-5efa-4f2c-b642-eb3c7fba6a69","resolution":{"observed_at":"2026-08-07T14:40:40.208024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:40.297180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.297180Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:d40746e6a92bb330467459e452054016084daa924114d515fae1d6179c341ad3","observation_id":"497ae892-7eae-4ea4-a8f3-64b0ccdbb7ff","resolution":{"observed_at":"2026-08-07T14:40:40.297180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.475684Z","title":"Galambos","venue":null,"work_id":"cd1e4d37-1f42-4588-bd83-9ecb0071b82f","year":1977},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.390665Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:9339d0a91e3991a549c874c38ea6d92550aacf02c28a3d78f3cfe91b984818e8","observation_id":"ee5895d2-ec4b-4382-b62f-9901f05fa8c2","resolution":{"observed_at":"2026-08-07T14:40:44.548698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-06T11:34:00.528900Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-07T14:40:40.464981Z","title":"Gandhi, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.464981Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:de7b0fd9acc812ae92ff841f01c9abca7263fad1becc3248fcf72b82c9e28e61","observation_id":"098f2393-f22d-45e7-a763-0ae6dba4a78e","resolution":{"observed_at":"2026-08-07T14:40:40.464981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:40:40.583421Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.583421Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:5f0f8af6b6bfbb829740c453e2892bd6a1b23637fd4911cc3834d827e747f306","observation_id":"b3655294-b413-4057-a4ce-ff9bb760fd73","resolution":{"observed_at":"2026-08-07T14:40:40.583421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.338844Z","title":null,"venue":null,"work_id":"fa0a9391-44d9-45bf-8af7-d14f666eea85","year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.657963Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:73aa373cb8f1520bb8184b6da618a36ff023fe1fcb7a99f90807f6dce56ced0a","observation_id":"587aa42e-bd3f-49f0-bb65-5e8e184b92c6","resolution":{"observed_at":"2026-08-07T14:40:44.394401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16772","last_updated":"2024-06-26T15:00:04Z","snapshot_observed_at":"2026-08-10T00:32:50.707898Z","submitted_at":"2024-06-24T16:31:12Z","title":"OlympicArena Medal Ranks: Who Is the Most Intelligent AI So Far?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16772","snapshot_observed_at":"2026-08-07T14:40:40.764182Z","title":"Huang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.764182Z"},"links":{"cited_paper":"/paper/2406.16772","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:a2c2900be614210ed66b6a1afd6ac4599f8d0cd430456c6140d3d4bbe1250415","observation_id":"6891f0ac-5f4e-444b-8e7c-e08b7b453a40","resolution":{"observed_at":"2026-08-07T14:40:40.764182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09891","last_updated":"2025-01-17T00:41:44Z","snapshot_observed_at":"2026-08-07T18:09:30.057330Z","submitted_at":"2025-01-17T00:41:44Z","title":"Evolving Deeper LLM Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09891","snapshot_observed_at":"2026-08-07T14:40:40.871189Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.871189Z"},"links":{"cited_paper":"/paper/2501.09891","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:a665a7b50332da844df8fa454427f440e9a638c2b8e178bf918628cbf8c71c30","observation_id":"d20acd15-cff0-4775-bde4-9c56bb80c01b","resolution":{"observed_at":"2026-08-07T14:40:40.871189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16377","last_updated":"2024-12-07T22:50:41Z","snapshot_observed_at":"2026-08-05T11:33:45.483902Z","submitted_at":"2024-10-21T18:00:06Z","title":"A Simple Model of Inference Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16377","snapshot_observed_at":"2026-08-07T14:40:40.957595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.957595Z"},"links":{"cited_paper":"/paper/2410.16377","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:6957a595219e42117950db53baf003c1c3ef45210ee6ac76106f0818c573f0cd","observation_id":"641263f8-c8c2-4378-8ca2-b52cdcc7e3b1","resolution":{"observed_at":"2026-08-07T14:40:40.957595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14382","last_updated":"2025-02-20T09:18:53Z","snapshot_observed_at":"2026-08-07T18:02:33.909462Z","submitted_at":"2025-02-20T09:18:53Z","title":"S*: Test Time Scaling for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14382","snapshot_observed_at":"2026-08-07T14:40:41.058314Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.058314Z"},"links":{"cited_paper":"/paper/2502.14382","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:cd76b7476d48aae673e1a906072a79a57e36102c312f4b8d7d8ed266d3559cb7","observation_id":"1d51f9f6-71e7-4b35-8641-d17ab126bf7f","resolution":{"observed_at":"2026-08-07T14:40:41.058314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15771","last_updated":"2025-05-29T05:35:57Z","snapshot_observed_at":"2026-08-07T18:14:56.811692Z","submitted_at":"2025-02-16T11:05:27Z","title":"Learning to Reason from Feedback at Test-Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15771","snapshot_observed_at":"2026-08-07T14:40:41.165894Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.165894Z"},"links":{"cited_paper":"/paper/2502.15771","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:f6676bcb24186bfeca1b41ecc301e69d5a56eefd0fd4406d9d336480cec187dc","observation_id":"8affb4cb-92e0-4b06-b76c-5ca0b89c2d76","resolution":{"observed_at":"2026-08-07T14:40:41.165894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T14:40:41.276077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.276077Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:c8e98685a116d116fddeabab199e8388c4785086f234d3ad1e1cf598da199d88","observation_id":"a97404e4-6e93-4568-9269-9c9949baf107","resolution":{"observed_at":"2026-08-07T14:40:41.276077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:40:41.381868Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.381868Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:5d55e44b7cf8cbe462328f5e9cf75ee739b4e78df7ed95ea0c6f9f02ae966c0d","observation_id":"bdc76d2d-090b-4bd4-8120-59bd30323835","resolution":{"observed_at":"2026-08-07T14:40:41.381868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15028","last_updated":"2024-04-02T17:51:49Z","snapshot_observed_at":"2026-07-06T16:23:53.247204Z","submitted_at":"2023-09-26T15:57:57Z","title":"Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15028","snapshot_observed_at":"2026-08-07T14:40:41.468076Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.468076Z"},"links":{"cited_paper":"/paper/2309.15028","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:44408d832decc7fe6407de4e446db2c2e951736d7945f3e82d352a21a36ff4d9","observation_id":"58bc3bbb-01bc-402c-bb0b-67aa8298aa77","resolution":{"observed_at":"2026-08-07T14:40:41.468076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.190694Z","title":"Aime problems and solutions","venue":null,"work_id":"ce5455cd-1c1a-4050-9cb4-5f024f34ce3b","year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.544855Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:8844b8563a22015d15330dde7824454ae5a3407bf8fcb0da8eb21ba8d968d2ef","observation_id":"11de2ecb-a877-4491-bc81-8436d449d41f","resolution":{"observed_at":"2026-08-07T14:40:44.282250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:40:41.629981Z","title":"Muennighoff, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.629981Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:a6516342b6bfdc8b5a38e309d6b0a86ceb84df4111f0b5808abb241f890c83c9","observation_id":"2371bc63-b9c9-49ea-8395-18021ff9196f","resolution":{"observed_at":"2026-08-07T14:40:41.629981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.081884Z","title":"Learning to reason with llms","venue":null,"work_id":"3275abf0-38cb-4b5c-9872-96d78e634e0a","year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.696588Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:e690f2235625c94b11ebc661ec68965c25f5172701028e39c9639ecc0cf2efa8","observation_id":"7cdde967-89a1-4952-af17-1847709248f3","resolution":{"observed_at":"2026-08-07T14:40:44.139462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:41.789857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.789857Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:8e5b5f464e684678ff9ee9ec96d7fed952e1ab86ddb34f7792aa735b285da489","observation_id":"9469758e-8822-4cb0-b939-79f6c33f487d","resolution":{"observed_at":"2026-08-07T14:40:41.789857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19328","last_updated":"2025-02-26T17:19:12Z","snapshot_observed_at":"2026-08-07T17:45:32.159301Z","submitted_at":"2025-02-26T17:19:12Z","title":"Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19328","snapshot_observed_at":"2026-08-07T14:40:41.848273Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.848273Z"},"links":{"cited_paper":"/paper/2502.19328","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:9da0aacd4184f439575bb3d097bf44473b72f610dd053e9ff7754847af2a88a7","observation_id":"e8a2ba81-decd-4911-b96e-44adcf724f05","resolution":{"observed_at":"2026-08-07T14:40:41.848273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:41.916263Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.916263Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:bfc1e90588cf9d3e8fea0b656c21872401d5d5e503fa274289fc66a4a91b2f2f","observation_id":"7987d3da-ce64-422a-9779-f9d097f1d6a5","resolution":{"observed_at":"2026-08-07T14:40:41.916263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T14:40:41.981282Z","title":"Snell, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.981282Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:33879c82bef1f0319abc782ab179aaf342fcba4467a18378ce65bd514ba5dab7","observation_id":"f9deeb4e-e44e-4dc1-b3b1-4aefd34e8f02","resolution":{"observed_at":"2026-08-07T14:40:41.981282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.983085Z","title":null,"venue":null,"work_id":"bd449e92-f417-4bf0-9130-636e9fa1d3f5","year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.091107Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:320868dff5502b1a754dae20d8394fd9b900bf43c4a4bfa6791f89651e2ce434","observation_id":"6ce7f65b-9d25-468b-b1fc-5e6a28aaf0e9","resolution":{"observed_at":"2026-08-07T14:40:44.024575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02424","last_updated":"2018-10-22T13:48:32Z","snapshot_observed_at":"2026-07-06T05:13:49.420787Z","submitted_at":"2016-10-07T20:56:47Z","title":"Diverse Beam Search: Decoding Diverse Solutions from Neural Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02424","snapshot_observed_at":"2026-08-07T14:40:42.164794Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.164794Z"},"links":{"cited_paper":"/paper/1610.02424","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:95c6be853d9055f8d4c9a54d628f140b8e7036ced864c16e197ed2827b27cbf2","observation_id":"03193b64-3997-472f-b58a-fb3fda932b77","resolution":{"observed_at":"2026-08-07T14:40:42.164794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12468","last_updated":"2026-05-27T05:13:38Z","snapshot_observed_at":"2026-08-07T18:10:26.767471Z","submitted_at":"2025-02-18T02:55:48Z","title":"MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12468","snapshot_observed_at":"2026-08-07T14:40:42.231068Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.231068Z"},"links":{"cited_paper":"/paper/2502.12468","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:18a8bab43be8f386ca000919caa0a06f190931689ce7771d0740332c0f07598f","observation_id":"b3feee3c-4cff-4bec-80d7-48957c93de28","resolution":{"observed_at":"2026-08-07T14:40:42.231068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-08-09T22:51:48.255703Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-08-07T14:40:42.304124Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.304124Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:ebd3ded4a24b4b6454b59d9f861d3934606a0c93eaabcc2a3bd39c75df946ffd","observation_id":"4fc7de80-569c-4865-9f02-3751b968a9cb","resolution":{"observed_at":"2026-08-07T14:40:42.304124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16838","last_updated":"2024-11-20T17:57:26Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:45:59Z","title":"From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16838","snapshot_observed_at":"2026-08-07T14:40:42.375970Z","title":"Welleck, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.375970Z"},"links":{"cited_paper":"/paper/2406.16838","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:b53d2e9b765f4c25bfdd48ed69544afe3f5639f022dc343d336250dc95241a68","observation_id":"07e50bf0-a5c8-4ad7-ade3-bd0e2263271b","resolution":{"observed_at":"2026-08-07T14:40:42.375970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.911672Z","title":null,"venue":null,"work_id":"4ffe9c15-f721-4e1f-b033-da64b9926ce5","year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.439987Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:2cb15337733e7a9b3c2452b9f50a93cdd83484bb45366353d1d33ce8bc072297","observation_id":"b7886825-e9f0-4228-9f38-d78df43c4302","resolution":{"observed_at":"2026-08-07T14:40:43.932992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-09T04:48:29.237275Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T14:40:42.491053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.491053Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:dcb8f0e38ba7739de420dd9e378e3b9639f81c43a468d892f15d79f625d23da3","observation_id":"aab6bc26-c491-4c70-a393-298260d74354","resolution":{"observed_at":"2026-08-07T14:40:42.491053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:40:42.535646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.535646Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:27e114d506d54d57c7c856f566594e230a369f955039d01313bc025cd59cfcfb","observation_id":"67a2b27c-f669-4e92-82c5-747935fa7ec6","resolution":{"observed_at":"2026-08-07T14:40:42.535646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T14:40:42.616883Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.616883Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:6584bb2546694581a669e31fa3006b6812d83f72fd9901dc753aaaa12704ef3b","observation_id":"c2ef4477-229f-4c36-a4d9-fa1df9c27b32","resolution":{"observed_at":"2026-08-07T14:40:42.616883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04404","last_updated":"2025-02-06T08:52:43Z","snapshot_observed_at":"2026-08-09T00:20:19.377517Z","submitted_at":"2025-02-06T08:52:43Z","title":"Step Back to Leap Forward: Self-Backtracking for Boosting Reasoning of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04404","snapshot_observed_at":"2026-08-07T14:40:42.686239Z","title":"Yang, X.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.686239Z"},"links":{"cited_paper":"/paper/2502.04404","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:48115d55241978027c113f6778a59435a32f69b440ecdedf57be51d8b18f2a19","observation_id":"e2f61140-d94d-4675-ba74-4790077aeae0","resolution":{"observed_at":"2026-08-07T14:40:42.686239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-07T23:06:45.603790Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-07T14:40:42.735954Z","title":"Zhang, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.735954Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:73564705e402acb71d9250eb1c561f79752c8ae7ab566e22588c4737f902780a","observation_id":"da283fa3-a8ac-4004-b05a-2ef47b81a6e6","resolution":{"observed_at":"2026-08-07T14:40:42.735954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05510","last_updated":"2023-03-09T18:59:47Z","snapshot_observed_at":"2026-08-09T16:16:46.530132Z","submitted_at":"2023-03-09T18:59:47Z","title":"Planning with Large Language Models for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05510","snapshot_observed_at":"2026-08-07T14:40:42.814618Z","title":"relative lift","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.814618Z"},"links":{"cited_paper":"/paper/2303.05510","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:74473a4958bd97720dfd0d9cc760eb14031bd9074396c798b06eae520af61c35","observation_id":"78f0f04c-8b72-4920-9d4d-bdc76f798214","resolution":{"observed_at":"2026-08-07T14:40:42.814618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4025.24025","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.351195Z","title":"So, 22 = 4 does not divide n4 + 1for any n","venue":null,"work_id":"2a2bbc7a-5a5f-45f6-84f6-2e23b18b71f6","year":null},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.869321Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:0041ff1ac121820107f21d565ffd6e58c8df79d0771b7cb19cb51a1f15f142fb","observation_id":"6a0047ff-82ce-4a70-a95c-6fb8b39bc50b","resolution":{"observed_at":"2026-08-07T14:40:43.459387Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4846.20851","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.023153Z","title":"Find the least positive integermsuch thatm 4 + 1is divisible byp 2","venue":null,"work_id":"9c6fe70a-1d0c-438e-8d2f-80087c327a13","year":2023},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.903751Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:fee93ec8ca651b8708f7bb65b0fe850503d48d3cca60fc6dc327756b3cedad78","observation_id":"963f95f2-006d-4d81-a5fd-c4291c12c796","resolution":{"observed_at":"2026-08-07T14:40:43.110325Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T15:09:49.469387Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2505.18149."}