{"as_of":"2026-08-14T02:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6311f225879953b80c68420ee4dc78e189d9daa83b34fa094b0117eed896c58","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:38:09.669496Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:32:34.050519Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T08:16:47.988122Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20325","snapshot_observed_at":"2026-08-05T15:32:34.050519Z","title":"arXiv preprint arXiv:2505.20325 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02581","last_updated":"2026-06-18T10:35:57Z","snapshot_observed_at":"2026-08-06T21:17:50.512643Z","submitted_at":"2025-08-27T09:46:50Z","title":"Charting the Future of Scholarly Knowledge with AI: A Community Perspective","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:32:34.050519Z"},"links":{"cited_paper":"/paper/2505.20325","citing_paper":"/paper/2509.02581"},"observation_digest":"sha256:2b5b4a5465cb84e655c2cc7ac56857d764ca94717efc13043b1da974f1252469","observation_id":"15ec245d-9310-4ad4-8c1e-9028e1dee8e9","resolution":{"observed_at":"2026-08-05T15:32:34.050519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20325","snapshot_observed_at":"2026-08-04T11:17:47.380695Z","title":"Mills, Baochun Li, and Di Niu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05969","last_updated":"2026-07-19T06:24:18Z","snapshot_observed_at":"2026-08-10T15:34:13.761285Z","submitted_at":"2025-10-07T14:24:32Z","title":"Probing the Difficulty Perception Mechanism of Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:17:47.380695Z"},"links":{"cited_paper":"/paper/2505.20325","citing_paper":"/paper/2510.05969"},"observation_digest":"sha256:43f1a43ffa3d66d8c660ad14787698825962e4e2581cfbf09cdeaa67a435e597","observation_id":"844d56b7-b373-48ef-a857-ded12ee0f99f","resolution":{"observed_at":"2026-08-04T11:17:47.380695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"cited_work":{"arxiv_id":"2505.20325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20325","snapshot_observed_at":"2026-07-02T08:16:47.988122Z","title":"Guided by gut: Efficient test-time scaling with reinforced intrinsic confidence.arXiv preprint arXiv:2505.20325, 2025","venue":null,"work_id":"1192e589-ae7e-4b16-9e87-408e7dcc9b71","year":2025},"citing_paper":{"arxiv_id":"2606.05478","last_updated":"2026-06-03T21:57:05Z","snapshot_observed_at":"2026-08-06T02:03:24.426362Z","submitted_at":"2026-06-03T21:57:05Z","title":"Can We Predict The Human Preference For Text-to-Image Content Prior To Generation And Is It Even Useful To Do So?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T06:14:02.804743Z"},"links":{"cited_paper":"/paper/2505.20325","citing_paper":"/paper/2606.05478"},"observation_digest":"sha256:ea81cf321d77c801b28ce9ea82616a5936a7ba8c6198e5508e213e1fa77a23dc","observation_id":"bc13135e-6691-44a3-9540-2bc9e08097c0","resolution":{"observed_at":"2026-07-02T08:16:47.989711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20325/citation-record","integrity":"/paper/2505.20325/integrity","json":"/paper/2505.20325/citation-record.json","paper":"/paper/2505.20325"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:38:05.873523Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:05.873523Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:2687411b76a358d13ecfee1050d3050f79c7685c9f511960f7e1dc5bd7dad6cd","observation_id":"620d9cf2-c30c-4480-b918-1b33ce129e91","resolution":{"observed_at":"2026-08-07T14:38:05.873523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:12.130458Z","title":"Aime 2024, 2024","venue":null,"work_id":"8fcbcfce-3d56-4fe4-95fe-f0d1562dff37","year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:05.925251Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:b4ca32a44b22dd7257a615b2957e5062e728a267c3bdfe433ef5ea657b612e12","observation_id":"1776254f-df8f-4d91-88df-5b91a25e7582","resolution":{"observed_at":"2026-08-07T14:38:12.211214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:11.959473Z","title":"Amc 2023, 2024","venue":null,"work_id":"eca9456f-cbb8-4101-9150-89be11dd43c9","year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:05.977590Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:a2633b681f371f5de35d45ff54bf35dc85528aca609b79ba8706d65bc322a5be","observation_id":"43978ab9-3435-4f45-b887-e6ecaee39293","resolution":{"observed_at":"2026-08-07T14:38:12.073545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:38:06.056917Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.056917Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:51dea205d6431cade3e8a07e8715a1e934483cc71b6f8723a257a0f406d4c78d","observation_id":"af9197ef-2360-4ca2-9f92-a8fb13d9563d","resolution":{"observed_at":"2026-08-07T14:38:06.056917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:11.805796Z","title":"Beeching, L","venue":null,"work_id":"d09f3f41-daec-4767-ac23-1c13768dd337","year":null},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.142439Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:7f7c030ef39d604b783302ffaf13862c484173c3b104b6559a52a8d629380415","observation_id":"ede02f6e-2793-42b7-8f93-0f11b4156857","resolution":{"observed_at":"2026-08-07T14:38:11.880781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T14:38:06.243955Z","title":"Brown, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.243955Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:96df8269f0718cfce0684bb914540b664de3c740ada7ee8ce5b587382e8718f4","observation_id":"b6de529b-cb61-4b4d-ad25-7120d28bc587","resolution":{"observed_at":"2026-08-07T14:38:06.243955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T14:38:06.368130Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.368130Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:428d89a423c2875dfd496aa6f3db95128e42eb9148fabec0bcee6a23d09dc7ba","observation_id":"a2f16126-dfd9-4e77-b446-51c3ca062809","resolution":{"observed_at":"2026-08-07T14:38:06.368130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:11.648477Z","title":null,"venue":null,"work_id":"af262123-a8ab-4191-b40f-7ecac7c43e3e","year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.447995Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:b00e2263dc9a71b445f887e64d7bae43c876513d900d116b86fe3e71a6d27d0f","observation_id":"b3b13825-21a9-43d5-b2ea-ec3e2a514f09","resolution":{"observed_at":"2026-08-07T14:38:11.753855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:38:06.546725Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.546725Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:4d8c144eb0a90783734ea25475e3a38e3fdd84057f16a743a7262e852eaccb83","observation_id":"9a803f04-33f8-40ea-92ce-30a8913881d5","resolution":{"observed_at":"2026-08-07T14:38:06.546725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:11.550498Z","title":"Hendrycks, C","venue":null,"work_id":"a4ba1d36-78c4-47c2-817b-d60b5ac39962","year":2021},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.663440Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:cec834adff9c1537a9869425d66cd06b72210a3a5e9979766e0ab1accdf2642f","observation_id":"fd848a76-2d71-49c5-90a7-4add7dba8010","resolution":{"observed_at":"2026-08-07T14:38:11.591045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:06.744841Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.744841Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:4795bdd3c34331a6f1e2eb55b6970cc1451e5d7df5f62d51d2f3810640702f67","observation_id":"091945ec-7752-400b-9747-496389e0deb4","resolution":{"observed_at":"2026-08-07T14:38:06.744841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08901","last_updated":"2024-02-15T05:42:15Z","snapshot_observed_at":"2026-08-13T05:02:31.446507Z","submitted_at":"2023-12-14T13:03:13Z","title":"Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08901","snapshot_observed_at":"2026-08-07T14:38:06.836586Z","title":"Huang, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.836586Z"},"links":{"cited_paper":"/paper/2312.08901","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:45d46b88017ab7b54f22bd7d0ab748bd3c89add0919d5c3fe4b1bf5e4bc378df","observation_id":"c1c4ea3d-8a90-427e-90a0-41bd95cf66ad","resolution":{"observed_at":"2026-08-07T14:38:06.836586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02497","last_updated":"2025-06-29T06:49:52Z","snapshot_observed_at":"2026-08-11T17:28:05.787689Z","submitted_at":"2025-01-05T10:24:20Z","title":"A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02497","snapshot_observed_at":"2026-08-07T14:38:06.844783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.844783Z"},"links":{"cited_paper":"/paper/2501.02497","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:fe61e1d49b1ec1d974f7dd449dbb160bee502923070e003b3c4c696356f4fa11","observation_id":"68e15420-fe97-4a1a-a2a9-2b751259aa77","resolution":{"observed_at":"2026-08-07T14:38:06.844783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:11.404728Z","title":"Lightman, V","venue":null,"work_id":"59e06f0b-3d46-4054-a9f0-5ae73743f193","year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.936135Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:f67e1b84bffbab89717c19b2624e91ab124cbd42fa49dd58d8bb6b47528dd127","observation_id":"f834cc4c-2f21-4129-8a55-66cebada5555","resolution":{"observed_at":"2026-08-07T14:38:11.436050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-08T18:40:06.157350Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:38:06.969200Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.969200Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:dfcc10c6dfacde894e8a5d40fa743ec9fe275d23db74d58a505c7c5786638693","observation_id":"0c218e16-140b-455b-92f5-e2e6dc5776f2","resolution":{"observed_at":"2026-08-07T14:38:06.969200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:38:07.116566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.116566Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:4055acd8e9c1f4010faddb0bb30def02a26ee3a42d105b2a34229a508c3bf5d0","observation_id":"7e0d1284-5ed0-4a2e-b3bf-a284df2d6aa8","resolution":{"observed_at":"2026-08-07T14:38:07.116566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:11.224989Z","title":"Loshchilov and F","venue":null,"work_id":"a3b9595a-70be-40cb-a3e6-29c849cc6638","year":2017},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.291431Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:e88fcd71d3ab9e419351d6a0353c64c4bf58bd8e1bc842e633bf051e2fcaf111","observation_id":"130743de-7a1f-4339-9ac6-331caf5fedfe","resolution":{"observed_at":"2026-08-07T14:38:11.287185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:11.056752Z","title":null,"venue":null,"work_id":"ff624857-7ad1-4bd5-887a-8a9319bd5a39","year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.331385Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:5c4429f4a6627e52b5f27905bd18b5584296163e7e548ec2fdeddb683e809778","observation_id":"04ad16e2-6ad2-40bc-bd9e-e6e95281c95a","resolution":{"observed_at":"2026-08-07T14:38:11.112908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-13T04:40:53.870336Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T14:38:07.369948Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.369948Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:3168df9533d22285beb20fc462c628eff5998cbffcadae7c0f4c6b967dd730df","observation_id":"b77e8eb1-cffd-4a6e-8c4c-dc90b07f2190","resolution":{"observed_at":"2026-08-07T14:38:07.369948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:38:07.442769Z","title":"Muennighoff, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.442769Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:a42017f57922146e225bb878a706f925917a1ad7a824119ceb8c8332e12ffae8","observation_id":"7b21f4d5-fec1-46d4-9fe4-59f8646c9a14","resolution":{"observed_at":"2026-08-07T14:38:07.442769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:07.486642Z","title":"Mukherjee, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.486642Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:3d455cc933ac18404414e2b98158a0dcb076a0e1490d89f22892a88a1b7e0bcf","observation_id":"b6bcb2ce-1559-4df0-b147-bd3b38466f04","resolution":{"observed_at":"2026-08-07T14:38:07.486642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:07.552577Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.552577Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:acadcc8b4f7fbcf4d24574059dd395be8c336c485a53dc67f8705c7eadb3900f","observation_id":"152f48db-b446-4d9c-a8a7-b8d530ba88a4","resolution":{"observed_at":"2026-08-07T14:38:07.552577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:07.599879Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.599879Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:420065a068fce02499637accd58a79f3a557e676f115ceedd057bd49cbbb3731","observation_id":"84830fb7-ea87-4631-8a6b-f932f90731e4","resolution":{"observed_at":"2026-08-07T14:38:07.599879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14634","last_updated":"2025-05-25T13:19:57Z","snapshot_observed_at":"2026-08-11T22:23:22.805086Z","submitted_at":"2025-02-20T15:16:42Z","title":"CER: Confidence Enhanced Reasoning in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14634","snapshot_observed_at":"2026-08-07T14:38:07.670992Z","title":"Razghandi, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.670992Z"},"links":{"cited_paper":"/paper/2502.14634","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:79c8e810b92459d58eaec286a2abc9dc7960f21a56ae929f3af619291a5b1ef4","observation_id":"54476c1a-1a20-4f66-be78-1d2390021cb7","resolution":{"observed_at":"2026-08-07T14:38:07.670992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T14:38:07.712548Z","title":"Reimers and I","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.712548Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:339c2894b17723086e76bedc741fb055ca07a3bd0851969306f186b65a5782c3","observation_id":"ec5afd97-7704-4d95-b9e8-6994af35ee7c","resolution":{"observed_at":"2026-08-07T14:38:07.712548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:38:07.767361Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.767361Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:9604acff7b13fb08d6d176418dadcd6ccaebd2c1520be53639d20e8c3f3dbce5","observation_id":"146b9d54-b8b3-4aed-ac1b-126f16c69c34","resolution":{"observed_at":"2026-08-07T14:38:07.767361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:38:07.838485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.838485Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:136e9bc3ef6a800d77905cd1f0d5989a6e0b46b1befc7068f8f3eb8b48f6e9f3","observation_id":"d421a740-bcc8-454f-bcf0-264db62b192e","resolution":{"observed_at":"2026-08-07T14:38:07.838485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T14:38:07.878929Z","title":"Snell, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.878929Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:95008f2479465228f6295f99d31a1d79ad6f35d419256b63642bf99a15700e61","observation_id":"8ece51a7-daa5-4db2-ae73-23d767fa5cc0","resolution":{"observed_at":"2026-08-07T14:38:07.878929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:07.924312Z","title":"Taubenfeld, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.924312Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:313cd48fa5b7e0c2904a2d0da27a5b76bb1ed77c1f1fb2372f1800324a34d66f","observation_id":"676b6f88-109d-4035-9a73-331fb183a32d","resolution":{"observed_at":"2026-08-07T14:38:07.924312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:38:07.958180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:07.958180Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:462bb3a3c9237a998132a9ae58401a5bbefd6441c9c7503226e44e1134e0e593","observation_id":"90d4aa54-fef9-4c26-875d-7faf4cda9a01","resolution":{"observed_at":"2026-08-07T14:38:07.958180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-13T13:57:03.619983Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-07T14:38:08.046459Z","title":"Villalobos, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.046459Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:6386e448076ac7d20e1c16577a3628e66c4b7e232003cf6f09c7e2a363b0bc18","observation_id":"fbcb6a76-e838-4dc0-ad3a-c6b7899f51fc","resolution":{"observed_at":"2026-08-07T14:38:08.046459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:10.902424Z","title":"von Werra, Y","venue":null,"work_id":"39755673-8761-452b-9ed4-ea9877e3c892","year":2020},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.179759Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:4dde0e873e35fd70b3f28b357c34166840ff5c1fcb8634c7a564f9aab0ea2354","observation_id":"2bd75d16-8eb9-4e98-853f-418f13e659bc","resolution":{"observed_at":"2026-08-07T14:38:11.000450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17017","last_updated":"2025-02-04T03:59:49Z","snapshot_observed_at":"2026-08-12T22:54:44.565394Z","submitted_at":"2024-08-30T05:14:59Z","title":"Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17017","snapshot_observed_at":"2026-08-07T14:38:08.271853Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.271853Z"},"links":{"cited_paper":"/paper/2408.17017","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:0d93a9f4fe33945f60cdbc73743d1058f391e8419d94ea7a64ef98b9deaf175a","observation_id":"9265c321-11c5-4633-99d7-8e7d6836272b","resolution":{"observed_at":"2026-08-07T14:38:08.271853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-12T22:24:37.331657Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-07T14:38:08.302465Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.302465Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:30dc4c34c263a24b2ed044cd062a88a493ed161f8770c2e91f205ca4eb296626","observation_id":"17a1d9d0-06be-4a7e-92ef-e9794a1bc5e6","resolution":{"observed_at":"2026-08-07T14:38:08.302465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T14:38:08.379040Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.379040Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:5b61b98e6254a08689e6b89c0261de2db2acb41b1dabd0a396cf67b199726713","observation_id":"9a200362-c2cc-46b8-a892-b9921d212d6c","resolution":{"observed_at":"2026-08-07T14:38:08.379040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:08.450860Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.450860Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:2249f6a268d6d1997448f9e85b105da3624debeda9046e6c609f0b2b2ea1fa25","observation_id":"06520007-f52c-4fba-a7fc-bbb0050358ae","resolution":{"observed_at":"2026-08-07T14:38:08.450860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-13T17:25:54.385380Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-07T14:38:08.500777Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.500777Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:92bc8465013810395ee5e7084161d0cb551ccd5a9734dba5106b09c5c8fc5c47","observation_id":"303e843d-b984-4aa7-952c-3feec4d5ad60","resolution":{"observed_at":"2026-08-07T14:38:08.500777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:10.754098Z","title":null,"venue":null,"work_id":"d3c625e1-ece7-4576-9d5a-f60ebd667207","year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.572256Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:da522f68a03a76e131ea6e171f6bc4109b4b17bec3db11c507ac092c26560e38","observation_id":"f10ada30-92b5-401a-9376-3f3ec6a61296","resolution":{"observed_at":"2026-08-07T14:38:10.832963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-13T00:17:43.021579Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T14:38:08.638944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.638944Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:21fbfc3c767bbcfaff1651b4d672b9b9ddf9c8ae31e23519939ce8315395038d","observation_id":"9bf720c4-d531-484a-9cea-ec5a7b6a8677","resolution":{"observed_at":"2026-08-07T14:38:08.638944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:10.681855Z","title":"Xiong, H","venue":null,"work_id":"d63968c9-5d17-4734-9769-ff6a58342e71","year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.738098Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:96038ecaee33595c21f6ff6c7e804f5a45d0a6cded9b8da08aa26b6511078791","observation_id":"b8c10bea-96b1-464f-8913-f695876c3ad7","resolution":{"observed_at":"2026-08-07T14:38:10.708187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:38:08.830653Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.830653Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:43c56849c4d5da1a0804d4df0103e7dc6ff93284314b4df200b61160d13b935f","observation_id":"5943cc40-aedc-41fc-b156-8170db198f12","resolution":{"observed_at":"2026-08-07T14:38:08.830653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-13T17:31:32.138475Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T14:38:08.920330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.920330Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:02bb2b7275bef9442b43c7702002a555c1406ba9d88f03394108b1900597d131","observation_id":"a236f04d-547f-45fb-a062-fec848137d57","resolution":{"observed_at":"2026-08-07T14:38:08.920330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T14:38:08.997900Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:08.997900Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:55e3f1997c19be70925fd996e9fa5c4e677be031fab69f695de7b4761c692c67","observation_id":"39d684a3-7e61-4dd6-ab8d-67099c7dd967","resolution":{"observed_at":"2026-08-07T14:38:08.997900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:10.505137Z","title":"Aime 2025, 2025","venue":null,"work_id":"6c1fe69b-b375-4e19-9e40-6a7f5e48511a","year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.095172Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:dd522026731865dbfc941a30748460513b9d4801b34dac75e6cbc9a10771af23","observation_id":"fde5c451-ff86-4a5d-b62c-d125c5e5dedd","resolution":{"observed_at":"2026-08-07T14:38:10.550902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:38:09.183758Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.183758Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:5933e6c41a6b5eae26f22e9063055a61c4042cd95890f5ff67dad487fc403ce5","observation_id":"1e79e282-ae10-462a-b77d-59ed721a99a5","resolution":{"observed_at":"2026-08-07T14:38:09.183758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T14:38:09.260859Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.260859Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:1fb053fe3360b3253509ab9ef7f217b76eefbe180ed08c1baafdd0c0ac2800b4","observation_id":"8e266061-ea17-44d7-83b7-efbca2fd6506","resolution":{"observed_at":"2026-08-07T14:38:09.260859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T14:38:09.339406Z","title":"Zhang, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.339406Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:c565b4f255013e4e2ccbb5189f7632bea4bf57c4e2ce3e15fd757ef277f723eb","observation_id":"09c651a5-2afd-4e38-9050-cf023f822fa7","resolution":{"observed_at":"2026-08-07T14:38:09.339406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-11T19:29:14.663052Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-07T14:38:09.415393Z","title":"Zheng, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.415393Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:6107b6f3f292c4de84df834514b4c2a72a4a342cf4b5e8325f1b26f0f3b4ec65","observation_id":"389238e8-7248-4a42-9359-e6cc8a6a1af8","resolution":{"observed_at":"2026-08-07T14:38:09.415393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12328","last_updated":"2025-04-12T16:07:36Z","snapshot_observed_at":"2026-08-07T16:06:17.033571Z","submitted_at":"2025-04-12T16:07:36Z","title":"A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12328","snapshot_observed_at":"2026-08-07T14:38:09.508714Z","title":"Zhong, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.508714Z"},"links":{"cited_paper":"/paper/2504.12328","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:8c5c997a8e731b1df22df45294b7b3472e2244a88f01b5320bb79e3016eb9cad","observation_id":"7647961d-c5e5-4c55-a8a5-d33959af433d","resolution":{"observed_at":"2026-08-07T14:38:09.508714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-07T14:38:09.583950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.583950Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:c4a9fecd2fb64b38869e66d1108f59baa6c5847957866c46150cbb71cbe36e48","observation_id":"d1af8ecc-9c5f-4d4c-9b6a-7cede6644f4c","resolution":{"observed_at":"2026-08-07T14:38:09.583950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:10.392049Z","title":"Final Answer","venue":null,"work_id":"25351d4a-a7f3-4736-91fe-3d29685a9ebb","year":2023},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.669496Z"},"links":{"citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:3f40ba4862d532b7e280bcd81b279d381371c0aa9104790c443c71b66e911e09","observation_id":"206bae87-fb7d-44bf-9b70-6bb74186a3fd","resolution":{"observed_at":"2026-08-07T14:38:10.478152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2505.20325."}