{"as_of":"2026-08-23T12:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48e1bb21fb7687aa523b75c590402187393b7296b9e096ec5bcf4d91a56edfd1","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T06:48:41.372507Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28457/citation-record","integrity":"/paper/2607.28457/integrity","json":"/paper/2607.28457/citation-record.json","paper":"/paper/2607.28457"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02076","last_updated":"2025-07-02T18:27:42Z","snapshot_observed_at":"2026-08-14T10:43:51.935390Z","submitted_at":"2025-07-02T18:27:42Z","title":"Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02076","snapshot_observed_at":"2026-07-31T06:48:41.240335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.240335Z"},"links":{"cited_paper":"/paper/2507.02076","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:77288d05c73277c2d0d2585f252f207f72f96fa58f778bd0c751aa491d20f484","observation_id":"a825b8a0-ae52-4f03-be07-a13e398d6c2e","resolution":{"observed_at":"2026-07-31T06:48:41.240335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.244491Z","title":null,"venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.244491Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:a05b204c61e54f91281fe0f9abd00633a82f85549a4a5e6fc646aeb27975f4d4","observation_id":"1866da13-62ae-419f-8316-fa105773e787","resolution":{"observed_at":"2026-07-31T06:48:41.244491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.247542Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.247542Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:cbc1c1e88d11a3c13294198408bb8b05eb436d238283ae4af8f1c4183e2af238","observation_id":"e9f97217-0f6e-4d72-b4da-786b3a6a79a2","resolution":{"observed_at":"2026-07-31T06:48:41.247542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.250815Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.250815Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:ebf5cc52a5bdf64addc552d61cbefd0b6f7e7b189fce62a5384a2168106e2c31","observation_id":"60bf378f-42f9-4f5b-8588-235043699475","resolution":{"observed_at":"2026-07-31T06:48:41.250815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.253654Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.253654Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:d939ab6a7c7c767b5a0ffcafcdca513c610aaf0c2315c4c228155ea199c348dd","observation_id":"ba0bab8b-2f5b-4b63-a1f9-71c082b6835c","resolution":{"observed_at":"2026-07-31T06:48:41.253654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T06:48:41.256338Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.256338Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:f7e603ae8fb6df41435a159ff34d93eec0284e4b0ef76e58d757d328a0020812","observation_id":"2dc1fbba-3563-430b-8356-e8d315eb3bd6","resolution":{"observed_at":"2026-07-31T06:48:41.256338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-17T12:39:54.496393Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-07-31T06:48:41.259533Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.259533Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:5e09f20ed9e8dadcf59d4f1871bb11352cd2e08fafee29cd268ccb220b9d63bf","observation_id":"7772c9f4-63dd-41c3-879e-f713757fdd92","resolution":{"observed_at":"2026-07-31T06:48:41.259533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-20T09:26:23.689219Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07833","snapshot_observed_at":"2026-07-31T06:48:41.262444Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.262444Z"},"links":{"cited_paper":"/paper/2511.07833","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:d35b7ac35084c2371b836fb76b88657b9af9e2b69330e227d1790bae2ad7f398","observation_id":"7307b0b4-e442-4238-bc34-fa070b144c78","resolution":{"observed_at":"2026-07-31T06:48:41.262444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.265469Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.265469Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:f208f2caeeacbd918b9a21eb31a1ec427bf68c5661de92131958b8b63e2c1ec7","observation_id":"c29a4b29-bf6f-4119-bda5-724646d05362","resolution":{"observed_at":"2026-07-31T06:48:41.265469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.267928Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.267928Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:e27e84a2d344d0cac61515d7555390463cf476abeb0633580eb3c88277b839b1","observation_id":"f6597c73-e57e-46a6-8bd4-6d90be0b67a2","resolution":{"observed_at":"2026-07-31T06:48:41.267928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.270393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.270393Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:d3339d36782b15108a8e5e1140573b5608393034d558ca2411e79eda9dd52d92","observation_id":"547217c4-d886-4f21-bce1-a19450646a4b","resolution":{"observed_at":"2026-07-31T06:48:41.270393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.273153Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.273153Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:7e0bc8b8367555e7185a6d9afd284edcf9383016927d73638f0ea2651388a50d","observation_id":"a89943fd-80d0-4c0b-a257-ea385b6cc01d","resolution":{"observed_at":"2026-07-31T06:48:41.273153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.275571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.275571Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:c4b8f6d4e0bbee9626f809d8924bb054f8d44b6bbb9ed989782532341f46182f","observation_id":"99d1fe7f-29fd-43ee-af3c-a4747163b302","resolution":{"observed_at":"2026-07-31T06:48:41.275571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.278008Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.278008Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:e273d1267377f4b5b8c8def8eb4da1d484879c553d15af7a771576e4c131f642","observation_id":"d5dfbd5f-c099-4e32-b559-2fb2dc834d7a","resolution":{"observed_at":"2026-07-31T06:48:41.278008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.280511Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.280511Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:b55f79616cdc67d4ab91437b843f947580712b68fcdeb3adeade83e13b5c2e56","observation_id":"6dd1ccbf-491f-4809-9220-d1e08955db23","resolution":{"observed_at":"2026-07-31T06:48:41.280511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.282877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.282877Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:409627f407f29210519c6d36528d48de4b91d1160123e8ac8f1b61cf2ecb251e","observation_id":"91b87691-aeb7-4b45-aa10-3717a8b52558","resolution":{"observed_at":"2026-07-31T06:48:41.282877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.288293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.288293Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:c4cbee698eef31701d53a1f2e5e5564f0457d246cbf8cf91853dfc7949c0c6ab","observation_id":"99e235a5-2182-4e8c-9e4e-ab0c208aa240","resolution":{"observed_at":"2026-07-31T06:48:41.288293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.293988Z","title":"Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.293988Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:216898b2e046185fca93ae39e4626d56f3f778d09b0041c513adf2531a38ce6d","observation_id":"8690b733-71d7-42d6-8f5f-f3e1c0a19c52","resolution":{"observed_at":"2026-07-31T06:48:41.293988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.296469Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur-Ari, and Vedant Misra","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.296469Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:95acf72fb19cb49af604bcc095163b5da405394105469b23dabb76062078f4e7","observation_id":"931698e5-3d3b-4bf7-a4f7-17ee223f0808","resolution":{"observed_at":"2026-07-31T06:48:41.296469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.302878Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.302878Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:23a9ed4e4864943c895f89bc2664f0b92b3ee83230994244b6e99fecde474997","observation_id":"36908b5e-647a-435f-935f-0a0d4693b699","resolution":{"observed_at":"2026-07-31T06:48:41.302878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.305452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.305452Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:f23bcea4b80a9bf531389450eb03294746e3d5e9573647ac313171b8f779d5ab","observation_id":"15dc2459-51eb-4145-8da7-549ff3b58b24","resolution":{"observed_at":"2026-07-31T06:48:41.305452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T06:48:41.308067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.308067Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:5c5b5fe9dc54972b0bc692dcaf3d4f1fbbdb2ac30391fa30bf7e94c5ed604ce9","observation_id":"0642e10a-d52f-46ca-8c09-f5f437884a98","resolution":{"observed_at":"2026-07-31T06:48:41.308067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.311071Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.311071Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:3f8b3fb4a798a777e7ce1ce70d076bccff3584580e9cedd41acec615da5662a4","observation_id":"e1361378-cf90-4eeb-a66b-945b5aae723e","resolution":{"observed_at":"2026-07-31T06:48:41.311071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.314225Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.314225Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:bf63520e38153ab3c9d1090735f30356a34f0e2d8a0b08794d22cfceb1af1446","observation_id":"25a29516-b769-4f04-b7b8-94af82f3eb99","resolution":{"observed_at":"2026-07-31T06:48:41.314225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-31T06:48:41.320439Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.320439Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:013a254836b960f564d22cc855190c2f2b6a4a4950533fce52c474c40937dec8","observation_id":"b5599348-6e7e-4a5c-9cc8-0105cdfacdb6","resolution":{"observed_at":"2026-07-31T06:48:41.320439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.323528Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.323528Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:99b8262a5799c5d70346bb30c2a9ec8c6247cb7e96246eef8d855aac8fa8fa4b","observation_id":"669cfb3c-f3aa-4e79-8ee6-c4d087d527ad","resolution":{"observed_at":"2026-07-31T06:48:41.323528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.326262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.326262Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:c3426dc947c06d750c59480c5475176c125a63d7d5dc2ee0bf10e669fe445304","observation_id":"a14ef52f-9d3d-4df4-bf9c-759e86481854","resolution":{"observed_at":"2026-07-31T06:48:41.326262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23333","last_updated":"2026-08-10T13:00:06Z","snapshot_observed_at":"2026-08-16T14:48:21.656795Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23333","snapshot_observed_at":"2026-07-31T06:48:41.331963Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.331963Z"},"links":{"cited_paper":"/paper/2604.23333","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:07bb45ad652532b378ad168899ef52388941384368802414187b8d781aa828ab","observation_id":"bdca9a63-aad3-4285-995c-87118c8e3c97","resolution":{"observed_at":"2026-07-31T06:48:41.331963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.334779Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.334779Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:309439de941d07cf295dd942467de6012a90d027c0957d111765d1d16ba613a3","observation_id":"365bfda1-39b9-4cda-9048-a94ec618026c","resolution":{"observed_at":"2026-07-31T06:48:41.334779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-07-31T06:48:41.337255Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.337255Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:bf104561f304027bfd8fe1f279d5d122c19d44db4c336ddd5883becef16612b8","observation_id":"5beffa7d-7656-4943-b9ae-fb73df30609f","resolution":{"observed_at":"2026-07-31T06:48:41.337255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.339944Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.339944Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:66043dda1701dfc6d72a47050f3fe1326bb37aba26ddbbb83031e24259d83650","observation_id":"d8cb41a4-2e09-4d63-aa68-afd154732010","resolution":{"observed_at":"2026-07-31T06:48:41.339944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.01612","last_updated":"2026-07-02T02:29:33Z","snapshot_observed_at":"2026-08-18T20:04:49.596902Z","submitted_at":"2026-07-02T02:29:33Z","title":"Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.01612","snapshot_observed_at":"2026-07-31T06:48:41.342336Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.342336Z"},"links":{"cited_paper":"/paper/2607.01612","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:365018f7be47d2106b450909943d977e7d46399b263c9684b272ba96d20ea8cc","observation_id":"f15e6020-67ec-470c-be4e-24586c11e5b9","resolution":{"observed_at":"2026-07-31T06:48:41.342336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.345083Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.345083Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:94074edfa8972f4a6ad5e3e3e2d7f51220963a00a906a042e2e93fc82bb6793e","observation_id":"0e09cf6b-017e-4025-93c8-2c079fc9a959","resolution":{"observed_at":"2026-07-31T06:48:41.345083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.348222Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.348222Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:ec3b38e9876cbe054708c2e1c114679f8ce351b2c6fea774c98dfd2dd7bff419","observation_id":"2c5f91e8-3d50-4bb6-9a3a-b23ec8d8f839","resolution":{"observed_at":"2026-07-31T06:48:41.348222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-07-31T06:48:41.351015Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.351015Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:986dfb95b3c2276e808ab246d97b5187a7064c7a3a74dc06a843c6997ae8861f","observation_id":"aaed60f1-e0d4-4c17-9a79-efd6bcacb137","resolution":{"observed_at":"2026-07-31T06:48:41.351015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14853","last_updated":"2026-04-16T10:39:22Z","snapshot_observed_at":"2026-08-18T08:50:10.405688Z","submitted_at":"2026-04-16T10:39:22Z","title":"Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14853","snapshot_observed_at":"2026-07-31T06:48:41.353730Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.353730Z"},"links":{"cited_paper":"/paper/2604.14853","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:918b5155f879a8417757423055c01b38a8679f5d5593e8d55dfee832e7d4e189","observation_id":"b75c8d8c-e57a-4643-b252-50faf96d5b89","resolution":{"observed_at":"2026-07-31T06:48:41.353730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.356525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.356525Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:e8414b20d5a8bede7ccb0ee2bfd7b284f3e9a01fab8f64c67b823208846e6d48","observation_id":"3b431275-1549-4c2e-bd65-bde46ca7c758","resolution":{"observed_at":"2026-07-31T06:48:41.356525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-31T06:48:41.359063Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.359063Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:115b373f97e9804450e554c46ab85a153d329541069e627ece75d7edb26c1801","observation_id":"c16beda9-ad19-464a-9e24-01e347fc532c","resolution":{"observed_at":"2026-07-31T06:48:41.359063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.361965Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.361965Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:35800bc40bd8bf56931a6822b4ceaa627f993bfc05902d7fadd659e9e0c7ddfd","observation_id":"e6bb76ba-9a96-425b-baf0-a5a718f980af","resolution":{"observed_at":"2026-07-31T06:48:41.361965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.366260Z","title":"The maximum completion lengths used at evaluation are 800tokens for Countdown,1200for GSM8K,2048for MATH500 and AMC23,3072for AIME26 and MinervaMath, and4096for Olympiad- Bench","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.366260Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:05ca8ec59d7dfa99276ee2248176ff4ce9f2f7f4968e161e7e939a118ef406d4","observation_id":"8f988685-4a34-4678-969f-324a920868e9","resolution":{"observed_at":"2026-07-31T06:48:41.366260Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:48:41.372507Z","title":"Adaptive inference uses greedy decoding with𝛾= 0.85and 𝑇max = 10, so the observed variation primarily reflects training stochasticity rather than decoding randomness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.372507Z"},"links":{"citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:1e5608d9ccba4832bf8e1ae018d065ea9f427457c31f2fc1361186d7f1d36428","observation_id":"20ca0fa7-283b-436c-8bdf-7354f5bc85a7","resolution":{"observed_at":"2026-07-31T06:48:41.372507Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-07-31T06:48:41.285434Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.285434Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:1855552402ee4934726e296422bee302cb09e4bcb0af7cf4b19a2b394bd722c0","observation_id":"b0fb69d2-8dad-4010-a0bf-7464807a44b1","resolution":{"observed_at":"2026-07-31T06:48:41.285434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15960","last_updated":"2026-04-08T19:23:50Z","snapshot_observed_at":"2026-08-21T21:11:19.112634Z","submitted_at":"2025-05-21T19:23:45Z","title":"Efficient PRM Training Data Synthesis via Formal Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15960","snapshot_observed_at":"2026-07-31T06:48:41.290989Z","title":"CoRRabs/2505.15960 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.290989Z"},"links":{"cited_paper":"/paper/2505.15960","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:e3b820c1f5988ea33d30ee3cf134ce94dbf8f0a88fe2098fee0228c9074237ac","observation_id":"fd618804-d1ea-4a5a-a40e-50c5451a5c1d","resolution":{"observed_at":"2026-07-31T06:48:41.290989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T14:28:06.282643Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.28457."}