{"as_of":"2026-08-10T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67c61e910ae8c4d71277a058c14d36806fa2d537b82b9aee67bd65ed7706a22c","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:37:24.974376Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15512/citation-record","integrity":"/paper/2507.15512/integrity","json":"/paper/2507.15512/citation-record.json","paper":"/paper/2507.15512"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.848566Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.848566Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:12b0acbc5c8057b1bedf8dff28a8a4e37522afcf31f216e99434584b79211df7","observation_id":"3fb0fe32-d866-4d42-a53a-1af59abac6f5","resolution":{"observed_at":"2026-08-06T15:37:24.848566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.853986Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.853986Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:cad8a044a1e94841243114bee5bfbf0ea8c00219e92d7ed7ecceb72c43d7df46","observation_id":"1e472068-85f0-41fa-85f2-924d6c0ea33c","resolution":{"observed_at":"2026-08-06T15:37:24.853986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.856899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.856899Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:84e45429dd1716a219b4a1626e64378585959e48653d28f96285d01dac1203a0","observation_id":"06ed4b1f-d4ed-4cc3-b07b-41f36c918a98","resolution":{"observed_at":"2026-08-06T15:37:24.856899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T15:37:24.860769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.860769Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:7b2cdc632fb030c587a762ae0fba9068a393f89d994bdd45c95d43e698b9608c","observation_id":"00d2d16e-e232-4f97-b42b-9ff633586a45","resolution":{"observed_at":"2026-08-06T15:37:24.860769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01077","last_updated":"2024-12-02T08:47:24Z","snapshot_observed_at":"2026-08-10T06:26:21.375070Z","submitted_at":"2024-04-01T12:19:08Z","title":"Efficient Prompting Methods for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01077","snapshot_observed_at":"2026-08-06T15:37:24.863525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.863525Z"},"links":{"cited_paper":"/paper/2404.01077","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:5a2fce546556e6080ace15098657d684daa6a959e1de8fffd7042465ddd2b914","observation_id":"0888cbf8-91aa-4517-a4cf-70e55c111605","resolution":{"observed_at":"2026-08-06T15:37:24.863525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-06T15:37:24.865956Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.865956Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:552f5744615ae11ffd1bc1b722ac3d900c5e2d1446638bafd7f652aa0cfe0616","observation_id":"fec87c8d-ba97-4723-9c28-e1dca317d7b0","resolution":{"observed_at":"2026-08-06T15:37:24.865956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T15:37:24.869021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.869021Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6179303d395dd388260c38ed8a62b6a5251aa9b5c2727fa3c68699654f511178","observation_id":"387a8b27-0780-4018-8b0b-d7d4ae9d039c","resolution":{"observed_at":"2026-08-06T15:37:24.869021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:37:24.872325Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.872325Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:7a30885513af63efefb2d554a8c8f0a8e18e189a4232eb98879b1bcb187c863f","observation_id":"cf468863-344c-42fa-8c3d-fbdcf602386d","resolution":{"observed_at":"2026-08-06T15:37:24.872325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16235","last_updated":"2025-02-27T06:39:06Z","snapshot_observed_at":"2026-08-07T17:56:27.359357Z","submitted_at":"2025-02-22T14:13:37Z","title":"Dynamic Parallel Tree Search for Efficient LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16235","snapshot_observed_at":"2026-08-06T15:37:24.874870Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.874870Z"},"links":{"cited_paper":"/paper/2502.16235","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:0ef3c0425b69a9bb6926e5e0317775d5c596b5907514b9354989fe0b9b86f197","observation_id":"bf547cc7-471a-431c-a0fa-dd6c01112d2b","resolution":{"observed_at":"2026-08-06T15:37:24.874870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.284899Z","title":null,"venue":null,"work_id":"95474d55-30ed-4d57-8fc2-43a58c48cace","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.877196Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:d9545e7f21fd3016262518fecb198abac5f4d295de2eefa4dc80206ee953493d","observation_id":"b919a394-ae99-48ee-a1d0-fda14ca763de","resolution":{"observed_at":"2026-08-06T15:37:25.287141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-06T15:37:24.879489Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.879489Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6e1924805268761e1a814df1d4192436aea5a961a86f9fbce535c5b3c589a205","observation_id":"79fffff3-dc27-4602-9fb6-b8e1030a7516","resolution":{"observed_at":"2026-08-06T15:37:24.879489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:37:24.882178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.882178Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:ff570ba8032349efc9d21c911cede46ad4dc09ac6f810bc823cc097d904dd415","observation_id":"8794fd29-cfe3-42de-8b6e-43d1c798a70c","resolution":{"observed_at":"2026-08-06T15:37:24.882178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T15:37:24.884204Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.884204Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:389e030a0a5610ed470929e990b06b3351cae8c696f2063298dd06095eb894d9","observation_id":"fd5cbf11-bbb8-4adf-9c00-05a41dab1f82","resolution":{"observed_at":"2026-08-06T15:37:24.884204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.278372Z","title":null,"venue":null,"work_id":"9206ffd1-406d-4eeb-9648-f0d70b77769d","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.886512Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:f663e2fb5befa399ab101ce5ca9b567ed9c2929b538bdb137765b7d94dfd466d","observation_id":"270f58dd-1586-44d9-b353-99dc74c54396","resolution":{"observed_at":"2026-08-06T15:37:25.280708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02497","last_updated":"2025-06-29T06:49:52Z","snapshot_observed_at":"2026-08-08T16:04:18.962646Z","submitted_at":"2025-01-05T10:24:20Z","title":"A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02497","snapshot_observed_at":"2026-08-06T15:37:24.888836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.888836Z"},"links":{"cited_paper":"/paper/2501.02497","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:bd7fc0125724fec5eb824244c448acc727f7e2832bd484e8dbed6621fd74c8f3","observation_id":"32281b08-23e6-4e8c-8a35-9f3f0d922fae","resolution":{"observed_at":"2026-08-06T15:37:24.888836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16265","last_updated":"2024-06-26T14:01:15Z","snapshot_observed_at":"2026-08-01T16:15:24.164308Z","submitted_at":"2024-05-25T15:07:33Z","title":"MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16265","snapshot_observed_at":"2026-08-06T15:37:24.891071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.891071Z"},"links":{"cited_paper":"/paper/2405.16265","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:370d26e2ee20de4f59cc490988bc96b8ba914a70c0315a81cdbe55f6fa09aa46","observation_id":"1f219167-10ac-4d6a-82cf-37dfdece25e0","resolution":{"observed_at":"2026-08-06T15:37:24.891071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T15:37:24.893285Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.893285Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:e86a9c89a92949c261a6ff1c614775fdc134761a9fc89ec3df9e8779f6a2d634","observation_id":"122bc742-36ce-4876-a508-ca2ceaf498f3","resolution":{"observed_at":"2026-08-06T15:37:24.893285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.895591Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.895591Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:82a58e382e1b48de3cc1f905a58f26b559dedadf26e70e0ab68db60782da9145","observation_id":"cd30e8d6-b71f-4d93-9b37-cce2ecf9e573","resolution":{"observed_at":"2026-08-06T15:37:24.895591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T15:37:24.897708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.897708Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:7ba6014a99e420adac5afba82c1a4b2242a2f8e651317bee048e04cfd8295218","observation_id":"25fa7974-b8ca-4780-b4e5-9fc7d7d2fc39","resolution":{"observed_at":"2026-08-06T15:37:24.897708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.900251Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.900251Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:b0af977d9a609d84b26889aca6219d86df2f5a476b313119fa8711b89c66e62a","observation_id":"93694884-1d37-48aa-9d6c-fe9a1fb6f47f","resolution":{"observed_at":"2026-08-06T15:37:24.900251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.264136Z","title":null,"venue":null,"work_id":"12c11958-c88c-4b51-9dcb-8905e3f4582b","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.902306Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:c70b78593ace98c86ea64e66c60d2a07786223900f841acebb2e96e7e2a09160","observation_id":"94a41992-67de-4659-88cf-986d501d1dac","resolution":{"observed_at":"2026-08-06T15:37:25.266832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.257820Z","title":null,"venue":null,"work_id":"cd7b190e-89ef-49f6-9bd8-3327e68b97bb","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.904368Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:5e5403484b78e958502bd4ed688577eb16603bc8003408f233d7e9126e56d454","observation_id":"7d89afc0-0d57-4e87-8861-e1e16611743d","resolution":{"observed_at":"2026-08-06T15:37:25.259854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.251198Z","title":null,"venue":null,"work_id":"9e52ee13-e14b-4d82-922a-3db7a121d51c","year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.906307Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:04618a0a4526d114458ffd9fb717e3610e98b3994a3a6eba564c04b86c9d6ffe","observation_id":"0dc4419a-3029-4923-8ceb-d323da4ce8fe","resolution":{"observed_at":"2026-08-06T15:37:25.253476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.244561Z","title":null,"venue":null,"work_id":"0ba294b1-969b-49fd-a515-fd644f44cef5","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.908421Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:313180f40e6b7fdaa44e38da2360ddc2824d98b933284fe189fe15cc2828fa56","observation_id":"8f289958-4208-4114-9432-419e4611a362","resolution":{"observed_at":"2026-08-06T15:37:25.246885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T15:37:24.910293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.910293Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:4d69bab68f6d77071823e3e96d5c0adc6abf22847b5e7ba5e76633674071d48b","observation_id":"af9f2b31-e30b-4a7a-8262-590c58eb3025","resolution":{"observed_at":"2026-08-06T15:37:24.910293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.238628Z","title":null,"venue":null,"work_id":"00ce604d-9bda-4953-8344-96505cbc2125","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.912448Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:827f80e1ae9e0543a624086b2a029d5d3f4f776d8f78ed40c717e8cdcc9282ca","observation_id":"de22a193-3e29-4776-8967-80c4c52146bb","resolution":{"observed_at":"2026-08-06T15:37:25.240689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.231445Z","title":null,"venue":null,"work_id":"63bf6e3b-efb1-4fad-ac28-a6d1d6e04f1a","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.914826Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:b3b8ccaa162a1bbf676be0267cb90a21bca82a179454a9d9a8e6bd6349853395","observation_id":"54efe568-fdcf-4759-b2bb-ba8298b473d7","resolution":{"observed_at":"2026-08-06T15:37:25.233762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15645","last_updated":"2025-06-01T08:26:17Z","snapshot_observed_at":"2026-08-08T15:04:42.383367Z","submitted_at":"2024-11-23T20:31:58Z","title":"MC-NEST: Enhancing Mathematical Reasoning in Large Language Models leveraging a Monte Carlo Self-Refine Tree","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15645","snapshot_observed_at":"2026-08-06T15:37:24.916693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.916693Z"},"links":{"cited_paper":"/paper/2411.15645","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:68c5a9f45e67d4b708c6627af9a2318344c14edc1007c19b6230d02ccf0b218e","observation_id":"3d9c8bdf-a42b-4db3-b90f-a95684e72fd2","resolution":{"observed_at":"2026-08-06T15:37:24.916693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.919131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.919131Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:5028f4afb67276d660a1155a469ae87148e445f4a25c338dca7176fb97b5ac3b","observation_id":"ded48cee-0d04-43ff-beca-400b55807270","resolution":{"observed_at":"2026-08-06T15:37:24.919131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.221661Z","title":null,"venue":null,"work_id":"60d9eec2-789c-4ea6-a740-407d8e8a2987","year":2020},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.921365Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:9abb0aa1e2a880caf4c2fb37038637fc2cdab73d7b9d90025f0b69ce6145c510","observation_id":"8fc70004-692f-4544-9468-1df91cef1faf","resolution":{"observed_at":"2026-08-06T15:37:25.223708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:37:24.923893Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.923893Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:a9f1d87286f560528362ac7a9b29440f10343757d2c897138067ed00184512cc","observation_id":"56eda410-0fa7-473f-936f-6e655336c53b","resolution":{"observed_at":"2026-08-06T15:37:24.923893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T15:37:24.925962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.925962Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:7082f1b9d17bf9a08235ba3b9274441c1817f4c632a0b3c906fc80c87affa58b","observation_id":"255745b6-cfa4-4de7-8ab4-231be8d982ba","resolution":{"observed_at":"2026-08-06T15:37:24.925962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-07T08:05:38.374743Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-06T15:37:24.928392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.928392Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:cb54200ef1d4650d499b8e06577fff344c491e651ccfe3f076304409a8a11f58","observation_id":"cf571c63-c71a-4caa-946a-eea22154689b","resolution":{"observed_at":"2026-08-06T15:37:24.928392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T15:37:24.930558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.930558Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6f7b3a9f8311433eb3e4fb0cc23b56880f08f69a6526ce1ed0188fd4e36d9ff8","observation_id":"31c72ada-d685-449e-8af8-0f8c0db39c97","resolution":{"observed_at":"2026-08-06T15:37:24.930558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T15:37:24.932824Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.932824Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:776d7cb4ee4f803ccc222ce3c95c17c50492c538e8518fa844ecd07878381b37","observation_id":"942872f9-e760-4cfb-8a5f-5c709f276273","resolution":{"observed_at":"2026-08-06T15:37:24.932824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.215410Z","title":null,"venue":null,"work_id":"0c548533-5d81-45db-9017-383a01386aec","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.934824Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:8ceb6180a824b8835d2a32db716b33cbbd4c1843b1ca6452d39181a31b578ffe","observation_id":"fe7517a8-eff5-442b-81c5-822196e81a48","resolution":{"observed_at":"2026-08-06T15:37:25.217484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-08T14:45:36.681932Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-06T15:37:24.936924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.936924Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:5d001603da62004d8474bfe815486db0ab8511690aecfcdfe10afc24a240d97f","observation_id":"3ea2de8a-6282-446c-b3c8-dcb133f67084","resolution":{"observed_at":"2026-08-06T15:37:24.936924Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T15:37:24.939339Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.939339Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:ed5bae03bbfb1e9a77f4409d724c0e184c9c34b03c205f083106db9dc75a6451","observation_id":"c1d1a203-5b25-4b88-83ee-0776460c306d","resolution":{"observed_at":"2026-08-06T15:37:24.939339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.209059Z","title":"Le, Ed H","venue":null,"work_id":"7225664b-6c5b-4bd4-99f5-238c847900b6","year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.941418Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:f2513a569ed794d74337e906eb80302a37158cb5e4fe28ed5cf9cb5214ca906b","observation_id":"15a8f3ad-d36f-491d-b35c-69e2c695b8dd","resolution":{"observed_at":"2026-08-06T15:37:25.211239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.943275Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.943275Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:e75aa660b80a0a9d6ffe88462cba59ac60e172ed1e08327078a4d38426e0e0b3","observation_id":"01f4e93f-2cbf-4427-8840-5990a60af7c4","resolution":{"observed_at":"2026-08-06T15:37:24.943275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-06T15:37:24.945481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.945481Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:0163954184df8595861697ac9fb36ccfaeb7fcc59dfe01f1a050e013993da9df","observation_id":"079a00e7-b7f0-40a1-8453-95ada4905eb1","resolution":{"observed_at":"2026-08-06T15:37:24.945481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.198060Z","title":null,"venue":null,"work_id":"e3215772-d739-4ef8-9434-2fee8cafe568","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.947418Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:06f1a956a24506f7eb89a57dabe0dcfb8cca0fb94f48cd3e6f45e1e0d69bf620","observation_id":"888b3b45-63a5-4bf8-a25e-c57afb5d0ea5","resolution":{"observed_at":"2026-08-06T15:37:25.200649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09223","last_updated":"2025-06-15T13:24:11Z","snapshot_observed_at":"2026-08-10T03:15:09.599502Z","submitted_at":"2025-01-16T01:03:56Z","title":"Foundations of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09223","snapshot_observed_at":"2026-08-06T15:37:24.949552Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.949552Z"},"links":{"cited_paper":"/paper/2501.09223","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:b91958f77ed4a8f21933522b4d228a677a85f5f7518d04cc5ffbe826f4c8f8a0","observation_id":"47daccca-fc97-4a3f-a989-a7a8b31a624a","resolution":{"observed_at":"2026-08-06T15:37:24.949552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T15:37:24.951647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.951647Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:c697101b331444dc8593ec0635ac5b1343b2a1acf014c113134bde1b57f7a474","observation_id":"663df73f-68df-4176-9922-391a9287f81a","resolution":{"observed_at":"2026-08-06T15:37:24.951647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.191927Z","title":null,"venue":null,"work_id":"7e6a765d-fd73-46c2-aa7b-bdcc33ad46d1","year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.953990Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:0f7c13be142387ea6929f296e5733f4a4fc45675f9cde705eee554e0ad97dd28","observation_id":"a27e4034-1814-4d89-afa5-11b468fa5a14","resolution":{"observed_at":"2026-08-06T15:37:25.193983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T15:37:24.955844Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.955844Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:64cc8d13324f8acd7ba5b284fda03196471bacf5750812395fd291423c9441a7","observation_id":"40a8dd28-cd25-4b90-86d0-9a9856adc807","resolution":{"observed_at":"2026-08-06T15:37:24.955844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-06T15:37:24.957990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.957990Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:b31ed13bf2cda456f95d8c17aed6b4fa543d06cf0c809d4fcae993028fa39524","observation_id":"a1ecf1ba-7fac-4019-a561-0bda22fb1dce","resolution":{"observed_at":"2026-08-06T15:37:24.957990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.185604Z","title":null,"venue":null,"work_id":"073a68f8-70ee-42fc-a127-7f2bc2dc06a3","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.960189Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:3d7b7d6d397e51c0841aae21376c12027a895470620814a975db4927f1b77aff","observation_id":"98a9c10f-eba1-46ef-b98e-3ff54639620e","resolution":{"observed_at":"2026-08-06T15:37:25.187756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.178190Z","title":null,"venue":null,"work_id":"1095546b-f716-477a-bb79-34a4035d4dc8","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.962130Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:0ec919faa94e406e1b4b5513d987d3d4e90659002c1f559178b72a23a77826ee","observation_id":"1bfd7f65-1aeb-45a8-a77f-4127ea42aed0","resolution":{"observed_at":"2026-08-06T15:37:25.181254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-07T23:06:45.603790Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-06T15:37:24.964766Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.964766Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6420698d558a7c912adea345e62faf7c72d64a1374befc71f3df2cfd45e21afe","observation_id":"109efe03-ab17-4f2a-b832-038edf186e46","resolution":{"observed_at":"2026-08-06T15:37:24.964766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17140","last_updated":"2024-06-06T03:59:24Z","snapshot_observed_at":"2026-08-09T12:17:47.402634Z","submitted_at":"2024-04-26T03:41:28Z","title":"Small Language Models Need Strong Verifiers to Self-Correct Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17140","snapshot_observed_at":"2026-08-06T15:37:24.967055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.967055Z"},"links":{"cited_paper":"/paper/2404.17140","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:f54545b4cc1ce9613f1144e8a696c2d4d0c6296a2e638aa8159ced98b4dae2f0","observation_id":"8f21145a-2da8-4827-b183-28c5bb86f8d7","resolution":{"observed_at":"2026-08-06T15:37:24.967055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-06T15:37:24.969856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.969856Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:ca5f7ca47fc3468333a1264f26f3c2120ebd18341d98e2957b1f122816fb0b7d","observation_id":"d07800da-c014-48f5-a681-d6d9f3143dd2","resolution":{"observed_at":"2026-08-06T15:37:24.969856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14405","last_updated":"2024-11-25T17:57:55Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:37:33Z","title":"Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14405","snapshot_observed_at":"2026-08-06T15:37:24.972019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.972019Z"},"links":{"cited_paper":"/paper/2411.14405","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:e8601655341a53439e6e39a2d810501957e3a89dfcfd0aa35fcab0a56cccc2ef","observation_id":"afad08a3-61b1-4782-8c08-1af9a7c37026","resolution":{"observed_at":"2026-08-06T15:37:24.972019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15817","last_updated":"2025-06-09T21:22:15Z","snapshot_observed_at":"2026-08-07T23:33:11.410147Z","submitted_at":"2025-05-21T17:59:54Z","title":"Learning to Reason via Mixture-of-Thought for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15817","snapshot_observed_at":"2026-08-06T15:37:24.974376Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.974376Z"},"links":{"cited_paper":"/paper/2505.15817","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:1f49648b8b2cf861757139f0e7db06a7ffafa3117e38a5560498eb443ec266b2","observation_id":"cb2dd002-b98d-4d15-a457-1b9382094597","resolution":{"observed_at":"2026-08-06T15:37:24.974376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:33:15.536065Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.15512."}