{"as_of":"2026-08-10T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c06e268c56355e42f11f668689335776b7db9bb6c879a9b0833b7660078954c8","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:46:44.808617Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01951/citation-record","integrity":"/paper/2507.01951/integrity","json":"/paper/2507.01951/citation-record.json","paper":"/paper/2507.01951"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:45.015136Z","title":"Accessed: 2024-12-20","venue":null,"work_id":"525ffe1c-e242-4ee0-8710-18f9194794ec","year":2024},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.756380Z"},"links":{"citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:c6de76489c13c057075649d70af5cabafda0dc31a88035eabe98adc108f37aa5","observation_id":"649a06c3-d709-49f4-8d49-07364382960c","resolution":{"observed_at":"2026-08-06T20:46:45.017812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-06T20:46:44.759235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.759235Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:aa0c9e40e967e2f4f11e27816151c5cf8c59f8155fc87a032ee2f04911d45678","observation_id":"8226f95e-f046-4cbf-919f-72c19f342603","resolution":{"observed_at":"2026-08-06T20:46:44.759235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:46:44.762329Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.762329Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:75f7b3f216d25a28cc58e3c3511030839c8312b8c66869b5a078e32a31479a06","observation_id":"ffd2d00c-1b1d-470f-a630-a5176093bc0e","resolution":{"observed_at":"2026-08-06T20:46:44.762329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-06T20:46:44.767588Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.767588Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:79a96fb9d0d2b1383ce881f135d04bfaa88ec24db6b3b7a639131a4d803316d7","observation_id":"8385cb18-d209-40df-84d9-676f3c50eba2","resolution":{"observed_at":"2026-08-06T20:46:44.767588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04925","last_updated":"2024-06-22T08:18:48Z","snapshot_observed_at":"2026-08-08T11:40:48.324237Z","submitted_at":"2024-01-10T04:37:38Z","title":"The Impact of Reasoning Step Length on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04925","snapshot_observed_at":"2026-08-06T20:46:44.770899Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.770899Z"},"links":{"cited_paper":"/paper/2401.04925","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:84e4cf9890f955537c7b0eec1ec3f18f1c20721256e61e8a3e9b9beca57f06d5","observation_id":"6cb25bc9-63f5-4393-a4bc-dee21072b0d2","resolution":{"observed_at":"2026-08-06T20:46:44.770899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:45.006917Z","title":"Accessed: 2025-02-18","venue":null,"work_id":"0bcc5cdf-daa3-42af-948c-665a1e4fec97","year":2025},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.773451Z"},"links":{"citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:b8c0058c8d07e6b7b9b0fe826cfb9b24e2d35496b8b9233eabd38f9c342bf5aa","observation_id":"351255ef-6d68-4d7a-9219-6e99ab6ba5a9","resolution":{"observed_at":"2026-08-06T20:46:45.009803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-06T20:46:44.775814Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.775814Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:f483e8e00be4b56a3ca637f1996194e92c1148ee5b5a1e39d0fb545bfe760c6c","observation_id":"960841b0-a8eb-43b4-ae90-d6e7ef6b0273","resolution":{"observed_at":"2026-08-06T20:46:44.775814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-08T18:40:06.157350Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T20:46:44.778485Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.778485Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:24de1d1076da71eb5d0934f566534f4d7b6681c84ca8fd28a129b459b717fe42","observation_id":"47967841-d013-48fe-a5c4-a9853eeb27be","resolution":{"observed_at":"2026-08-06T20:46:44.778485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T20:46:44.780934Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.780934Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:861fd9c948d1dc593c2291564d9f439069aaabc74ba03c8865d18887f71df06b","observation_id":"7ebdc463-bd03-4a77-8dc5-8396593fd947","resolution":{"observed_at":"2026-08-06T20:46:44.780934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-06T20:46:44.783885Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.783885Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:ab64f754b81c4b4a749c0162b9908970b67153fa722db90b1ae8ce7631a5d547","observation_id":"1845ae5b-eaf4-43c4-a421-8b0b14f25fd2","resolution":{"observed_at":"2026-08-06T20:46:44.783885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T20:46:44.786503Z","title":"Muennighoff, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.786503Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:7afc3266312dc0081a53efe64101caa9f685118ee11259e8a5c9f3b9a6c92b64","observation_id":"d3880fce-8e76-4f62-a8e7-1d6e0efecb7b","resolution":{"observed_at":"2026-08-06T20:46:44.786503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:44.997576Z","title":"Accessed: 2025-04-13","venue":null,"work_id":"b9b93644-2460-45ff-a26d-3c8ac79c2276","year":2025},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.789082Z"},"links":{"citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:f84f6af352853b7e74fa0cf135280631d8fba71fa0e393ebfcf5ebb095e61f2f","observation_id":"2e4d49a9-e75a-4825-9437-4a33a5296366","resolution":{"observed_at":"2026-08-06T20:46:45.001249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T20:46:44.791690Z","title":"Accessed: 2025-01-31","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.791690Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:e9e09bfd9bc88705bfe42aab71dcf1a4d4b66c761d8f1cea1526ed5130fc63a7","observation_id":"a4aead36-ea7f-4f24-8df1-5142667e29da","resolution":{"observed_at":"2026-08-06T20:46:44.791690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T20:46:44.794776Z","title":"Snell, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.794776Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:8363055e9a1f178e100394fd7569c8106293ea8de58081ffe733c906cb3263b1","observation_id":"92296b9a-402d-4b5e-8175-2c9887416d9d","resolution":{"observed_at":"2026-08-06T20:46:44.794776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11520","last_updated":"2025-02-17T07:41:27Z","snapshot_observed_at":"2026-08-07T18:13:27.518580Z","submitted_at":"2025-02-17T07:41:27Z","title":"AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11520","snapshot_observed_at":"2026-08-06T20:46:44.797312Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.797312Z"},"links":{"cited_paper":"/paper/2502.11520","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:1051703970be2bd472a8eb09bb68645c70ec7cb4ea0df14c386f27a0fdd5bb13","observation_id":"d3461d8a-0174-4f13-a6fc-b94a0a92ee26","resolution":{"observed_at":"2026-08-06T20:46:44.797312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T20:46:44.799931Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.799931Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:10e537317f68680cf27e860dd163b9fbfd1d11b19882eb4cad00ab8fa669d39b","observation_id":"f5d6b8b6-6b14-4d25-831d-644c5316d7c7","resolution":{"observed_at":"2026-08-06T20:46:44.799931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T20:46:44.802656Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.802656Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:d39ed0ab90c96cf041bd425ab1228d24723548342ad77372230dffe04e68388e","observation_id":"85042b7b-9067-4a7b-8151-9a268dc0ed74","resolution":{"observed_at":"2026-08-06T20:46:44.802656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12215","last_updated":"2025-03-03T15:29:43Z","snapshot_observed_at":"2026-08-07T18:13:29.325301Z","submitted_at":"2025-02-17T07:21:11Z","title":"Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12215","snapshot_observed_at":"2026-08-06T20:46:44.805597Z","title":"Accessed: 2024-12-23","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.805597Z"},"links":{"cited_paper":"/paper/2502.12215","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:6d3e46dec975203b9a982c3ee2cfe871079ec8b41227138ce5a04883592efef6","observation_id":"54db9098-0616-4541-9ef3-e296ed949322","resolution":{"observed_at":"2026-08-06T20:46:44.805597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-06T20:46:44.808617Z","title":"Zhang, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.808617Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:481776e7ac3d5673ace8ac40e87a5f0f60574f59172283294fc07b400a4d5621","observation_id":"b537c84a-e98d-491f-97a5-ad21595fab3e","resolution":{"observed_at":"2026-08-06T20:46:44.808617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T20:46:44.765061Z","title":"Jaech, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.765061Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:bc7ff548391f1a881d39da4e9cd6b6c5de06f26ca8f6261bb8056682ad651efa","observation_id":"efa51012-8f6d-4d4e-9668-632be0b1bbdb","resolution":{"observed_at":"2026-08-06T20:46:44.765061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T20:46:44.752442Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.752442Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:c48e29a13055f709cdeb1731631541a0033d46f6e5ab1fff4d4100d43a2b8696","observation_id":"e9214b3c-3bd2-4c2a-b98c-8965c9052472","resolution":{"observed_at":"2026-08-06T20:46:44.752442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T20:46:44.748925Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.748925Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:366ecd29b6ff6dffb5fcc100d710a7d697e760a05d2e7968971f0b84532b1392","observation_id":"b532d1d6-c398-4e00-81bd-ba0d9d30f022","resolution":{"observed_at":"2026-08-06T20:46:44.748925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T06:20:24.808659Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.01951."}