{"as_of":"2026-08-15T17:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d02bbacc35faef1451686eb72e86cfc736473abe3738b95f94dbec4c9ad5c4a5","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:11:46.192441Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00396/citation-record","integrity":"/paper/2506.00396/integrity","json":"/paper/2506.00396/citation-record.json","paper":"/paper/2506.00396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:41.751456Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:41.751456Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:2f588be3d10d7ebc55eb6580e23ef087c066506bbbaa810c56b28cf5483e5baa","observation_id":"f6377368-b056-412a-96ae-e14ccad40c31","resolution":{"observed_at":"2026-08-07T12:11:41.751456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:41.847455Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:41.847455Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:316c5d7532e23548d02d5faed38299950896455998feda96c190aa4343f45c65","observation_id":"33a3c908-e5a4-4da1-9430-d564e72bd382","resolution":{"observed_at":"2026-08-07T12:11:41.847455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09687","last_updated":"2024-02-06T18:00:18Z","snapshot_observed_at":"2026-08-14T12:12:36.497853Z","submitted_at":"2023-08-18T17:29:23Z","title":"Graph of Thoughts: Solving Elaborate Problems with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09687","snapshot_observed_at":"2026-08-07T12:11:42.045200Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.045200Z"},"links":{"cited_paper":"/paper/2308.09687","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:254165cc79bc971ac62844b03bf38e597c37d901902a90c5ffdb41474f81be2c","observation_id":"f4499d80-d173-495d-aa62-b5e11faf4df3","resolution":{"observed_at":"2026-08-07T12:11:42.045200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T12:11:42.178654Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.178654Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:26e8e6dc5714e541d74a6c25896d2084c18d01b425a3b497107c031d93236a2b","observation_id":"a774c6f8-9cbb-4f70-a7eb-df45b99c2156","resolution":{"observed_at":"2026-08-07T12:11:42.178654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00122","last_updated":"2022-05-07T07:52:39Z","snapshot_observed_at":"2026-08-14T14:43:58.516546Z","submitted_at":"2021-09-01T00:08:14Z","title":"FinQA: A Dataset of Numerical Reasoning over Financial Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00122","snapshot_observed_at":"2026-08-07T12:11:42.331835Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.331835Z"},"links":{"cited_paper":"/paper/2109.00122","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:f05bcb9bbabc24c2dcc8ea65b5fb06d4246475c613f8b993d00c2fc20ca66253","observation_id":"cc94f70a-b3fa-48af-abc8-c7a354fcb0f0","resolution":{"observed_at":"2026-08-07T12:11:42.331835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:11:42.497773Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.497773Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:289f30879b6ae3365e1a6227c23c6ff758f35f3110694f174fd7644a1ad01355","observation_id":"7a086ed3-0756-41da-896f-065a4a73b3f6","resolution":{"observed_at":"2026-08-07T12:11:42.497773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.755617Z","title":null,"venue":null,"work_id":"632af8d4-bd61-40c8-9d2c-85f10752873b","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.637601Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:fcc562c21c1ec3757d4f9e88e12ca6af8da67d8e863c6a78add04e2c87ffa0eb","observation_id":"95746e22-c505-4434-a73e-f0f025859af1","resolution":{"observed_at":"2026-08-07T12:11:48.912689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04254","last_updated":"2024-02-23T15:09:58Z","snapshot_observed_at":"2026-08-15T02:21:47.483048Z","submitted_at":"2023-11-07T12:30:36Z","title":"Everything of Thoughts: Defying the Law of Penrose Triangle for Thought Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04254","snapshot_observed_at":"2026-08-07T12:11:42.761281Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.761281Z"},"links":{"cited_paper":"/paper/2311.04254","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:70eec91fda5881af44fb7440032099a1926547f1b875dad0ed472d0021e304cb","observation_id":"4bb8b3b9-fc0f-4f72-a8fd-e7e244cb4162","resolution":{"observed_at":"2026-08-07T12:11:42.761281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:11:42.881590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.881590Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:db7a28dfc5316c2542cc0e1f9915a4a6a1d837ecb5bf8adfb60b3077d098feb2","observation_id":"4e2df33f-7c43-4e80-bbd8-fd38cc1f67d5","resolution":{"observed_at":"2026-08-07T12:11:42.881590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-08-15T11:39:07.998070Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T12:11:43.039389Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.039389Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:1b4ab94adbf8c21ac14c83f56c06a225e3ce18016b65642cfa0cca34f163de6e","observation_id":"188d4c1d-6f1a-4d79-a559-54be10710330","resolution":{"observed_at":"2026-08-07T12:11:43.039389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-07T12:11:43.197324Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.197324Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:fc7850680956ab13848cca9e7aab8f08be09ea8e2159859f1eaf83ba78390d87","observation_id":"75a67c94-5ce5-4074-bbb4-7174c7500b37","resolution":{"observed_at":"2026-08-07T12:11:43.197324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.435891Z","title":null,"venue":null,"work_id":"bbf3af11-a763-495c-8be4-82dbfebe9f08","year":2016},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.343195Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:ce6d21d2c92ea2cc95d414366cf1f9eefa08988fc4d5838bec66372f8fb5323e","observation_id":"bb996b5b-de16-4817-a101-d0dafa3b1dfe","resolution":{"observed_at":"2026-08-07T12:11:48.581873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-13T12:35:47.840646Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T12:11:43.508406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.508406Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:29b9ba913588fbaf8d3d8baf9d43dea6435f311d16b5dd6a705cda2e81318419","observation_id":"cd972443-e59a-40ce-b06d-3303f40eea88","resolution":{"observed_at":"2026-08-07T12:11:43.508406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.274464Z","title":null,"venue":null,"work_id":"82318fd5-aafb-4323-a5e1-4a6cd8aa408f","year":2019},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.663834Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:b8545a94c5264b60f9176143dd2ba35f895afe2b37390ebda3d264baa382b5db","observation_id":"ac6ecb87-4432-4707-b893-a0045ec5f7c2","resolution":{"observed_at":"2026-08-07T12:11:48.348430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.002821Z","title":null,"venue":null,"work_id":"0fad8f5c-d8c8-49fe-af47-5dc8464dd49e","year":2017},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.827341Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:914596e66fdcdb5c973300aaa1e51cd976062ed9374baeda15cf9f1d45ad37a2","observation_id":"62239cb0-9347-4121-8d7d-05f951a4c1c9","resolution":{"observed_at":"2026-08-07T12:11:48.144129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:11:43.975924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.975924Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:fbe37db2d523caeef09eba00760b8aee268dc86f54ff9a114688318b14ee265e","observation_id":"73869741-03f6-4365-8c9b-9dc415079e0e","resolution":{"observed_at":"2026-08-07T12:11:43.975924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.860821Z","title":null,"venue":null,"work_id":"434b5283-2af0-454f-8f3f-91f8ecc6480f","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.122879Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:2a53f11fe0be4141e18062a3d560b9ef2a6d424ce9d26ab16b193e80e64e7d87","observation_id":"4055b49f-ec1b-4352-84a0-f9ce9dd6a23b","resolution":{"observed_at":"2026-08-07T12:11:47.926136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.221997Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.221997Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:7b9530c33f8d0af54b398250c026ac02b76bbc073d9105901ccbfcf31e491a45","observation_id":"49912d8b-c8cf-4072-bdc1-e0727f766815","resolution":{"observed_at":"2026-08-07T12:11:44.221997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.370193Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.370193Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:4b1d890c93fb038114bc1a1d59c5cf8d544a3a8294ccce683b0df2d7b3bea159","observation_id":"65b26389-f98b-4547-aab2-6754cc213b0b","resolution":{"observed_at":"2026-08-07T12:11:44.370193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.689793Z","title":null,"venue":null,"work_id":"20e5d16f-19e8-4d66-89be-8fe204a8b2ff","year":1990},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.457847Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:3035e2495154bc399f233920599e61a0dc169451ae4bba14a970a45f67c030bf","observation_id":"a4790b78-16e9-45ec-bb8b-b429c0fc16df","resolution":{"observed_at":"2026-08-07T12:11:47.759436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-14T15:46:52.927758Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-07T12:11:44.548976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.548976Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:f9de6424f4f76347fbde662c5ea51a6424cb98358394a4ba8a590fd4faefcc02","observation_id":"b9aaa710-1c47-41ed-9dd1-89d68d6435ff","resolution":{"observed_at":"2026-08-07T12:11:44.548976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.662344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.662344Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:9abe8eceae0072bbef950b2d7ffa6049ab90fc616cc0459c1e2768479d5a98ac","observation_id":"fdbd1863-aabd-4658-bf01-a14a595989a2","resolution":{"observed_at":"2026-08-07T12:11:44.662344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.531384Z","title":null,"venue":null,"work_id":"ee570f09-b255-46e0-8bc6-efa29f6b1d5a","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.725755Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:ba82d7afd269b0ac900561b8f17334213648a023a83062acf9420ea58a2ada62","observation_id":"b52a0d0b-9606-428e-8a7f-0f4c3a020837","resolution":{"observed_at":"2026-08-07T12:11:47.595645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:11:44.810602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.810602Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:9e7f734996cee752f32e5b3daa95e8ca853d1cc5ce7588d1c34937bc64ac02a9","observation_id":"25ecfa1a-a068-49e0-beea-9488145e4ca5","resolution":{"observed_at":"2026-08-07T12:11:44.810602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.904533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.904533Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:76f0c130ff92a12dfa7381cfcd6dc32c66e87d0c80151a64b4a25f526534ccb4","observation_id":"54b69683-c3c1-46c1-919f-080e91e0a93d","resolution":{"observed_at":"2026-08-07T12:11:44.904533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T12:11:44.977819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.977819Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:490ca24aa64b7d86a258a00a42452db436bd71ca50f0996694934e6a3c815871","observation_id":"20b8ee25-6ca8-437f-a48c-90b04c7aca29","resolution":{"observed_at":"2026-08-07T12:11:44.977819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-15T06:52:10.057508Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-07T12:11:45.058024Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.058024Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:93095e84e0d70b3cfc5defa857ea9dfa4a95350189d95385bc206bb2d9c898c6","observation_id":"22ae8d7f-691c-417f-975f-b2e50f5f1b5c","resolution":{"observed_at":"2026-08-07T12:11:45.058024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:11:45.120617Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.120617Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:726f5b45bc1b6ef9543ef710fd0e23ae6d7f2a9ea7dbbc4092a0c7cdeec1dfd3","observation_id":"06ebea2b-a996-450d-90de-d4a4cf82c051","resolution":{"observed_at":"2026-08-07T12:11:45.120617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.231234Z","title":null,"venue":null,"work_id":"2a19ff90-3320-40c9-b380-6d53eed1418e","year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.183971Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:c5c0dce4c09479f0d1a864905f8c39c3385fe3c146465ef9f2eb3dccc4f0a51d","observation_id":"4dce3f3e-4cef-4567-9e38-923e7a5aaa63","resolution":{"observed_at":"2026-08-07T12:11:47.282226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:45.260583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.260583Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:967834dc75b6708eaec376506ac4a869717770b5a1a875fc905459ffa097fc8d","observation_id":"58fb2e04-6789-4528-ab20-838d42e59af2","resolution":{"observed_at":"2026-08-07T12:11:45.260583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T12:11:45.365323Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.365323Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:b2e3b6ddcb704817a2810f5f7ddd1de3dfcfe0126a63b670ca6a295721f1f007","observation_id":"00d41d8c-0668-40df-9829-13e3d9fee315","resolution":{"observed_at":"2026-08-07T12:11:45.365323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04398","last_updated":"2024-01-19T01:05:05Z","snapshot_observed_at":"2026-08-13T04:46:47.723640Z","submitted_at":"2024-01-09T07:46:26Z","title":"Chain-of-Table: Evolving Tables in the Reasoning Chain for Table Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04398","snapshot_observed_at":"2026-08-07T12:11:45.444335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.444335Z"},"links":{"cited_paper":"/paper/2401.04398","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:11d01e752bf3824be23169874493cabaa46db5f35e6730223bca36b8a8f79f10","observation_id":"22c6d246-76e5-403c-be61-4cca2e589cfc","resolution":{"observed_at":"2026-08-07T12:11:45.444335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:45.475544Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.475544Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:b1d3444cb90e6d939f4b9cd54351c5d2cb90f162589fd712aec047fc9881e9f6","observation_id":"c97218ba-3f3b-4c83-9e10-22a1c2722c86","resolution":{"observed_at":"2026-08-07T12:11:45.475544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:45.568213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.568213Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:fe42c370b9417ccdad43c68991b35e5ffb347365954c3c373b60d5c598d4b9e8","observation_id":"02aadac5-3a10-41c4-ab28-8da1516f555c","resolution":{"observed_at":"2026-08-07T12:11:45.568213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.039428Z","title":null,"venue":null,"work_id":"5fed5b66-1889-4d65-b0df-47f1196fbcda","year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.666401Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:fb567baea3d0d4c8c05192d10bc50eeac98d5a393e27cee763ea525c5bded5e4","observation_id":"26fa552f-2b33-4684-9e9a-661ef3c1d765","resolution":{"observed_at":"2026-08-07T12:11:47.096342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T12:11:45.751564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.751564Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:4ab9c9a585eeeb3f4cc327e78dcdc540a865140b2652795afd951e771c0bf020","observation_id":"7e877f1d-7658-4cd9-8983-0f96efd48657","resolution":{"observed_at":"2026-08-07T12:11:45.751564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.915388Z","title":null,"venue":null,"work_id":"bb0eb0fb-72c9-4298-a8b4-f307cf9dee2b","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.857180Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:f271b9ef28328e0c072cb69a7eaf9a5c1588a5e74fcab8f6d239aa121390869e","observation_id":"77ab271b-cb31-40fb-a81d-147fbdc2ca4a","resolution":{"observed_at":"2026-08-07T12:11:46.962735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T12:11:45.942978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.942978Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:b18b96992964ee991d0bfce293838800343a31d89414f65ba86dde77def5b98c","observation_id":"5d01445e-2841-406d-808a-45f48acc6633","resolution":{"observed_at":"2026-08-07T12:11:45.942978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.019554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:46.019554Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:c9694d8612f82c62a7189cddf2c07d664f69e0946da8f32be669018c78ecb6db","observation_id":"fb7fb42d-6cd0-4eca-a422-d9b0e69eddbf","resolution":{"observed_at":"2026-08-07T12:11:46.019554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13227","last_updated":"2023-10-20T02:24:35Z","snapshot_observed_at":"2026-08-14T01:02:05.991652Z","submitted_at":"2023-10-20T02:24:35Z","title":"ToolChain*: Efficient Action Space Navigation in Large Language Models with A* Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13227","snapshot_observed_at":"2026-08-07T12:11:46.100639Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:46.100639Z"},"links":{"cited_paper":"/paper/2310.13227","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:210ac296704e5dcb35d3a052058db7f9bccb3fcdc5363b3cb8c075c79649dcae","observation_id":"23584c56-45e1-40e6-a1e6-fb8c3a2c20d5","resolution":{"observed_at":"2026-08-07T12:11:46.100639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.738681Z","title":null,"venue":null,"work_id":"1225d780-c52d-428e-a10f-d2792bb6e251","year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:46.192441Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:aff2e82f380b6bbfa5d865e5694f4fd894af5b0ca677283e71d50c6f26410226","observation_id":"cb77b58f-2502-4520-af81-f354e4335d57","resolution":{"observed_at":"2026-08-07T12:11:46.822688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T09:28:21.321986Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.00396."}