{"as_of":"2026-08-10T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbd433579a6e4e8542e73e5a641b1109477723bfe5fcc5bd517f3f6d4abf5932","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T06:04:01.595054Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T09:42:04.234036Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-20T09:41:59.979595Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2408.07199"},"observation_digest":"sha256:77cf5e0df966317e252b325f801b7e445472d370f0c3a721ca8c0ea41ab0e9f9","observation_id":"ded0495b-0a64-467b-9aa0-caf6eaca9810","resolution":{"observed_at":"2026-05-20T09:42:04.237687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-13T15:51:29.022336Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2412.21187"},"observation_digest":"sha256:a506b0e8876ae2cb45fe9723e74935f857dae01dee12c6afa109b4704f265d7b","observation_id":"547c4f5f-6ffd-45f1-9c91-fac1ba3bd1f3","resolution":{"observed_at":"2026-05-13T15:51:29.518054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:b80e7270c3dc9e266a7e2946f2853514a20562c5bc4a4221efb37a351f9b1913","observation_id":"6f125f57-580a-479a-98b2-a7d853c4db5d","resolution":{"observed_at":"2026-05-15T21:20:59.490615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-09T06:04:01.595054Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03095","last_updated":"2025-02-05T11:41:43Z","snapshot_observed_at":"2026-08-09T07:07:23.846920Z","submitted_at":"2025-02-05T11:41:43Z","title":"Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T06:04:01.595054Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2502.03095"},"observation_digest":"sha256:0d96ed1aff9f3eb78d237f2ea2db735e5a8bec8ab02b5fe0d7f41877f0ca541b","observation_id":"472214e9-0d6c-4a4b-9b67-3c20c0f517b1","resolution":{"observed_at":"2026-08-09T06:04:01.595054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:293eaeba565cb4d204ebfd80bc58a71ebf5be6ee427188f467e64c3d2d0a5800","observation_id":"b40e4971-2e58-423d-a19f-11be2b6f416e","resolution":{"observed_at":"2026-05-16T15:04:22.805429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-07T12:46:56.966984Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:56.966984Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:f5a18d9cda1eb01cbf36e8f0004f69ff513b07682bcfcfdfc87f4e12adc506b2","observation_id":"a4d0c8dd-2a5e-4fbf-ab85-a3e4745f2f97","resolution":{"observed_at":"2026-08-07T12:46:56.966984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-07T11:00:53.398869Z","title":"Step-level value preference optimiza- tion for mathematical reasoning.arXiv preprint arXiv:2406.10858, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06366","last_updated":"2025-06-12T10:22:01Z","snapshot_observed_at":"2026-08-09T20:26:32.963470Z","submitted_at":"2025-06-04T08:12:32Z","title":"AI Agent Behavioral Science","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:00:53.398869Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2506.06366"},"observation_digest":"sha256:c7cdba589cacb30325f67e0f5d34b52dd2bd1a586123c50c67a654e34a8c7e64","observation_id":"5d3c20b9-ec80-4818-b818-4671909126f3","resolution":{"observed_at":"2026-08-07T11:00:53.398869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-07T05:36:38.444011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07551","last_updated":"2025-06-12T07:30:27Z","snapshot_observed_at":"2026-08-07T22:38:32.445079Z","submitted_at":"2025-06-09T08:41:39Z","title":"CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:36:38.444011Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2506.07551"},"observation_digest":"sha256:2fd5537830602e7cb68d9878a4ad395f08151840e18fbae735df3ad943bf2b41","observation_id":"6749814d-8a1e-4756-9cbc-f9935e3b72cf","resolution":{"observed_at":"2026-08-07T05:36:38.444011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-06T23:35:35.544750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-09T12:43:12.249421Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.544750Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:fce8c119bd5b4755023de757af4ced0a3a9a5869d3e04501617ab752156eb217","observation_id":"81238a6e-2b0e-48b9-9012-9cd10c027c1c","resolution":{"observed_at":"2026-08-06T23:35:35.544750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2510.04595","last_updated":"2026-04-12T08:00:47Z","snapshot_observed_at":"2026-08-09T07:38:29.823568Z","submitted_at":"2025-10-06T08:49:04Z","title":"SpikingMamba: Towards Energy-Efficient Large Language Models via Knowledge Distillation from Mamba","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T09:44:53.290259Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2510.04595"},"observation_digest":"sha256:d294f45ded4b9ace8d019dde458159ddc4f284dd8ff8dab2e8f9e58f1e804862","observation_id":"183659f9-af00-406b-ad67-4fea6c4eb65c","resolution":{"observed_at":"2026-05-18T09:46:12.439895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2510.10649","last_updated":"2026-04-16T14:51:36Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T15:06:53Z","title":"Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T07:20:01.505216Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2510.10649"},"observation_digest":"sha256:5656f3942bc59a9bfc672695b464a37cd53cb8e86e825496947fa9ee5cd4327a","observation_id":"54ce838a-b3af-4aa0-ae8c-c181090fcbff","resolution":{"observed_at":"2026-05-18T07:21:04.436629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2605.09492","last_updated":"2026-05-20T15:55:09Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T11:57:39Z","title":"APCD: Adaptive Path-Contrastive Decoding for Reliable Large Language Model Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T05:22:25.475956Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2605.09492"},"observation_digest":"sha256:26bc894b18f6ae7b42e6f43d9d9d8c94572646ca4f7b77bcbcd02db5544a5e53","observation_id":"eec809d2-b0ab-4299-903e-b35cfb1d93e6","resolution":{"observed_at":"2026-05-12T05:26:25.191736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:b3f4be50398655ea26d0b42b39fa4fbaf5262c8720f0bc70667400721b2fc093","observation_id":"3dd2b738-438b-4692-8fc8-673e0334ace8","resolution":{"observed_at":"2026-05-13T07:37:29.952562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2406.10858 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:569657b76718c02cc929bce7848613c59d82cf9b0198c4bebda531246501e34a","observation_id":"7080c4b6-4ef2-4eaf-87ae-ec831fef7d5b","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-02T08:40:39.974766Z","title":"arXiv preprint arXiv:2406.10858 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.974766Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3a14e8e1eb5a95e1b0c5e37f2f2528aa8a7b8f454d74ebd0a85bfcfcbaf924ca","observation_id":"a9acd4b2-4ebd-42bf-90a9-62837c84ed50","resolution":{"observed_at":"2026-08-02T08:40:39.974766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10858/citation-record","integrity":"/paper/2406.10858/integrity","json":"/paper/2406.10858/citation-record.json","paper":"/paper/2406.10858"},"outbound":[],"paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2406.10858."}