{"as_of":"2026-08-23T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:083a1a23da647483e9aba1fb715779cfc73de9bf630c9832550601921c0c073c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:20:14.079797Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:06:21.444253Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T21:06:22.177325Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"cited_work":{"arxiv_id":"2411.11681","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11681","snapshot_observed_at":"2026-08-15T21:06:22.177325Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","venue":"cs.AI","work_id":"38b06f98-53fb-406f-913c-a56ea4054076","year":2024},"citing_paper":{"arxiv_id":"2505.11166","last_updated":"2026-06-03T04:46:17Z","snapshot_observed_at":"2026-08-19T20:40:16.273856Z","submitted_at":"2025-05-16T12:08:48Z","title":"SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:21.444253Z"},"links":{"cited_paper":"/paper/2411.11681","citing_paper":"/paper/2505.11166"},"observation_digest":"sha256:0a75d86c001aa9c2054ac2fc44a9ea51dc6eab147ee5943918a49415cf162cb3","observation_id":"625b7171-e13e-4332-9566-8c078399fdcb","resolution":{"observed_at":"2026-08-15T21:06:22.181532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11681/citation-record","integrity":"/paper/2411.11681/integrity","json":"/paper/2411.11681/citation-record.json","paper":"/paper/2411.11681"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.755730Z","title":"G.; Guo, Z","venue":null,"work_id":"fd4cc18f-b7ae-47dc-9511-21a96f73caa9","year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.855145Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:3ce66964126715a61b8e6d621fcd37459a5a37065d637d808efdee0b557d4f5e","observation_id":"4064787b-f7f6-443e-8f16-7f71e4de827f","resolution":{"observed_at":"2026-08-12T18:20:14.762028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.737908Z","title":null,"venue":null,"work_id":"07b986f1-50d5-435b-8e99-522a81564223","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.862914Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:d7288d643fe78f4a8c3763436d2bc6aedbe33ee8d7cf95f3f691100815a5b166","observation_id":"aa7c7899-4785-4ec0-a6aa-cfd9ab8ec6e0","resolution":{"observed_at":"2026-08-12T18:20:14.743311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.869596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.869596Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:22a7d7e42096d4279f9403df2c5f39711ff5381c89a6591cd95790225d7e5220","observation_id":"f80b4755-1396-47f1-9daa-b465b198ac61","resolution":{"observed_at":"2026-08-12T18:20:13.869596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T18:20:13.876021Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.876021Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:87ad8fe547a96f47598c7af91eef15ff333e9f0d2f3b65a3ef3e4b1881ec9f1a","observation_id":"06e1e333-0396-420c-ae1e-1cf16f1ec4c3","resolution":{"observed_at":"2026-08-12T18:20:13.876021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.883203Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.883203Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:301ff859e5f71f1d54ecb40f4153537e3e0fa7389a1fe029dfbada9fb04ec77a","observation_id":"a0454d7f-5243-4c11-bf9b-2248ba093ae7","resolution":{"observed_at":"2026-08-12T18:20:13.883203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T18:20:13.890056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.890056Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:aedb4dea5748aa1aadfb1a0cb3e10c96f531eaf313832aaee4ab60f775da2540","observation_id":"8043d3c7-1bee-4bd9-afa5-387d339eff64","resolution":{"observed_at":"2026-08-12T18:20:13.890056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.693570Z","title":null,"venue":null,"work_id":"8fea5bd2-6566-4f7a-a213-d7263cd02c4d","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.896845Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:8c0054e83acec0c0635d59eebd2dfca482e57f9057f3a8ed492c312324318781","observation_id":"eaccdb49-ae77-4a11-a633-333202d96141","resolution":{"observed_at":"2026-08-12T18:20:14.699714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.902327Z","title":"J.; Shen, Y.; Wallis, P.; Allen - Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.902327Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:f2a2ed577a8d2e60247dede4375b9c94edcc949f00c93acdcf833c3d385a6d64","observation_id":"9497a753-89b6-4f82-9ce7-188687de12d1","resolution":{"observed_at":"2026-08-12T18:20:13.902327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.661076Z","title":null,"venue":null,"work_id":"e31af7b4-7178-4a95-9696-1b22f32f8b34","year":2020},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.907171Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:3ec90fa74c4f44c5d3a4590821a6a6743ef2ac647d07dd7736cadfa01b9e7db7","observation_id":"0f71042d-a3e2-432a-9b13-8d46bdd26366","resolution":{"observed_at":"2026-08-12T18:20:14.666411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04925","last_updated":"2024-06-22T08:18:48Z","snapshot_observed_at":"2026-08-20T08:01:56.031115Z","submitted_at":"2024-01-10T04:37:38Z","title":"The Impact of Reasoning Step Length on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04925","snapshot_observed_at":"2026-08-12T18:20:13.912332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.912332Z"},"links":{"cited_paper":"/paper/2401.04925","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:994b02fe48632e49da0429d39756cd48871590275f7747a08257c13b242b886d","observation_id":"1ac934fb-3d04-40f6-91a5-53573afec9ee","resolution":{"observed_at":"2026-08-12T18:20:13.912332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-21T01:37:45.112714Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-12T18:20:13.918672Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.918672Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:b07c09b655ae77b60040753f25956eb5218d5dfbe833e905fc6eb56fd20ce5a4","observation_id":"17919b9b-4c53-43bc-83b3-d6b809a27bc3","resolution":{"observed_at":"2026-08-12T18:20:13.918672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-12T18:20:13.925085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.925085Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:f4d597857c05fc44e9147338a97126b5541e3f6a61434aac4b9c36c2d2d018a5","observation_id":"bf05dcc1-26d7-43c1-8876-d01f3cb28f33","resolution":{"observed_at":"2026-08-12T18:20:13.925085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.642655Z","title":null,"venue":null,"work_id":"ff9d228c-5bb7-43b7-a943-3c99443d3ad1","year":2011},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.931585Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:2653cafc4b2af4a8677710862101509ac1776f273ef47d7e61fe87a2d55d7d9b","observation_id":"c4802d0c-712b-4a43-b151-360f2d971be9","resolution":{"observed_at":"2026-08-12T18:20:14.648304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.619452Z","title":null,"venue":null,"work_id":"87ff03ab-20f7-4560-bd58-e7eb6b7ef022","year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.937717Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:a8d6eb1f678aebbd952f20b6d72989a4bce678ce792ccd05ad52abb1b0f2838d","observation_id":"80bd7a93-1d16-4484-a643-d5174506a6a4","resolution":{"observed_at":"2026-08-12T18:20:14.626816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-12T18:20:13.943239Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.943239Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:edf2d1218f573faac2ed736e3515ffaebe1b4d27e6586f59ae1c646bf65fa22b","observation_id":"288e386e-b59c-470a-8802-5dd726898d8c","resolution":{"observed_at":"2026-08-12T18:20:13.943239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-12T18:20:13.949599Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.949599Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:4aad8ceac60d785496da7c62e1496ffb6c898cd537f09e939bb1b4c4c56b65e4","observation_id":"3637dcc3-b26e-4069-b076-782c3ec85f84","resolution":{"observed_at":"2026-08-12T18:20:13.949599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-08-16T14:51:54.405312Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-12T18:20:13.956530Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.956530Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:5fa5cab68e4d5b32d1223abd78b268ad0d5a07ad402726754fb19dc148523433","observation_id":"935a371f-ddf4-4ee1-b8bc-22d547689031","resolution":{"observed_at":"2026-08-12T18:20:13.956530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.598748Z","title":"L.; Bari, M","venue":null,"work_id":"a623ced1-e793-49d3-bfc4-3cb54ae726cc","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.964313Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:90872bf5941fe528b7270be6053afa87e25d64d519af94819f313065c16018ec","observation_id":"69447051-366a-465c-8477-f75bb9e5cf60","resolution":{"observed_at":"2026-08-12T18:20:14.605398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.971334Z","title":"L.; Mishkin, P.; Zhang, C.; Agarwal, S.; Slama, K.; Ray, A.; Schulman, J.; Hilton, J.; Kelton, F.; Miller, L.; Simens, M.; Askell, A.; Welinder, P.; Christiano, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.971334Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:ff086195ef3bc03226a03c485f88bb8ab8dd5bce7a7b287969a40d3f46efcb4d","observation_id":"0c50e244-fe21-46ca-8f14-cea0f08fe4e8","resolution":{"observed_at":"2026-08-12T18:20:13.971334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.978109Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.978109Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:293b054431292fecc4908d26042431cee9210721835b852645e362be9f122080","observation_id":"9a045a4e-846e-477d-a9fe-30b6ebb88054","resolution":{"observed_at":"2026-08-12T18:20:13.978109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T18:20:13.984199Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.984199Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:66a0bf099e089c6c0f8a5bf247309469c20bde6428cabeaf3ed8a2ea0d392c9b","observation_id":"23db6937-3951-40e4-9360-c451fe2ac361","resolution":{"observed_at":"2026-08-12T18:20:13.984199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T18:20:13.990185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.990185Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:b3e2a772bf309b0dbd6c280fff64d4fe1922e71adce9ef140639ad0006ea6b75","observation_id":"9da5c1f5-4f36-48fc-b445-30169a388486","resolution":{"observed_at":"2026-08-12T18:20:13.990185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-12T18:20:14.001444Z","title":"F.; Siegel, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.001444Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:870a93f6a6d13cc4c64de5c2f7d243dee5c526f8ddce2f3bb0e81b18f4a9dc06","observation_id":"69932421-385d-4f3a-9afc-315608672f4b","resolution":{"observed_at":"2026-08-12T18:20:14.001444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-22T03:52:53.469568Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-12T18:20:14.014172Z","title":"X.; Dai, D.; Li, Y.; Chen, D.; Wu, Y.; and Sui, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.014172Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:8418759f84f111539cd7d1c9801f215fd54a2414173cfdc036154f89ece3d6b5","observation_id":"7ac11809-c912-46ac-a4e3-d6e3c29ad4a2","resolution":{"observed_at":"2026-08-12T18:20:14.014172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.555352Z","title":"V.; Chi, E","venue":null,"work_id":"e2dd9619-c404-4d14-b4c1-9302137142c6","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.020060Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:acf4e9b34d9bfcbcea7f1b8f97969629356e583dd3a8287e3127e21a6e617e01","observation_id":"7a8d09c2-9393-499f-af82-283e414df92d","resolution":{"observed_at":"2026-08-12T18:20:14.560218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-16T15:13:42.128297Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-12T18:20:14.025705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.025705Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:204860d03d65134c5874d81db323f2cb629924739094c25aa303e2d6c218fcd6","observation_id":"d195a577-dc7f-4dc9-bf04-853b4077e306","resolution":{"observed_at":"2026-08-12T18:20:14.025705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-12T18:20:14.032820Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.032820Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:8b42d98306251c9b47ebbd53b873d452f59d57946e985438b8daced8dd837e66","observation_id":"c7a366ea-27b8-4c33-909a-2a9edaa7432d","resolution":{"observed_at":"2026-08-12T18:20:14.032820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.535519Z","title":"H.; Le, Q","venue":null,"work_id":"fb830170-47d1-488c-802a-589341ac96f7","year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.038622Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:1c821cfd3cbafabc944ab454def1f7bda0e81ffb4a1688bf91c9ee0ba706ffc7","observation_id":"573e6d72-f60c-4d78-8631-f0b8bf4e563e","resolution":{"observed_at":"2026-08-12T18:20:14.542206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T18:20:14.043754Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.043754Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:1f6cb07244a04973da48cc0f376021bfbc5491b592aba52dab53a0957c9862cd","observation_id":"79d8f286-c094-44d7-87c7-74217c82891a","resolution":{"observed_at":"2026-08-12T18:20:14.043754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.513387Z","title":null,"venue":null,"work_id":"e9eef47b-6ed5-4df6-b5a9-c4eab5466ba9","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.049470Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:79da35e99cce27b2630bcab790f2a53ca569ac262ef49328afc1f49df26f6518","observation_id":"df8da85d-3057-4c60-847e-8f10c225b51b","resolution":{"observed_at":"2026-08-12T18:20:14.520712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-12T18:20:14.055687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.055687Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:156d08fff825ab1451521ce0da3bf64c549c2edb1db4268777ae16f054dc33c6","observation_id":"ec768db9-f861-464d-ae29-35ae60d00303","resolution":{"observed_at":"2026-08-12T18:20:14.055687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-19T22:24:29.848660Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-12T18:20:14.061179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.061179Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:d50300d7c393e793299462a3bcf60993d64b581fd59d3d27a31ab6a3713f556d","observation_id":"e065f485-159f-40ea-b431-68dd1d3c3f96","resolution":{"observed_at":"2026-08-12T18:20:14.061179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-08-16T17:38:22.018669Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-12T18:20:14.066939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.066939Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:abefaf11b1d26f9f6565ea8dede843aa201a3f0ea53a61d058b4ae70c154e9f2","observation_id":"948fde31-2f2d-4ef5-8106-19293324a369","resolution":{"observed_at":"2026-08-12T18:20:14.066939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.073328Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.073328Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:3195a899afad713b65874e1a491b547bd74a017e24955cc7a8d78425070a0068","observation_id":"3e0b9875-2783-407a-a813-3cbad5e146a6","resolution":{"observed_at":"2026-08-12T18:20:14.073328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.079797Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.079797Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:04a1945a1470b88dcd44a1de796768042bcff7c75757fecbf3bf072dfc205787","observation_id":"de6d25ca-9a10-465f-b98d-d47e637beaef","resolution":{"observed_at":"2026-08-12T18:20:14.079797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T14:56:41.818758Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2411.11681."}