{"as_of":"2026-08-10T13:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02c647e57b413c4415330398768b483dcf7ad2042bb8e6755e7d095d7310af88","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:57:56.794234Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:37.083838Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:30.651801Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":"2506.12446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12446","snapshot_observed_at":"2026-07-03T01:17:30.651801Z","title":"arXiv preprint arXiv:2506.12446 , year=","venue":null,"work_id":"717a313e-1c3f-46f5-8dc4-62e91acd42a6","year":null},"citing_paper":{"arxiv_id":"2606.09635","last_updated":"2026-06-08T15:33:13Z","snapshot_observed_at":"2026-08-02T03:20:14.810565Z","submitted_at":"2026-06-08T15:33:13Z","title":"Gradient-Guided Reward Optimization for Inference-time Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T16:43:04.984866Z"},"links":{"cited_paper":"/paper/2506.12446","citing_paper":"/paper/2606.09635"},"observation_digest":"sha256:6f4ea63bb5275ed7afdad256baf8a0d556cc47e9d931487e16862664fbf391ca","observation_id":"3b792169-b2d2-4d3e-9265-9f0db8bf8c72","resolution":{"observed_at":"2026-07-03T01:17:30.653219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12446","snapshot_observed_at":"2026-08-07T00:15:37.083838Z","title":"From outcomes to processes: Guiding prm learning from orm for inference-time alignment.arXiv preprint arXiv:2506.12446,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02694","last_updated":"2026-08-03T10:41:25Z","snapshot_observed_at":"2026-08-10T09:30:04.041789Z","submitted_at":"2026-08-03T10:41:25Z","title":"Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.083838Z"},"links":{"cited_paper":"/paper/2506.12446","citing_paper":"/paper/2608.02694"},"observation_digest":"sha256:66d48eccb001a4e4e253d67dc7c0f73a1f029568af54d444d3ebc211a629a613","observation_id":"033c006d-117b-49b8-afbe-e84dce3a2697","resolution":{"observed_at":"2026-08-07T00:15:37.083838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12446/citation-record","integrity":"/paper/2506.12446/integrity","json":"/paper/2506.12446/citation-record.json","paper":"/paper/2506.12446"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:57:56.681605Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.681605Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:dd8ed797a028a3a25d549d55df05bc7af8fb5c3c0e4651066b671b07fd57b82e","observation_id":"4912a7b3-e65e-41ef-8303-80c8726670f7","resolution":{"observed_at":"2026-08-07T00:57:56.681605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T00:57:56.685536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.685536Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:91d8e44a825dc7547476f42574c01d4089295fc9d6b255f51f5d3b74ad12266b","observation_id":"36b19547-6eef-4627-ae27-4dcc131ed85a","resolution":{"observed_at":"2026-08-07T00:57:56.685536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.689287Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.689287Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:c90d0436c553d655b7706bfb61f0b3bcf5cd60b6b9f38687d28b7ca3d70d04cb","observation_id":"5a301271-6912-400a-b58d-7c8d8420db2b","resolution":{"observed_at":"2026-08-07T00:57:56.689287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20495","last_updated":"2024-05-30T21:36:12Z","snapshot_observed_at":"2026-08-10T12:51:04.301261Z","submitted_at":"2024-05-30T21:36:12Z","title":"Transfer Q Star: Principled Decoding for LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20495","snapshot_observed_at":"2026-08-07T00:57:56.692630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.692630Z"},"links":{"cited_paper":"/paper/2405.20495","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:d03c0b84ac5fbb4f493177a803f7bff52ec70193e3c920fff24c12a7a1c96348","observation_id":"64b8a358-7d5d-46f4-b1bd-763f83fc57b1","resolution":{"observed_at":"2026-08-07T00:57:56.692630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:57:56.695734Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.695734Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:9ad5b672c4def97e92cf490c800b99e34cdbdf2c8365a8b395c08ede5cf9d964","observation_id":"bd759edf-e7f4-41a2-b8c4-a9a8ed339231","resolution":{"observed_at":"2026-08-07T00:57:56.695734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.225505Z","title":null,"venue":null,"work_id":"6a0b9b77-7f16-46b2-821c-4cd0a441611d","year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.698732Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:94e62d57fff9ef10e28d679f5e52effe6ac0c95faadfc3f4d56aa3fe38b350ee","observation_id":"be50a20e-9127-4da4-90a6-8a96f6782934","resolution":{"observed_at":"2026-08-07T00:57:57.228881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.214695Z","title":null,"venue":null,"work_id":"4f6862df-078b-4d7f-b91d-db7ebc888092","year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.701902Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:ba64568bb2e9bbd012c9a42943471a9b6c3d856f89bcef8cca8cbba83f023f13","observation_id":"5ba7954f-67b5-4ade-a03c-f8e5177afea9","resolution":{"observed_at":"2026-08-07T00:57:57.218508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:57:56.704410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.704410Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:4246bfc3bce77b2deec4d264ef133f8e179eaa756e2cfc9e025211d2fcda611c","observation_id":"f4b0db48-f16d-4119-9208-e0a95dcea152","resolution":{"observed_at":"2026-08-07T00:57:56.704410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T00:57:56.707328Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.707328Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:6e30424da3c52fa76e7c6bfd90d8a6a58bb2a0914b6c95fdc87e31bb6eab2bd8","observation_id":"7c3de4f8-d9f8-4c1e-8feb-4f2346d6cdee","resolution":{"observed_at":"2026-08-07T00:57:56.707328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.204455Z","title":null,"venue":null,"work_id":"5f0c1769-2839-42c0-940b-9cabc0d6bbb7","year":2020},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.710065Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:7d04620be5699f3998f4aa63d12ca15e7d305620036809ccda7c8ae1a7ee687c","observation_id":"f374665c-7c97-4133-b1d5-1da0c4d3329d","resolution":{"observed_at":"2026-08-07T00:57:57.207916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06639","last_updated":"2024-05-10T17:59:04Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:04Z","title":"Value Augmented Sampling for Language Model Alignment and Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06639","snapshot_observed_at":"2026-08-07T00:57:56.712904Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.712904Z"},"links":{"cited_paper":"/paper/2405.06639","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:260a05c4ac114bfe5391e07b3c3f00c87bdcd02be5429e7b21f76b6b6aac894c","observation_id":"750e2506-feb8-4427-b82d-5e28a9a52517","resolution":{"observed_at":"2026-08-07T00:57:56.712904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.716070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.716070Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f1d487734dba54b641c294de78459f9c12f2a77d1850026f64e8a4157238fe4a","observation_id":"ff29bdb1-8785-49a8-a405-a1467e673158","resolution":{"observed_at":"2026-08-07T00:57:56.716070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.194633Z","title":null,"venue":null,"work_id":"31f7c115-d125-41f7-9343-ec8fedaf7ab9","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.718781Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:14fd1485dbfa64fd786ab5042c049e9a69cc7aa2c60a23427885f818fa812ebe","observation_id":"30413e44-3eea-4f9f-99c3-37fa6e7a001b","resolution":{"observed_at":"2026-08-07T00:57:57.198063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.184676Z","title":null,"venue":null,"work_id":"e4176810-3fb9-4219-a765-1b8616d15cc5","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.721421Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:3c9201ebd2a658fac34e70d9898e394287559fdc29ae1c5f08393c505c306bc4","observation_id":"2d75fb37-7379-41ef-9b21-9d795adc87fe","resolution":{"observed_at":"2026-08-07T00:57:57.188134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.174483Z","title":null,"venue":null,"work_id":"38cabc5c-de32-4b9e-8ae7-a7ca99bbe1f2","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.724342Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:32baac31b49c3bde95e4e8ffd4601bc41d11b702e1a278e36ec9b430af85fa94","observation_id":"e2c5cddc-97b0-4acb-9b40-bb6750515811","resolution":{"observed_at":"2026-08-07T00:57:57.178228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:57:56.727160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.727160Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:bcd4cf84f034f8d875f79f8403059f6dc0380a361c8e4483807c51a9e370521b","observation_id":"d2fea9c8-b210-42d0-8d78-732189a2b6d3","resolution":{"observed_at":"2026-08-07T00:57:56.727160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02676","last_updated":"2023-10-18T07:11:12Z","snapshot_observed_at":"2026-08-04T10:05:48.268152Z","submitted_at":"2023-02-06T10:28:16Z","title":"Chain of Hindsight Aligns Language Models with Feedback","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02676","snapshot_observed_at":"2026-08-07T00:57:56.730028Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.730028Z"},"links":{"cited_paper":"/paper/2302.02676","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:6cb8ab67ece664e7464678b1f60e4f74da9120ed4a17cd7c97d89fc70bfcc1d1","observation_id":"63beea3b-8356-4f0c-96e8-868abdd8ef81","resolution":{"observed_at":"2026-08-07T00:57:56.730028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.164526Z","title":null,"venue":null,"work_id":"5d4a9082-5430-4cb9-820c-169f36a41a21","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.733069Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:1130c3e1b215a1f44f0c8019c5bdc5d276db741f58a2b065338c708cf24bcbfe","observation_id":"90b1afa9-5f82-4ca0-a092-fe93568fe61a","resolution":{"observed_at":"2026-08-07T00:57:57.168071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17022","last_updated":"2024-06-03T20:50:26Z","snapshot_observed_at":"2026-08-09T12:39:32.277152Z","submitted_at":"2023-10-25T22:00:05Z","title":"Controlled Decoding from Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17022","snapshot_observed_at":"2026-08-07T00:57:56.735807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.735807Z"},"links":{"cited_paper":"/paper/2310.17022","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:33bcf68a5c31e758c04b6c631a75e0482d359a98660c46a44a941e06087839e4","observation_id":"b034acf2-58e1-40be-b0af-8d389838d0e4","resolution":{"observed_at":"2026-08-07T00:57:56.735807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-07T00:57:56.738980Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.738980Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:8f462265f79a507bf2fe15f6019b9735da0906dc55ecb2840a3a4a59c6c452f7","observation_id":"1367ce34-8eba-4b7f-a077-1e9959661349","resolution":{"observed_at":"2026-08-07T00:57:56.738980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.742029Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.742029Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:7b48bcd2af9488c9441bbf129ead14bda91e00e5639d46dada6a19380c1b113e","observation_id":"cd673f1c-19fe-4958-a75d-b6523f875956","resolution":{"observed_at":"2026-08-07T00:57:56.742029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.744661Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.744661Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:e96b4676d6e642e5ca3261345960ace976b3740163eb756ba44c4ab180300f09","observation_id":"922294fd-5611-495f-9001-32f2266d9f50","resolution":{"observed_at":"2026-08-07T00:57:56.744661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.747399Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.747399Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:ddee05f2c425b937110b53e3ee8c0655da7262d6a7ed162252666e9aedfee498","observation_id":"143a9fd4-240f-44aa-bc2f-f615c4e8db85","resolution":{"observed_at":"2026-08-07T00:57:56.747399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.750234Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.750234Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:e7470ff90758e3b547ec808eea6bcf00649944b78cf01bce85639474711868d0","observation_id":"3199fd39-8f9e-45ef-ae6a-b68988faee9d","resolution":{"observed_at":"2026-08-07T00:57:56.750234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.127229Z","title":null,"venue":null,"work_id":"06c7eb16-6b7f-4341-bb6b-f504619b39cf","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.753004Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:6ce56019e753a16445f12e4594ef87efcc534c19cfa3cd658717cfc21cc91dc9","observation_id":"a7787224-2806-4057-ac3b-82b765031810","resolution":{"observed_at":"2026-08-07T00:57:57.131045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T00:57:56.755879Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.755879Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:215df31aa394d7d70369f44d1054c4982f9197a525e32a48ffafa174176a9e4d","observation_id":"78ed9d1c-1e6c-47a6-8d80-cb1291d8bbef","resolution":{"observed_at":"2026-08-07T00:57:56.755879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.116168Z","title":null,"venue":null,"work_id":"d6a7d1d1-f6ed-44d1-952e-f86645a01ddb","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.758899Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:2dd3cd9718f96644b29de0b8aade30bce70e6523786f42834a46881a178dd68c","observation_id":"62b97dd5-3282-43c5-8392-2a43316d5d4c","resolution":{"observed_at":"2026-08-07T00:57:57.119669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-07T00:57:56.761990Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.761990Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:59a1144a6cb3942d2e28dcfd475fc9cecd5b8ab3025ef8d5d62e360add44fa62","observation_id":"b835bba0-5dc3-49a4-a69b-fdd4e7ec0ca3","resolution":{"observed_at":"2026-08-07T00:57:56.761990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.104746Z","title":null,"venue":null,"work_id":"8eef77b4-088c-4ca7-880e-b3f8994e3f69","year":2025},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.764821Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:22d32f9dd767e4d7e04f79927b04aae41a3077340a2f9f60c7edf300653c7b02","observation_id":"4e89d054-047c-48db-be8a-bd8991fc20d9","resolution":{"observed_at":"2026-08-07T00:57:57.109086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.094631Z","title":null,"venue":null,"work_id":"e4194b57-2fa2-4b81-b314-156df9020067","year":2025},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.767542Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:236dd043bfe74f639543a1ac1823cf3737257c6c04e080a176378a046b97438f","observation_id":"ac75c50f-f1d4-4a42-9063-586384f48b1e","resolution":{"observed_at":"2026-08-07T00:57:57.097961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08193","last_updated":"2025-07-15T00:32:25Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:58:24Z","title":"GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08193","snapshot_observed_at":"2026-08-07T00:57:56.770058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.770058Z"},"links":{"cited_paper":"/paper/2410.08193","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:ca0b992a0acff13d596f0220ea352d953ee619a38ce3e9d3ad880043552f84dd","observation_id":"affda21e-2a61-4a2e-a931-ae8f8241e175","resolution":{"observed_at":"2026-08-07T00:57:56.770058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.083392Z","title":"Inference-time alignment in continuous space","venue":null,"work_id":"15f8f78e-88d6-43f4-b046-486adfc0bbfa","year":2025},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.772720Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:0c341015f0013cd58d7c2b724e1ce46fa2beeea218dccafff772d1084fbebda3","observation_id":"aca8fcc6-d181-4273-9fc6-653d0d315f8c","resolution":{"observed_at":"2026-08-07T00:57:57.087942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-07T00:57:56.775426Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.775426Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:ba7144e739092079f79226a38fa427020a11cf0ed1b1b57a402a3763f022a964","observation_id":"71993794-c053-464e-aee0-5b8a05fd2004","resolution":{"observed_at":"2026-08-07T00:57:56.775426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03708","last_updated":"2024-08-17T13:39:13Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:35:26Z","title":"Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03708","snapshot_observed_at":"2026-08-07T00:57:56.778437Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.778437Z"},"links":{"cited_paper":"/paper/2310.03708","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:98747ad6c11cd7308b3eca6908beb51cb32aeffa925ab4b9a4e8209c81910400","observation_id":"1b4a77da-8cf0-4db5-ad51-48d485e998c6","resolution":{"observed_at":"2026-08-07T00:57:56.778437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.071370Z","title":null,"venue":null,"work_id":"a9621c6c-734a-4b6c-bc7e-95a12afe7ee6","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.781278Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:4d19d2aafc1e4ef603cacda03645361f241ff063f8c93efe94bde87a5cf87b51","observation_id":"f423252d-98fe-4eb1-b8ba-ddcb0c443197","resolution":{"observed_at":"2026-08-07T00:57:57.075895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T00:57:56.785108Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.785108Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:6f4348885b5370e5e7834639b9268e7246daef44c763983217e8a20f73c539a4","observation_id":"5cdc6326-be2b-460e-bb3f-bacb141ca3a5","resolution":{"observed_at":"2026-08-07T00:57:56.785108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T00:57:56.788097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.788097Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:e5c8126941f5833137f43323ef4719bd8e629217e9e923c697161aca4a98b6eb","observation_id":"a3988930-adf1-455e-8a44-bdacb97b37f9","resolution":{"observed_at":"2026-08-07T00:57:56.788097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.790928Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.790928Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:08b0d1a9a64d2ad88319bcd91e74a37921d19cf629f1347e1ad578b602a77d0e","observation_id":"89243b78-9e17-42f3-8ef2-3cb6b72e0e5b","resolution":{"observed_at":"2026-08-07T00:57:56.790928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.794234Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.794234Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:8f8fdb9368a53fafa7af8fba91733fba2d4b530777c9958a43d6609ee8479634","observation_id":"abab279f-b4a8-4765-8e2c-21f35eb5758f","resolution":{"observed_at":"2026-08-07T00:57:56.794234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T01:13:57.356873Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2506.12446."}