{"as_of":"2026-08-09T13:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4bc9f1d8707c951f36defd987932d111ca94012288f2e1da99b51cef286be29","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:05:24.716701Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T15:58:33.337226Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":"2401.01879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":"89e29a37-f045-43dc-92d2-8054b57d49ba","year":2024},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:6d3e6877ad5a4a9358fd47a60af88cb1c4f8568caad353cdd1df892b6ebdcc34","observation_id":"96409407-698f-46e4-94b8-aa6ec6c1c4d4","resolution":{"observed_at":"2026-05-18T15:58:33.341248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-07T06:02:25.808950Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06444","last_updated":"2025-07-09T07:47:59Z","snapshot_observed_at":"2026-08-08T12:16:57.487955Z","submitted_at":"2025-06-06T18:05:45Z","title":"Saffron-1: Safety Inference Scaling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.808950Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2506.06444"},"observation_digest":"sha256:eb0998819acc65e49e156568df47681c6be20d7b03503a91acb3c8e15e088afb","observation_id":"3d2422cc-5f7a-453c-9cf4-7df4670ccb21","resolution":{"observed_at":"2026-08-07T06:02:25.808950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-06T23:48:23.000632Z","title":"Ahmad Beirami, Alekh Agarwal, Jonathan Berant, Alexander D’Amour, Jacob Eisenstein, Chirag Nagpal, and Ananda Theertha Suresh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16043","last_updated":"2025-06-19T05:40:54Z","snapshot_observed_at":"2026-08-08T14:46:38.823120Z","submitted_at":"2025-06-19T05:40:54Z","title":"DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:23.000632Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2506.16043"},"observation_digest":"sha256:c9bb1c6801da906983224056876632b8f57d46b899adce547ac46674b9f6c9b8","observation_id":"a30c1c74-b806-4531-aeba-dff77327aa7d","resolution":{"observed_at":"2026-08-06T23:48:23.000632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-06T23:13:12.544731Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19882","last_updated":"2025-07-07T02:00:46Z","snapshot_observed_at":"2026-08-08T12:23:41.491036Z","submitted_at":"2025-06-24T02:19:30Z","title":"Position: Machine Learning Conferences Should Establish a \"Refutations and Critiques\" Track","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:13:12.544731Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2506.19882"},"observation_digest":"sha256:945853edcd9e20b0e95867ae1f2fe3dac4d58a9ae7b043840f76ce4ec6ac9d01","observation_id":"f5934dc1-2b12-42c4-a29f-b80ac7716703","resolution":{"observed_at":"2026-08-06T23:13:12.544731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-06T15:26:19.894110Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-08T01:18:19.012196Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:19.894110Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:f9053d0f6fe48d47900ecf1db90499c43f0468f4ece372c90abd283637cb2d0c","observation_id":"9d527b4d-6f21-4db1-ba27-14c2408157a1","resolution":{"observed_at":"2026-08-06T15:26:19.894110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-05T12:27:27.267919Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-08T14:14:58.948394Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.267919Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:bddd9a4a445363656ec6c30199842a859581c9619eeb28ae2c4f4d37524bf6ae","observation_id":"416f724d-3c68-4ef6-a538-9b84233ed729","resolution":{"observed_at":"2026-08-05T12:27:27.267919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-04T07:23:56.319781Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26219","last_updated":"2026-06-03T00:59:51Z","snapshot_observed_at":"2026-08-04T07:23:55.106713Z","submitted_at":"2025-10-30T07:52:14Z","title":"Test-time reward-guided alignment of language models by importance sampling on pre-logit space","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T07:23:56.319781Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2510.26219"},"observation_digest":"sha256:528fba9441a1749fa2ad7a7b7ebcdf449e06df582203e881f3661e9a25390b39","observation_id":"5ff8a040-ccd8-4a84-a400-f3953db445e1","resolution":{"observed_at":"2026-08-04T07:23:56.319781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":"2401.01879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":"89e29a37-f045-43dc-92d2-8054b57d49ba","year":2024},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:52b19d0020a71026f2b3132dc98ce5b05866feffab245c4b6fe1dfc81fc4b9c5","observation_id":"aecf7ed5-1411-470a-81e6-aec8b16c3cf2","resolution":{"observed_at":"2026-05-10T13:20:25.648729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-02T20:53:24.751933Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:62714218ff09331b05494501291841ffbe6cff7ec8c12e96d9d4a935d0ea48a3","observation_id":"720b3ea0-fa45-4009-8487-9e6e6307be9d","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:6fef5fc73fd6c8780d2ec3534052db2d316e7e9d33c36a24cbea663a799dd099","observation_id":"201b043a-7f93-4d8d-8517-d38a777d7b34","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-02T08:40:48.100649Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:48.100649Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:f6a3a1eef1dc7ca0e2e03ceb7694cb60a6e7e8cb1393ea1112d360ad164ea9fd","observation_id":"178e307c-b0ff-4a56-891f-cd2d77dc74dc","resolution":{"observed_at":"2026-08-02T08:40:48.100649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-08T05:05:24.716701Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05643","last_updated":"2026-08-06T06:38:37Z","snapshot_observed_at":"2026-08-09T13:10:32.682329Z","submitted_at":"2026-08-06T06:38:37Z","title":"Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T05:05:24.716701Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2608.05643"},"observation_digest":"sha256:a5994dd8d5bf1dea2f08f01b1c3a47067055974fab1dec5e4a16f8a67d1d908f","observation_id":"7a1bb9e5-a64a-498e-994a-8a2353e61a3b","resolution":{"observed_at":"2026-08-08T05:05:24.716701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.01879/citation-record","integrity":"/paper/2401.01879/integrity","json":"/paper/2401.01879/citation-record.json","paper":"/paper/2401.01879"},"outbound":[],"paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2401.01879."}