{"as_of":"2026-08-10T04:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:054585e4b2a4680d2f81a3a37855718a6614964819c1f88d1d4af44914106bbf","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:28:59.743545Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:27:28.637485Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T20:39:29.243714Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05913","snapshot_observed_at":"2026-08-04T12:27:28.637485Z","title":"Best-of-n through the smoothing lens: Kl divergence and regret analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03520","last_updated":"2026-06-10T17:21:57Z","snapshot_observed_at":"2026-08-07T07:08:30.567791Z","submitted_at":"2025-10-03T21:24:41Z","title":"Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T12:27:28.637485Z"},"links":{"cited_paper":"/paper/2507.05913","citing_paper":"/paper/2510.03520"},"observation_digest":"sha256:314ef2cb10b2f80379c68a2d29ad774d6849915b58d328eb0b556be7f4ec2612","observation_id":"3545a9e9-d152-4a23-b9c4-7580a44a94cb","resolution":{"observed_at":"2026-08-04T12:27:28.637485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"cited_work":{"arxiv_id":"2507.05913","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05913","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Best-of-n through the smoothing lens: KL divergence and regret analysis.arXiv preprint arXiv:2507.05913","venue":null,"work_id":"ccc8aa5e-ef73-48c7-b330-580a9f264058","year":null},"citing_paper":{"arxiv_id":"2605.13537","last_updated":"2026-05-13T13:47:06Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:47:06Z","title":"Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T20:27:26.552596Z"},"links":{"cited_paper":"/paper/2507.05913","citing_paper":"/paper/2605.13537"},"observation_digest":"sha256:419505d9fae0ed0b3dfe780048325832587ccf11238e0c9eb920aa837ec277a7","observation_id":"8584fc7a-97be-49fe-a67a-187801539ab3","resolution":{"observed_at":"2026-05-14T20:39:29.247752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05913/citation-record","integrity":"/paper/2507.05913/integrity","json":"/paper/2507.05913/citation-record.json","paper":"/paper/2507.05913"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:52.559956Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:52.559956Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:831119f4a60d4c88867d69aab6254c45890d687dc46593570f3eaf30f4328237","observation_id":"8ce6e034-1836-4f15-b008-c71c9bb35f0e","resolution":{"observed_at":"2026-08-06T19:28:52.559956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:28:52.618979Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:52.618979Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:b6ae52a18fbf15dfad24f12d7be326c818bbdb8f5a0d3f2ebfb3c355d1e1fded","observation_id":"d04662fd-b050-4620-bb54-e25119632517","resolution":{"observed_at":"2026-08-06T19:28:52.618979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:07.386364Z","title":"Variational best-of-n alignment","venue":null,"work_id":"3da3fd2f-7635-47b5-91ca-07c9e83f05b4","year":2025},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:52.705364Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:00158749ed7bb797409a208e7579c3c95af5747293ad15b8deb64ed5226c68f4","observation_id":"3ebd86b7-d44a-4208-906b-59d51d5aecf8","resolution":{"observed_at":"2026-08-06T19:29:07.511226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:52.821009Z","title":"Theoretical analysis of kl-regularized rlhf with multiple reference models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:52.821009Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:874866ac91f25122e0d2e8a22e1ede3777bc5c3b2b659587e1b7c610e4ebfc37","observation_id":"601540f5-577a-44bd-969b-b44d2261e935","resolution":{"observed_at":"2026-08-06T19:28:52.821009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T19:28:52.913576Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:52.913576Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:3e39b906b04617fe4bb3e95a931fa31cd049b302209edecaff10106f3e1c6938","observation_id":"b1af68a8-0e1c-43bf-a1fd-43ded7d1787d","resolution":{"observed_at":"2026-08-06T19:28:52.913576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:07.117573Z","title":"Infalign: Inference-aware language model alignment","venue":null,"work_id":"8f08fbbf-15fd-4d95-b158-140d0d5a1200","year":2025},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.001945Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:f3b6f199e5c055b46ec371c615bba1c36c20334b805c600a0a93a7e07ad20a42","observation_id":"19bfc809-1ae5-4de0-bbfc-a668ae52244c","resolution":{"observed_at":"2026-08-06T19:29:07.243477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:06.873829Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":"8eea0022-a694-47cf-bf76-9e8f1a4ed08d","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.122617Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:06a6e908820419c4089868ba4aada5dd41958b9fa42563e8c436d26faeea14df","observation_id":"2472b580-9c99-416e-b729-29f25acd089f","resolution":{"observed_at":"2026-08-06T19:29:07.019005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:06.585647Z","title":"Q-learning for risk-sensitive control","venue":null,"work_id":"913f49db-96c0-43e9-b20a-594c9657801d","year":2002},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.203873Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:00d98be39d169ff954bce352385987eb161d7c173d9737ddaa6a3157cb742b40","observation_id":"161a9e20-845a-48ee-839d-021f3162647f","resolution":{"observed_at":"2026-08-06T19:29:06.732725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T19:28:53.329718Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.329718Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:0e2cc0fb79bc6f846d759a01c3de5797ea126cd2d6108f382375098fcfd9ba60","observation_id":"88478503-8ef4-4b14-9a3e-694e37266884","resolution":{"observed_at":"2026-08-06T19:28:53.329718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07198","last_updated":"2023-08-02T05:53:36Z","snapshot_observed_at":"2026-07-06T12:37:51.427037Z","submitted_at":"2022-02-15T05:12:43Z","title":"A short note on an inequality between KL and TV","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07198","snapshot_observed_at":"2026-08-06T19:28:53.449165Z","title":"A short note on an inequality between kl and tv","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.449165Z"},"links":{"cited_paper":"/paper/2202.07198","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:7cad1d3afd0e1157faa5ab7c931ace49be17f18ca53dcbf04eb9e243951b9668","observation_id":"3bad5a91-22c5-419d-8c94-a3902c77982d","resolution":{"observed_at":"2026-08-06T19:28:53.449165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:06.363528Z","title":"The master equation and the convergence problem in mean field games:(ams-201)","venue":null,"work_id":"d1c56257-6f56-459c-8b61-567bdf90a256","year":2019},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.524864Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:546dc26b2d47b82d74dcf9435952b34b702e0816237aac8b270c680c761ea0bf","observation_id":"5aa90d68-8dd2-4b55-8f6e-92ca8bc28ee2","resolution":{"observed_at":"2026-08-06T19:29:06.473880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-06T19:28:53.661417Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.661417Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:38ca7aaa21d9af4f3b00b356e0314272bd8c002a0d9bf54c5769290690fb4027","observation_id":"ac2747d2-67f7-42a0-9154-a4e87dbab96e","resolution":{"observed_at":"2026-08-06T19:28:53.661417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:53.798241Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.798241Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:994e535eb7faf86c04fefb72441066be1a03e60b2db4283b6e4aff19ce0b901e","observation_id":"bb73da34-49fc-4bb7-908b-50f43ba162e5","resolution":{"observed_at":"2026-08-06T19:28:53.798241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:06.127413Z","title":"Soft best-of-n sampling for model alignment","venue":null,"work_id":"40fbd27f-7800-441e-a320-1509ede706f8","year":2025},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:53.904911Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:a2583f306fa48950007fe5aae9f45d5867ea187d3ebe60ed71774fa0444d7482","observation_id":"daf9ad92-3588-4f28-b6ce-f0ab9bda33f9","resolution":{"observed_at":"2026-08-06T19:29:06.250074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:05.883175Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"a3416e76-6032-469c-bca5-f7587d0fafd1","year":null},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.001136Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:1f649f4118560e1fce03fb11bb233f2d70ca4d5a8e098e5e79d5433995d3492b","observation_id":"3500e86d-7259-4f5b-85ee-db9d1d77baf2","resolution":{"observed_at":"2026-08-06T19:29:06.003667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-06T19:28:54.102931Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.102931Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:abe8fec0a09bae033f6d0a36a8c11d5370c7dbfef1642988f24c91d7e8ce5e65","observation_id":"8d3a0bcf-b5a8-421e-8c57-287a77f28537","resolution":{"observed_at":"2026-08-06T19:28:54.102931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:05.643962Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":"a60eebe6-6980-48b7-a7af-eb0622695a47","year":null},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.224393Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:dc8d3666923c737fc652f4a37732de468ea42699d140cd193148e14e78d3cbd7","observation_id":"5f2a30f0-326f-48cf-a273-7622b5ece621","resolution":{"observed_at":"2026-08-06T19:29:05.752450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T19:28:54.348620Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.348620Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:69b61cd1b99c527ccc2dfd2611ad9178844c8295b838473548237776d59d0820","observation_id":"3366544c-778c-497b-a6c4-f82a7b6c2df9","resolution":{"observed_at":"2026-08-06T19:28:54.348620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:54.469265Z","title":"A framework for few-shot language model evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.469265Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:5b3284c5b6e1a344427c9850cb497f645ff5cd59108619e3bdcf75947ae09361","observation_id":"186afac0-7b57-4d07-a848-7ac07c1fadee","resolution":{"observed_at":"2026-08-06T19:28:54.469265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:05.373025Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"0c14e234-1332-4da2-9e50-06d1896110dc","year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.570470Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:0b7987901eda83138c9eb72b823297f93836a4f8792bf13ec890038c21b5249b","observation_id":"6fdeb58c-e912-4005-876e-3cb8d2b7e924","resolution":{"observed_at":"2026-08-06T19:29:05.543335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04118","last_updated":"2026-04-27T03:46:23Z","snapshot_observed_at":"2026-07-06T21:36:40.449308Z","submitted_at":"2025-06-04T16:12:26Z","title":"Guided Speculative Inference for Efficient Test-Time Alignment of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04118","snapshot_observed_at":"2026-08-06T19:28:54.698080Z","title":"Guided speculative inference for efficient test-time alignment of llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.698080Z"},"links":{"cited_paper":"/paper/2506.04118","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:66ac551016fba5f25397c64cf645325bbd495b54f7004658df864e909e5223af","observation_id":"d9d32290-4ce1-49f2-a2fe-9067a5ef89d8","resolution":{"observed_at":"2026-08-06T19:28:54.698080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-04T16:20:42.997639Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-06T19:28:54.801422Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.801422Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:59462bafb03ba477bf5c37421cde303933566bfaa10636b1ad93449032e5bdda","observation_id":"ab799296-c1a3-44d0-b8c4-81e837b32367","resolution":{"observed_at":"2026-08-06T19:28:54.801422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:05.085602Z","title":"Statistical theory of extreme values and some practical applications","venue":null,"work_id":"ed7f055e-f97a-4f3c-a6d3-2e7059a84fc5","year":1954},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.941263Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:04b0e3aa9836e464e4e388588acc91119e20480637af0f5259e861230bac75f8","observation_id":"539fb220-9f5e-44d2-8be8-54fe107213b2","resolution":{"observed_at":"2026-08-06T19:29:05.217536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:04.798902Z","title":"Hilton, P","venue":null,"work_id":"330efdde-9d11-4fbc-9110-e80e66adb242","year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.069321Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:2b6ada6d2dc04338be39d346161c39e753909dbfe38d40a1d29c1ec1f80b6d7b","observation_id":"64402ae6-45dc-4991-90ef-4421c7277eb4","resolution":{"observed_at":"2026-08-06T19:29:04.947535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:04.603125Z","title":"Risk-sensitive markov decision processes","venue":null,"work_id":"ff5e6ec3-6274-46b1-83d9-02779932da4d","year":1972},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.145296Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:50944bf0a63531ab7166b57382571a619ede6a0d4732993f28819e2af284b767","observation_id":"b1f6fedc-0060-4073-84ae-6bea47ec2d06","resolution":{"observed_at":"2026-08-06T19:29:04.693728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21878","last_updated":"2025-04-07T17:44:38Z","snapshot_observed_at":"2026-08-07T16:31:54.737337Z","submitted_at":"2025-03-27T18:00:08Z","title":"Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21878","snapshot_observed_at":"2026-08-06T19:28:55.252415Z","title":"Is best-of-n the best of them? coverage, scaling, and optimality in inference-time alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.252415Z"},"links":{"cited_paper":"/paper/2503.21878","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:7728470123577ef7e01d4be1151317cdc58b763fa286e53566fd25683b53287e","observation_id":"c363c589-ea24-4b53-b71c-b72722679d1d","resolution":{"observed_at":"2026-08-06T19:28:55.252415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03556","last_updated":"2024-12-19T22:37:45Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:51:32Z","title":"Best-of-N Jailbreaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03556","snapshot_observed_at":"2026-08-06T19:28:55.320762Z","title":"Best-of-n jailbreaking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.320762Z"},"links":{"cited_paper":"/paper/2412.03556","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:bf8930a9218b7f9bff2019c3a0e03c4ddf3781c5524717c91d0e1b274aca2b2c","observation_id":"71faf483-00ac-4258-909e-e4c8a15e3999","resolution":{"observed_at":"2026-08-06T19:28:55.320762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:04.351195Z","title":"Evaluation of best-of-n sampling strategies for language model alignment","venue":null,"work_id":"1226de9d-eebf-4a45-b32f-cc929c51b88d","year":null},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.411403Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:b5e9c92b9809359d9624e20faf9c2c68e4ae86302b347c398059dcb37ab1633c","observation_id":"9389ae74-a7e5-4806-a549-42a4c80e1ee8","resolution":{"observed_at":"2026-08-06T19:29:04.478293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:04.103015Z","title":"Regularized best-of-n sampling to mitigate reward hacking for language model alignment","venue":null,"work_id":"85db8792-3462-40ad-98ed-d7fe6b333b8f","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.545672Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:c94beeb7d0acacab009bdf6be2a263beed6a755753aa0fd97848584e74862ede","observation_id":"5e1823eb-b27b-49b4-aef6-df26a2505cc7","resolution":{"observed_at":"2026-08-06T19:29:04.252861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:55.657057Z","title":"Inference-time reward hacking in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.657057Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:dc2972ac28a9b7e4f7a84e6b50655c47c9b56b99b312aeb1d3d32c8f5a59136e","observation_id":"6ed88f36-d430-445e-b00c-1c10a059d193","resolution":{"observed_at":"2026-08-06T19:28:55.657057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-06T19:28:55.771105Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.771105Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:a6649c0f66ffc640f3567b0605dec4a099881655fe773254b0ba9265c9cdb73d","observation_id":"a3223f1b-673c-43ab-ae62-693610b0990b","resolution":{"observed_at":"2026-08-06T19:28:55.771105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:03.899598Z","title":"On reinforcement learning and distribution matching for fine-tuning language models with no catastrophic forgetting","venue":null,"work_id":"53525668-2b8b-41ac-ba79-0c46a61c7869","year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.916902Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:78ad18d5b0b187fecdd03ab8c42109bfff9e4d0648859b97e1c0a0cc3cb5f977","observation_id":"05b1f509-175e-4ba2-8111-9c46923220e3","resolution":{"observed_at":"2026-08-06T19:29:03.984079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11275","last_updated":"2022-10-21T10:24:00Z","snapshot_observed_at":"2026-07-06T13:12:51.785555Z","submitted_at":"2022-05-23T12:47:13Z","title":"RL with KL penalties is better viewed as Bayesian inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11275","snapshot_observed_at":"2026-08-06T19:28:56.065982Z","title":"Rl with kl penalties is better viewed as bayesian inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.065982Z"},"links":{"cited_paper":"/paper/2205.11275","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:0b7e781fd94f4cd55a92417a0f0a9f9c10fc392775a6b0bcd784430ac3041be5","observation_id":"93333f7d-8616-41bb-b553-deae042a3f7d","resolution":{"observed_at":"2026-08-06T19:28:56.065982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:03.662450Z","title":"A new penalty function method for constrained minimization","venue":null,"work_id":"24770884-3daa-4811-8178-dae2547b5996","year":1972},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.187855Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:802f9b3a00f9c3118b94328cfe9ba067f254277f98bae06278d380c2b20b3b9d","observation_id":"4880f3a2-9ccf-4207-a706-833ace878a9d","resolution":{"observed_at":"2026-08-06T19:29:03.773935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04124","last_updated":"2023-11-07T16:50:33Z","snapshot_observed_at":"2026-08-02T11:30:46.576643Z","submitted_at":"2023-11-07T16:50:33Z","title":"Unveiling Safety Vulnerabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04124","snapshot_observed_at":"2026-08-06T19:28:56.310852Z","title":"Unveiling safety vulnerabilities of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.310852Z"},"links":{"cited_paper":"/paper/2311.04124","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:cb44d9dbce3ed6a1c8e186398ac474a315cc1fa7e205d74e94023387903f8691","observation_id":"310532ee-2c97-4b8b-af17-a07f09c7015f","resolution":{"observed_at":"2026-08-06T19:28:56.310852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:03.463003Z","title":"On tilted losses in machine learning: Theory and applications","venue":null,"work_id":"2cb93b7b-5097-41e7-8368-382919b65a6b","year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.384645Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:42694cae2cbeb6d95341711a5f2c1793b9c9ebda60f340045384c49c479bd456","observation_id":"53e330cf-3069-4bea-8c0c-a36497ded7ec","resolution":{"observed_at":"2026-08-06T19:29:03.551967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10920","last_updated":"2019-09-28T20:40:02Z","snapshot_observed_at":"2026-08-08T04:49:08.372428Z","submitted_at":"2019-08-28T19:36:23Z","title":"Deep Learning Theory Review: An Optimal Control and Dynamical Systems Perspective","version":2},"cited_work":{"arxiv_id":"1908.10920","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.10920","snapshot_observed_at":"2026-08-06T19:29:00.360864Z","title":"Deep Learning Theory Review: An Optimal Control and Dynamical Systems Perspective","venue":"cs.LG","work_id":"d69462b4-5b7a-48b9-910f-dda288d61715","year":2019},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.511550Z"},"links":{"cited_paper":"/paper/1908.10920","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:730fe604b022029a48b4ae2efb6e3e5e0e9d039103dc423875435e9a374ad9a7","observation_id":"6dd95ac2-a8a0-4e63-bd5d-56f1633c3e6c","resolution":{"observed_at":"2026-08-06T19:29:00.463455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05883","last_updated":"2024-06-09T18:41:50Z","snapshot_observed_at":"2026-08-04T01:42:16.654511Z","submitted_at":"2024-06-09T18:41:50Z","title":"Information Theoretic Guarantees For Policy Alignment In Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.05883","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05883","snapshot_observed_at":"2026-08-06T19:29:00.151583Z","title":"Information Theoretic Guarantees For Policy Alignment In Large Language Models","venue":"cs.LG","work_id":"36055592-fe9f-4cce-a3ee-5bfc6c05bea1","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.648495Z"},"links":{"cited_paper":"/paper/2406.05883","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:1a05b4c9d02d1b7891b0eaa84f04f5f9a925af5941223f9dbf04b00cb15b4b9a","observation_id":"0642541b-daa0-41ce-8282-c91540f41148","resolution":{"observed_at":"2026-08-06T19:29:00.250224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:03.166705Z","title":"Controlled decoding from language models","venue":null,"work_id":"d67b21e5-d5bd-43db-9b59-a206a93df136","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.751460Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:f857308d00eecd8fb6ff497bdc991d1f02b5aa1b3808a44ec7d7c3f3448f9b64","observation_id":"2be4de91-739a-4700-bbfc-75b639fe3726","resolution":{"observed_at":"2026-08-06T19:29:03.298681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T19:28:56.899965Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:56.899965Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:48186ac6d99a4173ed3ab410aeccddfc77ad36a58e03c34f49e115de4d93e3e2","observation_id":"76b71c17-22b7-47fa-a71a-192e9cdd5cb0","resolution":{"observed_at":"2026-08-06T19:28:56.899965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-06T19:28:57.016499Z","title":"2 olmo 2 furious","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.016499Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:2544659e1d69dfebac7b3d682e57e3c4e3e2cafd35eb4ea7e162029d1e9acd77","observation_id":"b786f6be-7028-450b-a487-f725761866db","resolution":{"observed_at":"2026-08-06T19:28:57.016499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:57.146706Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.146706Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:7ee05d7fab9b67891721284dfcba5cbe9ea462cdefe1c5005da70cc973c6c9f0","observation_id":"727ea2c9-e0d9-49a4-a3b4-07f05e4e6421","resolution":{"observed_at":"2026-08-06T19:28:57.146706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:02.936218Z","title":"On solving large-scale finite minimax problems using exponential smoothing","venue":null,"work_id":"8836738e-7737-458f-8f04-fe4308f6265f","year":2011},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.243847Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:c168475cf6ad2dd5e48463490f023589e31a28001af409c858dca18bbc93a7a1","observation_id":"b5753a7e-95fc-4b31-ba63-0362f90f5ff4","resolution":{"observed_at":"2026-08-06T19:29:03.055142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:02.690174Z","title":"Information theory: From coding to learning, 2022","venue":null,"work_id":"f76e1aa5-bfcb-416c-b0f6-c8484efdf738","year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.401914Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:9ff347dd8361b39204c4ab8a60d191a321b5abfc31b546feb08cbe99151d60ac","observation_id":"4d635e82-6652-41e2-8114-782abf0743bf","resolution":{"observed_at":"2026-08-06T19:29:02.826144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16033","last_updated":"2025-09-03T03:41:08Z","snapshot_observed_at":"2026-08-09T06:48:10.044243Z","submitted_at":"2024-10-18T04:38:21Z","title":"TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16033","snapshot_observed_at":"2026-08-06T19:28:57.548449Z","title":"Treebon: Enhancing inference-time alignment with speculative tree-search and best-of-n sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.548449Z"},"links":{"cited_paper":"/paper/2410.16033","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:a595be1d5913fa6f5cdabc75d19bba9143c2ae3e8c6b723412f53964c9341011","observation_id":"380b06d1-6599-4930-a23b-5248a0d52bd6","resolution":{"observed_at":"2026-08-06T19:28:57.548449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T19:28:57.640777Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.640777Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:3eab4b1ad356f2f742cada9d186ac6917e2a51775953d452ad30123f4143ef7a","observation_id":"a1f2b118-520e-4cbd-9198-e42a0ac0638e","resolution":{"observed_at":"2026-08-06T19:28:57.640777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-07-06T18:49:16.284410Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-08-06T19:28:57.750523Z","title":"Bond: Aligning llms with best-of-n distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.750523Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:02c5235f9abcdb7932d422fa8f2192997e4d59389a2b794bd2871a960e5f0437","observation_id":"1082371d-7dc0-4884-9d76-215b731ec668","resolution":{"observed_at":"2026-08-06T19:28:57.750523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T19:28:57.885691Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:57.885691Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:378915680c10b8577da1db20805988f234d9dc090d77ff0f4a2828791ad8ffb2","observation_id":"da09c6cb-4cdc-4fc2-b991-3d8e071a0571","resolution":{"observed_at":"2026-08-06T19:28:57.885691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:02.477274Z","title":"The importance of online data: Understanding preference fine-tuning via coverage","venue":null,"work_id":"0f08825f-9918-4acd-99cf-3f221cd12840","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.017561Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:2e5869b8993d4a443a7be32ff51c2fbb5636fb65fcc7ea0f84aa9c849c5aa722","observation_id":"3eff8743-70ea-4993-a1df-8e259b7fba33","resolution":{"observed_at":"2026-08-06T19:29:02.564388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:58.112400Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.112400Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:2bbd8c0b053d19f4280602a5a2a2e21ec4792856c2e5d58b1f0bba793f0b978c","observation_id":"43b2d2e0-e4b5-44d8-8694-8a8679a424a0","resolution":{"observed_at":"2026-08-06T19:28:58.112400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:58.222281Z","title":"Inference scaling f-laws: The limits of llm resampling with imperfect verifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.222281Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:a6dcea1763bcc31f0c1f0f087bb2ec124bf46e9074dd0592dcece1f14e1d9e57","observation_id":"b0da765a-9292-43ce-8a78-0d46ac347b0e","resolution":{"observed_at":"2026-08-06T19:28:58.222281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20290","last_updated":"2024-10-31T18:27:13Z","snapshot_observed_at":"2026-08-03T23:26:49.562857Z","submitted_at":"2024-10-26T23:20:48Z","title":"Fast Best-of-N Decoding via Speculative Rejection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20290","snapshot_observed_at":"2026-08-06T19:28:58.356008Z","title":"Fast best-of-n decoding via speculative rejection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.356008Z"},"links":{"cited_paper":"/paper/2410.20290","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:5cbd969a6ed47504c7eaac689bf2e2957a59cd5bc63a8392d418ca9ddbbd3da2","observation_id":"9c54f448-de15-4244-b20a-a49a0b647a27","resolution":{"observed_at":"2026-08-06T19:28:58.356008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T19:28:58.458027Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.458027Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:7975ee4006a4f522294add75dd56e9d8a21ae5b5f3e10b80ce3b0d4fb788d51e","observation_id":"4a49e034-e132-4766-87c8-61fa95b9cdb6","resolution":{"observed_at":"2026-08-06T19:28:58.458027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:28:58.572765Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.572765Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:7756abce5ea759d654231c93d2a564e6a08286c1d9768ee804d346fad3f21acd","observation_id":"0e3eca5e-52af-4aa6-970f-3d4ee506d061","resolution":{"observed_at":"2026-08-06T19:28:58.572765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:02.132382Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":"c53bea3f-cd83-4a9d-b871-39a2b47472e8","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.704734Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:f35ecbb4e6b6ea11d7dd77f0363d13be40bc31c06dbdce5b656f15058eaffb1f","observation_id":"55bbc992-aee4-4daa-b6ee-a5cf6912e674","resolution":{"observed_at":"2026-08-06T19:29:02.304528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:01.855458Z","title":"Robust variable selection with exponential squared loss","venue":null,"work_id":"82ae6fc2-65bd-4006-b420-6d31cf5e5f76","year":2013},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.851458Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:115d32965844b5deb31cdb149f346ea0510871e2a06b1b87d79383050438f42a","observation_id":"db710494-7c25-499f-9fda-597c279565c2","resolution":{"observed_at":"2026-08-06T19:29:01.995933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:01.515022Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":"3ab23f16-a46a-4bc8-b3eb-0a85d05fbbff","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:58.937433Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:0073a641c55a7564e09a74727b89b3c2935d7c9f5af4acd2575191ddc59c1de7","observation_id":"12b2e296-184b-436e-b81b-7bece514809b","resolution":{"observed_at":"2026-08-06T19:29:01.699260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:01.255448Z","title":"Asymptotics of language model alignment","venue":null,"work_id":"68fb9d1c-d6be-43c9-8bc4-2d5fe718bb95","year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.076528Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:ca0e9a5657cfdf6f0cc9008d59f26b64cf5ebaeb30642b0ddca941073669c5e9","observation_id":"c9134f7e-168b-4b3b-8458-985d2c47c02d","resolution":{"observed_at":"2026-08-06T19:29:01.364536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:59.200479Z","title":"Convergence of the inexact langevin algorithm and score-based generative models in kl divergence","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.200479Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:3e0a207cbd77f60057d8492551ae381c8da4e8405f0da3886da94599f98fc0e3","observation_id":"093679e0-110d-4480-907f-5811acb13c66","resolution":{"observed_at":"2026-08-06T19:28:59.200479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-08T23:10:48.899751Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-08-06T19:28:59.337652Z","title":"A theoretical analysis of nash learning from human feedback under general kl-regularized preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.337652Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:279a4e6723b7c77b84aeecf9cd7e8cc3b17df34159e0614d02d199b031eab92a","observation_id":"683f5707-3ded-4ea2-9359-4f792525dc08","resolution":{"observed_at":"2026-08-06T19:28:59.337652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-06T19:28:59.418783Z","title":"Provable offline preference-based reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.418783Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:ef49ca8c53caee8036e987d97aa18c4637cba27682f7c3219a7f923986686ab4","observation_id":"faa4c54d-4083-4620-95f4-cb0d669efcad","resolution":{"observed_at":"2026-08-06T19:28:59.418783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04625","last_updated":"2025-02-11T10:58:16Z","snapshot_observed_at":"2026-07-06T19:46:41.798193Z","submitted_at":"2024-11-07T11:22:46Z","title":"Sharp Analysis for KL-Regularized Contextual Bandits and RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04625","snapshot_observed_at":"2026-08-06T19:28:59.510021Z","title":"Sharp analysis for kl-regularized contextual bandits and rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.510021Z"},"links":{"cited_paper":"/paper/2411.04625","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:670d192d59488072d1b2e9f60d3d609144afa642c24aeb0041e95f8c642c47f4","observation_id":"c246fe7b-c98b-49c4-ab0f-333531e32621","resolution":{"observed_at":"2026-08-06T19:28:59.510021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:29:01.072740Z","title":"Calibrating sequence likelihood improves conditional language generation","venue":null,"work_id":"6c186371-bf9d-42c6-9497-5aec5feaf353","year":2022},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.653529Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:94a2833cad2c6070e0540adcc60c4803670d91b468e40f80f7ef6d8399eeb223","observation_id":"6d617809-b2c2-46f8-acdb-1da6b3ccd165","resolution":{"observed_at":"2026-08-06T19:29:01.134347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:28:59.743545Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.743545Z"},"links":{"citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:7f026e94faa45f88bd683b5b15c1edf24a59acae71169dc00b1a5f54fb623235","observation_id":"c3eea33b-c332-4ce8-a9da-7bb7bec78699","resolution":{"observed_at":"2026-08-06T19:28:59.743545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-09T02:51:17.508221Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 2 inbound Pith citation observations for arXiv:2507.05913."}